中文写作与日常办公
Qwen 在中文榜单排第 4、长问题排第 6,国内入口也更顺手;追求更高中文同榜结果时,Claude 排第 1。
先用同一份真实材料比较语气、事实和修改次数,不要只看一段示例。
六种常见用途
Qwen 在中文榜单排第 4、长问题排第 6,国内入口也更顺手;追求更高中文同榜结果时,Claude 排第 1。
先用同一份真实材料比较语气、事实和修改次数,不要只看一段示例。
Arena WebDev 中 Claude、Kimi、Qwen 分列第 1、第 2、第 3;国内模型已经非常接近第一梯队。
模型成绩不等于完整开发体验,还要比较 Agent 外壳、终端权限、上下文和失败恢复。
Agent 真实会话的确认成功信号中,两者分列第 1 和第 2;GPT-5.6 Sol 可作为海外第二梯队候选。
高价模型也会失败。先小权限运行,并检查它是否真的完成、是否乱用工具。
长问题榜单中 Qwen 第 6、Claude 第 7、Kimi 第 10,三者都是当前可优先测试的长材料候选。
标称 1M 上下文不等于整段都能稳定利用,关键结论仍要做页码和原文回查。
Arena Vision 中 Qwen 第 2、Claude 第 6;Gemini Flash 价格较低,可作为批量图片任务候选。
识图、生成图片和生成视频是三种能力,不能因为一个视觉榜单就推断全部多模态都强。
DeepSeek 当前公开 API 单价最低;GLM 和 Qwen 在部分能力榜单里名次更靠前,适合比较质量和成本的平衡。
DeepSeek 已公告 8 月 16 日调价。批量使用前先按你的平均输入、输出和缓存命中率重算。