返回:模型能力比较

第二篇 · 不同用途建议

不是选“最好”,
而是选这次更合适

下面的建议来自上一页的分项证据和当前 API 价格。用途变了,优先级也会变。

六种常见用途

先给首选,再说明什么时候换第二个

01

中文写作与日常办公

Qwen 在中文榜单排第 4、长问题排第 6,国内入口也更顺手;追求更高中文同榜结果时,Claude 排第 1。

先用同一份真实材料比较语气、事实和修改次数,不要只看一段示例。

02

编程与做网站

Arena WebDev 中 Claude、Kimi、Qwen 分列第 1、第 2、第 3;国内模型已经非常接近第一梯队。

模型成绩不等于完整开发体验,还要比较 Agent 外壳、终端权限、上下文和失败恢复。

03

让 Agent 连续做事

Agent 真实会话的确认成功信号中,两者分列第 1 和第 2;GPT-5.6 Sol 可作为海外第二梯队候选。

高价模型也会失败。先小权限运行,并检查它是否真的完成、是否乱用工具。

04

长文档、研究与大项目材料

长问题榜单中 Qwen 第 6、Claude 第 7、Kimi 第 10,三者都是当前可优先测试的长材料候选。

标称 1M 上下文不等于整段都能稳定利用,关键结论仍要做页码和原文回查。

05

看图、多模态理解

Arena Vision 中 Qwen 第 2、Claude 第 6;Gemini Flash 价格较低,可作为批量图片任务候选。

识图、生成图片和生成视频是三种能力,不能因为一个视觉榜单就推断全部多模态都强。

06

低预算 API 与批量调用

DeepSeek 当前公开 API 单价最低;GLM 和 Qwen 在部分能力榜单里名次更靠前,适合比较质量和成本的平衡。

DeepSeek 已公告 8 月 16 日调价。批量使用前先按你的平均输入、输出和缓存命中率重算。

想核对名次和价格?

回到八维能力矩阵

查看完整证据