AI Agent 该用哪个 LLM?2026 实测选型指南

TL;DR — 一句话结论

别给整条 Agent 链路配一个"最强模型"。Agent 是多步循环,成本和延迟会被步数放大。

分三层选:规划层用强模型(Claude Sonnet/Opus、Kimi K2 thinking、DeepSeek);工具调用层用稳而快的(Claude Sonnet/Haiku);子任务层用便宜的(Haiku、Gemini Flash、免费 gpt-oss)。

关键不是聪明,是稳:function calling 别乱填参数、多步别跑偏、JSON 别崩。

2026 年,几乎每个团队都在做 Agent。然后几乎每个团队都踩了同一个坑——第一版全用最强模型,跑通了,账单也炸了。

我见过一个数据分析 Agent,单次任务平均 22 步工具调用,全链路 Claude Opus。功能很惊艳。直到月底,财务来问"这一个功能怎么花了四位数"。问题不在模型,在于没人意识到 Agent 的成本是按步数乘出来的。一次对话只调一次模型;一个 Agent 任务调二十多次。同样的单价,账单差一个数量级。

这篇不评"哪个模型 MMLU 最高"。Agent 选型是另一套逻辑——它考验的是稳定性、工具调用、和成本结构。下面按我们做了一年多 Agent 的实战经验,把它讲清楚。

先破一个误区:Agent ≠ 用最聪明的模型

"既然 Agent 这么重要,那肯定要上最强的 Opus。" 这句话听起来对,做起来烧钱。

Agent 的本质是一个循环:观察 → 思考 → 调用工具 → 再观察,反复多轮直到完成。这意味着两件事被放大了。第一,成本:每一步都是一次完整的模型调用,而且上下文里塞满了之前所有步骤的 observation,输入 token 越滚越大。第二,延迟:二十步串行,每步多等一秒,用户就多等二十秒。

所以 Agent 选型的第一原则不是"多聪明",而是"这一步值不值得用贵模型"。决定下一步干什么——值得。把一段 JSON 里的字段抽出来填进工具参数——不值得。

Agent 对 LLM 的真实需求(和聊天完全不同)

聊天场景,你要的是一次回答得漂亮。Agent 场景,你要的是二十步都别出岔子。具体拆成这几条,按重要性排序:

反直觉点:排行榜上的综合得分,对 Agent 的参考价值有限。一个 function calling 稳、JSON 不崩、指令遵循好的"中等聪明"模型,做 Agent 往往比一个高分但爱自由发挥的模型更好用。

三层分工:把对的模型放在对的位置

我们的实践是把 Agent 内部的模型调用分成三层,每层配不同的模型。下面的价格均为 ApiTopMix 当前实时价(每百万 token,输入/输出,完整价格见定价页):

规划层(Agent 的"大脑")—— 强模型,低频

负责任务分解、复杂决策、卡住时的重新规划。调用频率低,但每次都重要,值得上强模型。

模型价格 /1M适合
claude-opus-4-6 / 4-8$3.00 / $15.00最复杂的规划与决策,指令遵循最稳
claude-sonnet-4-6(含 thinking)$2.20 / $11.00多数 Agent 的规划层主力,性价比好
kimi-k2-thinking$0.12 / $0.50推理规划,超高性价比的备选
deepseek-v3.1$0.03 / $0.15预算敏感时的规划层,中文任务尤佳

执行层(工具调用主力)—— 稳而快

Agent 大部分步骤都在这一层:决定调哪个工具、填参数、解析返回。要的是 function calling 稳定 + 快 + 不太贵。

模型价格 /1M适合
claude-sonnet-4-6$2.20 / $11.00工具调用稳定性的标杆,复杂 Agent 首选
claude-haiku-4-5$0.60 / $3.00高频工具调用,又快又便宜还稳
qwen3-coder-480b$0.04 / $0.18代码类 Agent 的执行层(写/改/跑代码)

子任务层(简单活)—— 越便宜越好

分类、抽取、格式化、短摘要这类没难度的活,用最便宜的,能省一大笔。

模型价格 /1M适合
gemini-2.5-flash$0.30 / $1.80快速分类、抽取、结构化
deepseek-v3.1$0.03 / $0.15便宜量大的子任务,中文友好
openai/gpt-oss-120b免费开源模型,跑得动的简单子任务直接零成本

一个真实的多模型路由:就这么几行

很多人担心多模型会让 Agent 代码变复杂。其实用一个 OpenAI 兼容的聚合网关,所有模型共用一个 Key、一套 SDK,路由只是按当前角色换 model 参数:

# 一个 ApiTopMix Key 同时调三层模型
from openai import OpenAI
client = OpenAI(api_key="sk-...", base_url="https://apitopmix.com/v1")

ROUTING = {
    "plan":    "claude-sonnet-4-6",   # 规划层:稳
    "act":     "claude-haiku-4-5-20251001",  # 执行层:快而便宜
    "subtask": "gemini-2.5-flash",    # 子任务层:最省
}

def agent_call(role, messages, tools=None):
    return client.chat.completions.create(
        model=ROUTING[role],
        messages=messages,
        tools=tools,
        tool_choice="auto" if tools else None,
    )

# Agent 主循环里,按当前步骤的角色取模型
plan   = agent_call("plan", planning_messages)        # 低频、强模型
result = agent_call("act",  step_messages, tools=TOOLS) # 高频、便宜稳

Node.js 端同理,把 baseURL 指到 https://apitopmix.com/v1,用同一个 Key 切 model 即可。接口细节见 开发文档。这套结构的好处是:你可以在不动业务逻辑的前提下,随时把某一层换成更便宜或更强的模型——只改字典里一行。

成本测算:一个 20 步任务,分层 vs 全 Opus

假设一个典型 Agent 任务:20 步,其中 2 步规划、12 步工具调用、6 步简单子任务。每步平均累积输入 8K token、输出 1K token。我们对比"全用 Opus"和"三层分工":

方案规划 2 步执行 12 步子任务 6 步单任务总价
全用 Opus($3/$15)$0.108$0.648$0.324$1.08
三层分工Sonnet $0.079Haiku $0.252Flash $0.062$0.39
差额同样 20 步、同样完成度省 ~64%

单次省 $0.69 看着不多。乘以每天一万次任务呢?一天省近 $7,000。这就是为什么 Agent 的模型分工,不是优化项,是生存项。详细的降本方法论,可以参考我们这篇 把 API 成本砍半

诚实说一句:上面的体感推荐基于我们自己的 Agent 任务,不是普适排行榜。你的工具集、prompt 风格、任务类型都会影响结果。强烈建议:固定一组你真实的 Agent 任务,把候选模型在执行层各跑一遍,统计成功率、平均步数、单任务成本,再做决定。

不同类型 Agent 的推荐起点

常见问题

1. 一开始就要做三层路由吗?还是先单模型跑通?

先用一个 Claude Sonnet 把 Agent 跑通,验证逻辑对。逻辑稳了,再做分层降本——这时你已经有真实日志,知道哪些步骤简单到可以降级。别在还没跑通时就过度工程。

2. 便宜模型在执行层会不会经常调错工具?

会有概率,所以要兜底。给执行层加一个"工具调用结果校验",参数非法或返回异常就 fallback 到更强模型重试一次。这样既吃到便宜模型 90% 的省钱,又不让边界情况砸到用户。

3. 为什么不直接用某个平台的 auto 路由?

auto 路由按通用启发式选模型,但它不懂你的 Agent 里"这一步是规划还是子任务"。你自己按角色显式路由,控制力和可预测性都更强。关于平台层的对比,可以看 AI API 聚合平台选型指南

4. thinking 模型放在执行层会怎样?

不建议。推理模型每次会产生大量思考 token,放在高频的工具调用层,延迟和成本都会爆。把它的"想得深"用在低频的规划层,性价比才出得来。

一个 Key,跑通三层 Agent

ApiTopMix 用一个 OpenAI 兼容 Key 同时覆盖 Claude、Gemini、DeepSeek、Qwen、Kimi 与免费开源模型,按角色切 model 即可。Claude 系列省 27%–40%,$5 起充。

延伸阅读

结语

Agent 选 LLM,不是选一个冠军,是给一支队伍排兵布阵。规划层要将才,执行层要稳兵,子任务交给杂役。把对的模型放在对的位置,你的 Agent 既跑得稳,又花得起。

从今天起,别再用一个模型跑完整条链路。先去看一眼你 Agent 的日志:哪一步其实根本不需要那么强的模型?那就是你的第一个降级点。

Expert Tip:给 Agent 的每一步打三个埋点——step_role(规划/执行/子任务)、modeltool_call_valid(工具参数是否合法)。跑一周后做透视,你会发现两件事:某一层用了过强的模型(降级点),以及某个便宜模型的 tool_call_valid 异常低(该层不能降)。这张表比任何模型排行榜都更适合指导你自己的 Agent——因为它量的是你真实任务,不是别人的基准。我们靠它把一个 Agent 的月成本砍掉过三分之二,且成功率没动。