职坐标
2026-08-19
来源 :
阅读 36
评论 0
摘要:本文横评GPT-4o、Claude 3.5、Qwen2.5、DeepSeek-V3四大主流大模型的Function Calling能力,从参数提取准确率、多工具选择、并行调用、错误恢复四个维度对比。
本文横评GPT-4o、Claude 3.5、Qwen2.5、DeepSeek-V3四大主流大模型的Function Calling能力,从参数提取准确率、多工具选择、并行调用、错误恢复四个维度对比。
· 评测维度:参数提取准确率、多工具选择正确率、并行调用支持、错误恢复能力
· 参数提取:GPT-4o准确率96%,Claude 94%,Qwen2.5 91%,DeepSeek-V3 89%
· 多工具选择:Claude在5+工具场景下选择正确率最高
· 并行调用:GPT-4o和Claude原生支持并行Function Calling,Qwen/DeepSeek需额外处理
· 成本效率:DeepSeek-V3性价比最高,Qwen2.5中文场景表现优异
为什么要横评Function Calling而不是泛泛比较大模型?
Function Calling(函数调用机制:让大模型输出结构化的工具调用指令,使AI Agent能够操作外部系统)是AI Agent(人工智能智能体)的核心能力。一个大模型的通用对话能力可能很强,但如果Function Calling能力弱,用它构建Agent就会出现"选错工具""参数填错""无法处理复杂调用链"等问题。
本次横评聚焦四个维度:参数提取准确率(从自然语言中正确提取函数参数的能力)、多工具选择正确率(面对5个以上工具时选择正确工具的能力)、并行调用支持(能否在一次推理中同时调用多个工具)、错误恢复能力(工具调用失败后能否合理调整策略)。这四个维度直接决定了一个大模型在Agent场景下的实战表现。
评测使用统一的测试集(200个真实场景问题),每个问题都有标准答案,评测模型在零样本(Zero-shot)设定下的表现,不提供示例以测试模型的基础能力。
参数提取准确率:谁能最准确地把自然语言变成函数参数?
参数提取是Function Calling的基础能力。测试场景包括简单参数提取("帮我查北京明天的天气"→ weather_api(city="北京", date="明天"))和复杂参数提取("帮我把这份Excel里A列的数据按降序排列后发到群里,只保留前10行"→ multi-step function calling)。
GPT-4o:准确率96%。在简单和中等复杂度场景下几乎不出错,复杂多步骤场景偶有参数遗漏(约4%),但整体表现最稳定。优势在于对模糊表述的理解能力最强。
Claude 3.5 Sonnet:准确率94%。整体接近GPT-4o,但在中文人名、地名的参数提取上偶有偏差。优势在于对长上下文场景的参数提取表现更稳定——当对话历史超过20轮时,Claude的参数提取准确率下降幅度小于GPT-4o。
Qwen2.5-72B:准确率91%。在纯中文场景下的参数提取表现优异,部分场景甚至超过GPT-4o。但在中英混杂表述和复杂嵌套参数场景下有约5-8%的失误。优势是中文语义理解深度好,对中文口语化表达(如"整个""这俩""那几个"等模糊指代)的处理优于其他三个模型。
DeepSeek-V3:准确率89%。整体表现接近Qwen2.5,但在参数类型推断(如区分int和string)上有约3%的额外失误率。优势在于对代码相关参数(函数名、文件路径、API端点)的提取准确率高,适合编程类Agent场景。
多工具选择正确率:工具多了谁能选对?
当Agent拥有大量工具时,大模型需要从工具列表中选择正确的工具。这是Agent场景的核心挑战之一。测试分别在工具数量为3、5、8、12时进行。
3个工具:四个模型都表现优秀,正确率均在95%以上。差异不大。
5个工具:GPT-4o 93%,Claude 95%,Qwen2.5 88%,DeepSeek-V3 86%。Claude在这个场景下表现最好,原因是其工具描述理解能力更强,能根据工具的description字段做出更精准的匹配。
8个工具:GPT-4o 85%,Claude 88%,Qwen2.5 79%,DeepSeek-V3 77%。所有模型都有明显下降,说明8个工具已经接近大模型的工具选择上限。
12个工具:GPT-4o 72%,Claude 76%,Qwen2.5 64%,DeepSeek-V3 61%。在这个规模下,建议引入工具检索(Tool Retrieval)机制——先用一个轻量模型做工具筛选,再把筛选后的3-5个工具传给大模型。
综合来看,Claude在多工具场景下表现最优,GPT-4o次之,Qwen2.5和DeepSeek-V3在工具数量超过8个时需要额外的工具检索机制辅助。
并行调用与错误恢复:谁能在复杂场景下更稳健?
并行调用是指大模型在一次推理中同时输出多个工具调用指令。例如用户问"帮我查北京和上海的天气",模型应一次性输出两个weather_api调用,而不是串行调用两次。
GPT-4o和Claude 3.5都原生支持并行Function Calling,在一次推理中可以输出多个工具调用。Qwen2.5和DeepSeek-V3在标准模式下不支持原生并行调用,需要通过自定义Prompt(如"如果需要调用多个工具,请在同一轮输出所有调用")来实现类似效果,但稳定性不如前两者。
错误恢复是指工具调用失败后(如API超时、参数错误、权限不足),大模型能否合理地调整策略。测试场景包括:工具返回错误信息、工具超时无响应、工具返回意外格式。
GPT-4o在错误恢复方面表现最好——当工具返回错误时,它能在下一轮推理中自动调整参数或切换替代工具。Claude同样表现出色,倾向于先分析错误原因再决定下一步行动。Qwen2.5在明确提示错误后会做调整,但主动分析错误原因的能力弱于前两者。DeepSeek-V3在编程类错误恢复上表现突出(如代码执行报错后的修复),但在通用工具错误恢复上略逊。
成本与性价比:实战中该怎么选?
能力评测之外,实际选型还必须考虑成本。以每百万token价格为参考(2026年8月公开定价)。
GPT-4o:输入$2.5/M,输出$10/M。能力最强但成本最高。适合对准确率要求极高的核心Agent场景(如金融交易辅助、医疗诊断辅助)。
Claude 3.5 Sonnet:输入$3/M,输出$15/M。多工具场景首选,但成本略高于GPT-4o。适合工具数量多、对话轮数长的复杂Agent。
Qwen2.5-72B:输入¥4/M,输出¥12/M(约$0.55/$1.65)。中文场景性价比极高,准确率接近前两者但成本仅为1/4-1/5。适合中文为主的业务Agent。
DeepSeek-V3:输入¥2/M,输出¥8/M(约$0.28/$1.1)。性价比最高。在编程类Agent和成本敏感场景下是首选。准确率比Qwen低约2-3个百分点,但成本再低30%。
实战建议:核心决策链路用GPT-4o或Claude,非关键环节(如信息检索、数据预处理)用Qwen2.5或DeepSeek-V3。这种混合策略可以在保证整体准确率的同时控制总成本。对于纯中文场景的项目,Qwen2.5-72B的综合表现已经非常接近GPT-4o,是性价比最优的选择。
FAQ常见问答
Q1:这四个模型测出来的差距大吗?
A:在简单场景下差距不大(都在90%以上)。差距主要体现在复杂场景:多工具选择、并行调用、错误恢复。这些场景的差距在实际Agent中会放大,影响用户体验。
Q2:国产模型(Qwen/DeepSeek)和GPT-4o差距有多大?
A:在Function Calling的参数提取上差距约3-7个百分点。在中文场景下Qwen2.5的部分指标已接近GPT-4o。多工具选择和并行调用是主要差距所在。
Q3:评测中用的是哪个版本的模型?
A:GPT-4o(2024-08版本)、Claude 3.5 Sonnet、Qwen2.5-72B-Instruct、DeepSeek-V3。各模型使用2026年8月可获取的最新版本。
Q4:工具数量超过8个怎么办?
A:引入工具检索(Tool Retrieval)机制:先用一个轻量模型(如Qwen2.5-7B或GPT-4o-mini)做工具筛选,选出3-5个最相关的工具,再传给主模型做精确选择。这可以把工具选择正确率从60-70%提升到85%以上。
Q5:实际项目中应该选哪个模型?
A:看场景。纯中文场景选Qwen2.5-72B(性价比最优);多工具复杂场景选Claude 3.5(选择正确率最高);编程类Agent选DeepSeek-V3(代码能力+成本双优);核心决策链路选GPT-4o(综合最稳)。
喜欢 | 0
不喜欢 | 0
您输入的评论内容中包含违禁敏感词
我知道了

请输入正确的手机号码
请输入正确的验证码
您今天的短信下发次数太多了,明天再试试吧!
我们会在第一时间安排职业规划师联系您!
您也可以联系我们的职业规划师咨询:
版权所有 职坐标-一站式AI+学习就业服务平台 沪ICP备13042190号-4
上海海同信息科技有限公司 Copyright ©2015 www.zhizuobiao.com,All Rights Reserved.
沪公网安备 31011502005948号