我们追踪了100万次LLM API调用——62%使用了错误模型
一项针对超过100万次LLM API调用的分析显示,62%的调用使用了与任务不匹配的模型,导致成本浪费和效率低下。研究发现,许多开发者倾向于选择功能过强的模型来处理简单任务,而正确选择模型规模可以显著降低成本并提升响应速度。报告建议根据任务复杂度动态调整模型选择,以避免不必要的支出。
背景速读
- 大型语言模型(LLM)API 调用是指开发者通过 OpenAI、Anthropic、Google 等公司提供的接口向 AI 模型发送请求并付费。不同模型(如 GPT-4、GPT-3.5、Claude 系列)的定价差异巨大,复杂模型价格是简单模型的几十倍。
- 该文作者追踪了超过 100 万次 LLM API 调用,发现高达 62% 的调用使用了过于昂贵或过于强大的模型,而实际任务(如翻译、摘要、简单问答)完全可以用更便宜的模型完成。这意味着大量企业在 AI 开支上存在系统性浪费。
- 这一发现反映了当前 AI 应用的一大现实问题:开发者倾向于“用最强的模型”,而不是根据任务复杂度匹配合适的模型。类似的问题在早期云计算时代也出现过(过度配置服务器资源)。
- 文章提供了实用建议,包括按任务分级选择模型、设置成本监控、以及使用路由层自动将请求分配到性价比最优的模型。