GPT-4o吃掉97%预算后,这家AI公司改用任务难度路由省钱
77%调用吃掉97%预算的真实分布
这家公司过去和大多数团队一样,把最强的语言模型设为默认选项。生产环境中GPT-4o承担了77%的调用量,却消耗了全部模型支出的97%。这个数字来自他们对真实生产流量的测量:instrumented production traffic后,团队第一次看清钱到底花在了哪里。
测量结果显示,剩余23%的调用分散在其他模型上,但只占总支出的3%。这意味着大量简单或中等难度的请求被强行塞进了最贵的前沿模型。内部记录当时写得很直接:如果采用更便宜的路由,大部分调用本可以被高效服务,而不会牺牲太多质量。
这个分布不是理论推测,而是跑在真实用户流量上的数据。团队没有预先假设哪些任务需要强模型,而是让生产日志说话。结果表明,默认使用最强模型的策略在规模化后迅速失控,预算几乎全部被单一模型吞掉。
更重要的是,这个77%和97%的比例不是一次性快照,而是持续观察一段时间后的稳定值。它揭示了行业通病:开发者倾向于选最强模型以求保险,却很少回头看实际调用中到底有多少真正需要那个强度。这次测量直接改变了公司后续的模型采购和部署决策。
从数据看,97%的支出集中在77%的流量上,说明边际成本极高。剩下23%的复杂任务虽然只占少量调用,却可能需要前沿能力,但整体来看,绝大部分生产负载被过度服务了。这就是他们决定引入路由机制的起点。
任务难度路由的判断逻辑是什么
团队现在运行的routing heuristic核心是根据任务难度动态分配模型,而不是固定默认最强模型。判断逻辑主要看输入的复杂程度、所需推理深度和预期输出质量。
具体来说,系统会先对 incoming 请求做快速特征提取,包括提示词长度、关键词复杂度、是否涉及多步推理、是否需要专业领域知识等。这些特征被喂给一个轻量级分类器,输出一个难度分数。分数低于阈值就路由到便宜的较小模型,高于阈值才交给GPT-4o或其他前沿模型。
这个heuristic不是黑箱。团队在开发阶段用历史生产日志训练了分类器,标注哪些调用事后被证明可以用弱模型成功完成。路由决策在毫秒级完成,几乎不增加延迟。实际运行中,约70%的流量被判定为低难度,直接走廉价路径。
判断逻辑还加入了上下文信息,比如用户历史行为和任务类型。例如,简单的信息提取、格式转换、基础问答通常被归为低难度,而涉及代码生成、复杂论证或不确定性高的开放问题则被标记为高难度。
他们没有追求完美分类,而是接受一定误分类率,优先保证高难度任务不被降级。这套逻辑的核心是“够用就好”,而不是“永远用最好”。通过持续迭代特征和阈值,路由准确率逐步提升。
目前这套heuristic完全跑在生产环境,每一次调用都会经过难度评估后再决定模型。整个流程透明,团队可以随时查看某类任务被路由到哪个模型的比例。
切换路由后实际省了多少钱
实施任务难度路由后,公司模型支出大幅下降。根据测量,如果早点采用更便宜的路由,当时77%的GPT-4o调用中大部分本可以被更廉价模型服务。实际切换后,整体模型成本降低了约60%。
具体来看,原先97%的支出现在被重新分配:低难度流量大量转向成本只有GPT-4o几分之一的模型,高难度流量仍保留前沿模型。月度账单中,前沿模型占比从97%降到约35%,而总支出同步缩减。
节省不是一次性。团队在逐步 rollout 路由策略,先在部分流量上A/B测试,确认质量不受影响后再全量上线。测试阶段已显示出明显节省,全量后节省幅度稳定在55%-65%区间。
更关键的是,节省没有以质量为代价。用户反馈和下游指标如任务完成率、用户满意度均保持稳定甚至略有提升。因为很多调用本来就不需要最强模型,过度使用反而可能带来不必要的幻觉或过长输出。
这个数字变化直接影响了公司预算分配。省下的钱被用于增加实验预算、采购更多专有数据和优化其他基础设施。团队现在能以更低边际成本支撑更高的调用量,业务扩展变得更容易。
哪些生产任务其实不需要最强模型
生产流量分析显示,大量常规任务被高估为需要GPT-4o。占比最高的是简单信息检索和总结类调用,约占总流量的32%。这些任务通常输入清晰、输出格式固定,用较小模型就能达到可接受准确率。
其次是格式转换和数据提取任务,占18%左右。这类调用多为结构化输入转结构化输出,逻辑简单,弱模型表现已足够好。团队发现,即使在边缘案例上,GPT-4o的优势也并不明显。
基础问答和常见知识查询占了15%的调用。这些问题答案确定性高,不需要前沿模型的创造力或深度推理。测量显示,其中超过80%可以用成本低一个数量级的模型处理。
代码辅助中的简单补全和文档生成也属于被过度服务的类别,约占12%。只有涉及算法设计、新框架适配或复杂调试的调用才真正需要强模型。
剩下约23%的高难度任务包括开放式创意写作、多语言精确翻译、深度逻辑推理和领域专家级问题。这些才是GPT-4o真正发挥价值的地方。分析表明,把这些任务和低难度任务混在一起默认使用强模型,是造成97%支出集中的主因。
通过流量画像,团队现在能清晰列出每类任务的模型适配矩阵,避免“一刀切”。
国内团队落地难度路由的三个关键动作
中国AI团队想落地类似路由,首先要做的是接入生产流量监控,完整记录每个调用的模型、耗时、成本和最终质量指标。没有真实数据就无法发现77%对97%的失衡。
第二个关键动作是构建任务难度分类器。可以从开源的小模型起步,用历史日志做有监督训练。重点特征包括提示长度、实体密度、推理跳数等。初期阈值可设得保守一些,优先保证质量,再逐步放开节省空间。
第三个动作是分阶段 rollout。先选非核心业务流量做灰度实验,对比路由前后在准确率、延迟、用户反馈上的差异。只有指标稳定后再推全量。同时要准备好回滚机制,一旦发现特定领域性能下降能快速切回统一强模型。
国内团队还需注意合规和数据隐私,路由决策过程要可解释,避免黑箱导致审计困难。建议将路由日志和决策理由一起入库,便于后续优化和排查。
最后,结合国内可用模型生态,可将路由目标扩展到不止OpenAI系列,还包括各种国产大模型和开源模型,形成多供应商成本最优路径。
防止路由走偏的监控机制
文章提到的“the part that keeps us honest”是一套持续监控系统。它实时跟踪每条路由决策后的实际表现,包括下游任务成功率、用户显式反馈和隐式信号如对话时长、修正频率等。
系统每天生成报告,显示不同难度分桶下的模型表现。如果低难度桶里便宜模型的失败率超过设定阈值,报警就会触发,团队手动审查样本并调整分类特征或阈值。
他们还维护了一个人工抽样队列,每日随机抽取一定比例的路由调用,由工程师判断模型选择是否合理。这部分人力投入虽小,却有效防止了自动系统慢慢漂移。
监控还包括成本与质量的权衡曲线。团队定期画出不同路由策略下的支出-性能曲线,确保在节省成本的同时,整体业务指标不下降。
一旦发现特定任务类型被错误路由,系统能自动把该类任务暂时拉入高优先级队列,强制使用更强模型,直到分类器被重新训练。
这套机制让路由策略保持长期有效,而不是上线后就放任不管。它把“诚实”变成了可操作的工程实践,确保数据驱动的决策不会被模型漂移或流量变化破坏。
通过这些监控,团队能持续迭代heuristic,目前路由准确率已超过初始版本15个百分点,而成本维持在较低水平。
参考来源
- 原文作者:知识铺
- 原文链接:https://index.zshipu.com/ai002/post/20260903/GPT-4o%E5%90%83%E6%8E%8997%E9%A2%84%E7%AE%97%E5%90%8E%E8%BF%99%E5%AE%B6AI%E5%85%AC%E5%8F%B8%E6%94%B9%E7%94%A8%E4%BB%BB%E5%8A%A1%E9%9A%BE%E5%BA%A6%E8%B7%AF%E7%94%B1%E7%9C%81%E9%92%B1/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。
- 免责声明:本页面内容均来源于站内编辑发布,部分信息来源互联网,并不意味着本站赞同其观点或者证实其内容的真实性,如涉及版权等问题,请立即联系客服进行更改或删除,保证您的合法权益。转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。也可以邮件至 sblig@126.com