新浪新闻

提价后开发者Token成本激增,Harness工程如何实现效率跃升?

BigNews 08.07 18:48

模型集体提价导致开发者Token成本激增,而解决问题的关键已从“选模型”转向“搭Harness”——通过工程化手段优化上下文和调度逻辑,可在不换模型的情况下大幅压低Token消耗。

一、Harness工程的核心目标确立:成本管控边界与上下文约束

定义问题边界:Harness(AI Agent的运行时控制层)负责管理Token消耗的三大来源——系统提示词冗余(约22%)、记忆与上下文浪费(约20%)、工具返回冗余(约18%)。不干预Harness,78%的Token消耗属于无效浪费。

关键认知转变:决定Token成本的已不是模型单价,而是编排层的上下文组织方式。有实验证明,在保持6个模型和22个任务不变的前提下,仅替换Harness层,每任务Token消耗从14.2k降至8.8k。

效果量化基准:不同Harness对同一模型的Token花费影响最高差30倍;开源项目OpenSquilla通过智能路由可实现60%-80%的成本节省;腾讯云开发者团队基于10个优化方向实现全流程预估降本50%-65%。

二、关键效率提升手段:上下文瘦身与智能调度

分步曝光上下文:改造SKILL.md,将非必要内容后置到资源层按需提取。改造后自动化测试Skill正文从198行降至128行(-35%),主调度Skill(tech-leader)只保留骨架与分流规则,执行细节按需读文件。

CLI替代MCP调用:将数据库迁移、编译、服务启动等确定性操作封装为统一脚本(如dev-env.sh),AI只传参数不拼命令。MCP工具每次调用需额外消耗10-15KB输入Token用于JSON Schema,且算入一次完整LLM推理轮次,用CLI可直接跳过这些中间环节。

动态提示词分层:将系统提示词拆为静态层(角色设定,可缓存命中99.9%)、语义层(任务相关,按需加载)、上下文层(本次临时信息)。经过缓存设计,7,876个Prompt Token中有7,876个来自缓存读取。

三、效率跃升的关键结论:Harness决定成本下限,模型决定质量上限

编排层降本普遍有效:在6个不同模型上测试,仅换Harness后成本下降幅度在33%到61%之间,与模型能力无关。这意味着无论用哪个模型,Harness优化都能带来确定的成本收益。

质量提升依赖模型能力:在48个能力指标×模型单元中,Harness提升了30个单元的质量,但有7个回退,且均集中在Flash 3.5、Qwen 3.6等较小模型上。小模型即使有好的Harness,也难以在复杂推理上取得质量突破。

投资回报清晰:一旦采用“分层动态注入+智能路由+缓存复用+上下文瘦身”的综合Harness方案,可在保持95%以上语义保留率的前提下,将Token成本降低60%-80%,同时将推理延迟降低50%以上。 (以上内容均由AI生成)

加载中...