代码只改几行,Token却被吃掉12万?这个优化太狠了
分类小报
你是不是也遇到过这种坑:明明只需改几行代码,却因为长上下文反复携带,一次性烧掉几十万 Token?腾讯云轻量云团队的 DevFlow 就是活生生的例子。
事情是这样的,在多 Agent 研发工作流里,随着流程推进,上下文会不断膨胀。有一次 Developer 的上下文已经攒到了 120K tokens,结果只为了改一个 handler 逻辑、补个 import、再改另一个 handler 并更新报告。如果这 4 个动作拆成 4 轮请求,每轮都要带着那 120K 的“历史包袱”重来一遍。真正新增的代码可能才几十行,但成本却被指数级放大。这就是典型的“长上下文 × 额外模型请求”陷阱。
怎么破?腾讯云给出了三招“省钱秘籍”。第一招是“断舍离”,把代码探索交给短生命周期的临时 Agent,只把结论传给主流程,原始搜索记录随 Agent 消失而退出;第二招是“按需加载”,模板和 Skill 不再一次性塞进 Prompt,而是等到真正要写报告时才读取;第三招是“合并打包”,多个独立的读写操作尽量在一轮响应里提交,还专门设计了 replace_batch 工具,让一次调用搞定多处修改,避免重复消费长上下文。
这套组合拳下来,不仅砍掉了大量无谓的模型往返,更关键的是控制住了上下文的膨胀速度。对于正在做 AI 辅助开发或构建多 Agent 系统的你来说,这绝对是一份值得细品的实战指南。想深挖背后的 LoopForge 项目?去 GitHub 看看吧!
来源:https://mp.weixin.qq.com/s/1jTuuEZzOryliS1C87Jy1g