代码只改几行,Token却被吃掉12万?这个优化太狠了

分类小报
· 进步分子, 投稿

你是不是也遇到过这种坑:明明只需改几行代码,却因为长上下文反复携带,一次性烧掉几十万 Token?腾讯云轻量云团队的 DevFlow 就是活生生的例子。

事情是这样的,在多 Agent 研发工作流里,随着流程推进,上下文会不断膨胀。有一次 Developer 的上下文已经攒到了 120K tokens,结果只为了改一个 handler 逻辑、补个 import、再改另一个 handler 并更新报告。如果这 4 个动作拆成 4 轮请求,每轮都要带着那 120K 的“历史包袱”重来一遍。真正新增的代码可能才几十行,但成本却被指数级放大。这就是典型的“长上下文 × 额外模型请求”陷阱。

怎么破?腾讯云给出了三招“省钱秘籍”。第一招是“断舍离”,把代码探索交给短生命周期的临时 Agent,只把结论传给主流程,原始搜索记录随 Agent 消失而退出;第二招是“按需加载”,模板和 Skill 不再一次性塞进 Prompt,而是等到真正要写报告时才读取;第三招是“合并打包”,多个独立的读写操作尽量在一轮响应里提交,还专门设计了 replace_batch 工具,让一次调用搞定多处修改,避免重复消费长上下文。

这套组合拳下来,不仅砍掉了大量无谓的模型往返,更关键的是控制住了上下文的膨胀速度。对于正在做 AI 辅助开发或构建多 Agent 系统的你来说,这绝对是一份值得细品的实战指南。想深挖背后的 LoopForge 项目?去 GitHub 看看吧!

来源:https://mp.weixin.qq.com/s/1jTuuEZzOryliS1C87Jy1g

订阅《创造者日报》邮件版
每天精选可动手的搞钱机会、好用工具与稀缺观点,免费直达你的邮箱。
English reader? Subscribe the EN edition →
iMessage 邮件 联系我们
EN