英伟达紧随OpenAI之后,也推出了重大开源项目——SoL-Pi。
这一系统以Pi为基础平台,在其上构建了一套Harness效率增强层,使AI能够实现自我迭代与优化。
在这套高度自动化的流程中,AI扮演了研究员的角色。它们观察Agent的操作过程,识别出那些浪费Token的步骤,提出改进方案并修复漏洞,随后将方案提交进行测试。
AI从152个候选方向出发进行搜索,最终筛选出四种核心架构机制。
实际测试的结果令人惊讶:Token消耗最高可减少64%,API调用成本下降了50%至54%。
在专业研究场景下,每小时可直接节省8.75美元至13.5美元。英伟达此举相当于将AI成本优化的开关开放给了公众。
安装过程非常简单,只需一行代码:「pi install git:github.com/NVlabs/SoL-Pi」,即可将其部署到现有的Pi系统上。
Codex高速运行,但半数Token可能空转
在让AI进行递归自我改进之前,能否先让它降低自我改进的成本?Harness,即模型运行时使用的整套框架,被认为是当前最佳的解决方案。
模型负责推理,而Harness负责整合工具、上下文、执行反馈和任务流程,使模型能够读取文件、修改代码、运行测试,并根据结果继续行动。
同一模型在不同Harness中的运行效率可能差异显著。
当前的问题在于,编程智能体的任务正变得越来越复杂。从补全几行代码,到跨仓库修复问题,再到长时间自主工作,单次任务可能持续数小时。此时,一些平时不明显的Token浪费会逐渐累积。
例如,修改完文件后,下一步明明是运行测试,模型却仍需进行一次推理。一个已读取的大文件,在后续请求中仍被反复携带。在数千行日志中,真正影响决策的可能只有几行,但昂贵的模型却不得不从头读取。
递归自我改进(RSI)同样无法避免这种开销。AI每次尝试改进系统都需要消耗Token,失败的方案也不例外。SoL-Pi的出现正是为了解决这一问题。
最终结果显示,与基础Pi相比,SoL-Pi减少了45%至49%的Token使用,成本降低了约三分之一,平均得分保留了约94%。与Codex和Claude Code原生的Harness相比,Token使用量减少了35%至64%,标价成本降低了50%至54%。
SoL-Pi是如何实现如此出色表现的?这需要详细拆解其四大核心机制。
AI自我进化,四大策略登场
英伟达的流程最终保留了四种机制,这些机制精准地针对重复性劳动。
第一层:动作融合,一次调用完成编辑与验证
Action Fusion直接针对的是两次工具调用之间多余模型决策环节。在基础Pi的运行轨迹中,最常见的序列是修改文件、接收结果,然后再调用命令进行测试或构建。既然后续命令已经非常明确,那么中间这轮模型的“一来一回”就有了巨大的压缩空间。
Action Fusion将一次编辑及其后续命令封装在同一个本地执行序列中。Harness在底层完成修改和命令运行,再将合并后的结果一次性返回。测试照常执行,结果正常获取,但中间那轮模型请求被成功省去。这相当于将两次分散的请求合并为一次高效的闭环操作。
第二层:在线上下文压缩,按子任务动态核算成本
Online Context Compact解决的是“何时触发压缩”这一核心痛点。上下文越长,历史材料越容易变成算力与资金负担。但压缩也有代价:重写上下文可能会打断已有的KV-cache复用,需要重新支付处理成本。因此,过早压缩未必省钱,过去的策略往往是将压缩动作尽量推迟。
SoL-Pi重构了判断时机。它将大任务拆分为子任务,每完成一步,就重新进行评估。其核心逻辑在于精准计算:只有当“未来预计省下的开销”能够覆盖“本次重写的成本”时,系统才会真正执行压缩操作。
第三层:输出归档与索引,大块文件按需召回
ObservationPack专门处理大段工具输出造成的“重复计费”问题。一个大文件或一份超长结果,首次读取后如果一直滞留在上下文里,后续每一轮请求都会原样携带它,持续消耗缓存资源。
SoL-Pi的做法是将完整内容直接归档到本地磁盘,上下文里只留一个稳定的短句柄和一小段摘录。这就像读完长篇报告后,直接把原件存档,手边只留索引和关键摘要。模型需要查阅细节时,直接根据索引按页取回即可。
第四层:小模型初筛日志,引入严格的证据核验机制
Evidence-Preserving Reducer的核心,是将长日志的第一遍阅读委派给成本更低的模型。构建和测试日志动辄上万字,真正影响下一步决策的往往只有几行报错。让前沿大模型每次通读全文成本极高;而直接交给小模型总结又容易引入幻觉。
SoL-Pi在中间加了一道严格的防线——证据核验。辅助模型读完日志后,必须输出一份紧凑的诊断回执。系统会拿着这份回执,逐条与归档的原始日志进行比对。只有严丝合缝对得上的原文,才会被放行交给前沿大模型。这确保了主模型只接收被证实的信息,从源头上切断了误差传导。
152个点子筛选,仅留下4个
为什么是这4个机制?这就要说到英伟达真正的野心,RSI(递归自我改进)。既然AI能改代码,也应该能改造“生产AI的系统”。但RSI太烧钱,每一次试错都要付Token费。于是英伟达换了个目标——先别急着让AI更聪明,先让它更省钱。
相比直接追分,Token效率更难作弊。刷任务分数很容易过拟合,给特定题目写规则就行;但删重复上下文、压缩工具输出、合并无效决策,这些优化能迁移到不同任务和模型。
于是,一条“Agent研究Agent”的流水线启动了:团队先搭出535个可验证环境,再让AI提出152个优化方向,随后经过三轮筛选——先用历史轨迹估算收益,没潜力的直接淘汰;再让AI自己改代码、跑实验,并由Reviewer Agent挑刺;最后冻结方案,在完全隔离的held-out任务上验真,能力不能掉,效率必须涨。
152个想法,最终只活下来4个,平均约40个才能出1个。于是SoL-Pi的核心方法也逐渐清晰:让AI大量提出假设,再自动实验、淘汰、验证,把真正有效的少数机制筛出来。
让RSI飞轮自行运转
SoL-Pi背后,是MIT副教授、英伟达研究总监韩松掌舵的Efficient AI团队。对他们来说,SoL-Pi当前省下了多少Token开销,不过是一个阶段性注脚。他们真正看重的,是这条“AI研究AI”的飞轮还能转多大。
在官方项目主页中,团队还埋下了两个极具野心的长线伏笔:
一个是“闭环预训练”(Pretraining the harness)。 目前的535个环境依然是人工构建的,未来将由Agent自己去全网收集任务、搭环境、验证、更新自己的harness。算力和环境多样性一旦拉升,harness很可能也会跑出属于自己的Scaling Law。
另一个是“效率复利”(Efficiency for efficiency)。 用变省了的harness,去跑规模更大、成本更低的自动研究循环,进而找出更高效的机制,形成成本压缩的复利效应。
在这个飞轮里,人只负责在初期提供先验方向;一旦进入循环,从研究到验证全程零干预;等AI把机制跑通了,人再回来搞清楚AI到底发现了什么,并将机器生成的粗糙代码重构成符合工业标准的版本。
现在,模型的Scaling Law各家还在争论不休;但Harness的Scaling Law,已经有人开始抢跑了。而那个在赛道上狂奔的,是AI自己。
参考资料: https://nvlabs.github.io/SoL-Pi/ https://github.com/NVlabs/SoL-Pi https://x.com/MaxForAI/status/2098050525279478059 本文来自微信公众号“新智元”,作者:ASI启示录,编辑:桃子 摩西,36氪经授权发布。