Meta 的 AIRA3 在 NVIDIA 4,182 支队伍参加的 Nemotron 挑战赛中排名第八
Meta 表示,AIRA3 通过自主微调 NVIDIA 的 Nemotron-3-Nano-30B 推理模型,获得了 Kaggle 金牌。
文章目录 · 12
一、一场真实竞赛让 Meta 的研究系统与数千支队伍同场较量
Meta 表示,其 AIRA₃ 自主研究系统在 NVIDIA 的 Nemotron 模型推理挑战赛中排名第八,在 4,182 支队伍中获得 Kaggle 金牌。
这一结果来自一场真实进行的竞赛,而非 Meta 事后组建的基准测试。Kaggle 记录显示,该挑战赛于 2026 年 3 月 16 日至 6 月 15 日举行,吸引了 5,223 名参与者,并收到 71,743 份提交。Meta 于 6 月让 AIRA₃ 参赛,并表示其最终成果通过了与其他参赛者排名所用相同的私有测试集评估。
第八名并不意味着赢得比赛:有七支队伍排名高于 AIRA₃,而 Kaggle 的现金奖仅授予前三名。“金牌”指的是该平台的奖牌等级。这一区别很重要,因为将结果描述为 AIRA₃“击败了 4,000 支队伍”,抹去了排名更高的参赛结果,也混淆了获得奖牌与取得第一名之间的差异。
即使有上述限定,这一排名仍比内部演示提供了更有力的证据。目标模型、提交格式、评估程序和截止日期均由 NVIDIA 与 Kaggle 设定。Meta 可以针对公开任务进行优化,但并不控制最终评分环境。
Meta 将这一结果解读为 AIRA₃ 能够以可与人类专家相当的水平提升特定模型能力的证据。该排名支持了一个更狭义的主张:该系统生成了一份竞争力极强的微调提交。它本身并不能证明其具备通用科学能力,或在开放式工作中与人类研究人员等同。
二、Nemotron 挑战赛实际衡量了什么
该竞赛要求参赛者在保留相同基础模型的前提下,提高 NVIDIA-Nemotron-3-Nano-30B 的推理准确率。规定提交内容为兼容的低秩适配(LoRA)适配器,最大秩为 32。
这一限制使竞赛成为一个针对性的模型改进问题,而不是寻找能力最强、没有限制的大语言模型。参赛者可以改变训练数据、提示策略、合成数据管线、强化学习方法或轻量级微调流程,但其最终适配器必须能够在 NVIDIA 指定的模型和评估栈上运行。
NVIDIA 的技术报告将 Nemotron 3 Nano 描述为混合式 Mamba-Transformer 专家混合模型。它总计包含 316 亿个参数,每次前向传播会激活 32 亿个参数;若计入嵌入层,则约为 36 亿个。
根据冠军队伍公开的技术说明,提供的训练集包含 9,500 个带标签的问题,涵盖位操作、数值方程、字母算术、文本密码、计数系统、单位换算和重力。每个提示都提供未知转换规则的示例,并要求模型在回答新案例前推断该规则。
Kaggle 使用 vLLM 推理引擎加载每个提交的适配器。答案主要从 LaTeX \boxed{} 表达式中提取;当其与参考字符串完全一致,或处于 \(10^{-2}\) 的相对数值容差范围内时,即被判定为正确。最终得分为正确答案所占比例。
固定的推理配置包括 8,192 个 token 的模型长度、最多生成 7,680 个 token、温度为零,以及 top_p 设为 1.0。这些控制项减少了采样行为造成的差异,使排名更集中反映每个适配器学到了什么。
私有测试集限制了针对最终答案的直接优化,但并未形成一项受控的人类对 AI 实验。Kaggle 队伍可以使用不同的算力预算、外部资源和自动化工具,一些提交本身也可能高度依赖 AI。因此,排行榜比较的是完成的系统和工作流,而不是在相同实验室条件下、没有辅助的个人研究人员。
三、AIRA3 使用了多种模型和编码工具链
Meta 表示,AIRA₃ 并不依赖单一智能体或中央控制器。它在隔离环境中运行多个长期运行的智能体,每个智能体都将一个语言模型与编码工具链配对。
这些智能体通过两种共享机制异步协调。论坛用于传递假设、实验发现和讨论,共享文件系统则存储解决方案产物。随着信息不断积累,各个智能体自行决定调查或扩展哪些发现。
这一设计旨在让有价值的发现超越单个智能体的上下文窗口或运行时长而保留下来。一个模型与工具链组合完成的实验可以成为另一个组合的输入,使后续工作能够建立在先前结果之上,而不是独立重新开始搜索。
在这场真实进行的 Nemotron 竞赛中,Meta 使用了一个集成方案,将搭配 OpenCode 的 GPT 5.5 与搭配 Claude Code 的 Claude 4.8 结合起来。因此,第八名的结果属于完整的 AIRA₃ 工作流,而非某一个底层语言模型。
Meta 还报告了在同一私有测试集上进行的若干赛后评估。使用 Muse Spark 1.2 与 MuseCode 的配置达到了 Meta 所称的金牌表现。Muse Spark 1.1 搭配 OpenCode,以及 GLM 5.2 搭配 OpenCode,则达到了银牌区间。
这些事后结果为编排方案能够适用于不同模型与工具链组合提供了有用证据,但它们并非额外的真实竞赛排名。只有 GPT 5.5 与 Claude 4.8 的集成方案在竞赛期间获得了所报告的第八名。
四、AIRA3 如何延续 Meta 先前的研究智能体工作
AIRA₃ 延续了 Meta 于 2026 年 4 月记录的 AIRA₂ 系统。该早期项目聚焦于自主机器学习研究中的三个瓶颈:有限的实验吞吐量、长时间搜索中不可靠的验证信号,以及固定单轮模型操作者的受限行为。
AIRA₂ 通过异步多 GPU 工作池、Hidden Consistent Evaluation 协议,以及能够交互式界定和调试自身工作的 ReAct 智能体来应对这些问题。
Meta 报告称,在 MLE-bench-30 上,AIRA₂ 在 24 小时后的平均百分位排名为 81.5,72 小时后为 83.1,而最强基线为 72.7。在其独立的 AIRS-Bench 套件上,AIRA₂ 在 20 项任务中的六项上超过了所述的人类最先进水平。
AIRA₃ 的公告将评估从选定的研究基准转向一场具有外部截止日期和私有评分的活跃竞赛。其论坛与文件系统设计也强调持久化智能体之间的协作,而不是仅将并行工作者呈现为提高实验吞吐量的方式。
Meta 尚未发布 AIRA₃ 论文、源代码版本或详细技术报告。该公告未披露智能体数量、总算力开支、训练方案、实验次数、Meta 研究人员的干预情况,或用于区分共享知识价值与增加试验次数价值的消融实验。因此,目前尚无法复现这一第八名工作流,或确定哪一组件贡献最大。
五、这一结果证明了什么,以及哪些问题仍未得到验证
最明确的实际结果是:一个自主研究工作流在外部评估下,为受约束的模型训练问题生成了一个前十名解决方案。对于构建研究智能体的开发者而言,这表明该工作流能够充分管理数据生成、实验、微调和选择,从而与经验丰富的 Kaggle 队伍竞争。
这一结果并不表明 AIRA₃ 独立选择了有价值的研究问题、设计了评估方案,或改进了其自身的底层智能体模型。它是针对已知竞赛目标,对独立的 Nemotron 模型预定义能力进行优化。将其描述为递归自我改进,将超出现有证据所能支持的范围。
Meta 表示,只需更改任务说明,同一系统即可在不同领域之间迁移。它报告称,在内部基准测试中,生产环境 GPU 内核的延迟降低了 27%;并在 Kaggle 的 Deep Past Challenge 中达到了金牌级表现,该竞赛涉及将音译的古亚述阿卡德语翻译成英语。
Deep Past 竞赛有 Kaggle 的独立记录,但 Meta 尚未为该次运行提供可识别的 AIRA₃ 排行榜条目、得分或技术说明。GPU 内核数据同样属于内部结果,未披露工作负载、基线、硬件配置或测量方法。因此,这两项结果都应被视为 Meta 报告的迁移测试,而非可独立复现的证据。
对于评估自主研究系统的公司而言,Nemotron 的排名证明了具有竞争力的任务表现,但成本和效率仍未得到解答。若没有算力使用情况、人工监督记录,以及与独立并行智能体的受控比较,该结果无法证明 AIRA₃ 是否比专家团队更经济,或其共享协调机制是否优于同等规模的非协调搜索。
常见问题
什么是 AIRA3?
AIRA₃ 是 Meta 的自主 AI 研究系统。Meta 将其描述为多个长期运行的模型与编码工具链组合,它们在隔离环境中工作,并通过共享论坛和文件系统进行协调。
AIRA3 赢得 NVIDIA 竞赛了吗?
没有。它排名第八并获得 Kaggle 金牌。七支队伍排名更高,而该竞赛的名次奖金覆盖前三名。
哪些模型驱动了真实竞赛提交?
Meta 表示,真实参赛条目结合了运行 OpenCode 的 GPT 5.5 和运行 Claude Code 的 Claude 4.8。
AIRA3 对 Nemotron 做了什么改动?
它为 NVIDIA 的 Nemotron-3-Nano-30B 基础模型生成了一个 LoRA 适配器,其秩限制为 32。竞赛衡量的是经适配后的模型能否更准确地回答结构化推理问题。
AIRA3 是否公开可用?
Meta 的公告未提供 AIRA₃ 的源代码版本、可下载系统或完整技术论文。其确切训练流程和算力需求仍未披露。
参考来源
Share