LLM-as-a-Verifier:一种通用验证框架
该框架通过在智能体任务中提供细粒度连续评分,在多个机器人及编程基准上达到最先进性能,并可用于强化学习提升样本效率。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
研究人员提出LLM-as-a-Verifier,一种无需额外训练的通用验证框架,专为智能体任务设计。该框架不采用传统的大语言模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身裁判方法(即提示模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身对候选解决方案输出离散分数),而是通过计算评分token logits分布的期望生成连续分数。这种概率化公式使验证可沿多个维度扩展:评分粒度、重复评估和标准分解。实验表明,提升评分粒度能更好区分正负解决方案,得到更校准的比较;而扩展重复评估和标准分解通过方差与复杂度降低,持续带来验证准确率的增益。研究进一步引入一种成本高效的排序算法,利用验证器的连续分数从候选中选出最佳方案。
LLM-as-a-Verifier在Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench和MedAgentBench上分别达到86.5%、78.2%、87.4%和73.3%的最优性能。此外,该框架的细粒度信号可作为任务进度估计的代理,研究团队已为Claude Code构建扩展,使开发者能够监控和改进自身智能体系统。最后,研究表明LLM-as-a-Verifier可为强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身提供密集反馈,在机器人学与数学推理基准上提升了SAC和GRPO的样本效率。