返回文章列表
推理与部署

从单一帕累托前沿到个性化偏好:PersonTTS让测试时扩展更贴近用户需求

阅读约 3 分钟

测试时扩展(Test-Time Scaling,TTS)的核心思路,是在推理阶段投入更多计算,让大语言模型获得更强的解题能力。常见做法包括生成多个候选、增加验证或搜索步骤,再从中选择更可靠的答案。但在真实使用中,“更准确”通常不是唯一目标:有的用户愿意等待更久以换取成功率,有的用户更在意响应延迟,也有人需要严格控制推理费用。

这正是论文《From Pareto to Preference》试图解决的问题。作者指出,现有TTS效率研究往往沿着单一资源维度优化,例如在准确率—成本或准确率—延迟之间推进一条帕累托前沿。这样的结果能够说明不同策略的总体取舍,却未必能直接回答某个具体用户的需求组合:在给定准确率门槛的同时,既不能超过延迟上限,也不能突破成本预算时,应该采用哪一种控制器?

论文将这一任务定义为“个性化测试时扩展”:针对用户特定的准确率、延迟和推理成本要求,发现能够最大化联合满足率的可执行控制器。这里的控制器可以理解为负责安排测试时计算的策略,例如决定何时生成更多候选、何时进行验证,以及何时停止继续推理。重点不只是找到某个平均表现最好的方案,而是让策略与用户偏好相匹配。

核心方法包括:

  • 需求驱动的控制器发现:将多项约束放在同一评价目标中,直接衡量一个候选策略满足用户全部要求的程度。
  • 跨用户经验复用:PersonTTS不会为每个新用户画像从零开始搜索,而是根据需求相似性初始化控制器。
  • 程序化经验提炼:框架从此前搜索过程中提取可复用的程序化指导,帮助发现代理更快探索可能的策略。
  • 目标画像重新评估:即使使用了其他用户的经验,每个候选控制器仍会在目标用户画像下接受评估,避免简单照搬历史结果。

实验覆盖AIME和HMMT,并考察未见过的用户画像及留出题目。根据论文摘要,PersonTTS在联合需求满足率上优于多种TTS基线;在候选评估预算相同的条件下,跨用户经验复用还进一步改善了策略质量,同时降低了发现代理所需的时间和成本。

这项工作的价值在于,它把TTS的优化目标从“寻找一条普适的效率曲线”推进到“为具体偏好选择推理策略”。对于推理服务提供商而言,这种思路有助于根据不同套餐、设备和响应要求动态配置计算;对于研究者而言,它也提示未来的TTS评测不能只报告准确率或单项成本,而应关注多约束下的满足率。不过,摘要没有给出具体提升幅度,控制器的可迁移范围及其在更多任务、模型和实际流量中的稳定性,仍需要完整论文和后续研究验证。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章