返回文章列表
强化学习

Shopify如何用PyTorch和vLLM把生产失败变成模型能力

阅读约 3 分钟

生成式AI产品上线后,真正棘手的问题往往不是如何启动,而是如何持续变好。Shopify在GraphQL智能体上的实践,展示了一个以PyTorch和vLLM为基础的持续学习闭环:系统每天吸收生产中的失败,把产品经验逐步压缩进模型权重。其结果是,模型质量超过通用前沿模型,同时服务成本下降96%。

先定义质量,再谈训练

Shopify认为,质量标准是整个闭环的起点,也是后续学习真正优化的奖励信号。团队把产品要求拆成完整性、执行效果、回答质量和安全性等维度,并为每个分数提供清晰锚点。这样,产品规范才能变成标注员、评审模型和训练流程都能理解的质量契约。

评测数据不能只由精心挑选的样本构成。黄金样本有助于检查已知问题,但随机抽取的真实流量才能揭示生产环境中未被预料的失败。Shopify还建议让两名资深标注员盲评随机样本,并用Cohen’s kappa检查一致性。如果专家之间都难以达成一致,说明评分标准仍然含糊,直接交给模型只会放大误差。

把评审模型校准成可靠指标

初始评分标准只是评审模型的起点。Shopify使用DSPy,并结合GEPA、Agentic Context Engineering等反思式优化方法,根据失败记录改进评审提示和结构化规则。评审模型不能只在离线数据上看起来准确,还应回测既有A/B测试,确认它能识别已知的成功与失败方向,并通过定向降级实验验证每个指标是否真的对准目标行为。

实践中,多个小而专注的评审器通常比一个包揽所有行为的“大评委”更容易解释和信任。它们共同构成离线优化指标,但仍需持续与真实线上表现对照。

先优化应用外壳,再更新模型权重

在训练模型之前,Shopify先用自动研究方法改进已有的前沿模型应用。优化对象不只是单条提示词,还包括工具定义、动态提示组装和控制循环等完整 harness。代理提出改动,用评审器打分;得分提升就保留,否则丢弃。这个过程把应用代码也纳入了可迭代的实验空间。

当提示词、工具和编排的改进趋于停滞,团队再从匿名生产流量中挖掘难例。前沿推理模型组成的评审面板会分析失败对话,由仲裁器合并为修复指令,并将指令插入用户回合之前重新回放。若修复后的对话通过评审,就可成为强化学习轨迹;仍然失败的案例则交给人工专家,使用同一套评分标准进行纠正。

这些修复后的轨迹先用于监督微调较小模型,再通过强化学习把评审得分转化为奖励,进一步更新模型权重。由此,生产中的失败不再只是工单、提示词补丁或Slack讨论,而成为模型能力的一部分。

意义与影响

这套方法的关键不在某个单独组件,而在于把质量定义、自动评审、应用优化、难例挖掘和权重训练连接起来。它也说明,企业模型的竞争力可能来自对自身生产数据的持续吸收,而不仅是初始模型规模。PyTorch提供训练基础,vLLM支撑高效服务,二者与评测和数据流程结合后,才形成可持续的工程飞轮。

来源:PyTorch Blog

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
让推理模型学会适时停下:效率奖励如何改善拒答能力
强化学习
cctest.ai
强化学习

让推理模型学会适时停下:效率奖励如何改善拒答能力

一项研究发现,推理模型面对信息不足的问题时,往往比面对可回答问题投入更多计算,并在无休止的思考后仍尝试作答。研究者通过强化学习奖励高效判断任务是否可解,使模型在提升拒答表现的同时显著缩短思维链。

阅读全文