返回文章列表
模型评测

PerfReasoning:大语言模型能真正理解硬件性能吗?

阅读约 3 分钟

导语

硬件设计和软件优化都离不开性能建模。面对同一个工作负载,数据如何复用、存储层级如何承载中间结果、计算如何映射到硬件,以及数据需要移动多少次,都会影响最终性能。PerfReasoning 试图回答一个具体问题:大语言模型不仅能不能解释这些因素,还能不能据此建立可靠的分析模型?

核心要点

  • 同时评估两种能力。 该基准一方面要求模型直接回答性能推理问题,例如比较不同映射方案、预测片外数据流量和缓冲区需求;另一方面要求模型生成分析型性能模型代码。后者更接近实际工程使用,也更容易暴露推理链条中的错误。
  • 直接推理明显强于模型构建。 在基于问答的推理任务中,最强的闭源模型准确率超过 90%,表现最好的开放权重模型达到 82.4%。但当任务转为构建性能模型时,除 GPT-5.6 Sol 外,其他模型配置的平均通过率都低于 15%,而且不同运行之间波动很大。
  • 强化学习带来可量化提升。 面向具体任务训练后,一个 4B 规模模型的映射推理准确率提升了 15.7 个百分点。这说明领域化训练可能比单纯扩大通用能力更适合解决结构明确的硬件分析问题。
  • 自我修订并非可靠解法。 在没有外部反馈的情况下,让模型进行多轮自我检查和改写,并没有稳定改善结果。模型能够发现部分表面问题,但未必能验证公式、边界条件和数据移动假设是否正确。

意义与影响

PerfReasoning 的价值不只是给模型排名,更在于区分“会解释”与“能建模”这两种经常被混为一谈的能力。性能分析需要保持计算、数据复用、存储容量和移动成本之间的一致性;答案听起来合理,并不代表生成的模型可以运行,也不代表它在不同映射或边界条件下仍然成立。

这一结果对 AI 辅助芯片设计和编译优化具有直接启示。当前模型或许已经适合帮助工程师梳理设计空间、解释性能瓶颈,或快速提出候选分析思路,但在自动生成可依赖的性能模型之前,仍需要更严格的执行测试、形式化校验和外部反馈机制。基准还显示,针对任务的强化学习可能是一条有效路径,而缺乏验证信号的提示工程难以替代真正的训练。

作者计划公开这一基准,以便研究者在统一任务上复现实验并持续跟踪进展。对硬件领域而言,这类评测有助于把“看起来懂架构”转化为可测量、可复核的工程能力。

来源:arXiv

评论

正在确认登录状态……

正在加载评论……

相关文章