返回文章列表
AI 科研

数学发现的瓶颈,可能不是解题,而是找对问题

阅读约 2 分钟

导语:研究资源首先卡在“选题”

当 AI 开始参与研究级数学工作时,真正稀缺的资源不只有模型的长链推理能力,还有专家逐项检查证明、反例和问题表述的时间。传统的人机协作通常由人先挑出一个问题,再让模型尝试解决,最后由数学家审核结果。随着候选数量和模型产出不断增加,开头的选题与结尾的复核都可能成为瓶颈。

论文《The Problem Is the Problem: Towards Scalable Mathematical Discovery》提出的 FAR,试图改变这一工作流:专家不必预先指定某一道题,而是给出自己熟悉并感兴趣的研究方向,系统负责在相关文献中寻找值得尝试的问题。

核心要点:把数学发现做成分层筛选

FAR 的名称对应三个阶段:

  • Find:从较大规模的数学文献中恢复猜想、开放问题及其上下文;
  • Attempt:让模型对经过初步整理的问题进行尝试,产生可能的证明、解答或推进方向;
  • Recommend:依据自动化分流结果,把更值得关注的材料推荐给专家团队。

在组合数学试验中,流程从 5,245 篇论文出发,提取出 6,453 个候选猜想或开放问题。经过对问题表述和开放状态的筛选,留下 4,717 个看似定义良好且仍未解决的候选。随后,系统发现 598 个潜在解答,并将其中 77 项送交作者团队复核。研究者报告称,这一过程中涉及 Davies–Jenssen–Perkins–Roberts、Erdős–Straus、Ikenmeyer–Pak–Panova 以及 Lund–Saraf–Wolf 等相关猜想或问题。

意义与边界:AI 更像研究流量的调度器

这套方法的重要变化,是把 AI 的角色从“回答人类指定的问题”扩展为“帮助人类决定哪些问题值得回答”。它借鉴搜索和推荐系统的思路,将昂贵的推理与人工审阅集中在多轮过滤之后,从而减少专家面对海量低质量候选的负担。

不过,自动筛出的“仍未解决”并不等于真正开放,模型生成的潜在解答也不等于经过严格证明。论文中的数字描述的是组合数学试验流程及其筛选结果,最终价值仍取决于作者团队的数学复核。因而,FAR 更适合作为研究导航和候选分流基础设施,而不是无人监督的定理生产线。它所展示的关键方向是:当 AI 的解题能力持续提升,如何更系统地管理问题发现、验证和专家注意力,可能比单纯追求更长的推理过程更重要。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章