从单一答案到多方案:化学可行性感知的逆合成语言模型
一项新研究提出 Top-K 提示与训练范式,让语言模型在单步逆合成中同时生成多种可能路线。基于约4560万条经验证反应训练的 C3LM,在 OOD URSA-expert-2026 基准上展现出竞争力,并与传统模型形成互补。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 775 篇文章
一项新研究提出 Top-K 提示与训练范式,让语言模型在单步逆合成中同时生成多种可能路线。基于约4560万条经验证反应训练的 C3LM,在 OOD URSA-expert-2026 基准上展现出竞争力,并与传统模型形成互补。
阅读全文大型语言模型对高频事实往往记忆更深,传统统一强度的知识卸载方法因此容易失效。AdaPop根据事实流行度和局部置信度调整遗忘压力,并用控制器动态平衡遗忘与保留。
阅读全文Ramp面向美国企业的支付数据表明,Anthropic在企业用户中的领先仍未稳固,OpenAI近期增长速度更快。与此同时,整体企业AI付费率持续上升,说明市场扩张与份额争夺正在同时发生。
阅读全文OpenAI推出Apple信息插件,允许ChatGPT在用户授权后分析、整理、搜索、编辑甚至发送消息。该功能把聊天机器人推进到个人通信执行层,同时也放大了本地权限、云端存储和自动发送的隐私风险。
阅读全文Google允许出版商在网站上嵌入“首选来源”按钮,让读者主动选择希望在搜索、Discover和Google News中优先看到的媒体。此举既是用户体验功能,也反映出AI搜索减少传统网页点击后,Google对内容生态压力的回应。
阅读全文当 GPU 从稀缺设备变成可按小时租赁的生产资料,算力价格波动就开始具备金融对冲需求。CME、Silicon Data 与 CFTC 的一系列动作,显示 GPU 期货正在从概念走向市场基础设施。
阅读全文Pew Research对近五年英文网页的分析显示,在剔除ChatGPT发布前的旧页面后,约35%的页面呈现出明显的AI创作或深度编辑迹象。研究也发现,不同类型域名之间的AI使用比例差异显著。
阅读全文企业支出管理平台Ramp推出AI模型路由服务Router,通过统一API连接多家大模型,并提供按成本、性能和难度分配请求的策略。该服务目前仅在美国开放,2026年剩余时间免收路由服务费,但模型推理费用仍由用户承担。
阅读全文Meta 正把实验性 AI 游戏创作应用 Pocket 推向美国用户。用户只需输入提示词,就能生成可互动的小型游戏,并将其发布、 remix 或分享给他人。
阅读全文研究人员发现,攻击者可将恶意提示加密后藏在网页中,诱导Grok自行解密并执行,从而把用户姓名、位置和聊天记录发送至攻击者服务器。该案例暴露出传统静态内容过滤难以覆盖工具输出与运行时状态。
阅读全文Slack正在推出Slack Code,将代码任务、AI代理和团队讨论集中到专属频道中。团队成员可以查看代码变更、预览网页效果,并在上线前提供反馈和审批。
阅读全文Binance推出Agent OS,让开发者可将ChatGPT、Claude Code、Cursor等AI工具接入交易、支付和链上服务。代理能够代用户下单,但风险控制主要依赖用户配置子账户和权限。
阅读全文Co-RL提出一种协作式多智能体强化学习框架,让多个不共享参数的模型通过彼此反馈获得奖励。在没有人工标注或可验证真值的情况下,模型仍能提升文本与多模态推理表现。
阅读全文FM-Bench把大模型放进一个持续20年的足球管理环境,观察它们如何在预算、交易、续约、青训和董事会压力下做出连贯决策。结果显示,真正拉开差距的不是模型规模或推理花费,而是管理行为。
阅读全文一项研究提出用序列标注替代孤立的Token打分,将文本统计、NLI蕴含关系和语言模型惊异度融合起来检测幻觉。BiGRU在RAGTruth上取得0.840 AUC,并显示时间上下文比单纯增加模型容量更关键。
阅读全文Zetta 提出一种闭环具身智能框架:在冻结基础策略的前提下,在线进化运行时批评器与恢复技能。它将动作级干预、回合级复盘和验证式更新结合起来,提升机器人在复杂环境中的执行可靠性。
阅读全文OmniScientist试图把AI科学家的能力从文本和预处理特征扩展到图像、信号、音频、视频、三维结构等异构原始数据。系统通过感知、构思、实验和写作环节,完成从研究问题到论文草稿的端到端流程。
阅读全文杰富瑞分析师围绕五类真实办公任务测试了八款全球主流Agent,阿里千问办公在综合表现和隐含Harness评分上排名第一。测试也显示,Agent竞争正从单纯比模型能力转向比任务完成质量与执行成本。
阅读全文FreeToken 提出一种面向边缘设备的 MoE 服务系统,不再把个人电脑简单视为“缩小版 GPU”,而是将 CPU、GPU、内存与存储统一调度。论文展示了在消费级和工作站硬件上运行更大开放权重模型的可能性。
阅读全文Agent Lightning v1.0提出“框架原生智能体强化学习”范式,让部署时负责工具调用、上下文管理和流程控制的智能体框架直接参与模型后训练。实验显示,仅用6000个训练样本和有限算力,Qwen3.5-9B在SWE-bench Verified上的成绩从41.8%提升至56.4%。
阅读全文一项覆盖多种记忆存储方式的统一评估显示,记忆系统的优劣取决于任务、上下文长度和运行成本。对长期运行的智能体而言,动态选择记忆基底可能比寻找单一最优方案更重要。
阅读全文