AlphaEvolve助力矩阵乘法指数再创新低:ω上界降至2.371177
DeepMind团队联合研究者重新设计矩阵乘法指数优化问题,并引入机器学习算法与AlphaEvolve进行搜索,将当前上界从2.371339推进至2.371177。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 791 篇文章
DeepMind团队联合研究者重新设计矩阵乘法指数优化问题,并引入机器学习算法与AlphaEvolve进行搜索,将当前上界从2.371339推进至2.371177。
阅读全文Ventor-QTest 提出一种无需目标 API 提供概率信息的黑盒审计方法,通过重复请求和长序列探测,衡量托管模型输出的稳定性与极端偏离。
阅读全文牛津大学研究团队用 128 张二手 GPU 搭建 DumpsterCluster,验证了退役硬件服务大模型推理的可行性。研究同时指出,低采购成本并不等于低总成本,电价与电力碳强度将决定这类方案是否真正划算。
阅读全文一项针对37个大语言模型的心理测量审计发现,模型能够复现人类态度关系的大致方向,却难以稳定保留真实受访者数据的联合分布、潜在结构和人口统计效应。
阅读全文RAG 投毒攻击可能让模型在错误信息面前表现得更加自信,传统基于困惑度和一致性的检测因此容易失效。论文提出 D-SCAN,通过监测生成过程中的文档级注意力熵变化识别潜在攻击。
阅读全文UI-Mate提出了一套环境驱动的GUI智能体训练流程,并引入基于上下文示范的任务执行机制。其27B模型在OSWorld-Verified上取得77.0%的成绩,展示了开放权重电脑操作智能体的进展。
阅读全文一篇来自上海人工智能实验室的研究,将智能体AI的潜在风险按照物理认知、社会认知和自指认知划分为三个层次。研究关注的核心并非系统是否“像人”,而是认知能力扩展后,人类的能动性、自主性与控制能力是否会被削弱。
阅读全文WorldRover 提出一套基于虚幻引擎的合成数据引擎,将长时探索视频与深度、轨迹、光流和三维点跟踪等标注同步生成。它试图为需要持续建模、记忆和交互的世界模型提供更完整的训练数据。
阅读全文一项针对真实收据字段抽取的研究发现,常见的置信度阈值方法可能在文档级相关性、评分泄漏和分数并列等问题下失去风险控制。研究进一步提出从平均风险到文档级 PAC 证书的有效性阶梯,并说明何时应使用条件化校准。
阅读全文SPARGen 尝试用一个原生多模态生成模型处理多类空间任务,将三维重建、稠密对应和空间推理都转化为由指令驱动的生成问题。它的价值不在于单点任务刷新纪录,而在于让不同空间监督共同塑造同一套表示。
阅读全文OpenAI 正在 macOS 版 ChatGPT 桌面应用中引入 Computer History,让 ChatGPT 和 Codex 能参考用户近期的点击、输入和应用活动。它不像 Windows Recall 那样保存截图,但仍把个人电脑使用痕迹推向了更敏感的 AI 记忆场景。
阅读全文一篇安全研究文章追踪了“token brokers”的兴起:他们从创业公司手中收购未用完的 AI API 额度,再以折扣形式转卖给其他买家。这个市场让推理额度开始具备“准货币”属性,也给云厂商、模型公司和合规团队带来新风险。
阅读全文UniSwap 面向说话视频中的身份替换任务,尝试在一个音视频扩散 Transformer 内同时迁移人物外观与声音音色。它的重点不只是生成效果,而是让换脸、换声、口型、动作和时序在流式场景中保持一致。
阅读全文LiveAnimate 试图解决一个长期矛盾:扩散式人像动画质量高,但生成太慢、记忆开销也会随时长膨胀。该工作把 14B 级视频 DiT 改造成可实时流式推理的系统,并兼顾长序列稳定性。
阅读全文一篇新论文把“能否始终不跑题、不自相矛盾”变成了可自动评测的任务。NCP-Bench 显示,即便语言表现很强的模型,在长轮次互动里也很容易失守。
阅读全文StateFlow 提出一种以“持久3D世界状态”为核心的生成式预演框架,用于电影、游戏、建筑和城市设计等场景。它不再把视频一次性生成完,而是先构建可编辑世界,再围绕状态演化和相机访问进行迭代。
阅读全文Ex-Omni-2D试图解决一个关键问题:现有能听会说的多模态对话模型,往往缺少“视觉存在感”。它把文本、个性化语音和参考条件下的视频生成整合到同一套对话流程中。
阅读全文VibeLifeBench 试图补上智能体评测中的一个空白:真实生活任务不是一次性问答,而是持续数周、环境不断变化、规则经常没有明说的长期协作。
阅读全文UniMoMo 提出一种后训练压缩框架,把已训练的大型推荐 MoE 模型转换为更小的标准 MoE。它以专家在校准数据上的功能相似性和路由流量为依据,在尽量保持推荐效果的同时降低推理开销。
阅读全文SWE-Bench ProMax 将评测焦点从单点修 Bug 推向跨文件、跨语言的代码重构,试图缓解现有编程智能体基准逐渐饱和与测试质量存疑的问题。
阅读全文Ouroboros 将智能体的工具、提示词、上下文组装和核心实现纳入可演化范围,并通过经过审查的提交把改进变成后续运行时的一部分。论文称其在 Terminal-Bench 2.1、OSWorld-Verified 和 CL-Bench 上刷新了多项结果。
阅读全文