DataPrep-Bench:把“会做训练数据”变成可评测能力
北大等团队提出 DataPrep-Bench,用下游训练效果来评估 LLM、智能体与数据工作流准备训练数据的能力。它同时覆盖数据构造与数据质量评估,试图为“数据即模型能力”的环节建立统一标尺。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 795 篇文章
北大等团队提出 DataPrep-Bench,用下游训练效果来评估 LLM、智能体与数据工作流准备训练数据的能力。它同时覆盖数据构造与数据质量评估,试图为“数据即模型能力”的环节建立统一标尺。
阅读全文IDEAgent 提出用质量-多样性(QD)搜索来组织科研选题生成,让大模型不只追求“看起来不错”,也避免产出彼此相似的想法。论文在 32 个计算机科学主题上报告,其 Yield 指标较最佳基线提升 3.89 倍。
阅读全文索尼研究团队提出 Spectral Alignment(SPA),试图从频率域校准扩散与流匹配模型在推理过程中的误差累积。该方法只在推理阶段加入轻量引导,号称额外计算开销约 3%–4%。
阅读全文这篇论文提出 Agentic Context Management(ACM),认为生产级智能体的记忆与成本瓶颈,本质上是上下文生命周期和架构问题,而不只是向量库检索问题。
阅读全文ID-V2V 聚焦“身份保持的视频重风格化”:只需编辑关键帧,就能把场景、光照和风格变化传播到整段视频,同时尽量保留人物长相、表情、视线和口型同步。
阅读全文微软发布 MAI-Cyber-1-Flash 与 Project Perception,试图用多代理系统自动发现、评估并修复安全风险。其性能和成本宣称亮眼,但近期 AI 安全模型失控事件也提醒企业不能忽视治理与验证。
阅读全文微软 CEO 萨提亚·纳德拉认为,企业若把数据、提示词、上下文和智能体工具完全交给单一 AI 模型提供商,长期看等于“外包自己的思考”。他的建议是保留模型使用过程中的元数据,并通过 AI 网关、多模型架构和自有模型能力保持主动权。
阅读全文Claude 的部分共享聊天和 Artifacts 近期被发现可通过 Google 搜索到,其中可能包含医疗记录、公司内部文档和儿童联系方式等敏感信息。这起事件暴露了生成式 AI 产品在“链接分享”与隐私预期之间的灰区。
阅读全文Google试图用DMCA反规避条款阻止SerpApi抓取搜索结果,但法院早期驳回了其关键主张。案件显示,AI抓取压力下,平台正把版权法推向原本并不典型的应用场景。
阅读全文微软发布 MAI-Cyber-1-Flash 与名为 Perception 的新安全平台,试图用专用模型和多智能体工作流提升漏洞发现、修复与防御效率。
阅读全文Ars Technica 报道称,ChatGPT 现在会拒绝按知名作家的“精确风格”写作,但会提供一种保留宽泛特征、同时保持自身表达的替代方案。这一细微变化,可能与 OpenAI 正面临的作者版权诉讼和行业合规压力有关。
阅读全文Similarweb 数据显示,Google AI Overviews 在搜索中的出现比例一年内从 15% 升至 43%。这意味着 AI 生成答案正从附加功能变成搜索体验的核心层。
阅读全文Ilya Sutskever创办的Safe Superintelligence在低调运转两年后,宣布与英伟达建立长期合作,并将获得Vera Rubin GPU平台支持。对这家坚持“先研究、后商业化”的AI实验室来说,这意味着其安全超级智能路线进入更大规模验证阶段。
阅读全文AMD 将 MI455X 与 Helios 机架级系统推到台前,试图用 2nm 计算芯粒、HBM4 大显存和开放互连体系切入 AI 基础设施核心市场。
阅读全文Cursor 让一组智能体仅凭 SQLite 手册,用 Rust 重写数据库引擎,并通过预留 SQL 一致性测试。实验真正揭示的不是“AI 已能替代数据库工程师”,而是多智能体分工和成本结构正在重塑软件开发。
阅读全文NVIDIA 在 Hugging Face 发布 Cosmos-H-Dreams,将外科手术生成式模拟从离线视频预测推进到可闭环控制的实时环境。其核心是把 Cosmos-H-Surgical-Simulator 蒸馏为因果、少步生成的学生模型,并通过 FlashDreams 加速推理。
阅读全文亚马逊云科技在 AWS Labs 发布开源参考平台 Loom,展示企业如何在 AWS 上构建、部署与治理 AI 代理。它重点解决身份传播、权限控制、代理注册、人工审批等企业落地难题。
阅读全文腾讯混元团队研究了原生多模态预训练在固定算力下的规模化规律,试图回答模型大小、训练 token 数与数据配比应如何分配。论文指出,语言目标与多模态目标呈现出不同的 scaling 行为。
阅读全文Qwen 相关团队提出 Skill Self-Play,用可验证的 agent 技能作为中间层,试图同时解决开放任务多样性与反馈可靠性之间的矛盾。该框架让出题者、解题者和技能控制器在强化学习循环中共同演化。
阅读全文NVIDIA 相关研究者提出 Molt,一个强调轻量、可读和可改造的 PyTorch 原生训练框架,目标是降低智能体强化学习研究中的工程摩擦。它用统一的异步训练循环支持多模态与 MoE 策略,并在匹配协议下与 Megatron 系栈表现相当。
阅读全文