MaxKernel:让多智能体协作编写和优化 TPU 内核
MaxKernel 将大语言模型、编译器反馈与硬件性能分析结合起来,探索自动生成高性能 TPU 内核。系统提供人工协作、全自动优化和图搜索三种工作模式。
阅读全文MaxKernel 将大语言模型、编译器反馈与硬件性能分析结合起来,探索自动生成高性能 TPU 内核。系统提供人工协作、全自动优化和图搜索三种工作模式。
阅读全文Iris-mini 与 Iris-pro 将网页链接结构转化为多跳搜索任务,并交替使用监督微调和强化学习训练搜索策略。研究还显示,推理阶段的上下文管理对复杂搜索表现至关重要。
阅读全文Terminal-Universe提出了一条不同于从零构建任务的路径:从已有终端智能体轨迹中恢复工作区,再生成可执行、可验证的新任务。该方法同时扩展任务的广度与交互深度,用于改善代码智能体训练。
阅读全文终端智能体能力提升后,静态或从零生成的任务往往难以继续提供有效反馈。论文提出“环境演化”,通过离线逐代提高环境难度,为长程强化学习持续制造学习信号。
阅读全文Editable Visual Design 提出一种结合视觉语言模型、图像生成模型与代码智能体的新型设计范式,让 AI 生成的不再只是扁平图片,而是可继续编辑的分层视觉作品。
阅读全文一项新研究提出BCIT方法,尝试解决自主LLM后训练中“旧经验是否仍然适用”的问题。它通过条件检查、冲突否决和小规模试训,减少盲目沿用历史更新带来的风险。
阅读全文Google 正把个人代理 Gemini Spark 接入 Google Photos,允许用户通过自然语言整理相册、编辑图片并触发跨应用操作。该功能将首先面向美国英语环境中的 Gemini AI Pro 和 Ultra 订阅用户逐步开放。
阅读全文OOMOL Lab 开源了 Open Flow,一个面向 AI Agent 的工作流自动化平台。它通过可视化 Workbench、命令行接口和自托管运行时,将智能体接入工作流的创建、编排与运行环节。
阅读全文DisCo 将机器学习开源仓库中的操作性知识提炼为可复用、可验证的技能,并注入研究型智能体。论文称,AREX-Skill Library 已覆盖 1,000 个仓库和 5,000 多项技能。
阅读全文HarnessDev 将智能体评测的重点从“模型完成了什么任务”推进到“模型能否构建支撑任务的运行基础设施”。结果显示,大模型生成的框架在代码、搜索和研究场景仍落后于成熟的人工作品,但在写作和机器学习实验中已展现出竞争力。
阅读全文Meta为面向编程及其他智能体场景的Muse Spark模型推出“贡献者”定价。用户或企业同意分享提示词与模型输出,即可获得约95%的价格折扣。
阅读全文UI-Venus-2 试图解决 GUI 智能体落地时的三类瓶颈:环境覆盖不足、任务构造脆弱,以及执行结果难以可靠验证。该系统通过统一的推理—行动闭环,覆盖移动端、网页和桌面环境,并引入面向安全的执行机制。
阅读全文Uber披露了一套面向软件工厂的AI成本治理方法:在智能体使用量快速增长的同时,通过模型路由、上下文工程和工具调用改造,压低单位会话成本。
阅读全文CAST 将稀疏的任务成败结果转化为动作级批评监督,让模型不仅学会采取行动,也学习判断行动是否符合政策与当前状态。实验显示,这种方法在动态工具调用任务中提升了代理的跨步骤可靠性。
阅读全文数据科学智能体的效果不只取决于大模型,也取决于任务如何定义、状态如何管理以及结果如何评估。DS-Lighting将这些通常隐含的系统设计拆解为四层,并提供统一的可执行框架。
阅读全文LLM 智能体可以在运行时修改提示词、工具和执行框架,但一次成功的改动也可能在不同状态下无法撤销。EvoUndo 将可恢复性验证、状态定位与回滚语言结合起来,系统分析自我进化的安全边界。
阅读全文StarHarness 将智能体的“能力问题”部分转化为“运行框架问题”,在固定模型权重的前提下,自动搜索更适合具体企业环境的 harness。研究显示,经过少量迭代后,智能体在多个企业任务基准上的表现显著提升。
阅读全文代码生成速度提升,并不等于研发交付周期缩短。小红书 Muse 的实践显示,企业级 AI Coding 的关键在于上下文贯通、运行时控制与可恢复的 Agent 协作。
阅读全文Meta曾设想用AI Agent接管大量日常工作,并据此推进团队重组。但内部数据显示,代码产出、技术事故和工程师救火时间同步上升,激进的“AI原生”计划最终遭遇现实检验。
阅读全文Cisco 正把内部 AI 从聊天助手升级为能够记忆上下文、跨系统调用工具并在后台推进任务的个人 Agent。MyAgent 的价值不只在于覆盖9万名员工,更在于它试图成为企业工作流的新入口。
阅读全文字节跳队提出 DART-SD,通过将工具调用过程建模为具有“菱形拓扑”的状态图,定位失败轨迹中的关键断点。它只训练断点之后的恢复步骤,从而避免破坏已经正确的推理前缀。
阅读全文