StartupBench:让通用智能体接受真实商业工作流检验
StartupBench不再从研究者预设的任务出发,而是从已有市场需求的AI创业产品及其工作流中构建端到端评测。结果显示,即使是表现最强的模型,也只能可靠完成约30%的任务。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 791 篇文章
StartupBench不再从研究者预设的任务出发,而是从已有市场需求的AI创业产品及其工作流中构建端到端评测。结果显示,即使是表现最强的模型,也只能可靠完成约30%的任务。
阅读全文《Personalized Auto-Research》提出“个性化自动科研”概念:AI 科研助手应理解研究者的知识积累、方法能力与合作网络,而不是只围绕一个研究目标生成通用方案。
阅读全文PTXBench 将功能正确性、目标指令运行情况与实际加速效果放到同一套测试中,检验大模型能否利用架构特定 PTX 优化 GPU 内核。结果显示,生成正确代码与获得真实性能收益之间仍有明显鸿沟。
阅读全文LEGO-RL试图解决编码智能体强化学习中的一个关键难题:如何在不改动原有Harness控制流的前提下,让真实工具调用、上下文压缩和执行反馈可靠地进入策略优化流程。该框架在三个编码智能体Harness上训练Qwen3.5-35B-A3B,并提升了SWE-bench Verified成绩。
阅读全文MathForm 将 Mathlib 知识检索、编译器诊断和语义一致性反馈引入数学自动形式化流程,并据此构建了约 367K 条 Lean 4 验证数据。基于该数据训练的 8B 模型,在多项基准上超过了若干专用 32B 模型。
阅读全文EditBridge提出一种面向超高分辨率图像编辑的扩散桥框架,不再把低分辨率编辑结果简单交给独立超分辨率模型处理,而是利用原始高清图像补回真实细节。论文称,该方法可在2K分辨率下实现3.6至8.4倍加速,并将4K编辑耗时控制在61秒。
阅读全文ASI-Bench试图测量AI最难被传统基准覆盖的能力:自主探索未知、选择研究方法,并将想法转化为可验证结果。测试显示,一旦人类逐步撤去方法指导,现有系统的表现会显著下滑。
阅读全文Stripe确认收购AI模型路由平台OpenRouter,交易价格据报道达到75亿美元。表面上这是支付公司进军AI,实质上更像是一次切入开发者AI支出的基础设施布局。
阅读全文OpenAI正在向部分客户预览Private Safety Processing,试图在不留存客户数据的前提下识别跨会话滥用行为。此举也将企业AI安全与隐私保护的竞争,推向Anthropic已实行的数据保留政策。
阅读全文Google以1000万美元竞得Spirit Airlines的大规模企业数据,其中包含数十年的员工邮件、人事和薪酬记录。空乘工会认为,去除姓名并不能解决员工机密信息被推断、重新关联或用于新用途的问题。
阅读全文Google在搜索和Gemini中集中推出互动可视化、模拟实验、定制测验和学习资料整理等功能,进一步争夺学生的日常学习场景。新工具覆盖从理解概念到复习、研究和答疑的多个环节。
阅读全文多名网络安全研究者称,自己突然失去OpenAI Trusted Access for Cyber计划的使用资格。OpenAI承认这是影响部分用户的技术问题,并要求相关人员重新申请和完成身份验证。
阅读全文随着数据中心和GPU投入持续攀升,AI算力正从技术资源变成需要管理价格风险的关键成本。Silicon Data希望建立GPU租赁参考价,并推动算力期货进入传统金融市场。
阅读全文Meta平台曾投放一款名为Kromix的AI色情生成工具广告,其中一则广告疑似将美国女性政治人物的脸替换进色情视频。事件再次暴露出平台在拦截非自愿私密影像和规避审核广告方面的漏洞。
阅读全文StateM 把长程智能体的执行过程拆解为持久状态、阶段上下文和可检查的状态转移,在不修改模型权重的情况下显著提升 Terminal-Bench 2.1 成绩。研究还显示,同一套运行时与规则可以迁移到不同模型,并降低高分运行成本。
阅读全文Large Discovery Model 将生成模型与贝叶斯非参数奖励代理结合起来,让 AI 不只提出候选方案,还能根据实验结果和不确定性决定下一步搜索方向。
阅读全文MOSS-VL 将实时交互作为视觉语言模型的核心能力,通过门控交叉注意力、交互式训练数据与分阶段课程学习,实现边看边说。报告显示,它在多个开放流式评测中取得领先表现,并在视觉上下文变长时展现出更明显的首 token 延迟优势。
阅读全文HarmProfile 将模型安全失效从一次性的攻击结果,转变为可系统分析的内容分布。研究发现,前沿模型不仅会规模化地产生有害内容,不同模型还呈现出各自独特的风险画像。
阅读全文一篇新研究提出“智能体事务”概念,尝试把数据库中的ACID原则迁移到会推理、调用工具并修改工作空间的LLM智能体中。其数据智能体在相关基准上较现有方法提升10.6%。
阅读全文一项覆盖100项真实前沿科研任务的评测,追踪了8种模型与智能体框架组合产生的800条完整轨迹。研究认为,当前系统的主要瓶颈不是能力不足,而是缺少持续自检、质疑与纠错的元认知闭环。
阅读全文