黑森林实验室发布 Flux3:多模态模型走向音视频原生生成
德国 AI 初创公司 Black Forest Labs 发布多模态基础模型 Flux3,主打对图像、视频、音频与动作信息的统一建模。其看点在于引入 Self-Flow 架构,并强调可生成最长 20 秒的音视频同步片段。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 795 篇文章
德国 AI 初创公司 Black Forest Labs 发布多模态基础模型 Flux3,主打对图像、视频、音频与动作信息的统一建模。其看点在于引入 Self-Flow 架构,并强调可生成最长 20 秒的音视频同步片段。
阅读全文TechCrunch 采访多位进攻性网络安全研究者发现,OpenAI、Anthropic 等模型的安全护栏,正在让部分合法防御工作变得更慢、更绕、更不稳定。
阅读全文这篇论文关注一个被 RAG 和 AI Agent 放大的问题:搜索结果不是给人逐条浏览,而是交给模型生成答案时,真正重要的是一组文档能否共同支撑任务。
阅读全文南加州大学等研究者提出 ActiveVision,用 17 项任务检验多模态大模型能否像人一样反复观察、修正假设并寻找新证据。结果显示,前沿模型与人类表现仍存在巨大差距。
阅读全文Self Gradient Forcing 针对自回归视频扩散模型中的“历史上下文梯度缺口”,尝试让未来帧的损失反向监督早期生成内容如何写入更有用的 KV 记忆。该方法以两阶段训练在不完整回传长序列 rollout 的前提下,提升长视频外推的一致性。
阅读全文AMD发布面向大型AI数据中心的Helios机架级系统,并称其将于今年晚些时候开始向客户交付。随着微软、Anthropic、OpenAI等客户计划部署,AMD正试图在Nvidia长期占优的AI算力基础设施市场打开缺口。
阅读全文美国两党议员提出“AI Kill Switch Act”,拟授权国土安全部在特定高风险事件中命令AI系统降速、限制功能或完全关闭。该法案把前沿AI的安全控制从企业自律进一步推向政府强制监管。
阅读全文PyTorch Blog 介绍了 Helion 面向 TPU 的新后端:它可将 Helion 内核编译到 Pallas,让开发者用更接近 PyTorch 的方式编写 TPU 高性能内核。文章以 Flash Attention 为例,展示了自动调优与流水线策略如何影响 TPU 利用率。
阅读全文Runway 发布面向开发者的 Media Router,可按质量、速度、成本等偏好,为图像、视频、音频生成请求自动选择模型。此举显示生成式媒体竞争正在从单一模型能力,转向模型编排与基础设施能力。
阅读全文OpenAI 将 ChatGPT Health 扩展到美国所有 18 岁以上登录用户,覆盖免费与付费套餐。用户可连接 Apple Health、MyFitnessPal、医院系统等数据,但医疗安全边界仍是最大争议。
阅读全文Google 第二季度营收依然强劲,但 AI 数据中心和基础设施投入增长更快,使公司上市以来首次出现季度自由现金流为负。资本开支继续上调,投资者开始重新评估 AI 军备竞赛的成本。
阅读全文由三名哈佛辍学生创办的 AI 芯片公司 Etched 完成 3 亿美元 C 轮融资,估值达到 103 亿美元。公司押注推理计算瓶颈,试图用自研芯片、内存与互连系统挑战 GPU 主导格局。
阅读全文Google 在 2026 年第二季度财报电话会上披露,Gemini 月活用户已超过 9.5 亿,距离十亿级产品仅一步之遥。这个数字显示,AI 助手竞争正从模型能力之争,进入分发、生态和使用场景的综合较量。
阅读全文Meta AI 提出 GAMUT 基准,用两层元评分表评估开放式长文本回答是否“说全了”。它试图补上当前事实性评测偏重“说得对”、却较少衡量“是否遗漏关键事实”的短板。
阅读全文这篇论文提出 Masked Visual Actions,把动作表达为视频中某个实体被部分揭示的像素轨迹。它让同一个视频模型既能预测机器人动作带来的场景变化,也能从目标物体运动反推机器人应如何行动。
阅读全文nyra labs 的论文指出,现代 ASR 常把“逐字转写”和“整理后转写”混在一起学习,导致识别结果、WER 评估和词级时间戳都不稳定。研究尝试用任务 token 与交叉注意力微调,让模型按需输出可控的逐字稿或意图稿。
阅读全文异步强化学习能提升吞吐,但 rollout 与训练之间的策略滞后会放大更新风险。SAT 试图把 PPO 的裁剪区间与样本陈旧度对齐,让高不匹配样本获得更保守的更新约束。
阅读全文PaddleOCR 团队提出 HPD-Parsing,用分层并行解码替代整页自回归生成,缓解 VLM 文档解析中的长序列瓶颈。该方法在公开基准上达到 4,752 tokens/s,同时保持有竞争力的解析精度。
阅读全文DataFlow-Harness 试图弥合自然语言需求与平台化数据流水线之间的断层:不再让智能体只吐出脚本,而是引导其构建可持久保存、可视化编辑的 DAG 工作流。
阅读全文AgentDebugX 是一个开源调试框架,试图解决 LLM Agent 失败时“报错点不等于根因点”的常见难题。它将调试组织为检测、归因、修复、重跑的闭环,并提供库、CLI、Web 控制台等入口。
阅读全文