腾讯混元发布 Hy4 preview:770B 参数模型迈向 Agent 化应用
腾讯混元推出 Hy4 preview,采用总参数 770B、激活参数 4.9B 的架构,并支持 1M 上下文。除模型开源外,官方还展示了其与游戏引擎、MCP 等工具体系结合的应用方向。
阅读全文腾讯混元推出 Hy4 preview,采用总参数 770B、激活参数 4.9B 的架构,并支持 1M 上下文。除模型开源外,官方还展示了其与游戏引擎、MCP 等工具体系结合的应用方向。
阅读全文阿里达摩院联合中国医科大学附属盛京医院等机构研发的DAMO LiON,可通过增强CT辅助识别微小肝脏恶性病灶。模型在两个月真实世界前瞻性临床试验中,帮助医生发现了15例此前被遗漏的恶性肿瘤。
阅读全文名为 Ox Alpha 的新模型在 OpenRouter 上线后迅速引发关注,但其开发者仍保持匿名。现有讨论从中国团队的 GLM,到微软尚未发布的 MAI,尚未形成可靠结论。
阅读全文Motif 3 是一款 decoder-only 稀疏 MoE 语言模型,总参数 3140 亿、每个 token 激活 132 亿参数。它通过 GDLA 架构、专家专用训练与多教师后训练,试图在推理、代码和长上下文任务上同时取得平衡。
阅读全文DeepSeek-V4-Flash 官方 API 已上线公测。此次版本并未改变 MoE 284B、激活 13B 与 100 万 token 上下文等基础设定,而是通过后训练显著强化 Agent 与编码任务表现。
阅读全文Kimi 团队介绍了 Kimi K3:一款 2.8T 参数的 MoE 模型,每次推理激活 1040 亿参数,并支持原生视觉和 100 万 token 上下文。论文称其在长程编码、智能体、知识、推理和视觉任务上达到前沿水平,同时开放完整权重。
阅读全文蚂蚁百灵推出新一代原生混合推理模型 Ling-3.0-Flash,以 124B 总参数、5.1B 单次激活参数主打更高“智效比”。该模型面向 Agent 场景强化长程规划、自我纠错与长文本处理,并计划在限时免费体验后开源。
阅读全文Anthropic正式推出Claude Opus 5,多项编程、工具使用和复杂任务评测接近或超过Fable 5,定价仍维持上一代水平。比跑分更值得关注的是,它在代码生成、3D建模和自我验证流程中展现出更强的自主判断能力。
阅读全文Anthropic 发布 Opus 5,定位为比 Fable 5 更便宜、限制更少的重量级模型,并在部分基准测试中实现反超。它还通过新的 Automatic Fallbacks 机制,尝试减少安全拦截对 API 使用体验的影响。
阅读全文Anthropic 发布 Claude Opus 5,将其定位为接近 Claude Fable 5 智能水平、但成本约为一半的日常主力模型。它在编码、自动化、知识工作和部分科学任务上展示了明显提升,但相关数据主要来自官方评测与早期客户反馈。
阅读全文月之暗面发布 Kimi K3:2.8 万亿参数、MoE 架构、百万 token 上下文与原生多模态,是这次更新最受关注的关键词。更重要的是,官方计划在 7 月 27 日前开放完整权重,使其成为开源大模型竞争中的新变量。
阅读全文OvisOCR2 将文档页面图像直接转换为按自然阅读顺序排列的 Markdown,覆盖文本、公式、表格与视觉区域。其 0.8B 规模模型在 OmniDocBench v1.6 和 PureDocBench 上取得领先成绩,显示端到端文档解析路线正在逼近甚至超越传统流水线方法。
阅读全文据TechCrunch援引《金融时报》报道,Moonshot AI即将发布的Kimi K3可能成为中国参数规模最大的开放权重AI模型,并被认为有望缩小与Anthropic Opus 4.8等闭源前沿模型的差距。
阅读全文arXiv 新论文提出 VAIOM,一种用于一小时外汇 K 线下一期收益概率建模的 decoder-only Transformer。它把连续金融特征作为输入,同时用离散收益桶作为输出目标,试图弥合金融数据与“next-token”范式之间的差异。
阅读全文