Claude Mythos 5 网络安全能力扩展至更多防御者
Anthropic 宣布 Claude Mythos 5 现已集成至 Claude Security,并即将登陆合作伙伴的网络安全防御工具。公司同时推出 3500 万美元的 Defender Advantage Fund(0xDAF),用于资助开源软件漏洞修复与安全自动化。
推荐理由:相较直接开放模型,以限定输出物提供补丁和告警的控制方式,为防御能力安全放量给出了可参照的产品分发思路,也解释了后续基金与验证计划的逻辑。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Anthropic 宣布 Claude Mythos 5 现已集成至 Claude Security,并即将登陆合作伙伴的网络安全防御工具。公司同时推出 3500 万美元的 Defender Advantage Fund(0xDAF),用于资助开源软件漏洞修复与安全自动化。
推荐理由:相较直接开放模型,以限定输出物提供补丁和告警的控制方式,为防御能力安全放量给出了可参照的产品分发思路,也解释了后续基金与验证计划的逻辑。


推荐理由:数学形式化的难点是编译通过但语义漂移,该框架用检索规划和语义一致性反馈迭代修正,并开源数据集和 8B 模型,给小模型做形式化提供了可复用路径。
蚂蚁百灵开源 Ling-3.0-tiny-base 与 Ling-3.0-flash-base,并同步开放预训练、中期训练及 WSM 合并等共 6 个 checkpoints。tiny-base 总参数 7.9B、激活参数 1.3B,flash-base 总参数 124B、激活参数 5.1B,均采用统一训练方案,适合持续预训练、监督微调、偏好优化及强化学习后训练等场景。
推荐理由:Ling-3.0 开放中间 checkpoint 和 WSM 合并策略,研究者可比较各训练阶段增益,并在自己数据上从合适节点继续预训练或后训练,而不只是拿到最终权重。
推荐理由:在Apple Silicon本地生成视频,把云端视频生成的计算依赖降到了消费级硬件,为需要数据隐私或低成本原型创作的工作流提供了替代路径。
百度千帆今日上架智谱开源旗舰模型GLM-5.3,API定价与智谱官方保持一致。该模型与上代同架构、同参数,依靠后训练Scaling在代码与网络安全能力上表现超预期,AA综合智能指数取得60分,与Kimi K3并列开源模型第一。开发者可通过API调用或订阅Token Plan企业版接入Claude Code等AI工具使用。
推荐理由:GLM-5.3 与上代同参数却靠后训练 Scaling 进入前沿,单任务成本又是同档最低,这让原本受调用成本限制的长链路智能体和编码任务有了开源可选项。
GLM-5.3 API即日上线,擅长复杂编码、防御性网络安全与长程任务,在AA综合智能指数中取得60分,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰同级,并与Kimi K3并列开源模型第一。该模型以更小参数规模和更低调用成本降低前沿智能门槛,单任务成本为旗舰模型中最低。API定价与GLM-5.2持平,模型权重将于下周五开源。
推荐理由:GLM-5.3 把前沿智能的单任务成本压到同档最低,模型选型时成本与智能可以放在同一优先级比较,而不必默认高价闭源旗舰。
Mojo🔥 语言现已正式开源,采用 Apache 2.0 许可证(含 LLVM 例外),编译器、工具链及全部源码已发布至 modular GitHub 仓库。Mojo 上周刚达成 1.0 版本(源码稳定),此次开源涵盖整个编译器与工具链。目前暂不接受编译器相关贡献,计划年底前开放,标准库自 2024 年起已接受社区贡献。
推荐理由:Mojo 从闭源编译器转为可自行构建的工具链,开发者能直接查看和修改标准库实现,减少对厂商二进制分发的单一依赖。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,可直接加载 PyLate、Stanford-NLP ColBERT 及 colpali-engine 检查点,用于 ColBERT 式晚期交互检索。
推荐理由:与同骨干的稠密模型相比,多向量检索在平均 NDCG 上高出约一个点,代价是索引体积增大数十倍,适合需要保留逐词精确匹配的场景。
本文演示如何用开源评测框架 Inspect AI 和 Harbor 评估 agent 技能,并借助 Google Sheets 和 Data Studio 进行可视化分析。
推荐理由:把技能评估拆成模型基线、技能条件与多维事实打分,让团队用同一套脚本量化技能增量,而不是凭单次演示做判断。
蚂蚁集团 inclusionAI 开源 ConceptEdit,一个基于概念缩放与密集监督的图像编辑数据生成管线。该管线通过三阶段流程(VLM 生成指令、FLUX 执行编辑、VQA 评估筛选)构建大规模、基于分类法的图像编辑数据集,并提供单概念与多概念两种变体。项目采用 MIT 许可证,支持断点续跑,需 OpenAI 兼容 VLM 端点与本地 FLUX 检查点。
推荐理由:流水线把图像编辑数据生成拆为指令生成、FLUX 编辑、VLM 评判三步,多概念版本将多个并行编辑合并为一条指令并支持断点续跑,为构建带质检的编辑训练数据提供可复用框架。
MOSS-VL是一个将实时交互(边感知边说话)作为一等能力的开源视觉语言模型家族,通过门控交叉注意力让语言解码器在生成时同步处理视觉输入。MOSS-VL-Realtime在四个流式基准中平均成绩居开源模型之首(三项第一、一项第二),在OmniMMI Proactive Alerting上以66.0分大幅领先最佳基线(37.5分)。
推荐理由:把视觉 token 放在解码序列之外,并用门控交叉注意力让模型边生成边接收画面,给低延迟多模态交互提供了一个具体架构参考。
2026年1至8月,Hugging Face公开模型仓库从243万增至296万,但85.6%的模型下载量不足200次,1.5%的仓库占据99.2%下载量。中国实验室月度最大开源模型参数规模在754B至2.78万亿之间,美国实验室七个月中五个月低于130B。AMD与NVIDIA各发布超200个新模型仓库,成为发布开源模型最多的机构。
推荐理由:下载量与点赞量分别记录实际依赖和社区兴奋点,把两者混为同一个热度指标是评估开源模型生态时最常见的偏差。
推荐理由:比单点漏洞发现更值得关注的是 GLM-5.3 在多步利用任务上的提升,这细分了安全团队能够交给模型的工作类型,从定位缺陷到验证攻击路径。
推荐理由:官方称 27B 稠密多模态模型整体表现超过 Qwen3.7-Plus,262K 原生上下文可扩至 1M,Apache 2.0 协议下本地部署轻量应用多了一个更高效的选择。
Unsloth 发布 Qwen3.8-27B 的 Dynamic GGUF 量化版本,4-bit 量化可在 17-19GB 内存设备上本地运行,并同时上传 NVFP4 量化。
我们承诺过开源 Qwen3.8 的模型权重。现在,是时候见面了!🎉 ⚡ Qwen3.8-27B: - 一款原生多模态稠密模型。仅凭 27B 参数,综合表现超越 Qwen3.7-Plus,在真实世界的编码与办公工作流中尤为亮眼。 - 原生支持 262K 上下文,可通过 YaRN 轻松扩展至 1M tokens。 - 为开发者而生。高效、高质量,并采用 Apache 2.0 许可证。 🚀 Qwen3.8-2.4T-A95B(Max 级别)的开放权重也已于近日发布。 无论你是想用 Qwen3.8-27B 在本地部署轻量级应用,还是用 Qwen3.8-2.4T-A95B 构建智能体,它们现在都属于你了! 下载、部署,去构建我们尚未想象到的东西吧。👀👇 - Hugging Face: https://huggingface.co/collections/Qwen/qwen38 - ModelScope: https://www.modelscope.cn/collections/Qwen/Qwen38
推荐理由:原文给出了本地运行的具体内存门槛、量化版本和硬件对照表,读者可以据此判断能否在自己的设备上跑通这个 27B 模型。
小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。
推荐理由:除开源模型外,TEMPO 让同一智能体在每个宏观步骤切换为 critic,用测试时推理估计回报,给稀疏奖励长程任务的强化学习训练提供了可借鉴的结构。
蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通单机 Agentic RL 后训练闭环。以井字棋为最小验证任务,用 GSPO 算法训练 400 步后,rollout/rewards_mean 从约 -0.5 升至 0.4,response_len 降至约 850 tokens,工具调用与动作选择趋于稳定。
推荐理由:真正可复用的不是井字棋,而是把可复现错误、可验证反馈、本地训练和同环境复测串成的轻量后训练闭环,适合为本地小模型稳定工具调用和格式约束。
DeepSeek发布Agent产品DeepSeek Harness,核心理念“一切皆插件”,基于名为Cordis的内核,支持在Agent运行中随时更换插件并保持状态不崩,官方预设100多个一方插件。产品提供标准、PTC、极简、创造四种模式,其中创造模式可让Agent现场创造并挂载新插件实现自改造。目前为开发者预览版,GitHub已获3.7万Star。
推荐理由:文章把Harness定位为插件化基建而非单一Agent,Cordis内核的时间与空间可组合性解释了Agent如何在运行中插拔能力,这比模板本身更值得理解。
MiniMax 推出 Music 3.0,新一代音乐生成模型,可根据创意概念和可选歌词一次性完成整首歌的作曲、编曲、演奏与制作,最长支持五分钟。
推荐理由:把简单描述扩展成包含配器进出、情绪曲线和演唱方式的专业模板,降低了非专业创作者控制音乐生成细节的门槛。
Google 发布开源 C++ 库 Credentio,用于处理 C2PA Content Credentials,初期支持规范 2.2 和 2.4 版本。该代码此前驱动近 40 个符合 C2PA 标准的 Google 产品,扩展至数百亿个生成的图像、视频、音频和文档资产。
推荐理由:Google 开源了自家验证数十亿生成资产所用的 C2PA 库,本地验证带来零带宽开销和小内存占用,对做媒体溯源工具的开发者有直接参考价值。