跳到正文
北京时间

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

697条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 661–680 条 · 共 697 条
9月9日周二
  1. FireRedTeam:原创语音与多模态项目64

    FireRedTeam 开源 FireRedChat 全自托管全双工语音交互方案

    FireRedTeam 发布 FireRedChat,一个完全自托管的实时语音 AI 智能体全双工交互解决方案。系统集成了 TTS、ASR、pVAD(个性化语音活动检测)和 EoT(结束轮次检测),不依赖外部 API、无数据泄露、部署完全可控。

    推荐理由:官方发布了可完全自托管的实时语音智能体方案,组件构成和部署路径都写清楚了,适合评估私有化语音交互搭建。

9月2日周二
  1. FireRedTeam:原创语音与多模态项目62

    FireRedTeam 开源 FireRedTTS-2 长对话语音生成模型

    FireRedTeam 发布 FireRedTTS-2,一款面向播客和聊天机器人的长对话流式 TTS 系统,支持最多 3 分钟、4 个说话人的多语种对话生成,覆盖中英日韩法德俄语并支持零样本跨语言音色克隆。

    推荐理由:官方开源了长对话流式语音合成模型,给出多语言支持、延迟数据和部署方案,适合关注播客与对话生成的读者参考。

8月27日周三
  1. Claude Platform:开发者版本说明(RSS)61

    Claude Platform 发布 PHP SDK 测试版

    Claude Platform 于 8 月 27 日推出 PHP SDK 测试版。该 SDK 允许开发者通过 PHP 语言调用 Claude API,构建基于 Claude 的应用程序。

    推荐理由:Anthropic 给 PHP 开发者递了橄榄枝,beta 版 SDK 让 PHP 项目接入 Claude 更容易了,虽然量级不大但补上了生态缺口。

8月21日周四
  1. 公众号:DeepSeek(深度求索)80

    DeepSeek-V3.1 发布,迈向 Agent 时代的第一步

    DeepSeek 正式发布 DeepSeek-V3.1,采用混合推理架构,一个模型同时支持思考与非思考模式,官方 App、网页端及 API 均已同步升级。

    推荐理由:混合推理架构统一思考与非思考模式,Agent基准提升具体,API兼容Anthropic格式直接降低Claude Code接入门槛。

  2. 公众号:DeepSeek(深度求索)63

    DeepSeek-V3.1 发布,迈向 Agent 时代的第一步

    DeepSeek-V3.1 以混合推理模型形式开源,用户可一键切换思考模式,同时 Agent 智能体支持性能得到增强。

    推荐理由:DeepSeek V3.1 不是小修小补,混合推理和 Agent 支持让它从‘对话模型’转向‘行动模型’,开源这一步让 Agent 开发有了新底座。

8月15日周五
  1. 蚂蚁 inclusionAI:GitHub 新仓库58

    inclusionAI/UI-Venus

    UI-Venus 是一款本地 UI 智能体,仅以屏幕截图作为输入,即可执行精确的图形用户界面元素定位与高效导航。该代理无需依赖系统底层代码或辅助功能接口,直接通过视觉信息理解界面结构,实现自动化操作。其核心能力在于对任意应用或网页中的按钮、菜单、文本框等元素进行准确识别与交互,提升了跨平台任务执行的通用性与可靠性。

    推荐理由:蚂蚁这个纯截图驱动的 UI Agent 在当时算是早期探索,代码开源可直接用,做 GUI 自动化的值得看看底层怎么实现元素定位和导航。

8月7日周四
  1. Hao AI Lab81

    [Lmgame Bench] 🔥 OpenAI 刚刚发布了两款开放权重的推理模型:gpt-oss-120B(约1170亿参数)和 gpt-oss-20B(约210亿参数),它们是自 GPT-2 以来首批开放权重的 OpenAI 模型。 我们在 Lmgame Bench 中对两者进行了测试,涵盖4款互动游戏: 🧱 推箱子 | 🟦 俄罗斯方块 | 🔢 2048 | 🍬 糖果传奇 以下是它们的排名(满分25分): → gpt-oss-120b → 第12名 → gpt-oss-20b → 第13名

    推荐理由:OpenAI 终于开源了,这是 GPT-2 之后第一次放开权重,120B 和 20B 两个尺寸直接对标 Llama 和 Qwen 的开源生态。虽然游戏 benchmark 排名不算惊艳,但信号本身比分数重要得多,所有基于开源模型做产品的团队都得重新评估选型。

8月6日周三
8月5日周二
  1. OpenAI Developers(RSS)79

    如何用 Ollama 在本地运行 gpt-oss

    OpenAI 开发者发布教程,讲解如何用 Ollama 在本地硬件上部署 gpt-oss-20b 或 gpt-oss-120b 并选择合适的推理设置。

    推荐理由:来自 OpenAI 开发者官方的实操指南,读者可按步骤在自己硬件上用 Ollama 跑通 gpt-oss 两个规格模型。

  2. Hao AI Lab67

    FastVideo团队推出FastWan系列快速视频生成模型。该模型采用名为“稀疏蒸馏”的新训练方法,能将视频去噪速度提升70倍。在单块H200 GPU上,仅需5秒即可生成一段5秒的视频。团队提供了在线演示,并依据Apache-2.0许可证完全开源了模型、代码和数据。

    引用Hao AI Lab@haoailab

    (1/n) 🚀 借助 FastVideo,你现在可以在单块 H200 GPU 上于 5 秒内生成一段 5 秒的视频! 隆重推出 FastWan 系列,这是一个快速视频生成模型家族,通过我们称为“稀疏蒸馏”的全新配方训练而成,可将视频去噪时间加速 70 倍! 🖥️ 在线演示:https://fastwan.fastvideo.org/(感谢 @gmicloud 的支持!) 🔗 博客:https://hao-ai-lab.github.io/blogs/fastvideo_post_training/ 🔓 我们以 Apache-2.0 许可证完全开源我们的模型、代码和数据

    推荐理由:视频生成终于从「等一分钟」进化到「实时出片」,FastWan 用稀疏蒸馏把去噪压了 70 倍,单卡 H200 五秒出五秒视频,做短视频工具和实时交互产品的团队该认真看看这个开源方案。

7月25日周五
  1. 上海人工智能实验室 InternLM:原创项目67

    上海AI实验室开源 Intern-S2-Preview-397B 与 Intern-S2-Preview-35B 科学多模态模型

    上海人工智能实验室 InternLM 团队发布 Intern-S2-Preview-397B,定位面向科学智能与长程智能体的最强多模态基础模型,通过新的视觉语言预训练范式、20 多个领域的大规模多任务强化学习以及沙盒环境中的智能体强化学习提升通用推理与科学能力。

    推荐理由:官方仓库同时给出 Intern-S2 两档新模型与 S1 系列的架构细节和基准对比,便于读者评估科学场景下的开源选型。

7月2日周三
  1. Yann LeCun

    DeepSeek 时刻后,AI 人才正从封闭的 OpenAI、Anthropic 流向拥抱开放科学与开源的 META。这种「拥抱开放」的趋势有利于行业透明度、科学进步与安全监管。OpenAI 承诺今夏发布开放权重模型,或将改变这一格局。

    引用Nirit Weiss-Blatt, PhD@DrTechlash

    在当前的AI人才争夺战中,大家都聚焦于那些大数字(据称的薪酬方案)。这忽略了更大的图景:DeepSeek时刻之后的文化转变。 META是美国在开放科学(出版物)和开源(Llama)方面的领导者。OpenAI和Anthropic都众所周知地不开放。 AI人才流向META,就是拥抱开放性的AI人才。 这对行业是好事。对科学是好事。甚至对安全关切也是好事(更多透明度,更多人关注问题,更多解决方案)。这是一个值得庆祝的趋势。 OpenAI在今年夏天晚些时候发布一个开放权重模型(如下所承诺)可能会改变这种平衡。

    推荐理由:LeCun 谈 DeepSeek 时刻后 AI 人才流向 Meta 与开源文化的关系

6月23日周一
  1. Prime Intellect(网页)61

    Prime Intellect 发布 SYNTHETIC-2 开源推理数据集与行星尺度流水线并行推理运行

    Prime Intellect 发布 SYNTHETIC-2,一个开源推理数据集,基于 DeepSeek-R1-0528 生成经过验证的推理轨迹,并启动行星尺度的流水线并行分布式推理运行。

    推荐理由:原文给出流水线并行推理与 TOPLOC v2 验证机制的细节,开源社区可据此了解如何用消费级 GPU 参与大规模推理贡献。

6月20日周五
  1. OpenMOSS / 复旦NLP / 上海创智 / MOSI(网页)69

    OpenMOSS 开源 MOSS-TTSD-V0 中英双语对话语音生成模型

    OpenMOSS 发布并开源 MOSS-TTSD-V0,支持中英双语对话语音生成、零样本双说话人音色克隆、声音事件控制和长语音生成,模型权重、推理代码和 API 全部开源并支持商用。

    推荐理由:原文给出训练数据规模、Codec 设计和对比结果,读者可据此评估这个开源对话语音模型的可复用价值。

5月29日周四
  1. DeepSeek68

    🚀 DeepSeek-R1-0528 现已发布! 🔹 基准测试性能提升 🔹 前端能力增强 🔹 减少幻觉现象 🔹 支持 JSON 输出与函数调用 ✅ 立即试用:https://chat.deepseek.com/ 🔌 API 使用方式不变 — 文档在此:https://api-docs.deepseek.com/guides/reasoning_model 🔗 开源权重:https://huggingface.co/deepseek-ai/DeepSeek-R1-0528

    推荐理由:DeepSeek-R1 的常规迭代,幻觉降低和 JSON 输出是实用改进,但距离代际跃迁还差得远。开源权重直接可用,做推理链产品的团队值得花半小时跑一下。

  2. 公众号:DeepSeek(深度求索)85

    DeepSeek-R1 更新至 0528 版本,推理能力显著增强

    DeepSeek 发布 R1 模型小版本升级 DeepSeek-R1-0528,在数学、编程与通用逻辑等基准测评中取得当前国内所有模型中首屈一指的成绩,整体表现接近 o3 与 Gemini-2.5-Pro。

    推荐理由:后训练投入增加带来的推理提升幅度,为开源社区提供了可蒸馏的高质量思维链,小模型也能接近大模型表现。

5月22日周四
  1. Hacker News:AI 热帖

    将Agent封装为MCP服务器示例

    MCP Agent Server示例展示了将Agent工作流封装为MCP服务器的"Agent即服务"架构。提供asyncio(轻量级内存执行,适合开发测试)和Temporal(生产级持久化、支持暂停恢复)两种实现。通过装饰器暴露Agent能力,支持多Agent互操作,可与Claude Desktop等任意MCP客户端集成,实现复杂工作流的标准化封装与跨平台复用。

    推荐理由:展示 Agent 即 MCP 服务器新范式,支持多 Agent 协作与主流客户端集成

  2. Cognition 模型 / Devin 博客(网页)64

    Cognition 发布官方 DeepWiki MCP Server,免费开放 GitHub 仓库问答

    Cognition 发布官方 DeepWiki MCP Server,免费且无需登录或鉴权,可对 DeepWiki.com 已收录的 GitHub 仓库进行程序化问答和上下文获取。

    推荐理由:原文列出了三个可用工具和接入方式,开发者可以直接把它接进 Claude Desktop 等 MCP 客户端来查询 GitHub 仓库。

5月11日周日
  1. Prime Intellect(网页)67

    Prime Intellect 发布 INTELLECT-2,32B 推理模型通过全球分布式强化学习训练

    Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数推理模型,并在数学和编码基准上超过 QwQ-32B。

    推荐理由:原文给出分布式异步 RL 的完整基础设施与训练配方细节,并开源模型、代码和数据,读者可以了解去中心化训练的可行路径。

5月5日周一
  1. Cognition 模型 / Devin 博客(网页)74

    Cognition 发布 DeepWiki,为任意 GitHub 仓库生成免费 AI 文档

    Cognition 推出 DeepWiki,将 Devin Wiki 和 Devin Search 免费公开,把 URL 中的 github.com 换成 deepwiki.com 即可查看任意仓库的 AI 文档。已索引超过 50,000 个热门公开仓库,涵盖 Model Context Protocol、LangChain 等;公开仓库可免费添加,私有仓库需 Devin 账号。

    推荐理由:原文给出了使用方式和已索引规模,读者可以据此判断如何用 DeepWiki 快速理解陌生代码仓库。