跳到正文
北京时间

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

697条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 621–640 条 · 共 697 条
2月7日周六
  1. FireRedTeam:原创语音与多模态项目63

    FireRedTeam 开源 FireRed-OpenStoryline 对话式视频创作工具

    FireRedTeam 于 2026-02-10 正式开源 FireRed-OpenStoryline,将视频创作变为自然语言对话,支持素材搜索下载、脚本生成、BGM 与配音字体推荐,以及全流程剪辑。

    推荐理由:官方开源的对话式视频剪辑项目,覆盖素材检索、脚本生成到剪辑全流程,并可直接通过 Claude Code 等 Agent Skills 安装使用。

2月5日周四
  1. Nathan Lambert:Interconnects(RSS)

    Nvidia 为何构建开源模型:对话 Bryan Catanzaro

    Interconnects 第17期访谈中,Nvidia 副总裁 Bryan Catanzaro 系统回顾了 Nemotron 开源模型项目的技术演进与战略定位。访谈涵盖该系列模型从研发初期到当前版本的迭代历程,剖析了英伟达在开源 AI 领域的布局逻辑,并披露了 Nemotron 在合成数据生成与模型训练效率方面的最新进展及未来规划。

    推荐理由:NVIDIA副总裁亲述开源模型战略,揭示芯片巨头如何通过开放生态锁定行业标准

2月4日周三
  1. Hugging Face:Blog(RSS)76

    Community Evals:因为我们不再信任黑箱排行榜胜过社区

    LMSys 推出了社区驱动的评估框架 Community Evals,旨在通过开源和开放科学推进人工智能民主化。该框架允许社区贡献和审查评估案例,以透明、可复现的方式测试模型。此举旨在改变依赖少数机构“黑箱”排行榜的现状,让更广泛的社区参与定义和衡量AI模型的能力与价值。

    推荐理由:Hugging Face 推社区评测挑战黑盒排行榜,开源生态评测标准可能改变

2月3日周二
  1. Hugging Face:Blog(RSS)80

    全球开源AI生态系统的未来:从 DeepSeek 到 AI+

    Hugging Face 在其官方博客发布文章,展望了全球开源人工智能生态系统的发展路径与未来趋势。文章以 DeepSeek 等代表性开源模型为例,探讨了开源社区如何推动技术民主化与创新加速。核心观点指向一个更加开放、协作的“AI+”未来生态,其中开源框架、模型和工具将深度融入各行各业,降低开发门槛并促进多样化应用场景的涌现。

    推荐理由:开源AI核心平台对生态走向的判断,直接影响开发者技术选型和投资方向

2月1日周日
  1. OpenMOSS / 复旦NLP / 上海创智 / MOSI(网页)62

    MOVA 发布:32B MoE 端到端同步视频-音频生成模型全栈开源

    OpenMOSS 团队发布 MOVA 音视频基础模型,总参数 32B MoE、激活 18B,支持文本或图像到音视频的端到端同步生成,最高 720p、单段 8 秒。模型采用非对称双塔架构(14B Wan 2.2 I2V 视频塔与 1.3B 音频塔)加双向 Bridge 和 Aligned ROPE 对齐时间轴,并开放模型权重、训练与推理代码及微调方案。

    推荐理由:原文给出架构、训练策略和开源范围,读者可以了解端到端音视频生成如何处理同步问题并可复现研究。

1月31日周六
  1. Jim Fan

    我还记得2023年Stanford Smallville发布时的兴奋。那是当时最大的多智能体模拟——没错,25个bot感觉已经很多了。今天是"Bigville"时刻。我们正在看到一个新生的、大规模的外星文明模拟实时展开:数量级更多的agent、高得多的IQ、不受限制的互联网接入,由全套MCPs提供支持。 能出什么问题呢? [引用 @DrJimFan]:著名的Stanford Smallville正式开源! 25个AI agent居住在一个数字版Westworld中,不知道自己生活在模拟里。他们上班、八卦、组织社交活动、结交新朋友,甚至坠入爱河。每个都有独特的个性和背景故事。 Smallville是2023年最鼓舞人心的AI agent实验之一。我们经常谈论单个LLM的涌现能力,但多智能体涌现在大规模下可能更加复杂和迷人。一个AI群体可以演绎整个文明的演化。 前方有无限新的可能性。游戏将首先感受到影响。 Github: https://github.com/joonspk-research/generative_agents Paper: https://arxiv.org/abs/2304.03442 Authors: @joon_s_pk @joseph_c_obrien @carriejcai @merrierm @percyliang @msbernst

    引用Jim Fan@DrJimFan

    著名的斯坦福 Smallville 正式开源了! 25 个 AI 智能体居住在一个数字化的西部世界,浑然不知自己生活在一个模拟之中。他们去上班、闲聊、组织社交活动、结交新朋友,甚至坠入爱河。每个智能体都有独特的个性和背景故事。 Smallville 是 2023 年最鼓舞人心的 AI 智能体实验之一。我们常常谈论单个 LLM 的涌现能力,但多智能体的涌现在大规模下可能会复杂和迷人得多。一个 AI 群体可以演绎出整个文明的演化。 前方有无尽的新可能。游戏将最先感受到这一冲击。 Github: https://github.com/joonspk-research/generative_agents Paper: https://arxiv.org/abs/2304.03442 Authors: @joon_s_pk @joseph_c_obrien @carriejcai @merrierm @percyliang @msbernst

    推荐理由:经典Agent实验首次开源,个人开发者可搭建AI虚拟社会观察涌现行为

1月30日周五
  1. 蚂蚁 inclusionAI:GitHub 新仓库61

    高效离线推理框架 Flood:吞吐量显著领先,支持多模态与量化

    Flood 是一款面向离线应用的高效大语言模型推理框架。它采用流水线并行降低通信开销,并通过分段式KV缓存管理提升连续性。框架支持连续批处理、分块预填充、FP8/INT8量化及多模态模型推理。性能测试表明,其在多种模型和硬件上的吞吐量最高可达 vLLM 的 2.4 倍。其专用内核 SegmentAttention 在处理长序列时,解码速度较 FlashAttention 最高提升 3.16 倍。该项目于 2025 年 3 月开源并快速迭代,已支持前瞻解码等新特性。

    推荐理由:蚂蚁的 FLOOD 框架用流水线并行替代张量并行来压通信开销,实测吞吐比 vLLM 高 1.4 到 2.4 倍,做离线推理部署的团队值得花半小时跑一下 benchmark 看看自家场景能不能吃这个红利。

1月28日周三
  1. Nathan Lambert:Interconnects(RSS)

    Arcee AI 全力投入在美国构建的开放模型

    Arcee AI 发布开源大模型 Trinity Large,标志着其全面投入在美国本土构建开放模型的战略布局。该发布作为 Interconnects 第16期访谈的核心内容,彰显该公司对开源生态与数据主权的承诺。Trinity Large 的推出代表 Arcee AI 在本土 AI 基础设施建设上的关键进展,强调模型训练与开发的地理合规性及技术自主性。

    推荐理由:开源模型Trinity Large发布,美国本土训练的企业级合规新选择

1月27日周二
  1. Hugging Face:Blog(RSS)83

    中国开源AI生态中的架构选择:构建超越DeepSeek的未来

    Hugging Face发布博客文章,探讨中国开源人工智能生态系统的核心架构选择与发展路径。文章聚焦于如何构建一个超越现有模型(如DeepSeek)的可持续技术体系,分析了中国开发者在模型架构、训练框架、部署工具和社区协作等方面的关键决策。文中指出,中国开源社区正致力于打造独立且互操作的技术栈,以应对大规模模型训练与推理的独特挑战,并推动全球AI生态的多元化发展。

    推荐理由:揭示中国开源AI架构演进,帮助开发者把握生态趋势与选型方向。

  2. 公众号:月之暗面(Kimi)61

    Kimi 发布并开源 K2.5 模型,带来全新视觉理解、代码和 Agent 集群能力

    Kimi 发布并开源迄今最智能、最全能的 K2.5 模型,原生多模态架构支持视觉与文本输入、思考与非思考模式,在 Agent、代码、图像、视频及通用智能任务上取得开源 state-of-the-art 表现。

    推荐理由:Kimi K2.5把视觉理解和Agent集群能力打包开源,国内模型里比较早做这个组合的,虽然参数规模争议不小,但对想搭多模态Agent的团队是个可用的起点。

1月22日周四
  1. Moonshot AI:Kimi Blog

    Kimi 供应商验证器

    Kimi 发布 K2.5 模型时开源 Kimi Vendor Verifier(KVV),用于验证第三方推理实现的准确性。针对开源模型部署渠道多样化导致的质量失控问题,KVV 提供六项关键基准测试,覆盖参数约束验证、多模态流水线、长输出压力测试、工具调用一致性及编程能力评估。项目与 vLLM/SGLang 社区合作修复根因,并提供预发布验证和实时更新的公开排行榜。完整评估在双 H20 8 卡服务器上约需 15 小时。

    推荐理由:Kimi开源Vendor Verifier,系统性解决开源模型第三方部署质量验证难题

1月16日周五
1月15日周四
  1. Hugging Face:Blog(RSS)80

    开放回应:你需要知道的事

    OpenAI 正通过开源与开放科学推进人工智能的民主化进程。其核心目标是降低 AI 技术的门槛,促进更广泛的参与和创新。这一举措将推动研究透明化,加速技术迭代,并鼓励全球协作共同构建 AI 的未来。

    推荐理由:开源替代方案降低 AI API 依赖,开发者多一个免费可控的选择

1月12日周一
  1. Hacker News:AI 热帖

    Agent-of-empires:OpenCode 与 Claude Code 会话管理器

    Agent-of-empires(AoE)是一款支持 Linux 与 macOS 的 AI 编码代理会话管理器,兼容 Claude Code、OpenCode 等 9 种主流 AI 工具。该工具基于 tmux 实现会话持久化,支持在多分支代码库上并行运行多个代理,提供 Docker 沙盒隔离、Git worktrees 管理及实时状态检测,并可通过 Web 仪表板或 Cloudflare 隧道从手机远程访问,解决多代理协作时的状态追踪与工作环境隔离问题。

    推荐理由:同时管理多个AI编码代理,手机远程监控不再乱套

1月5日周一
  1. Hugging Face:Blog(RSS)73

    Introducing Falcon-H1-Arabic: 以混合架构突破阿拉伯语AI的边界

    阿联酋技术创新研究院在Hugging Face发布了Falcon-H1-Arabic模型。该模型采用创新的混合架构,融合了自回归与自编码技术,专门针对阿拉伯语进行优化。其目标是通过提升对阿拉伯语复杂语法和丰富形态的理解与生成能力,显著推进阿拉伯语人工智能的发展。这一发布标志着阿拉伯语大语言模型在技术架构上取得了重要进展。

    推荐理由:阿拉伯语AI新模型发布,推动多语言AI应用发展

  2. Liquid AI 模型与工程博客(网页)63

    Liquid AI 发布 LFM2.5 端侧模型家族,预训练扩展至 28T tokens

    Liquid AI 发布 LFM2.5-1.2B 模型家族,将预训练从 10T 扩展到 28T tokens 并加入强化学习后训练,覆盖 Base、Instruct、日语、视觉语言和音频语言五个变体。

    推荐理由:官方发布给出了完整基准数据和推理速度对比,读者可以据此评估 1B 级端侧模型在指令遵循和部署上的实际水位。

12月18日周四
  1. Hugging Face:Blog(RSS)73

    Transformers v5 中的分词:更简单、清晰与模块化

    Transformers v5 发布了全新的分词处理架构,核心变化是引入了更简单、统一的 API 设计,将分词器、后处理器和解码器模块化。新版移除了大量遗留代码,使代码库体积减少了约 40%,并显著提升了处理长文本和特殊 token 的灵活性。这一改进旨在降低开发者使用门槛,同时为各类大语言模型(如 GPT、Claude、LLaMA)提供更高效、一致的分词支持。

    推荐理由:Transformers库tokenization模块重构,开发者可更高效处理文本数据。

12月16日周二
  1. Hugging Face:Blog(RSS)83

    CUGA 登陆 Hugging Face:普及可配置的通用 AI 智能体

    开源可配置通用智能体 CUGA 现已集成至 Hugging Face Spaces,便于开发者便捷实验。该智能体在复杂任务基准测试中表现卓越,在包含 457 个 API、750 个真实任务的 AppWorld 基准排名第一,在 WebArena 基准也位居前列。其核心提供可配置的推理模式以平衡性能与成本,支持计算机使用与多工具无缝集成,并能与 Langflow 结合进行低代码工作流设计。采用 Apache 2.0 许可的 CUGA 支持多种开源模型,在高性能推理平台(如 Groq)上运行能显著提升效率。

    推荐理由:开源AI代理框架性能领先,集成Hugging Face和Langflow,开发者可快速构建复杂任务。

12月15日周一
  1. 通义 QwenAudio:原创语音项目60

    通义实验室开源 Fun-ASR 系列语音识别模型,含方言与 31 语言版本

    通义实验室发布 Fun-ASR 端到端语音识别模型系列并开源。Fun-ASR-Nano-2512 参数量 800M,基于数千万小时语音训练,支持中英日三语、7 种汉语方言和 26 种地方口音;Fun-ASR-MLT-Nano-2512 同为 800M,基于数十万小时训练,支持 31 种语言。

    推荐理由:原文给出两个识别模型的训练规模、语言覆盖和开源基准对比,还附部署与推理路径,读者可据此评估在中文和方言场景的可用性。

12月11日周四
  1. Hugging Face:Blog(RSS)76

    llama.cpp 服务器新增多模型管理功能

    llama.cpp 服务器新增了类似 Ollama 的多模型管理功能。该功能采用多进程架构,每个模型独立运行,确保单个模型崩溃不影响其他服务。系统支持自动发现本地 GGUF 模型文件、按需加载,并默认采用 LRU 机制管理最多同时加载4个模型。用户可通过请求中的模型字段路由到特定模型,并可使用 API 进行加载、卸载和列表查看。所有加载的模型可继承路由器的统一设置,也支持通过预设文件为每个模型单独配置参数。内置 Web UI 同样支持模型切换。

    推荐理由:本地跑模型终于能像 Ollama 一样热切换,开发调试效率大幅提升