跳到正文
北京时间

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

697条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 641–660 条 · 共 697 条
12月5日周五
  1. Hugging Face:Blog(RSS)76

    介绍 swift-huggingface:完整的 Hugging Face Swift 客户端

    swift-huggingface 是一个全新的 Swift 客户端,旨在彻底解决旧库下载模型缓慢、不可靠且不支持断点续传的问题。它提供完整的 Hub API 覆盖,核心改进包括具备进度跟踪和断点续传的可靠下载、与 Python 生态共享缓存以避免重复下载,以及通过灵活的 TokenProvider 模式简化身份验证。该库现已独立发布,并将很快集成到 swift-transformers 中取代原有实现,未来还将支持 Xet 存储后端以实现更快的下载。

    推荐理由:Swift 开发者可无缝集成 Hugging Face 模型,下载更可靠且与 Python 共享缓存。

12月3日周三
  1. 蚂蚁 inclusionAI:GitHub 新仓库63

    蚂蚁集团开源AState:面向强化学习的高性能状态管理系统

    蚂蚁集团开源了AState,这是一个专为强化学习设计的高性能通用状态数据管理系统。它旨在解决RL训练与推理中的I/O效率低下、权重同步性能不足及状态恢复不鲁棒等核心挑战。系统采用三层架构:提供张量原生接口的API层、支持多种部署模式的服务层以及具备高效可扩展传输能力的基础层。其关键特性包括统一的张量级API、高性能权重同步和拓扑感知设计。在万亿参数规模下,AState能在约6秒内完成权重同步,远低于业界常见的分钟级延迟,目前已作为ASystem的关键组件在蚂蚁内部生产环境部署。

    推荐理由:蚂蚁把万亿参数 RL 训练的权重同步从分钟级压到 6 秒,这套 AState 系统是真刀真枪的工程解法,做大规模 RL infra 的团队值得拆一拆它的 RDMA P2P 架构。

12月1日周一
  1. Hugging Face:Blog(RSS)93

    Transformers v5:以简化模型定义驱动AI生态

    Transformers v5正式发布,其每日pip安装量从v4的2万次大幅提升至300万次以上,总安装量突破12亿次。模型架构数量从40个扩展至超400个,Hub上兼容的模型检查点从约1,000个增至75万个。新版本聚焦于简化模型定义、训练、推理与生产部署,通过引入AttentionInterface等模块化设计,显著降低了代码贡献与维护成本。此外,库将明确以PyTorch为唯一后端,逐步淘汰Flax/TensorFlow支持,并简化分词处理,以推动标准化与生态兼容性。

    推荐理由:Transformers v5 大幅简化模型集成,提升训练推理效率,开发者可快速上手最新 AI 模型。

11月26日周三
  1. Prime Intellect(网页)69

    Prime Intellect 发布 INTELLECT-3:106B 参数 MoE 模型,大规模 RL 训练并全栈开源

    Prime Intellect 发布 INTELLECT-3,一个 106B 参数的 MoE 模型,在 GLM-4.5-Air 基座上经 SFT 和大规模 RL 训练,在数学、代码、科学和推理基准上达到同规模最先进水平。

    推荐理由:原文给出了完整的模型权重、训练框架与 RL 环境开源清单,读者可以据此复现大规模强化学习后训练。

11月21日周五
  1. Hugging Face:Blog(RSS)80

    RapidFire AI 实现20倍更快的 TRL 微调

    RapidFire AI 发布了一套加速 TRL 微调的工具,通过自适应分块调度方案,允许在单个或多个 GPU 上并发启动多个训练配置并实时比较。内部基准测试显示,实验吞吐量比顺序执行高出约 16 至 24 倍。该工具提供即插即用的 TRL 配置包装器、分块并发训练、支持实时停止/恢复/克隆修改的交互式控制操作、自动多 GPU 编排以及 MLflow 仪表板,使用户能快速筛选最优配置,极大提升微调效率。

    推荐理由:开发者可并发测试多个微调配置,大幅提升实验效率。

11月20日周四
  1. Hugging Face:Blog(RSS)83

    介绍 AnyLanguageModel:为苹果平台提供本地与云端大语言模型的统一 API

    AnyLanguageModel 是一个 Swift 包,旨在为苹果平台上的大语言模型集成提供统一解决方案。它作为苹果原生 Foundation Models 框架的替代品,允许开发者通过相同的 API 接口,灵活调用本地模型(如通过 Core ML、MLX、llama.cpp 运行)与云端服务(如 OpenAI、Anthropic)。该方案复用苹果精心设计的 API 作为基础,大幅降低了在不同模型提供商之间切换的代码修改成本,并利用 Swift 的包特性功能避免依赖膨胀,从而简化开发流程,鼓励对本地开源模型的探索。

    推荐理由:Apple开发者可一键切换本地与云端模型,大幅降低AI应用开发门槛。

11月17日周一
  1. Hugging Face:Blog(RSS)73

    使用Hugging Face轻松构建和共享ROCm内核

    Hugging Face的kernels库简化了高性能深度学习内核的构建与共享,支持CUDA、ROCm等多种后端。本文以ROCm兼容内核为例,展示如何利用kernel-builder工具构建、测试并共享内核。以RadeonFlow的GEMM内核为具体案例,该内核是针对AMD Instinct MI300X GPU优化的FP8块状矩阵乘法实现,采用e4m3fnuz浮点格式和每块缩放因子以保持低精度计算准确性,并在2025年AMD开发者挑战赛中获最高奖。指南涵盖项目设置、构建配置及通过kernels社区分享的完整步骤。

    推荐理由:AMD GPU开发者可快速上手构建高性能AI内核,提升部署效率。

11月13日周四
  1. Hugging Face:Blog(RSS)88

    共建开放未来:Hugging Face与Google Cloud达成新合作

    Hugging Face与Google Cloud宣布建立深度战略合作,旨在将Google Cloud打造为使用开放模型的最佳平台。双方将合作构建CDN网关,把Hugging Face上的模型和数据集直接缓存在Google Cloud上,显著提升下载速度并增强供应链稳定性。Google Cloud客户在Vertex AI、GKE等服务中部署模型时将获得更快的首次响应。同时,Hugging Face的1000万开发者将受益于更多新型计算实例、价格下降以及通过Google安全技术强化的模型安全性。此次合作还将推动TPU在开放模型开发中的普及应用。

    推荐理由:开发者将享受更快的模型下载、TPU 原生支持和增强安全,简化 AI 部署流程。

10月27日周一
  1. MiniMax:Blog(网页)62

    MiniMax M2与AI智能体:简中见巧

    MiniMax正式开源并发布了专为AI智能体(Agent)和代码场景设计的大语言模型MiniMax M2。该模型API定价极具竞争力,仅为Claude Sonnet价格的约8%,且推理速度更快。在关键的智能体能力方面,其工具调用和深度搜索表现接近顶尖模型,编程能力在国内处于领先地位。MiniMax M2旨在解决性能、价格与速度的“不可能三角”,为构建更普及的AI智能体应用提供基础,体现了其“智能平权”的愿景。

    推荐理由:MiniMax M2 把 Agent 模型的价格打到了 Claude 的 8%,速度还翻倍,开源权重直接可用,做 Agent 的开发者值得上手试试。

10月26日周日
  1. Google DeepMind:Blog(RSS)

    MedGemma:健康 AI 开发领域最强的开源多模态模型

    谷歌 MedGemma 系列新增多模态模型,专为健康 AI 开发设计。作为该系列迄今最强的开源版本,新模型具备更强大的医疗场景理解能力,为开发者提供先进的医疗人工智能技术支持,助力构建更精准的健康医疗解决方案。

    推荐理由:DeepMind发布最强开放医疗多模态模型,支持开发者微调构建健康AI应用

10月24日周五
10月20日周一
  1. LangChain:Blog(RSS)64

    LangChain 三年回顾:从开源到 12.5 亿美元公司,发布 LangChain 1.0 与 LangSmith 扩展

    LangChain 创始人 Harrison Chase 回顾项目三年历程,公司估值达 12.5 亿美元,并宣布 LangChain 1.0 发布、LangSmith 扩展及 1.25 亿美元融资。

    推荐理由:三周年反思同时宣布 1.0 和 1.25 亿美元融资,LangChain 从实验框架转向企业级基础设施,影响开发者在兼容性与长期维护上的判断。

10月10日周五
  1. 蚂蚁 inclusionAI:GitHub 新仓库66

    Ming-VideoMAR:基于连续令牌的自回归视频生成模型

    Ming-VideoMAR 是一款仅解码器的自回归图像到视频生成模型,采用连续令牌统一视觉表征。它首次将时间因果性与空间双向性作为视频自回归核心原则,并提出了整合掩码生成的下一帧扩散损失。该模型首次实现了视频生成的零样本分辨率缩放,能灵活生成远超训练分辨率的视频。其在训练与推理效率上表现突出,参数量、训练数据量和GPU消耗仅为之前最佳模型Cosmos的极小比例(9.3%、0.5%和0.2%),同时在定量与定性评估中均实现超越。模型代码与检查点已开源,论文已被NeurIPS 2025接收。

    推荐理由:蚂蚁把自回归视频生成的训练成本砍到 Cosmos 的 0.2% 还能赢,这个效率信号比分数本身更值得关注,做视频生成的团队该认真看看它的课程学习和渐进分辨率策略。

10月1日周三
  1. Answer.AI 官方研发博客(RSS)65

    Answer.AI 开源 cachy,让 notebook 中 LLM 调用快 60 倍

    Answer.AI 发布开源 Python 包 cachy(pip install pycachy),通过补丁 httpx 的 send 方法,把 Anthropic 和 OpenAI SDK 的 LLM 调用响应自动缓存到本地并在相同请求时复用,无需编写 mock。

    推荐理由:原文给出了补丁原理和提速数据,读者可以直接复用这个零代码缓存方案加速自己的 LLM 测试和 notebook 工作流。

9月29日周一
  1. 蚂蚁 inclusionAI:GitHub 新仓库58

    inclusionAI/dInfer

    inclusionAI团队发布了dInfer,一个专为扩散语言模型设计的高效推理框架。该框架旨在解决扩散模型在文本生成领域推理速度慢、资源消耗大的核心挑战。dInfer通过一系列底层优化技术,显著提升了推理效率,能够更快地生成文本,同时降低计算成本,为扩散模型在更广泛的实际应用场景中部署提供了关键技术支持。

    推荐理由:蚂蚁把扩散语言模型的推理框架开源了,这类模型的推理效率一直是落地瓶颈,做端侧或低成本部署的团队值得看看能不能接上。

  2. 蚂蚁 inclusionAI:GitHub 新仓库57

    inclusionAI发布MingTok-Audio:首个统一连续语音分词器

    inclusionAI团队推出了MingTok-Audio,这是首个能有效融合语义与声学特征的统一连续语音分词器,适用于语音理解与生成任务。该模型基于纯因果Transformer架构,去除了卷积层以提升效率,并采用VAE进行连续特征建模以实现高质量音频重建。在语音重建性能上,其帧率为50,在SEED-ZH和SEED-EN测试集上的PESQ分别达到4.21和4.04,SIM为0.96,STOI为0.98,显著优于对比模型。在下游ASR任务中,其在多个方言数据集上取得了更低的错误率,例如在Hunan Minnan数据集上WER低至9.80%。

    推荐理由:蚂蚁把语音 tokenizer 做到了 PESQ 4.2 的离谱分数,比第二名翻了快一倍,做语音理解和生成的团队值得拿这个当新 baseline 跑一下。

9月22日周一
  1. 公众号:DeepSeek(深度求索)60

    DeepSeek-V3.1 更新至 Terminus 版本,优化语言一致性与 Agent 能力

    DeepSeek-V3.1 已更新至 DeepSeek-V3.1-Terminus 版本,在保持原有能力基础上,缓解了中英文混杂、偶发异常字符等问题,并优化了 Code Agent 与 Search Agent 的表现。官方 App、网页端、小程序与 DeepSeek API 均已同步更新,开源版本已发布至 Hugging Face。

    推荐理由:V3.1-Terminus 重点改进了语言混杂和 Agent 表现,开源权重与 API 已同步,适合评估多语言应用和工具调用的稳定性提升。

9月10日周三
  1. Thinking Machines Lab:官方博客(RSS)60

    破解LLM推理中的非确定性

    LLM推理的再现性是科学进步的基础,但即使在温度设为0的贪心采样下,ChatGPT等API以及vLLM、SGLang等自托管推理引擎仍无法保证确定性结果。常见的“并发+浮点非结合性”假设并不完整——GPU上重复执行相同矩阵乘法结果完全一致。真正原因在于:部分GPU内核是非确定性的,但LLM前向传播使用的内核均为确定性;推理服务器前向传播本身是确定性的,用户感知的非确定性源于浮点运算非结合性在不同聚合顺序下导致的细微数值差异。文章揭示了这一误解,并探讨如何实现真正可重现的LLM推理输出。

    推荐理由:Horace He 把 LLM 推理非确定性的锅从并发浮点转向 batch-size,并给出了可落地的 batch-invariant 内核实现,做推理部署和 RL 的工程师都该看看。