跳到正文
北京时间

Hugging Face

Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。

最新精选

第 101–120 条 · 共 169 条
5月8日周五
  1. Hugging Face:Blog(RSS)58

    MedQA:基于AMD ROCm与LoRA微调Qwen3-1.7B的临床问答模型

    该项目使用AMD Instinct MI300X(192 GB HBM3显存)和ROCm,通过LoRA微调Qwen3-1.7B模型实现医学问答。训练仅用2000条MedMCQA样本,约5分钟完成,仅更新约220万参数(占模型总参数的0.1443%),全程采用fp16精度,无需量化。HuggingFace生态(Transformers、PEFT、TRL、Accelerate)在ROCm上无缝运行,无需修改代码即可直接替代CUDA。模型已上传至HuggingFace Hub并提供在线Demo。

    推荐理由:一个月前的教程了,但如果你是 AMD 党想跑医疗微调,这篇把坑都踩完了,代码直接能复现,LoRA 适配器也挂在 Hub 上,拿来就能用。

5月7日周四
  1. Hugging Face:Blog(RSS)65

    vLLM V0 到 V1:在线强化学习中优先确保后端行为正确性

    为确保 vLLM 从 0.8.5 到 0.18.1 的重大重写后,在线强化学习训练结果与 V0 参考运行一致,团队优先修复后端行为而非调整 RL 目标。关键修复包括:将日志概率模式设为 `processed_logprobs` 以匹配采样器分布;禁用 V1 特有的前缀缓存和异步调度等运行时默认值;调整权重更新路径以匹配 V0 的缓存保留行为;并确保 rollout 后端使用 fp32 精度的 `lm_head` 进行最终投影。这些措施消除了策略比率均值偏差,使 V1 在 KL 散度、熵等指标上与 V0 达成一致。

    推荐理由:vLLM V1迁移时踩的四个坑全在这里,从logprob语义到fp32投影头,修完才调RL目标,做在线RL的团队可以直接抄这份配置清单。

5月1日周五
  1. Ant Ling76

    AntLingAGI团队宣布Ling-2.6-1T模型正式开源,已登陆Hugging Face平台,并通过Novita Labs提供官方推理体验。该模型采用混合专家架构,总参数1万亿、激活参数630亿,核心优化方向为“令牌效率”以满足真实生产需求。具体表现为:低令牌开销,能在无需冗长推理链的情况下保持强大智能;可靠的多步执行能力,提升指令、工具、上下文和工作流的控制水平;生产就绪的部署特性,覆盖从代码生成到错误修复的任务,并广泛兼容各类智能体框架。团队旨在通过降低测试、部署、定制和构建的难度,为开发者创造价值。

    引用Ant Ling@AntLingAGI

    上周,我们发布了 Ling-2.6-1T。今天,Ling-2.6-1T 正式成为开源模型~ 🤗 总参数 1T · 激活参数 63B 我们通过让测试、部署、定制和构建变得更简单,为开发者带来价值。 这款模型针对实际生产需求进行了“模型 token 效率”优化: • 更低的 token 开销:无需长推理链即可实现强大的智能 • 可靠的多步执行:更好的指令、工具、上下文和工作流控制 • 生产级部署:从代码生成到 bug 修复,兼容广泛的 Agent 框架 提前一瞥 @opencode 中的智能体能力

    推荐理由:1T参数开源模型不是天天有,蚂蚁这个Ling-2.6-1T强调token效率和Agent能力,做Agent的可以直接去Hugging Face上跑一下,看看是不是真的在生产环境省token。

4月30日周四
  1. Hugging Face:Blog(RSS)62

    AI评估正成为新的算力瓶颈

    AI评估成本已突破关键阈值,正重塑其可及性。Holistic Agent Leaderboard花费约4万美元运行了2万多次智能体推演,单次前沿模型测试成本可达2829美元。研究显示,相同任务成本差异可达33倍,脚手架选择是核心成本驱动因素。虽然静态基准可通过压缩技术实现百倍成本缩减,但智能体评估因轨迹长、噪声大而压缩有限。高支出未必带来更好结果:例如在GAIA测试中,2828美元方案准确率28.5%,而1686美元方案反达57.6%。当评估包含模型训练时,成本将完全超越常规API框架。

    推荐理由:这篇把分散的评估成本数据拉通了算总账,曾经便宜的评测现在动辄上万美元,独立评估正被价格挤出牌桌,做Agent的人必须意识到排行榜的代价。

4月29日周三
  1. SenseTime65

    是的,SenseNova U1 现已在 Hugging Face 和 GitHub 上发布! 探索它如何以语义精确性和像素级保真度实现复杂的 #信息图 创作。 Hugging Face: https://huggingface.co/collections/sensenova/sensenova-u1 GitHub: https://github.com/OpenSenseNova/SenseNova-U1 Discord: https://discord.gg/cxkwXWjp

    引用AK@_akhaliq

    SenseNova U1 已在 Hugging Face 上线 https://huggingface.co/collections/sensenova/sensenova-u1

    推荐理由:SenseNova U1 开源了,能生成像素级精准的信息图,对于做电商和可视化的人是个直接可用的工具,值得跑一下看看实际表现。

  2. Hugging Face:Blog(RSS)70

    介绍 NVIDIA Nemotron 3 Nano Omni:面向文档、音频和视频智能体的长上下文多模态模型

    NVIDIA 发布了 Nemotron 3 Nano Omni 模型,这是一个专为处理长上下文多模态任务设计的轻量级模型。该模型能够同时理解并处理文档、音频和视频数据,旨在赋能新一代多模态智能体。其核心变化在于将长上下文能力与多模态理解结合到一个小型化模型中,提升了在复杂跨模态场景下的处理效率与应用灵活性。

    推荐理由:NVIDIA 把多模态长上下文塞进 Nano 级别模型,文档、音频、视频 Agent 通吃,做端侧多模态应用的团队值得认真看看这个架构思路。

4月28日周二
  1. Hugging Face:Blog(RSS)58

    Adaptive Ultrasound Imaging with Physics-Informed NV-Raw2Insights-US AI

    NVIDIA 在 Hugging Face 上发布了一款名为 NV-Raw2Insights-US 的物理信息人工智能模型,专门用于自适应超声成像。该模型能够直接处理原始超声射频数据,实时生成高质量的诊断图像。它通过结合物理定律与深度学习,显著提升了图像分辨率和对比度,同时将传统处理流程中的多个步骤整合为单一前向传播,大幅提高了计算效率。这一进展有望推动超声设备向更便携、智能和精准的方向发展。

    推荐理由:NVIDIA 把物理先验塞进超声成像管线,从原始射频数据直接出诊断结果,跳过传统重建步骤。做医疗 AI 的值得拆一下这个端到端思路,但离通用场景太远。

4月24日周五
  1. Hugging Face:Blog(RSS)78

    DeepSeek-V4:智能体可实际使用的百万token上下文

    DeepSeek发布新一代模型DeepSeek-V4,其核心突破在于实现了长达百万token的上下文窗口,并确保智能体能够有效利用这一扩展的上下文能力。该模型延续了通过开源与开放科学推动人工智能发展与普及的使命,标志着大模型在长上下文理解和实际应用方面迈出重要一步。

    推荐理由:DeepSeek 把上下文窗口推到百万 token 不稀奇,关键是「agent 能实际用」这六个字。如果实测成立,RAG 的很多工程妥协可以扔掉了,做长文档和复杂 agent 的人该第一时间跑一遍。

4月23日周四
  1. Hugging Face:Blog(RSS)57

    如何在 Chrome 扩展中使用 Transformers.js

    本文介绍在 Chrome 扩展中集成 Transformers.js 库的具体方法,涵盖从环境配置、模型加载到前后端通信的关键步骤。通过示例代码演示了如何利用该库在扩展中实现本地机器学习推理,同时处理扩展权限限制与安全策略。文中还对比了 Web Worker 与 Service Worker 两种部署方案,并提供了性能优化建议,帮助开发者在浏览器扩展环境中高效运行 Transformer 模型。

    推荐理由:Hugging Face 官方出的 Transformers.js 浏览器插件教程,想在 Chrome 里跑端侧推理的前端开发者可以直接抄,省掉自己踩坑的时间。

4月21日周二
  1. Hugging Face:Blog(RSS)63

    QIMMA:一个质量优先的阿拉伯语大语言模型排行榜

    QIMMA 是一个首创质量验证流程的阿拉伯语大语言模型评估平台。它整合了14个基准测试的109个子集、超5.2万个样本,覆盖文化、STEM等7大领域,其中99%为原生阿拉伯语内容。平台采用双阶段质量验证:先由两个大模型自动评估,再经人工审核,发现并剔除了现有基准中存在的系统性质量问题。此外,QIMMA首次集成了阿拉伯语问题描述的代码评估任务,并公开逐样本推理结果,确保了评估的可靠性与透明度。

    推荐理由:QIMMA 把阿拉伯语基准的质量问题扒了一层皮,揭示现有数据集存在系统性错误,这个验证管线思路对所有多语言评估都有参考价值。

4月16日周四
  1. Hugging Face:Blog(RSS)69

    使用 Sentence Transformers 训练与微调多模态嵌入及重排序模型

    Sentence Transformers 发布了用于训练和微调多模态嵌入与重排序模型的功能。新版本支持将文本、图像等不同模态的数据映射到统一的向量空间,并优化了跨模态检索的精度。关键改进包括对嵌入模型和重排序器进行联合或分阶段训练,显著提升了如图文检索等任务的性能指标。此次更新旨在通过开源工具推动多模态人工智能技术的普及与发展。

    推荐理由:这是训练多模态嵌入模型的全套指南,附带 VDR 微调实验和代码。如果你需要把文本和图像检索对齐到自己的业务数据上,这篇能省掉大量试错时间。

  2. Hugging Face:Blog(RSS)77

    The PR you would have opened yourself

    随着2026年AI代码代理的成熟,开源项目如transformers面临PR数量激增但质量下降的挑战。这些代理生成的代码常忽视项目的隐式设计契约,导致代码冗长、引入错误并增加维护者负担。为此,团队为mlx-lm开发了一个Skill工具,用于将模型从transformers高质量地移植到mlx-lm框架。该工具不仅生成接近人工提交的PR,还提供生成示例、数值对比和独立的测试工具链,以辅助贡献者和审查者。其目标是让模型在加入transformers后能快速在MLX上可用,同时维护代码的可读性与设计一致性。

    推荐理由:这篇不是普通的工具介绍,而是在 agent 时代探讨开源贡献的尺度——用 Skill 加速模型移植的同时,仍强调人的判断和责任,做维护的人该读一读。

  3. Hugging Face:Blog(RSS)65

    Ecom-RLVE:面向电子商务对话代理的自适应可验证环境

    Ecom-RLVE 是一个为电子商务对话代理设计的自适应可验证环境。该环境支持智能体在模拟且可验证的电商场景中进行训练与评估,通过动态调整交互难度和规则约束来提升对话系统的鲁棒性与适应性。其核心在于结合强化学习与验证机制,确保智能体行为既符合商业逻辑又可追溯,为电商对话系统的开发与测试提供标准化、可复现的实验平台。

    推荐理由:做电商对话 agent 的可以看看,这个 RL 环境把难控的多轮对话变成了可验证的 reward,还附带了从易到难的课程,开源可跑,是个扎实的工具。

4月15日周三
  1. Hugging Face:Blog(RSS)71

    深入VAKRA:智能体的推理、工具使用与失败模式

    IBM Research在Hugging Face发布的博客详细剖析了其智能体框架VAKRA的核心机制。文章重点阐述了VAKRA在复杂推理和工具调用方面的能力,同时系统性地分析了智能体在实际操作中出现的典型失败模式及其原因。该研究旨在通过深入理解智能体的行为逻辑与局限,推动更可靠、鲁棒的自主智能系统发展。

    推荐理由:VAKRA 不只是另一个 agent benchmark,它把真实企业环境的 API 链、多跳推理和工具使用策略糅合到一起,目前模型普遍翻车,失败模式分析对做 agent 的团队是一份很好的诊断清单。

  2. Hugging Face:Blog(RSS)60

    认识HCompany的HoloTab:您的AI浏览器伴侣

    H公司在Hugging Face平台发布博客,正式推出AI浏览器伴侣HoloTab。该产品定位为浏览器内的智能助手,旨在通过AI技术提升网页浏览与信息处理效率。目前公开信息显示其集成于浏览器环境,具体功能细节与性能指标尚未披露。

    推荐理由:HCompany 把电脑操作模型做成了浏览器扩展,Routines 录制重播让网页自动化零门槛上手,做网页调研的人值得一试,但日常泛用性有限。

4月9日周四
  1. Hugging Face:Blog(RSS)81

    基于 Sentence Transformers 的多模态嵌入与重排序模型

    Sentence Transformers 开源社区发布了支持多模态的嵌入与重排序模型。新模型能够同时处理文本和图像输入,生成统一的语义向量表示,并可通过交叉编码器实现细粒度相关性重排序。该版本显著扩展了原框架的纯文本能力,支持图像-文本检索、跨模态匹配等场景,所有代码与预训练模型均已开源,延续了其推动AI民主化的目标。

    推荐理由:Sentence Transformers v5.4 把多模态嵌入和重排变成统一 API,跨模态 RAG 从试验品变成开箱即用,做多模态搜索的开发者可以直接上手复制。

  2. Hugging Face:Blog(RSS)60

    Waypoint-1.5:为消费级GPU打造的高保真交互世界模型

    Wayve发布Waypoint-1.5模型,用于生成高保真可交互虚拟世界。该模型经优化后能在消费级GPU(如RTX 4090)上高效运行,降低硬件门槛,支持实时交互与动态场景生成,适用于自动驾驶模拟、游戏开发等领域,推动AI技术民主化。

    推荐理由:Waypoint 1.5 把实时生成世界从 demo 变成了消费级 GPU 上能跑的东西,360p 版的兼容性让游戏本也能玩。高保真不是重点,实时响应和本地运行才是,做互动内容的值得关注。

4月8日周三
  1. Hugging Face:Blog(RSS)62

    Safetensors 加入 PyTorch 基金会

    Safetensors 安全张量格式原为 Hugging Face 项目,旨在解决模型权重存储的安全风险,现正式加入 PyTorch 基金会,移交至 Linux 基金会旗下,实现供应商中立治理。该格式因简单高效被广泛采用,成为 Hugging Face Hub 等平台默认模型分发方式,服务数万个模型。此次变更对用户无影响,格式、API 和集成保持不变。未来路线图包括设备感知加载与保存、张量并行和流水线并行的 API 支持,以及 FP8、GPTQ 等量化格式的正式集成。项目治理文档已公开,鼓励社区参与贡献。

    推荐理由:Safetensors 从单厂项目转为社区治理,意味着模型格式的安全性和互操作性有了更中立的长期保证,这对依赖它的开发者是个积极的制度信号。

4月2日周四
  1. Hugging Face:Blog(RSS)88

    Welcome Gemma 4: 设备端的 Frontier 多模态智能

    Google 正式发布了 Gemma 4,这是一款前沿的多模态人工智能模型,其核心特点是能够在设备端本地运行。该模型通过开源方式发布,旨在推动人工智能技术的进步与民主化。Gemma 4 的“在设备端”能力意味着数据处理可在本地完成,无需持续连接云端,这有望提升响应速度、增强隐私保护并实现离线使用。此举是 Google 通过开源和开放科学来普及人工智能的持续努力的一部分。

    推荐理由:前沿多模态模型开源,设备端可运行,降低AI部署门槛。

4月1日周三
  1. Hugging Face:Blog(RSS)70

    Falcon Perception

    Technology Innovation Institute 在 Hugging Face 平台发布了一篇博客文章,介绍了其 Falcon Perception 系统。该系统是一种先进的感知技术方案,专注于提升机器对复杂环境的理解与交互能力。文章阐述了其核心架构的更新,包括多模态数据融合机制的优化,以及实时处理效率的显著提升。关键性能指标显示,其在标准基准测试中的准确率与响应速度均有突破。

    推荐理由:Falcon 系列新成员,开源多模态模型阵营再添一员,开发者可关注选型