推荐理由:Gemma 4 一口气出了 8 个变体,本地部署的人最怕选错模型白折腾,这篇把选型逻辑拆得明明白白,从龙虾助手到树莓派都有对应方案,抄作业就行。
端侧 AI
全部主题跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。
最新精选
第 141–160 条 · 共 171 条
karminski-牙医@karminski3精选AI 评分7272
Sundar Pichai@sundarpichai精选引用Demis Hassabis@demishassabis很高兴推出 Gemma 4:这是目前各自尺寸下全球最优秀的开放模型。提供 4 种尺寸,可根据你的具体任务进行微调:31B 密集模型带来出色的原始性能,26B MoE 实现低延迟,还有高效的 2B 和 4B 模型适用于边缘设备——祝开发愉快!https://t.co/Sjbe3ph8xr
推荐理由:Google发布Gemma 4开源模型,4种尺寸覆盖从云端到端侧全场景
Demis Hassabis@demishassabis精选Gemma 4 开源模型发布,提供 4 种尺寸:31B dense 版追求极致性能,26B MoE 版实现低延迟,2B 与 4B 版适配边缘设备,均可针对特定任务微调。


推荐理由:Google 发布 Gemma 4 开源模型,覆盖 2B 至 31B 多尺寸,支持端侧与 MoE 架构
Google DeepMind@GoogleDeepMind精选Google 发布 Gemma 4 开源模型系列,采用 Apache 2.0 许可证,支持在本地硬件运行,专为高级推理和 agentic 工作流设计。


推荐理由:Google 开源 Gemma 4 模型,支持本地硬件运行并强化 Agent 与推理能力
Google Developers Blog(RSS)精选AI 评分8181 通过 Gemma 4 将先进的智能体能力引入边缘
Google DeepMind 发布了 Gemma 4 系列开源模型,旨在直接在设备端实现多步骤规划和自主智能体工作流。该版本包含用于实验“智能体技能”的 Google AI Edge Gallery,以及为开发者提供显著速度提升和结构化输出的 LiteRT-LM 库。Gemma 4 采用 Apache 2.0 许可,支持超过 140 种语言,并兼容移动设备、台式机及树莓派等多种物联网硬件平台。
推荐理由:开源 agentic 模型支持端侧运行,开发者可快速构建本地智能应用。
Hugging Face:Blog(RSS)精选AI 评分8888 Welcome Gemma 4: 设备端的 Frontier 多模态智能
Google 正式发布了 Gemma 4,这是一款前沿的多模态人工智能模型,其核心特点是能够在设备端本地运行。该模型通过开源方式发布,旨在推动人工智能技术的进步与民主化。Gemma 4 的“在设备端”能力意味着数据处理可在本地完成,无需持续连接云端,这有望提升响应速度、增强隐私保护并实现离线使用。此举是 Google 通过开源和开放科学来普及人工智能的持续努力的一部分。
推荐理由:前沿多模态模型开源,设备端可运行,降低AI部署门槛。
Hugging Face:Blog(RSS)精选AI 评分7070 Granite 4.0 3B Vision:面向企业文档的紧凑型多模态智能
IBM Granite团队发布了Granite 4.0 3B Vision模型,这是一个专为企业文档处理设计的紧凑型多模态大语言模型。该模型参数为30亿,具备视觉理解能力,能够同时处理文本和图像信息,特别针对报告、表格、图表等企业文档进行优化。其紧凑尺寸旨在降低部署和运行成本,使企业能够在资源受限的环境中高效实现文档智能分析、信息提取和知识管理。模型已在Hugging Face平台发布。
推荐理由:IBM 推出轻量级多模态模型,企业文档场景可直接落地部署
Hugging Face:Blog(RSS)精选AI 评分7373 将机器人AI引入嵌入式平台:数据集记录、VLA微调与设备端优化
NXP在Hugging Face发布技术博客,详细介绍了将视觉语言动作模型应用于嵌入式机器人系统的完整流程。核心工作包括构建真实世界的机器人交互数据集,对VLA模型进行针对性微调,以及实施一系列设备端优化以实现高效部署。该方案旨在解决大型模型在资源受限的嵌入式硬件上运行的挑战,推动机器人AI在边缘端的实际应用。
推荐理由:嵌入式AI开发者可掌握从数据集记录到设备端优化的全流程实践。
Apple:Newsroom(RSS)精选AI 评分7171 Apple 推出搭载 M5 芯片的全新 MacBook Air
Apple 发布了搭载 M5 芯片的全新 MacBook Air,为这款全球最受欢迎的笔记本电脑带来卓越性能和扩展的 AI 能力。新款 MacBook Air 在性能上实现显著提升,并增强了人工智能相关功能,进一步巩固其在轻薄本市场的领先地位。
推荐理由:Apple M5芯片强化端侧AI能力,开发者需关注硬件对AI部署的影响。
Google DeepMind@GoogleDeepMind精选我们推出 Nano Banana 2,基于最新的 Gemini Flash 模型构建。🍌 它在创建和编辑图像方面达到最先进水平,将专业级功能与闪电般的速度相结合。🧵


推荐理由:端侧手机本地实现Pro级图像生成与编辑,AI创作无需云端等待
Liquid AI 模型与工程博客(网页)精选AI 评分6464 Liquid AI 发布早期检查点 LFM2-24B-A2B,24B 总参数仅 2.3B 激活
Liquid AI 发布 LFM2 系列最大模型 LFM2-24B-A2B 的早期检查点,为 MoE 架构,24B 总参数、每 token 约 2.3B 激活,可放进 32GB 内存部署于云端和边缘设备。
推荐理由:官方给出架构配方和与 Qwen3、gpt-oss 的吞吐对比,读者可以据此评估这款 24B MoE 在笔记本和边缘部署上的实际可行性。
Hugging Face:Blog(RSS)精选AI 评分8686 GGML 和 llama.cpp 加入 HF 以确保 Local AI 的长期进展
GGML 和 llama.cpp 团队正式加入 Hugging Face,以支持本地 AI 社区的长期扩展。创始人 Georgi Gerganov 及团队将全职维护 llama.cpp,保持 100% 技术自主权和社区领导力,项目继续 100% 开源和社区驱动。Hugging Face 提供长期可持续资源,助力项目增长。技术上将优化 transformers 库与 llama.cpp 的无缝集成,实现近乎“一键式”的模型部署,并改进基于 GGML 的软件打包和用户体验。长期愿景是构建高效本地推理堆栈,推动开源超级智能的普及。
推荐理由:本地推理核心引擎获得长期资源保障,端侧 AI 生态稳定性大幅提升
Hugging Face:Blog(RSS)精选AI 评分7676 Transformers.js v4:现已在 NPM 上发布!
Transformers.js 发布第四个主要版本 v4,该版本现已通过 NPM 包管理器提供。这一更新延续了项目通过开源与开放科学推动人工智能技术进步与普及的使命,使开发者能够更便捷地获取并在项目中集成这一机器学习库。
推荐理由:浏览器和 Node.js 直接跑 HF 模型的大版本升级,前端开发者可零门槛接入 AI
Liquid AI 模型与工程博客(网页)精选AI 评分6666 Liquid AI 发布 LFM2.5-1.2B-Thinking,1.2B 参数端侧推理模型内存低于 1GB
Liquid AI 发布可在手机上完全离线运行的推理模型 LFM2.5-1.2B-Thinking,内存占用约 900 MB,已上线 Hugging Face、LEAP 和 Playground。
推荐理由:官方公布了小参数量思考模型的端侧内存、速度数据和训练配方,读者可以据此评估边缘推理方案的选型。
Liquid AI 模型与工程博客(网页)精选AI 评分6363 Liquid AI 发布 LFM2.5 端侧模型家族,预训练扩展至 28T tokens
Liquid AI 发布 LFM2.5-1.2B 模型家族,将预训练从 10T 扩展到 28T tokens 并加入强化学习后训练,覆盖 Base、Instruct、日语、视觉语言和音频语言五个变体。
推荐理由:官方发布给出了完整基准数据和推理速度对比,读者可以据此评估 1B 级端侧模型在指令遵循和部署上的实际水位。
Google DeepMind:Blog(RSS)精选 Gemini 3 Flash:专为速度打造的前沿智能
Gemini 3 Flash 正式发布,在大幅降低使用成本的同时提供前沿级智能,主打极速推理性能,为需要快速响应的 AI 应用提供高性价比选择。
推荐理由:Google发布Gemini 3 Flash轻量模型,兼顾前沿性能与推理速度
Hugging Face:Blog(RSS)精选AI 评分7676 llama.cpp 服务器新增多模型管理功能
llama.cpp 服务器新增了类似 Ollama 的多模型管理功能。该功能采用多进程架构,每个模型独立运行,确保单个模型崩溃不影响其他服务。系统支持自动发现本地 GGUF 模型文件、按需加载,并默认采用 LRU 机制管理最多同时加载4个模型。用户可通过请求中的模型字段路由到特定模型,并可使用 API 进行加载、卸载和列表查看。所有加载的模型可继承路由器的统一设置,也支持通过预设文件为每个模型单独配置参数。内置 Web UI 同样支持模型切换。
推荐理由:本地跑模型终于能像 Ollama 一样热切换,开发调试效率大幅提升
LMSYS:Blog(Chatbot Arena 团队)精选 在 NVIDIA DGX Spark 上优化 GPT-OSS:实现本地大模型部署
与 NVIDIA 合作,在 DGX Spark 上通过 SGLang 成功支持 GPT-OSS 20B 与 120B 模型,实现 20B 版本约 70 tokens/s、120B 版本约 50 tokens/s 的生成速度,达到目前最优水平。用户可通过 Docker 部署 SGLang 服务,接入 Open WebUI 实现本地聊天,或借助 LMRouter 转换请求格式以完全本地化运行 Claude Code。该方案使在 DGX Spark 上部署多百亿参数本地编码智能体成为现实。
推荐理由:DGX Spark本地跑通Claude Code完全离线,隐私敏感开发者的新选择
Google DeepMind:Blog(RSS)精选 Gemini 2.5 Flash-Lite 正式发布,可用于规模化生产
Gemini 2.5 Flash-Lite 结束预览,达到生产级可用状态。这款高性价比模型在轻量体积下提供高质量输出,支持 100 万 token 超长上下文和多模态能力。
推荐理由:Google轻量模型Gemini 2.5 Flash-Lite正式版发布,百万上下文多模态兼顾成本效益
Google DeepMind:Blog(RSS)精选 Gemma 3 270M 发布:专为超高效 AI 打造的轻量模型
Gemma 3 系列新增 270M 参数模型,仅 2.7 亿参数,定位紧凑型超高效 AI 专业工具。
推荐理由:Google 发布 270M 超小参数开源模型,端侧部署新选择