跳到正文
北京时间

端侧 AI

跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。

171条精选相关主题部署工程开源生态模型发布

最新精选

第 81–100 条 · 共 171 条
6月5日周五
  1. IT之家(RSS)76

    Meta 智能眼镜 App 暗藏人脸识别代码,NameTag 功能已推送至超 5000 万设备

    据《连线》今日报道,Meta 通过多次应用更新将人脸识别代码推送到智能眼镜配套 App 中,代号“NameTag”。该功能利用已部署的三个 AI 模型将人脸转换为“人脸特征模板”,与手机本地数据库匹配,识别成功后向佩戴者发送通知。App 下载量超 5000 万次。Meta 回应称代码仅为探索,尚未决定推出,且不会建立中央人脸数据库。此前 Meta 曾因人脸识别问题在伊利诺伊州和得克萨斯州分别达成 6.5 亿美元和 14 亿美元和解。

    推荐理由:Meta一边付近百亿美元和解金,一边把完整人脸识别代码塞进 5000 万用户的眼镜里,「探索」这个解释太轻巧——代码都推送了,离功能上线只差一个开关。

  2. Hacker News 热门(buzzing.cc 中文翻译)80

    Meta 在智能眼镜上搭载人脸识别功能

    Meta 为其智能眼镜产品推出了人脸识别功能,用户可通过眼镜识别他人身份,并获取相关信息。该功能目前正通过早期测试版本向部分用户开放,旨在增强增强现实设备的社交与信息交互能力。

    推荐理由:Meta 把完整的人脸识别栈塞进了智能眼镜 App,这事一旦激活,公共场所的匿名性将被重新定义。作者的技术取证链条扎实,迫使 Meta 必须正面回应。

  3. Google Research:Blog(网页)79

    Google Research 发布被动心率监测系统 PHRM

    Google Research 开发了一种被动心率监测系统(PHRM),利用智能手机前置摄像头在日常使用中(人脸解锁后数秒内)捕捉面部视频,通过深度学习估算心率,平均绝对百分比误差(MAPE)低于10%(对比心电图金标准),满足各肤色人群的行业精度标准。系统将全天心率测量整合为每日静息心率(RHR),平均绝对误差(MAE)低于5 bpm(对比可穿戴设备)。研究同时发布了迄今最大规模的公开智能手机视频数据集及预训练模型PHRM-mini,合格研究人员可申请访问。

    推荐理由:Google 这项发表在 Nature 上的研究,把手机前置摄像头变成了被动心率仪,而且专门解决了深肤色人群精度差的老问题,虽然离产品还远,但方向很对,穿戴设备的护城河可能又浅了一点。

6月4日周四
  1. MarkTechPost(RSS)71

    Meet OpenJarvis:一个本地优先的设备端个人AI智能体框架,支持工具、记忆与学习

    Stanford 研究人员发布 OpenJarvis,一个完全在设备端运行推理、智能体、记忆与学习的开源框架。它将个人 AI 系统分解为五个可组合原语:Intelligence、Engine、Agents、Tools & Memory 和 Learning。该框架与最佳云端模型的性能差距在 3.2 points 以内,边际 API 成本降低约 800 倍。

    推荐理由:斯坦福这个框架把云端模型能力拉到本地,成本降了800倍,所有想做离线个人助理的开发者该试试看,开源实现比PPT有说服力。

  2. Sundar Pichai73

    Gemma 4 系列累计下载量突破1.5亿次,Google随之推出新成员Gemma 4 12B。该模型仅12B参数,可在16GB VRAM笔记本上本地运行,兼顾尺寸与性能,支持多步推理和智能体工作流。采用Apache 2.0开源许可,供社区使用。

    引用Demis Hassabis@demishassabis

    庆祝 Gemma 4 下载量突破 1.5 亿次这一里程碑,同时发布全新的 Gemma 4 12B 模型! 对于如此小巧的模型来说,它性能极其强大,而且体积足够小,仅需 16GB 显存就能在笔记本电脑上本地运行。 采用 Apache 2.0 许可证——祝大家构建愉快!

    推荐理由:Gemma 4 12B 把多步推理塞进笔记本能跑的尺寸,Apache 2.0 开源,对想做本地 agent 的开发者是实实在在的新弹药,小模型的可用性正在逼近临界点。

  3. Demis Hassabis74

    Demis Hassabis 宣布 Gemma 4 系列下载量突破 1.5 亿,并正式发布新版 Gemma 4 12B 模型。该模型是一个统一的、无编码器的多模态模型,兼具边缘端效率与高级推理能力。尽管参数规模仅为 12B,但性能强劲,且足够小巧,可在仅需 16GB VRAM 的笔记本上本地运行。采用 Apache 2.0 开源许可证,方便开发者自由构建。

    引用Google Gemma@googlegemma

    认识 Gemma 4 12B! 一个统一的、无编码器的多模态模型,旨在将高性能智能直接带到你的笔记本电脑上,并以 Apache 2.0 许可证发布。 弥合边缘效率与高级推理之间的差距。以下是 Gemma 4 12B 的新内容:👇

    推荐理由:Gemma 4 12B 用 Apache 2.0 许可把多模态模型压进笔记本,16GB 显存就能跑,端侧智能的性价比又一次被 Google 拉高,做本地推理的可以马上试试。

  4. Hacker News 热门(buzzing.cc 中文翻译)78

    Gemma 4 12B:一种统一的、无需编码器的多模态模型

    Gemma 4 12B 是 Google 发布的一款统一架构、无需独立视觉编码器的多模态大语言模型(LLM)。该模型直接处理图像与文本输入,无需传统视觉编码器,简化了多模态推理流程。基于 12B 参数规模,Gemma 4 12B 面向开发者工具生态开放。目前其具体 benchmark 分数、上下文窗口、价格及开源/API 可用性等细节尚未披露。

    推荐理由:我觉得Gemma 4 12B最大的变化不是参数大小,而是第一次在开源模型里把多模态直接交给LLM主干处理,没有单独的视觉编码器,这意味着本地多模态应用的延迟和内存占用都会大幅下降,对于在笔记本上做Agent的开发者,这是一个必试的版本。

  5. HuggingFace Daily Papers(社区热门论文)76

    Ultralytics YOLO26:统一实时端到端视觉模型

    Ultralytics YOLO26 采用双头设计实现原生无 NMS 的端到端推理,彻底移除 DFL,获得更轻检测头与无约束回归范围。训练结合混合 Muon-SGD 优化器 MuSGD、转向推理头的 Progressive Loss 及保证小物体正样本的 STAL 标签分配。支持检测、实例分割、姿态估计、定向检测和分类,提供 5 种尺度(n/s/m/l/x)及开放词汇扩展 YOLOE-26。全部尺度在 COCO 上达 40.9–57.5 mAP,T4 TensorRT 延迟 1.7–11.8 ms;YOLOE-26x 在 LVIS minival 文本提示下达 40.6 AP。代码已开源。

    推荐理由:这次YOLO26把NMS和DFL都拿掉了,还把大模型训练的Muon优化器改成MuSGD,在COCO上的速度精度平衡比上一代强不少,做实时检测的应该拿来跑一跑。

  6. Google Developers Blog(RSS)78

    Gemma 4 12B:开发者指南

    Gemma 4 12B 是一款密集多模态模型,专为消费级设备上的高性能本地 AI 执行而设计。其采用新颖的无编码器架构,绕过传统视觉和音频编码器,将多模态数据直接输入大语言模型主干。

    推荐理由:Google 把多模态模型直接塞进消费级设备,靠的不再是缩水而是架构层面的创新。12B 放在本地跑,这次玩法变了。

6月3日周三
  1. IT之家(RSS)73

    月之暗面 Kimi Work Beta 版开启内测:面向知识工作者的通用型本地 Agent

    月之暗面今日宣布,Kimi Work Beta 版随最新版 Mac 和 Windows 客户端开启内测。Kimi Work 是基于 Kimi Code 的通用型本地 Agent,支持安装使用技能、运行定时任务,并继承在线版的专业技能与数据库,内置可调用浏览器的 Kimi WebBridge。用户用自然语言描述目标即可自动拆解任务、并行执行并交付产物。支持 Agent 集群,最高可创建含 300 个子 Agent 的团队。官方透露,Kimi Work 自身由 Kimi Code 写成,工程师一周内完成客户端开发,累计产出超 5 万行有效代码,其中 92% 由 AI 自主生成。

    推荐理由:月之暗面把AI Agent搬到了本地,不是聊天窗口,而是直接操控你的电脑。92%的代码由AI自己写的自举能力,比功能本身更吓人。做办公自动化的同行该看看怎么被卷了。

  2. Satya Nadella74

    通过Project Solara,我们正在构建一个专为智能体优先设备打造的新平台。 很高兴能与@cristianoamon和@Qualcomm合作!

    引用Cristiano R. Amon@cristianoamon

    我们正在从应用和操作系统转向智能体,这彻底改变了设备体验的方方面面。与 @satyanadella 就下一步的发展进行了一次很棒的对话。 观看我们在 #MSBuild 上的讨论。 阅读 OnQ 博客文章了解更多。https://www.qualcomm.com/news/onq/2026/06/project-solara-agent-first-computing

    推荐理由:微软和高通联手搞了个 Agent 优先的硬件平台 Project Solara,这标志着 AI 竞赛正式从模型卷到了设备,以后什么是智能终端可能要被重新定义。

6月2日周二
  1. Hugging Face:Blog(RSS)73

    Holo3.1:快速本地计算机使用智能体

    Holo3.1 是基于 Qwen 模型家族的计算机使用智能体系列,旨在提升在桌面、网页和移动环境中的鲁棒性。新模型提供 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次发布量化检查点,包括 FP8、Q4 GGUF 和 NVFP4,以优化本地推理。在 AndroidWorld 基准测试中,35B-A3B 模型得分从 67% 提升至 79.3%。在 DGX Spark 上,NVFP4 量化相比 BF16 实现 1.74 倍 token 吞吐量提升,并将平均步骤时间从 6.8 秒缩短至 3.3 秒。模型支持函数调用协议,可在第三方智能体框架中部署。

    推荐理由:Holo3.1 把计算机使用代理从桌面扩展到了移动端,还首次放出了量化版,让本地运行真正快了起来。想做 GUI 自动化的开发者可以立刻跑起来了。

  2. IT之家(RSS)71

    SK会长崔泰源:SK海力士计划未来五年内晶圆产能翻倍

    SK海力士会长崔泰源宣布,计划在未来五年内将整体晶圆产能提高一倍,以应对AI普及带来的持续存储供应短缺。他预测AI数据中心和AI PC的普及将持续拉动存储需求,供需紧张局面可能延续至2030年。SK海力士将投入大规模资金用于设备、建设等扩张,尽管面临前置时间长(新建晶圆厂至少三年)和资源成本上涨等挑战。目前,SK海力士市值已首次突破1万亿美元。

    推荐理由:存储龙头亲手确认产能翻倍且短缺持续到2030年,这个判断比任何市场预测都有分量,做AI基础设施和端侧产品的可以据此调整供应链预期。

6月1日周一
  1. Hacker News 热门(buzzing.cc 中文翻译)72

    本地设备 AI 图像生成模型 1-Bit Bonsai Image 4B 发布

    1-Bit Bonsai Image 4B 是一款新的 AI 图像生成模型,其主要特点是面向本地设备进行优化,可以在用户的本地硬件上运行。这是一款专注于端侧部署的图像生成解决方案。

    推荐理由:端侧图像生成终于进入可用阶段,把 4B 模型压到 iPhone 能跑而且性能保留 95%,做本地 AI 应用的产品人应该认真看一眼。

  2. Hacker News 热门(buzzing.cc 中文翻译)70

    我花200英镑把一台数据中心级GPU装进了我的游戏电脑

    一名用户以200英镑的价格购入了一块数据中心级GPU,并将其成功安装到自己的游戏电脑中。文章记述了这一非标准硬件改装过程、遇到的技术挑战以及最终实现本地运行大语言模型的体验。

    推荐理由:一个200英镑的二手 V100 加适配器,就让游戏电脑用上了 32GB 显存,跑 Qwen3.6-27B 达到 32 tok/s,噪音问题也解决了。对于想低成本本地跑大模型的人,这篇 DIY 手记很实用。

5月31日周日
  1. IT之家(RSS)72

    6000 多公里全程零干预:特斯拉 FSD 完成全球首次横穿加拿大自动驾驶

    一辆特斯拉汽车搭载 FSD V14.3.3 版本软件,完成了全球首次全程零人工干预、横穿加拿大的自动驾驶行程。车辆从温哥华出发,历时 4 天 21 小时,行驶 3760 英里(6051 公里)抵达哈利法克斯,全程所有驾驶操作(包括高速并线、应对复杂路况与自动泊车)均由系统自主完成,无任何系统退出或人工修正。该版本随 2026.14.6.6 更新推送,整合了春季软件功能。

    推荐理由:车主自己跑的6千公里零干预记录,比任何官方demo都实在。零接管、过施工、全自动泊车,FSD这个能力信号,对自动驾驶行业是颗定心丸。

  2. Simon Willison 博客73

    在浏览器中通过 Pyodide 和 Service Worker 运行 Python ASGI 应用

    作者展示了如何在浏览器中通过 Pyodide 和 Service Worker 运行 Python ASGI 应用。此前的 Datasette Lite 使用 Web Workers,但无法执行 `<script>` 标签中的 JavaScript。新方案由 Claude Opus 4.8 协助完成开发,解决了这一问题。作者已展示了基础的 ASGI FastCGI 演示和运行 Datasette 1.0a31 的演示,并计划后续将此方法应用于升级 Datasette Lite。

    推荐理由:Simon Willison 用 Service Worker 让 Python ASGI 在浏览器里真正跑了起来,这个技巧补上了 Datasette Lite 长期缺的 JS 执行能力,搞 Pyodide 的值得看看。

5月29日周五
  1. 公众号:通义实验室(千问)64

    通义实验室发布教程:在 Android 手机部署 MCP 感知服务器

    通义实验室发布教程,演示如何在 Android 手机上部署 MCP 感知服务器,使手机具备本地视觉与听觉分析能力。核心基于端侧 MNN 推理引擎和 Qwen3-VL 2B 模型(约 1.3GB),摄像头与麦克风采集的音视频在本地实时转化为结构化 JSON,再通过 MCP Tool 供 Claude Code 等云端 Agent 远程调用。整个过程不上传原始数据,仅传输语义提取结果。项目已开源,实测可识别红绿灯状态等场景。

    推荐理由:如果你做Agent总觉得AI对物理世界是瞎子,这篇教程就是解药。把Qwen3-VL塞进手机当本地眼睛,不传原始视频只给结构化文字,隐私友好又能被Claude直接调用。

  2. 公众号:面壁智能(MiniCPM)61

    面壁智能联合清华、OpenBMB开源最大中文预训练合成数据集及千万级SFT数据集,公开MiniCPM5‑1B核心数据

    面壁智能联合清华大学、OpenBMB发布并开源两大数据集:Ultra-FineWeb-L3(超600B Tokens,中文200B+,为当前最大中文预训练合成数据集)和UltraData-SFT-2605(国内首个千万级同时含深思考与非思考标注的SFT数据集)。两者基于UltraData数据分级治理体系构建,在MiniCPM5-1B训练流程中得到完全验证,覆盖预训练退火到后训练SFT全链路。已上线UltraData网站与HuggingFace,免费开放。

    推荐理由:填补了中文大规模合成数据空白,三年前还在用英文数据做中文模型的日子可以翻篇了,做端侧模型的可以直接拿这份数据跑一版 MiniCPM5-1B 级别的效果。