跳到正文
北京时间

端侧 AI

跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。

171条精选相关主题部署工程开源生态模型发布

最新精选

第 121–140 条 · 共 171 条
5月9日周六
  1. Elon Musk71

    Tesla通过分析真实车队碰撞数据,结合视觉系统与传感器,实现了安全系统的突破。传统碰撞传感器需要时间确认,降低阈值可能导致误触发。而视觉系统能提前“看到”即将发生的碰撞,与传感器协同,使约束控制器能更早、更准确地启动安全气囊和安全带预紧器。通过仿真重放碰撞并测量人体模型受力,团队发现提前部署能优化保护时机。这一改进使预测伤害严重程度整体显著下移,并通过OTA更新实现,是前所未有的安全提升。

    引用Wes@wmorrill3

    这些点中的每一个都是车队中真实发生的碰撞。真实世界的速度、碰撞和人员。而不仅仅是法规测试用例。 正是这些数据的丰富性才促成了这一结果。通过仿真,我们可以回放碰撞,并测量人体模型上所受的力。 然后遍历约束装置的展开时间,发现更早展开能为气囊提供最佳充气时间,并在乘员移出位置之前完成安全带预紧。 但碰撞加速度计需要时间才能确定。降低这一时间阈值会带来误触发的风险。 使用视觉让车辆有信心缩短这一时间。摄像头看到即将发生的碰撞,并与传感器一起告诉约束控制器降低滤波并更早采取行动。 预测伤害严重程度中的 Y 轴偏移,是基于以更快的检测阈值重新运行碰撞仿真后,人体模型中的传感器得出的。 如此全面地降低伤害严重程度是闻所未闻的,更不用说通过空中升级来实现这一点了。 我为分析团队的工作和奉献感到无比自豪。他们超越职责,提出“我们拥有道路上最安全的汽车,但能否让它更安全?”然后与视觉团队合作,构建实现这一目标所需的预测。经过仿真和物理碰撞测试的严格验证。如今已部署并改善着人们的生活。 我循环观看这段视频,想象着每一个点,一个人。

    推荐理由:below_threshold:T2 推文门槛 75,当前 finalScore=71

5月8日周五
  1. IT之家(RSS)80

    AI 终端智能化分级国标出炉:L1~L4 等级,涉及手机、电脑、眼镜、电视、耳机等

    工信部等部门联合发布《人工智能终端智能化分级》系列国家标准。该标准采用“2+N”架构,基础部分明确了AI终端的定义、分级体系与测试方法。智能化水平从低到高分为L1响应级、L2工具级、L3辅助级和L4协同级四个等级,其中L4级标准将在后续修订中完善。首批标准覆盖手机、电脑、电视、眼镜、汽车座舱、音箱、耳机共7个品类,小米、华为、荣耀等为主要起草单位,旨在为各类智能终端的智能化水平提供统一评价依据。

    推荐理由:中国首个AI终端智能化分级国标落地,L1到L4四个等级把手机、电脑、眼镜的智能水平钉在墙上,以后厂商再也不能模糊宣传,选型有了一把公用尺子。

  2. Rohan Paul78

    atomic.chat通过为LLaMA.cpp引入多令牌预测技术,大幅提升了本地大型语言模型的推理效率。该技术利用小型辅助模型预先生成后续令牌草案,由主模型进行验证。在MacBook Pro M5 Max上测试时,使Gemma 4 26B模型的令牌生成速度加快约40%,整体运行速度提升1.5倍。这项优化进一步巩固了LLaMA.cpp和GGUF格式在本地AI生态中的核心地位,为桌面应用、编程助手和私有设备助手等场景提供了更高效的部署方案。

    引用atomic.chat@atomic_chat_hq

    为 LLaMA.cpp 实现多 Token 预测(MTP)! 本地运行 Gemma4 模型速度提升 1.5 倍。 我们给 LLaMA.cpp 打了补丁。将 Gemma 4 助手模型量化为 GGUF 格式。我们在 MacBook Pro M5Max 上进行了测试。Gemma 26B 配合 MTP 起草 Token 速度提升 40%。基准测试、源代码和模型 👇

    推荐理由:在笔记本上把 Gemma 26B 的生成速度拉高 40% 是个真实的体验提升,atomic.chat 把 MTP 带入 LLaMA.cpp 生态,本地 AI 玩家可以直接拿去用。

  3. IT之家(RSS)70

    苹果首款 AI 可穿戴设备:内置摄像头的 AirPods 已进入 DVT 阶段,预计最快 9 月搭载新 Siri 亮相

    据报道,苹果内置摄像头的AirPods已进入设计验证测试(DVT)阶段,最快有望于今年9月作为其首款AI可穿戴设备发布。该产品左右耳机配备低分辨率摄像头,用于捕捉环境视觉信息,以支持升级版Siri实现视觉问答等功能。其整体外观类似AirPods Pro 3,但耳机柄因容纳摄像头而加长。产品原计划2026年发布,因Siri升级延迟而推迟,此次升级得益于与谷歌Gemini的技术合作。苹果还在探索其导航提醒等用途,并为缓解隐私担忧内置了数据上传指示灯。

    推荐理由:苹果把摄像头塞进 AirPods 做 Siri 的眼睛,这比智能眼镜更务实,但隐私指示灯能有多显眼是个疑问,做 AI 硬件的该看看苹果怎么绕开 Meta 的坑。

  4. Hacker News 热门(buzzing.cc 中文翻译)74

    DeepSeek 4:适用于 Metal 的 Flash 本地推理引擎

    DeepSeek 4 Flash 本地推理引擎正式发布,这是一个专为苹果 Metal 框架优化的开源项目。它允许开发者在配备 Apple Silicon 芯片的 Mac 上高效运行 DeepSeek 4 模型,实现本地离线推理。引擎通过 Metal Performance Shaders 显著提升了计算性能,降低了延迟与内存占用。该项目已在 GitHub 开源,并在 Hacker News 上获得了关注。

    推荐理由:antirez 写的引擎让 DeepSeek 4 在 Mac 本地跑出近乎 Flash 的速度,而且代码极其精简,做本地推理的开发者应该立刻克隆下来跑一下。

  5. Apple Machine Learning Research(RSS)69

    实用学习型图像压缩的关键要素

    学习型编解码器相比传统硬编码方法的显著优势在于能直接针对人类视觉系统进行优化,但目前尚未出现兼具感知质量与实用性的图像编解码方案。本研究通过全面分析关键建模选择,旨在填补这一空白,探索在感知质量与运行效率间的联合优化方案,并在消融实验中引入了若干新技术。研究进一步采用性能感知的神经架构优化方法,为构建真正实用化的学习型图像压缩系统提供了系统性的设计指南与实验基准。

    推荐理由:Apple 这篇调研把感知质量和运行效率同时拉进实做框架,做 codec 或端侧推理的人值得认真读一下。

5月5日周二
  1. Hacker News 热门(buzzing.cc 中文翻译)78

    Google Chrome 被曝未经用户同意悄然安装 4 GB AI 模型

    据隐私倡导网站报道,Google Chrome 浏览器在未经任何提示或用户同意的情况下,于后台自动下载并安装了一个名为“Nano”、体积达 4 GB 的人工智能模型。该行为旨在增强本地AI功能,但完全隐蔽的安装过程占用了用户设备存储空间,且未提供任何选项或通知,引发了对其数据隐私风险及软件更新透明度的广泛担忧。此事件在Hacker News上获得高度关注,突显了公众对科技公司单方面安装行为的普遍不安。

    推荐理由:浏览器里偷偷塞进4GB的AI模型,这件事揭开了一个很多人忽视的趋势,你的设备正在变成AI宿主,而且根本不需要征得同意。

4月30日周四
  1. Tomer Tunguz 博客(VC 分析)57

    AI推理市场的专业化分化

    AI推理市场正快速分化,各模态如文本、图像、视频和音频发展出独立推理技术栈。自ChatGPT发布后,NVIDIA数据中心收入三年内增长17倍,凸显市场爆发。分化根本原因在于工作负载差异:图像视频生成需高计算力,长上下文消耗更多内存,边缘设备则受功耗限制。市场按延迟分为实时、近实时和批量三层;按模态分为文本、图像视频音频;按部署分为云端和边缘。Hugging Face上已有超9万个图像生成模型,整个AI推理市场规模预计约1000亿美元,这种专业化趋势正为各细分领域创造领导者机会。

    推荐理由:Tomer 把推理市场跟数据库市场做类比,碎片化的逻辑讲得很透,做 AI 基础设施的朋友能直接用来梳理自己的赛道,普通人知道这么回事就行。

4月29日周三
  1. Tencent Hy67

    腾讯开源了Hy-MT1.5-1.8B-1.25bit翻译模型,其参数量为18亿,经量化后仅440MB,可在手机上完全离线运行。该模型支持33种语言、5种方言及1056个翻译方向,包括藏语、蒙古语等少数语言。在标准测试中,其性能媲美商业翻译API和2350亿参数的大模型。通过量化至1.25比特,模型内存占用从FP16格式的3.3GB大幅降低,比之前的1.67比特方法体积缩小25%、速度提升约10%,且无精度损失。该模型已在国际机器翻译竞赛中获得30项第一,并部署于腾讯多个产品中。

    推荐理由:440MB的模型能在手机上跑33种语言翻译,还宣称比谷歌翻译强,这个量化技术让离线翻译不再是‘能看不能用’,出差党可以试试看。

  2. Qwen60

    FlashQLA是基于TileLang构建的高性能线性注意力内核,专为个人设备上的智能体AI设计。其核心创新包括门控驱动的自动片内计算并行、硬件友好的代数重构以及TileLang融合的Warp专用内核,通过提升流处理器利用率,在前向传播上实现2-3倍加速,反向传播实现2倍加速。该技术在小模型、长上下文工作负载和张量并行设置中效果显著,虽然在大批次处理时内存I/O开销略高,但在边缘设备和长上下文场景中实际性能更优。反向传播通过16级Warp专用流水线在严格片上内存限制下实现了核心级加速。相关资源已开源。

    推荐理由:2 倍加速的背后是 Warp 特化流水线和自动 Copy 策略,像给手机 GPU 开了条专用跑道,做端侧 Agent 的可以直接拉代码试试。

  3. Qwen66

    FlashQLA是基于TileLang开发的高性能线性注意力内核,专为提升个人设备上智能体AI性能而设计。它实现了2-3倍的前向传播加速和2倍的反向传播加速。其核心技术包括门控驱动的片上自动计算与通信重叠、硬件友好的代数重构,以及TileLang融合的Warp专用内核。该设计通过自动片上通信重叠显著提升了流处理器利用率,在张量并行、小模型和长上下文任务中效果突出。尽管在大批量处理时,其将GDN流程拆分为两个内核的策略会带来额外内存开销,但在边缘设备和长上下文实际场景中性能更优。反向传播部分通过构建16级、严格片上内存限制下的Warp专用流水线,实现了超过2倍的内核级加速。

    推荐理由:Qwen 把线性注意力的推理效率压到了新台阶,2-3 倍加速对想做本地 Agent 的开发者是实打实的,不是论文灌水,是能跑在设备上的代码。

  4. Hugging Face:Blog(RSS)70

    介绍 NVIDIA Nemotron 3 Nano Omni:面向文档、音频和视频智能体的长上下文多模态模型

    NVIDIA 发布了 Nemotron 3 Nano Omni 模型,这是一个专为处理长上下文多模态任务设计的轻量级模型。该模型能够同时理解并处理文档、音频和视频数据,旨在赋能新一代多模态智能体。其核心变化在于将长上下文能力与多模态理解结合到一个小型化模型中,提升了在复杂跨模态场景下的处理效率与应用灵活性。

    推荐理由:NVIDIA 把多模态长上下文塞进 Nano 级别模型,文档、音频、视频 Agent 通吃,做端侧多模态应用的团队值得认真看看这个架构思路。

4月28日周二
  1. 蚂蚁 inclusionAI:HuggingFace 新模型55

    inclusionAI/Ling-2.6-flash

    inclusionAI发布了Ling-2.6-flash模型。该模型是其开源语言模型系列的最新成员,旨在通过开源与开放科学推动人工智能的进步与民主化。此次发布延续了团队降低AI技术使用门槛、促进更广泛社区参与开发的使命。

    推荐理由:蚂蚁 inclusionAI 的 Ling-2.6-flash 上线 HuggingFace,名字带 flash 大概率是轻量推理模型,但官方描述几乎空白,没有 benchmark 也没有用例,建议等社区实测再决定是否投入精力。

4月27日周一
  1. IT之家(RSS)71

    郭明錤:OpenAI 联手高通 & 联发科开发手机芯片,自研手机项目预计 2028 年量产

    天风国际分析师郭明錤称,OpenAI正与联发科、高通合作开发手机芯片,立讯精密为独家系统联合设计和制造合作伙伴,项目预计2028年量产。OpenAI旨在通过自研手机完全掌控软硬件,以提供由AI智能体驱动的全新体验:用户无需操作多个App,可直接通过手机执行任务。为实现此愿景,手机需能持续理解用户上下文,采用端侧小模型与云端大模型协同的架构。此举将推动AI手机换机潮,利好芯片合作伙伴,并有望帮助立讯精密在AI原生硬件时代实现超越。

    推荐理由:郭明錤的供应链料向来准,这次OpenAI做手机的阵容(联发科、高通、立讯)规格拉满,不是PPT项目。2028还远,但对手机行业来说,AI原生硬件的军备竞赛已经开始了。

4月23日周四
  1. The Decoder:AI News(RSS)72

    OpenAI 发布开源模型,可去除文本中的个人数据

    OpenAI 推出开源模型 Privacy Filter,专门用于检测和编辑文本中的个人数据。该模型能自动识别敏感信息并进行处理,以帮助减少隐私泄露风险,适用于需要数据脱敏的场景。

    推荐理由:OpenAI这个开源隐私过滤器能在本地自动脱敏8类个人数据,对需要清洗训练数据的团队是个实用的基建工具,不过它不保证合规,别当法律盾牌用。

  2. Google Developers Blog(RSS)59

    使用 LiteRT 与 NPU 构建现实世界中的设备端人工智能

    LiteRT 是一个生产就绪的框架,旨在帮助移动开发者充分发挥神经处理单元(NPU)的效能,以突破传统 CPU 或 GPU 在性能与电池续航上的瓶颈。该框架通过提供统一的 API 来屏蔽底层硬件复杂性,已成功助力 Google Meet、Epic Games 等行业领先者高效部署复杂的 AI 模型,实现实时视频处理、动画生成与语音识别等高级功能。此外,平台还提供基准测试工具并具备跨平台兼容性,能够支持 AI 应用无缝部署于移动设备、AI PC 及工业物联网硬件等多种终端。

    推荐理由:Google 把 LiteRT 从实验品推到生产级,统一 NPU 调用 API,做端侧 AI 的开发者终于不用逐家适配芯片了。虽然不是新概念,但 Google Meet 和 Epic Games 已经在用,说明不是 PPT。

  3. Hugging Face:Blog(RSS)57

    如何在 Chrome 扩展中使用 Transformers.js

    本文介绍在 Chrome 扩展中集成 Transformers.js 库的具体方法,涵盖从环境配置、模型加载到前后端通信的关键步骤。通过示例代码演示了如何利用该库在扩展中实现本地机器学习推理,同时处理扩展权限限制与安全策略。文中还对比了 Web Worker 与 Service Worker 两种部署方案,并提供了性能优化建议,帮助开发者在浏览器扩展环境中高效运行 Transformer 模型。

    推荐理由:Hugging Face 官方出的 Transformers.js 浏览器插件教程,想在 Chrome 里跑端侧推理的前端开发者可以直接抄,省掉自己踩坑的时间。

4月20日周一
  1. Hacker News 热门(buzzing.cc 中文翻译)76

    Show HN: TRELLIS.2 图像转3D功能已在 Mac Silicon 上运行——无需 Nvidia GPU

    TRELLIS.2 图像转3D功能完成 Mac Silicon 适配,无需 Nvidia GPU 即可在苹果芯片上本地运行。开发者开源的移植版本打破了此前对英伟达显卡的硬件依赖。该项目在 Hacker News 发布当日获得 102 个点赞,标志着端侧 AI 3D 生成技术向跨平台部署迈出重要一步。

    推荐理由:TRELLIS.2的Mac移植让Apple Silicon用户终于能在本地跑图像转3D,5分钟出带PBR纹理的400K顶点网格,步骤简单,实测性能数据详实,做3D原型和资产的值得一试。

4月14日周二
  1. HuggingFace Daily Papers(社区热门论文)70

    现实世界威胁下的移动 GUI 智能体:我们准备好了吗?

    研究人员推出了一款应用内容插桩框架及配套测试套件,包含122个动态任务和3000余个静态场景,用于评估移动 GUI 智能体在含第三方内容(如广告、用户生成内容)的真实环境中的表现。实验显示,现有开源及商业智能体均受显著影响,在动态和静态环境下的平均误导率分别为42.0%和36.1%,表明当前技术在大规模部署前仍需加强安全性验证。

    推荐理由:这篇论文系统揭示了移动 GUI 智能体的安全盲区,第三方恶意内容只需平均 10 个 token 就能让智能体误操作,视觉模态反而更脆弱,安全部署还有很长的路。

4月3日周五