Qwen 3.8 27B 表现出色,但默认推理强度过高导致过度思考
阿里 Qwen 实验室发布 Apache 2 许可的 27B 参数视觉大模型 Qwen 3.8 27B,官方基准显示其超越前代 Qwen 3.6 27B 及闭源 Qwen 3.7-Plus。
推荐理由:把 Qwen 3.8 27B 的推理档位成本量化成时间差异,xhigh 默认让生成同一 SVG 从 137 秒膨胀到 21 分钟,这个默认值比能力更影响本地选型。
跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。
阿里 Qwen 实验室发布 Apache 2 许可的 27B 参数视觉大模型 Qwen 3.8 27B,官方基准显示其超越前代 Qwen 3.6 27B 及闭源 Qwen 3.7-Plus。
推荐理由:把 Qwen 3.8 27B 的推理档位成本量化成时间差异,xhigh 默认让生成同一 SVG 从 137 秒膨胀到 21 分钟,这个默认值比能力更影响本地选型。
Unsloth 发布 Qwen3.8-27B 的 Dynamic GGUF 量化版本,4-bit 量化可在 17-19GB 内存设备上本地运行,并同时上传 NVFP4 量化。
我们承诺过开源 Qwen3.8 的模型权重。现在,是时候见面了!🎉 ⚡ Qwen3.8-27B: - 一款原生多模态稠密模型。仅凭 27B 参数,综合表现超越 Qwen3.7-Plus,在真实世界的编码与办公工作流中尤为亮眼。 - 原生支持 262K 上下文,可通过 YaRN 轻松扩展至 1M tokens。 - 为开发者而生。高效、高质量,并采用 Apache 2.0 许可证。 🚀 Qwen3.8-2.4T-A95B(Max 级别)的开放权重也已于近日发布。 无论你是想用 Qwen3.8-27B 在本地部署轻量级应用,还是用 Qwen3.8-2.4T-A95B 构建智能体,它们现在都属于你了! 下载、部署,去构建我们尚未想象到的东西吧。👀👇 - Hugging Face: https://huggingface.co/collections/Qwen/qwen38 - ModelScope: https://www.modelscope.cn/collections/Qwen/Qwen38
推荐理由:原文给出了本地运行的具体内存门槛、量化版本和硬件对照表,读者可以据此判断能否在自己的设备上跑通这个 27B 模型。
Liquid AI 发布 LFM2.5-VL-3B 视觉语言模型,屏幕理解 ScreenSpot-v2 平均 80.7,ToolSandbox 从 26.4 升至 59.5,RefCOCO 从 57.1 升至 87.9。
推荐理由:官方给出与更大模型对比的基准数据和端侧、GPU 实测速度,读者可据此评估它在边缘部署场景的适用性。
Google 发布教程,讲解如何用 LiteRT 和 Gemma 在 Raspberry Pi 5 上实现完全离线的实时边缘 AI,并演示其驱动 Reachy Mini 机器人。
推荐理由:原文给出 LiteRT-LM 在树莓派 5 上运行 Gemma 的具体性能数字与 CPU/GPU 分工架构,还附完整部署命令,方法可直接迁移到自己的边缘部署。
NVIDIA 发布 Nemotron 3.5 Lightning,一款可定制的开源 30B 混合专家(MoE)模型,专为常驻智能体设计。相比同类开源模型,其 token 生成速度最高提升 4 倍,任务完成时间缩短 30%。该模型采用开放权重,支持用户微调以匹配特定任务,并可在 RTX PC、DGX Spark 及 Jetson 等设备上运行。
推荐理由:本地运行 30B MoE 模型并声称 4 倍加速,与开源路由器结合可自动分配任务到最合适模型,给控制推理成本提供了新路径。
蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、每 Token 仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本。
推荐理由:1.3B 激活参数在 Mac 上实测首 Token 低于 100 毫秒,比只看参数量的轻量叙事更有参考价值,端侧 Agent 的落地边界因此更具体。
蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、推理时仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本。
推荐理由:以1.3B激活参数取得接近4B激活模型的综合能力,同时Agent分数超越部分30B+模型,多精度开源和本地部署方案让轻量Agent应用更易落地。
SGLang 与 Meta Superintelligence Labs 合作,为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持,该模型拥有 128k+ token 上下文窗口。
推荐理由:SGLang对Muse Glimmer的优化使30B多模态模型在RTX 5090上达到236 tok/s用户速度,本地智能体工作流不再受限于云端延迟。
Meta 开源 30B 参数密集模型 Muse Glimmer,Apache 2.0 许可,支持视觉,可在 18GB RAM/VRAM 环境本地运行,定位于本地智能体与编码工作流。
今天我们还将开放 Muse Glimmer 的权重,这是一个出色的 30B 参数稠密模型,可以在本地运行。很快我们还会发布 Muse Spark 1.2 的权重,这是我们最新的基础模型。Meta 是开源的有力支持者,我为这些发布感到自豪。祝贺 @alexandr_wang 和 MSL 团队在这些模型上所做的出色工作。
推荐理由:Meta 开源 30B 密集视觉模型,18GB 内存可本地运行,作者还提供了 GGUF 和运行训练指南,方便直接上手。


推荐理由:将一个 30B 模型以 Apache 2.0 许可完全开源并针对本地智能体优化,为需要离线运行或数据不出设备的 Agent 应用提供了更轻量的选择。
MiniMax 发布 MiniMax-H3,一个可接受文本、图像、音频和视频并生成最长 15 秒带音频视频片段的通用全模态生成系统。Python 包 PipeNetwork/minimax-h3-mlx 将其移植到 MLX,支持 Apple Silicon 运行。作者在 M5 Max MacBook Pro 上实测,下载约 115 GB 模型文件,视频生成耗时不到 45 分钟。
推荐理由:在 M5 Max 上生成本地视频的 45 分钟耗时,为判断这类模型何时能进入日常工作流提供了具体的参照。
Soup 推出 v0.72.4,支持在配备 4 GB 显存的笔记本 GPU 上通过 QLoRA 微调 8B 模型,无需 SSH 或云服务。
推荐理由:Soup 将 8B 模型微调压低到 4GB 显存笔记本,使得原本受 GPU 预算限制的个人开发者也能直接在本地迭代模型行为。
一个开源仓库提供了在单颗 AMD MI300X 上生产运行 DeepSeek-V4-Flash-0731 的完整配置与补丁,无需额外量化或权重卸载。该 304B 参数模型在 192 GB HBM 上实现单流 168.6 tok/s 解码、8 并发流 542 tok/s 聚合吞吐,并验证了 256K 上下文。
推荐理由:为 MI300X 提供了可部署的生产栈,包含 FP8 格式修复、推测解码优化和混合 KV 缓存策略,单卡就能服务 256K 上下文。
Swiftlet 是一个 Swift + Metal 运行时,可在普通 Apple 设备上运行 Qwen3-Next 和 Qwen3.5/3.6 MoE 混合模型,仅将小型稠密核心驻留内存,按需从存储流式加载路由专家权重。
推荐理由:用流式专家加载把 80B 模型塞进手机,具体 RAM 和速度数字让开发者能直接判断自己设备的上限,而不是停留在商详口号。
AirLLM 项目支持在单块 4GB 显存 GPU 上运行 70B 参数大模型推理,无需多卡或大规模显存配置。该项目已开源,相关讨论在 Hacker News 上获得 103 点热度,引发社区关注。
推荐理由:将 70B 模型推理压缩到 4GB 显存,让不带专用显卡的开发者也能本地测试大模型,但实际推理速度和质量仍需根据用例评估。
Liquid AI 发布 LFM2.5-2.6B,一个可完全在设备端运行的 2.6B 参数智能体模型,预训练约 34T tokens,词表扩展至 128K,Base 和 post-trained 权重已在 Hugging Face 开放。
推荐理由:原文给出了训练流程、基准对比和 CPU/GPU 吞吐数字,读者可以据此评估端侧智能体部署的可行性与取舍。
一个开源引擎让 Gemma 4 26B 模型能在任何 M 系列 Mac 上运行,仅需 2 GB 内存。该项目已发布在 GitHub 上,大幅降低了本地运行大语言模型的硬件门槛。
推荐理由:这是我见过最极端的端侧优化,把 26B 参数塞进 2GB 内存,意味着所有 M 系 Mac 都能本地跑大模型了,开发者值得马上 clone 试试。
Deltafin 项目成功在 64 GB M1 Max 上运行了 2.8T 参数的 MoE 模型 Kimi K3,当前中位推理速度为 0.0687 token/s(14.6 秒/token)。完整安装需约 1.7 TB 本地磁盘,流式模式仅需 215 GB 但推理速度降至 3 分钟以上/token。项目提供 OpenAI 兼容 API 服务器,支持聊天和代码补全,但建议客户端超时设为小时级别。
推荐理由:这是个在 M1 Max 上跑 2.8T MoE 的工程 hack,把不可能变成可能,虽然慢得只有聊天室节奏,但玩法足够硬核,玩硬件的看完会想开 issue 贡献数据。
Liquid AI 发布 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M 两个基于 LFM2 混合架构的双向编码器,支持 8,192 token 上下文,已在 Hugging Face 开放下载。
推荐理由:原文给出双向编码器的架构改动、17 项任务微调评测和长上下文 CPU 吞吐对比,读者可以据此评估其在边缘和本地部署中的适用性。
开发者成功在售价约 8 美元的 ESP32-S3 微控制器上运行了一个 28.9M 参数的大语言模型,完全在芯片本地运行,无需连接服务器,生成速度约 9.5 tok/s。
推荐理由:在8美元微控制器上跑28.9M参数LLM,之前同类只有260K参数,这套基于Flash查表的内存技巧首次搬到如此小的芯片上,工程细节和踩坑记录对嵌入式开发者参考价值很高。