Show HN: Context Gateway - 自动压缩 AI Agent 上下文再送入 LLM
YC 孵化的 Compresr 发布 Context Gateway,在 AI Agent 与 LLM 间自动压缩过长对话历史。后台预计算实现即时压缩,支持 Claude Code、Cursor 等,默认 75% 上下文阈值触发。curl 一键安装,TUI 向导配置。
推荐理由:YC背书的Agent上下文压缩工具,自动优化长对话,支持Claude Code等主流Agent
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
YC 孵化的 Compresr 发布 Context Gateway,在 AI Agent 与 LLM 间自动压缩过长对话历史。后台预计算实现即时压缩,支持 Claude Code、Cursor 等,默认 75% 上下文阈值触发。curl 一键安装,TUI 向导配置。
推荐理由:YC背书的Agent上下文压缩工具,自动优化长对话,支持Claude Code等主流Agent
Hugging Face 发布了 LeRobot v0.5.0 版本。该版本在数据集、模型、任务和社区四个维度上进行了全面扩展。具体包括:引入了新的现实世界和模拟数据集,推出了支持多任务学习的模型,并扩展了任务范围至移动操作和双臂协调。社区方面,提供了更易用的库、演示应用和教学资源。此次更新的核心目标是降低机器人技术的应用门槛,推动其民主化发展。
推荐理由:开源机器人AI框架大版本更新,降低具身智能研发门槛,值得关注落地进展
推荐理由:顶级AI科学家提出Agent科研新范式,从模拟个人转向构建分布式智能协作网络
Sarvam AI 以 Apache 2.0 协议开源 Sarvam 30B 和 Sarvam 105B 两款从零训练的推理模型,采用 MoE 架构,训练全部在 IndiaAI mission 提供的算力上于印度完成。
推荐理由:原文给出两款从零训练的开源推理模型的架构、训练流程和基准数据,并说明针对印度语言的优化与部署效率,可据此评估其与同类模型的差异。
FireRedTeam 发布 FireRed-OCR-2B 权重,基于 Qwen3-VL-2B-Instruct,在 OmniDocBench v1.5 上取得 92.94 的总成绩,高于 DeepSeek-OCR 2 的 91.09、PaddleOCR-VL 的 92.86 等模型。
推荐理由:原文给出了 OmniDocBench v1.5 具体分数、对比模型和三阶段训练方法,读者可以据此判断这个 2B 文档解析模型的实际位置。
📢当前的世界模型并没有真正在建模世界;它们建模的是某一个智能体对世界的视角。部分观测 ≠ 世界状态。 未来的世界模型将独立于任何单个智能体的视角。你将能够在任意时间点“放入”任意数量的智能体,而一个持久的世界状态将随着它们的交互而演化。想象一个神经 MMORPG 服务器。🧵[1/10]
推荐理由:从单视角到共享全局状态,开源多智能体世界模型或改变AI训练范式
为提升超长上下文下的计算效率,Ling 2.5架构将Ling 2.0的GQA改造为1:7的Lightning Attention与MLA混合线性注意力。此举旨在利用Lightning Attention提升长序列吞吐,并通过MLA极致压缩KV Cache。为确保改造后性能无损,团队设计了精细的平滑迁移训练策略,包括权重转换、QK Norm融合与Partial RoPE改造等多阶段加训。Scaling Law实验确定了1:7为最优混合比例,最终使万亿参数模型实现了更低的计算成本与更高的长文本推理效率。
推荐理由:为大模型长上下文优化提供可落地的工程实践参考。
推荐理由:42M小模型实现人形机器人全身控制,零样本迁移真实硬件且完全开源,开发者可复现
Liquid AI 发布 LFM2 系列最大模型 LFM2-24B-A2B 的早期检查点,为 MoE 架构,24B 总参数、每 token 约 2.3B 激活,可放进 32GB 内存部署于云端和边缘设备。
推荐理由:官方给出架构配方和与 Qwen3、gpt-oss 的吞吐对比,读者可以据此评估这款 24B MoE 在笔记本和边缘部署上的实际可行性。
GGML 和 llama.cpp 团队正式加入 Hugging Face,以支持本地 AI 社区的长期扩展。创始人 Georgi Gerganov 及团队将全职维护 llama.cpp,保持 100% 技术自主权和社区领导力,项目继续 100% 开源和社区驱动。Hugging Face 提供长期可持续资源,助力项目增长。技术上将优化 transformers 库与 llama.cpp 的无缝集成,实现近乎“一键式”的模型部署,并改进基于 GGML 的软件打包和用户体验。长期愿景是构建高效本地推理堆栈,推动开源超级智能的普及。
推荐理由:本地推理核心引擎获得长期资源保障,端侧 AI 生态稳定性大幅提升
开源模型与闭源巨头(如 GPT、Claude)之间的能力差距持续存在,形成永无止境的追赶态势。文章探讨了知识蒸馏技术对缩小差距的作用,分析了开源与闭源模型在创新时间尺度上的差异,以及开源模型如何通过专业化模型在特定领域寻找获胜路径。同时指出当前开源生态在基础研究和资源投入上的缺失环节,并评估了这种追赶模式的可持续性。
推荐理由:开源与闭源鸿沟难越,但蒸馏与专业化或是破局关键
FireRedTeam 发布开源工业级一体化语音识别系统 FireRedASR2S,集成 FireRedASR2(支持中文普通话、20+ 方言口音、英文、中英混说及歌声转写)、FireRedVAD、FireRedLID 和 FireRedPunc 四个模块,均开源权重与推理代码。
推荐理由:官方开源的一体化语音识别系统,给出与 Doubao-ASR、Silero-VAD 等的对比数字和完整推理代码,便于直接部署验证。
Meta与Hugging Face联合推出开源评估框架OpenEnv,旨在标准化智能体与真实系统的交互。Turing公司贡献了生产级“Calendar Gym”环境,用于在权限控制、时间推理等现实约束下研究工具使用智能体。该框架采用类似Gymnasium的API,通过标准接口连接真实工具,将评估重点从受控演示转向真实世界可靠性。日历系统因涉及多用户、多步骤工作流等复杂性,成为评估智能体实际能力的强大测试平台。
推荐理由:提供生产级基准测试,帮助开发者评估和改进 AI 代理在复杂环境中的表现。
inclusionAI 开源了 Humming,这是一个专为量化推理设计的高性能、轻量级即时编译 GEMM 内核库。它支持在 FP16、BF16、FP8 等多种激活数据类型下进行 8 比特以下任意权重类型的推理,兼容多种量化策略与缩放类型,并同时支持稠密 GEMM 和混合专家 GEMM 运算。该库兼容 SM75+ 及以上的所有 NVIDIA GPU,在多种计算场景下能提供业界领先的吞吐量和效率。其依赖极简,仅需 PyTorch 和 NVCC,软件包大小仅约 100 KB,便于超轻量化部署。
推荐理由:蚂蚁 inclusionAI 开源了一个 100KB 级的量化 GEMM 库,支持从 INT1 到 FP8 全家桶,SM75+ 全覆盖,做推理部署的工程师值得花半小时跑一下 benchmark,看看能不能替换掉现有的 Marlin 方案。
inclusionAI推出新一代旗舰即时模型Ling-2.5-1T,其总参数量达1T,活跃参数为63B,预训练语料扩展至29T tokens。该模型采用混合线性注意力架构,支持1M tokens上下文长度,并通过结合“正确性”与“过程冗余”的复合奖励机制,在相近的token效率下,其推理能力显著超越前代,接近前沿思维模型水平。经双向RL反馈和智能体验证等对齐策略优化,模型在创意写作和指令遵循任务上表现提升。它已兼容主流智能体平台,并在通用工具调用基准BFCL-V4上取得领先的开源性能。
推荐理由:蚂蚁把 1T 参数的即时模型开源了,63B 活跃参数加 1M 上下文,主打效率而非堆算力,对国内做开源推理模型的团队来说是个值得对标的基线。
inclusionAI发布了全球首个基于混合线性注意力架构的开源万亿参数思维模型Ring-2.5-1T。该模型通过高效的1:7 MLA与闪电线性注意力提升了推理速度与探索能力,并借助扩展的强化学习训练增强了深度思考和长程任务执行能力。其在IMO 2025和CMO 2025数学竞赛中均达到了金牌级别的性能。模型支持128K上下文长度,并可通过YaRN技术扩展至256K,现已于Hugging Face和ModelScope平台开源。部署方面,已支持SGLang,并提供了多GPU节点的服务器启动示例。
推荐理由:蚂蚁把万亿参数的开源 thinking model 放出来了,混合线性注意力架构是真新路线而非换皮,IMO/CMO 金牌级数学推理说明这不是纯堆参数。做开源大模型部署的团队值得认真看看它的架构选择。
小红书智能创作团队开源 FireRed-Image-Edit 图像编辑模型,权重采用 Apache 2.0 协议,并在 ImgEdit、GEdit 和自建 REDEdit-Bench 上取得开源模型中的最高分,如 ImgEdit_O 4.56。
推荐理由:小红书团队开源图像编辑模型,README 给出完整基准对比表、训练与部署方案,读者可自行核对开源 SOTA 的成色。
Prime Intellect 发布 Lab 平台,将 Environments Hub 与 Hosted Training、Hosted Evaluations 整合为覆盖大规模智能体 RL、推理与评估的后训练全栈平台,即日起向所有人开放。
推荐理由:原文交代了平台构成、已开放状态和训练配置方式,读者可以判断它能否替代自建 GPU 集群做智能体后训练。
一款让 AI agents 担任市长的城市模拟器,支持通过 REST API 或 MCP 服务器进行程序化城市建造与管理。
推荐理由:AI Agent 通过 MCP 协议玩模拟城市,有趣的 Agent 应用实践案例
Transformers.js 发布第四个主要版本 v4,该版本现已通过 NPM 包管理器提供。这一更新延续了项目通过开源与开放科学推动人工智能技术进步与普及的使命,使开发者能够更便捷地获取并在项目中集成这一机器学习库。
推荐理由:浏览器和 Node.js 直接跑 HF 模型的大版本升级,前端开发者可零门槛接入 AI