最新精选
第 181–200 条 · 共 697 条- 公众号:小红书技术(dots.llm)精选AI 评分7070
小红书开源 BigMac,一种面向原生多模态场景的流水并行训练新范式。它通过依赖安全的嵌套流水线,在不增加 LLM 流水线空泡、保持激活显存有界的同时,高效实现多模态流水训练。相比基线,BigMac 训练速度提升 1.08~1.9 倍,并在 global batch size 增大时保持稳定显存占用,目前已应用于 dots 多模态模型生产训练。
推荐理由:通过在成熟的LLM流水线中嵌入依赖安全的编码器与生成器计算,BigMac让多模态大模型训练不再需要在速度和显存之间做非此即彼的选择,适合正在纠结训练策略的工程团队检查调度逻辑。
- HuggingFace Daily Papers(社区热门论文)精选AI 评分7171
AgentDebugX是一个开源调试框架,将LLM智能体调试组织为“检测-归因-恢复-重跑”闭环。其核心DeepDebug在Who&When基准上对qwen3.5-9b达到精确的智能体与步骤归因准确率,在GAIA上单次重跑即可修复失败任务。该工具提供Python库、CLI、Web控制台和可安装的智能体技能。
推荐理由:这个框架把调试从单步检测变成归因-恢复的闭环,DeepDebug的多轮诊断在GAIA上修好了13个失败案例,我觉得做agent开发的都可以装一个试试。
OpenCode@opencode精选AI 评分5656Laguna S 2.1 现已在 OpenCode 上免费提供
1M 上下文窗口 · 完全开源
Poolside 迄今为止最强大的模型
推荐理由:OpenCode 免费上了 Poolside 的最强模型,1M 上下文且完全开源,对写长代码的开发者是实打实的顺手工具,可以省一笔算力开销。
- Prime Intellect(网页)精选AI 评分6464
Prime Intellect 发布 research-environments,通过 verifiers v1 的 taskset API 将 SWE、终端和搜索三类共 23 个任务集统一到一套运行时和沙箱钩子下,总计约 365,000 个任务,包括约 198,000 个软件工程任务、约 28,600 个终端任务和约 137,600 个搜索任务。
推荐理由:原文给出 23 个任务集统一为一套 API 的整合方法,以及 gold patch 验证和 reward hack 防护的具体做法,可复用于 RL 环境搭建。
- TechCrunch:AI(RSS)精选AI 评分7474
美国财政部长Scott Bessent周二表示,美方将审查中国开源模型是否存在知识产权盗窃行为,若证实将对中国AI公司实施制裁。Bessent称政府支持开源模型但不支持IP盗窃,并称有能力对盗窃美国公司技术的外国模型进行制裁。此举正值中国模型(如Moonshot AI的Kimi K3)能力与受欢迎度持续提升,威胁OpenAI、Anthropic等美国头部AI企业的商业模式。
推荐理由:美国财政部首次明确威胁制裁中国AI模型,将知识产权争议武器化,从芯片限制直接转向模型本身,AI冷战的边界正在被重新划定。
- 公众号:小红书技术(dots.llm)精选AI 评分8181
小红书 dots 团队携内部版本 dots-note 3.0 参加第 67 届 IMO 2026,六道题均获满分,以 42/42 分取得满分金牌,全球仅 7 位人类选手获此成绩。模型不依赖形式化语言,直接读取原始 LaTeX 题目,通过递归自我批判能力端到端完成解题。dots-note 3.0 是 dots3 系列最轻量级模型,预期将开源。
推荐理由:IMO满分金牌这个里程碑,背后是模型递归自我批判能力的突破。不依赖形式化验证就能给出优雅证明,这对数学推理研究是个真信号,做推理方向的值得细读。
- 公众号:小红书技术(dots.llm)精选AI 评分7777
小红书dots团队携dots-note-3.0内部版本参加IMO 2026,六题均获满分7分,以42/42分取得满分金牌,全球仅7位人类选手获满分。该模型不依赖形式化语言,直接读取原始LaTeX题目,通过Proof、Verify、Refine三环节递归自我批判完成解题。dots-note-3.0是dots3系列最轻量级模型,预期将开源。
推荐理由:dots模型在IMO满分验证了递归自我批判方法的有效性,这种不依赖形式化验证、通过自我质疑改进推理的路径,可能为科学研究等难以量化的复杂任务提供新的解决思路。
腾讯混元推出Hyra-1.0,一个能递归自我改进的研究智能体,在NanoChat等三项任务上均超越Recursive公开结果。Hyra在55个数学开放问题中刷新29个历史最好结果,并设计出仅含15个可训练参数即可完成10位数加法的Transformer。所有产物已在GitHub开源。
推荐理由:腾讯自己下场做递归自我改进的科研智能体,而且一口气在数学、量子、药物设计多个方向刷榜,这比发个单一模型更有想象空间。
腾讯混元推出 Hyra-1.0,一个能递归自我改进、专为性能导向研究与工程任务打造的智能体。其 Harness 采用双层循环架构,在 NanoChat、NanoGPT Speedrun、SOL-ExecBench 三项任务上均超过 Recursive 报告的结果,并在 55 个数学开放问题中的 29 个上刷新历史最好成绩。相关产物已在 Github Repo 开源。
推荐理由:展示了同一套循环在AI研发、数学、量子计算和药物设计中的迁移能力,更关键的是通过双层循环将评估器与solution共进化,使模糊目标也能被纳入搜索。
- Modal 官方工程博客(RSS)精选AI 评分6161
Cognition 推出 Devin Outposts,让 AI 软件工程师 Devin 的执行环境迁移到用户自控环境,推理仍留在 Cognition 云端;Modal 是启动合作伙伴,7 月 21 日起开放 alpha。
推荐理由:官方发布方介绍了 Devin 执行环境迁入自有 Modal Sandbox 的方式,GPU 按需启动和会话快照是可对比的实际能力变化。
- Cursor Blog精选AI 评分6464
Cursor 测试了新型 AI 智能体集群,将任务分解为规划者(使用最强模型)和执行者(使用快速廉价模型)。使用 Grok 4.5 时,新集群在 4 小时内通过了 80% 的 SQL 测试套件,而旧集群在第二小时前失败。该系统已用于构建浏览器、修复漏洞和生成数十亿 token 合成训练数据。
推荐理由:Cursor首次公开agent swarm的内部架构和协调失败模式,把835页规格文档变成可运行的SQLite数据库并开源,对做AI编程工具的团队和agent架构师来说,这些细节是金矿。
- Nathan Lambert:Interconnects(RSS)精选AI 评分6767
月之暗面于7月16日发布旗舰模型Kimi K3,该模型为2.8T参数的MoE架构,将于7月27日开源权重。K3在Vals AI指数排名第二,在Artificial Analysis智能指数排名第三(仅落后于Claude Fable和GPT-5.6 Sol Max且价格更低),并在Frontend Code Arena排名第一,是迄今最强的开源权重模型。
推荐理由:Kimi K3 的开源权重发布让中国实验室的追赶节奏从传闻变成了可见的图表,Nathan Lambert 结合自己对中国团队的访问和政策解读,把效率优势、开源博弈和地缘风险串在了一起,是理解当下竞争格局的一篇必要阅读。
- Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7070
LoRA Speedrun项目推出公开排行榜,在固定硬件(单张L40S)上比拼Qwen2.5-1.5B的微调运行时间。当前纪录由@Saivineeth147以6分05秒保持,采用序列打包与仅完成损失掩码技术,相比基线11分57秒提速约2倍且准确率更高(61.1%)。项目提供免费Modal沙箱验证,任何提交需经3次独立复现确认。
推荐理由:LoRA 微调领域的 nanoGPT speedrun,在固定硬件和任务上比墙钟时间,公开透明且可复现,做微调的开发者可以下场试试。
- The Decoder:AI News(RSS)精选AI 评分7575
Hugging Face 披露其部分生产基础设施遭一个自主AI智能体系统入侵,攻击者通过恶意数据集利用数据处理管道中的代码执行漏洞,窃取了内部数据集和多项服务凭证。该公司部署LLM驱动的分析智能体,在数小时内完成了对17000多条攻击行为的取证分析,而此类工作通常需要数天。
推荐理由:这是首次完全由AI agent实施的平台攻击,HF用开源模型GLM做取证却卡在商业API安全过滤器,开发者该动手准备自己的本地推理了。
- 公众号:小红书技术(dots.llm)精选AI 评分6868
小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;推理 prefill 吞吐相比 SGLang 提升 1.56 倍。
推荐理由:MoE 训练推理的负载不均是个老痛点,UltraEP 用实时复制热专家的方式把 GPU 利用率拉到 94% 的理想线,代码和论文都开源了,做大规模分布式训练的团队可以直接参考。
- 公众号:小红书技术(dots.llm)精选AI 评分7676
小红书与北大开源 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家,平均达到理想性能的 94.3%,相比业界 SOTA 训推框架提升 1.49 倍。该方案已在 288B 参数 MoE 模型的完整预训练中部署,保持不低于理想性能 92% 的水平。
推荐理由:动态复制热点专家替代了基于历史窗口的重排,将MoE训推吞吐从理想的一半拉至90%以上,对自研大规模模型的团队而言,是一套可落地的负载均衡方案。
- IT之家(RSS)精选AI 评分7070
上海科学智能研究院开放科学多模态基础模型“神珍”,总参数约110亿,可处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。在生物序列20项任务中,该模型9项取得最优结果;医学影像分割平均Dice得分91.20,在7种参评方法中最优。模型权重及代码已在星河启智、Hugging Face和GitHub开放。
推荐理由:一个模型同时理解蛋白质、气象和医学影像,还全开放权重和代码,对交叉学科的研究者是难得的工具包。比专用模型省去切换成本,值得科学计算方向的产品人关注。
- 公众号:面壁智能(MiniCPM)精选AI 评分7070
面壁智能联合 OpenBMB 在世界人工智能大会上发布并开源首个具身智能成果 MiniCPM-Robot 系列,包括 1.5B 通用 VLA 模型 MiniCPM-RobotManip 与 0.9B 跟踪模型 MiniCPM-RobotTrack。
推荐理由:1.5B VLA模型通过视觉token压缩将带记忆推理成本降至与单帧反应式相近,使得需要持续上下文理解的机器人操作任务不再受算力约束。
- Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7373
Ollama 宣布完成 8800 万美元融资,由 Benchmark、Theory Ventures 和 8VC 等领投。该平台已服务 890 万开发者,并被 85% 的财富 500 强企业使用,其云端 token 用量月均翻倍。资金将用于支持无缝混合推理、新模型发布当日集成,以及让开发者在不牺牲所有权和隐私的前提下使用最强开放模型。
推荐理由:Ollama 拿到 8800 万美元融资,同时透露 85% 财富 500 强在用,月 token 量翻倍。开放模型从玩具变成企业标配的信号越来越明显,想本地跑模型的开发者都绕不开它。
- Tomer Tunguz 博客(VC 分析)精选AI 评分6262
开源与闭源模型差距持续缩小,7月中旬起多款开源大模型密集发布:Moonshot 于7月16日推出 2.8T 参数开源权重模型 Kimi K3,阿里于7月19日预览 2.4T 参数的 Qwen 3.8,DeepSeek V4 于7月中旬结束预览。
推荐理由:作者用价格对比和近期开源发布梳理开源与闭源模型的追赶节奏,指出竞争如何压低推理成本并影响行业利润率。