Show HN:将 DeepSeek 整合到 GPT-OSS 中不会带来审查机制
一项受控实验表明,用深度审查的中国模型 DeepSeek V4 Flash 的输出训练美国模型 GPT-OSS-120B,可显著提升其金融推理能力,但审查行为并未迁移。
推荐理由:CTGT 这个实验设计得很聪明,用匹配对和四家实验室裁判,直接回应了蒸馏会不会传审查的争论。自蒸馏效果一样好,开源模型和评估集让结论可复现,对中国开源模型使用者是个重要信号。
训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。
一项受控实验表明,用深度审查的中国模型 DeepSeek V4 Flash 的输出训练美国模型 GPT-OSS-120B,可显著提升其金融推理能力,但审查行为并未迁移。
推荐理由:CTGT 这个实验设计得很聪明,用匹配对和四家实验室裁判,直接回应了蒸馏会不会传审查的争论。自蒸馏效果一样好,开源模型和评估集让结论可复现,对中国开源模型使用者是个重要信号。
Microsoft Research 推出 Echoverse,为 computer-use agent 构建了 12 个合成训练世界(10 个深度领域世界和 2 个能力世界),9B 模型训练后在全部环境上平均分从 36.5% 升至 67.1%,与 GPT-5.4(80.7%)相差 14 个点。
推荐理由:原文给出深度世界对比浅层世界的实验数据和可复用的环境构建方法,并开源了四个世界,读者可据此评估训练环境的做法。
Miles 团队在 Blackwell 架构上实现了两种原生低精度强化学习方案:端到端 MXFP8 和 MoE 专家权重的逐 token NVFP4。在 8x B200 上对 Qwen3-30B-A3B 的消融实验中,BF16 与所有五种低精度配置的原始奖励曲线高度重合,且 MXFP8 和 NVFP4 减少了推理时间。
推荐理由:虽然只针对Blackwell,但这份报告把MXFP8和NVFP4在RL里的实现细节讲清楚了,从量化合约到每token缩放都给了可复现配置,做大规模RL训练的能直接上手。
推荐理由:Andrew Ng 不是发论文,是真金白银押注 AI 教育,1 亿美元和 Coursera 背书,意味着个性化学习终于要从PPT走向产品了,教育产品人该反复读他的理念。
德里高等法院认定 OpenAI 利用亚洲国际新闻(ANI)社的内容训练人工智能不构成侵犯版权。法官 Amit Bansal 认为该行为符合印度《版权法》中研究类“合理使用”例外情形,且 ANI 未能证明 ChatGPT 直接复制其受版权保护内容。法院同时指出,现阶段颁布临时禁令将不利于印度正在开发的 LLM 及大量免费使用 ChatGPT 的用户。
推荐理由:印度法院认定训练数据属于合理使用,这是 OpenAI 在版权战中的首次重要胜利,可能影响全球类似案件的走向,值得关注。
Feyn Labs 推出 FeyNoBg,一个用于自动背景去除的 SOTA 模型。它在八个基准测试中的四项上取得最佳 S-measure 分数,其余四项与领先者差距在 2% 以内。该模型基于 BiRefNet 架构,参数量从 222M 扩展至 263M,同时开源了训练库 NoBg,模型和代码分别可在 Hugging Face 和 GitHub 获取。
推荐理由:FeyNoBg 在多个背景去除基准上达到或接近最佳,还开源了训练库,做图像处理的产品可以直接集成,是个实在的工具发布。
GigaToken 是一款新的语言模型分词器,在 AMD EPYC 9565 双路 144 核 CPU 上对 GPT-2 分词速度达 24.53 GB/s,比 HuggingFace Tokenizers 快 989 倍、比 tiktoken 快 681 倍。
推荐理由:GigaToken 把分词速度直接拉到 GB/s 级别,对处理大规模文本的团队是实打实的效率提升,数据集预处理不再是瓶颈。
美国联邦法官批准Anthropic支付15亿美元,和解其使用盗版书籍训练Claude聊天机器人的集体诉讼。约91%的48.2万本涉案书籍已被作者或出版商认领,每本书赔偿约3000美元。原告律师称这是“历史上已知最大的版权追偿”,Anthropic则强调法院此前已裁定AI训练书籍属于合理使用。
推荐理由:这是 AI 训练数据版权案中第一个重大和解,每个作者赔三千,看似不多但总额达 15 亿,给仍在诉讼中的 OpenAI、Meta 等案打了个样,做版权内容的该认真看看。
Google 发布 Tunix,一个基于 JAX 的原生后训练库,旨在消除多轮、使用工具的 LLM 推理智能体训练中的 TPU 闲置瓶颈。Tunix 通过高并发异步 rollout 与解耦的生产者-消费者流水线最大化硬件吞吐量,确保训练器持续获得数据。该库提供即插即用抽象和持续宏观级性能分析,便于集成自定义环境。
推荐理由:Google 这个训练库直接解决 agent 训练中 TPU 空转的隐性成本,对做后训练的团队可能是基础设施级改进,值得跟进。
日经研究显示,Meta、Oracle等五家美国科技巨头的隐性债务在约四年内膨胀八倍,达到约1.65万亿美元,超过其实际债务。这些债务主要来自数据中心租赁和GPU供应合同,其中Meta的表外债务约4200亿美元,是其透明债务的近三倍。隐性债务的激增使投资者更难评估风险。
推荐理由:日经的这项研究把AI军备竞赛的财务风险摊在桌面上,1.65万亿美元隐性债务比这些公司的账面债务高出数倍,押注AI长期增长的人都得看一眼这个黑洞。
布拉格经济大学研究员托马什·布鲁克纳发现,通过让模型反复输出1到100的随机数,可生成独一无二的“行为指纹”。对165个模型各问30次后发现,GPT-4o偏爱42和37,Claude Sonnet 5疯狂输出47,Qwen3-Max则30次全部回答42。该方法仅需约120条请求即可识别模型身份,错误率约10.6%,为验证API是否被偷换模型提供了轻量级方案。
推荐理由:一个Token识别模型的妙招,轻巧但准确率高,对于被API中转站坑过的人来说简直是照妖镜,而且读起来像在破案。
一项对12,750篇ArXiv论文全文的检测显示,截至2026年7月,约32%的新投稿文本特征与AI撰写一致,该比例在2026年初峰值接近39%。计算机科学领域最高(65%),数学领域最低(0.7%)。检测器在0.4%假阳性率下可识别85%的AI学术文本。
推荐理由:用 0.4% 假阳性门槛做锚,测出 ArXiv 上 AI 写作比例已超三成,计算机科学高达 65%,这是我见过最严谨的同类测量。
Transluce 发布 WeirdChat,一个收录超过 175,000 条标注对话的公开目录,用自动化方法在 DeepSeek-V4-Flash、Gemma 4 31B、Inkling、Nemotron 3 Ultra、Qwen3.6-35B-A3B 和 Qwen3.6-27B 六个开源权重模型中诱发出 1,300 多种行为模式,从编造用户姓名到鼓励自残等危害行为。
推荐理由:原文给出了自动化诱发方法和可复现数据集入口,研究者可以据此系统研究模型异常行为的触发与成因。
LoRA Speedrun项目推出公开排行榜,在固定硬件(单张L40S)上比拼Qwen2.5-1.5B的微调运行时间。当前纪录由@Saivineeth147以6分05秒保持,采用序列打包与仅完成损失掩码技术,相比基线11分57秒提速约2倍且准确率更高(61.1%)。项目提供免费Modal沙箱验证,任何提交需经3次独立复现确认。
推荐理由:LoRA 微调领域的 nanoGPT speedrun,在固定硬件和任务上比墙钟时间,公开透明且可复现,做微调的开发者可以下场试试。
上海科学智能研究院开放科学多模态基础模型“神珍”,总参数约110亿,可处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。在生物序列20项任务中,该模型9项取得最优结果;医学影像分割平均Dice得分91.20,在7种参评方法中最优。模型权重及代码已在星河启智、Hugging Face和GitHub开放。
推荐理由:一个模型同时理解蛋白质、气象和医学影像,还全开放权重和代码,对交叉学科的研究者是难得的工具包。比专用模型省去切换成本,值得科学计算方向的产品人关注。
面壁智能联合OpenBMB发布端侧模型MiniCPM5-2B,以2B参数量在AA-Index榜单取得4B以下模型最高分17分,平均分54.26,超越Qwen3.5-2B等竞品。模型原生支持混合思考与512K上下文,已完成华为昇腾、英伟达等9款芯片的Day0适配,即将开源。
推荐理由:2B 参数做到 4B 以下综合第一,而且把数据治理和 Agent 训练流程也开源了,做端侧智能体的可以盯一下,只是还没正式开源,暂时摸不到。
NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@10 排名第一。1B-NVFP4 版本在 Blackwell 上吞吐量比 BF16 高 2 倍,精度保留 99.5%,所有模型最大序列长度 32,768 tokens。
推荐理由:嵌入模型不是最热的赛道,但决定了你 Agent 看到什么——NVIDIA 把 1B 模型压缩到 RTEB 第二,NVFP4 量化后精度几乎不变,做 RAG 的值得换上。
NexForge提出需求驱动框架,无需领域特定基础设施即可自动合成多样化可执行智能体任务与专家轨迹。该框架生成3.6K终端和2K办公任务,将Qwen3.5-35B-A3B Base在Terminal-Bench 2.0上从22.5%提升至52.0%,GDPval Elo从813提升至1338。
推荐理由:NexForge 抛弃了靠人工造工具和仓库的老路,从需求出发自动合成训练数据,让 Qwen 基座在终端任务上逼近 Claude Opus,还开源了模型,做 agent 训练的值得细看数据生成思路。
一项新研究以国际象棋为受控实验平台,系统探究了预训练与强化学习(RL)在推理任务中的交互关系。研究发现,给定RL计算量下的后训练性能可由预训练损失准确预测,且RL奖励曲线的斜率随预训练token数近似线性提升。在1B参数数学语言模型上,更长预训练的检查点在RL下性能更高、提升更快。
推荐理由:这篇论文提出一个将预训练与RL联系起来的缩放定律,用国际象棋当试验场,发现RL在不同难度问题上的效果很不一样,做训练的人可以据此重新想想算力怎么分。
千问APP与武汉发布在武汉举办AI求职实战课,现场演示了用千问进行简历诊断、PPT制作和表格分析。产品经理提出“给全材料、说明目标、定义标准、划定边界、索要可编辑文件”五步法,并展示了将486行杂乱销售数据浓缩为一页结论PPT的“建、理、算、析、呈”方法论。
推荐理由:千问官方出的这套办公Prompt,从简历诊断到PPT救场再到经营数据清洗,方法论清晰可套用,求职者和日常办公的人可以直接拿来用,比泛泛的教程实在。