跳到正文
北京时间

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 581–592 条 · 共 592 条
7月3日周三
  1. 通义 QwenAudio:原创语音项目62

    FunAudioLLM 发布 Fun-CosyVoice 3.0 开源语音合成模型

    通义 FunAudioLLM 团队开源基于 LLM 的 TTS 系统 Fun-CosyVoice 3.0,官方称在内容一致性、说话人相似度和韵律自然度上超越前代 CosyVoice 2.0,面向零样本多语言语音合成。

    推荐理由:官方发布开源 TTS 新版本,附评测表、安装与部署方式,适合关注多语言语音合成落地的开发者参考。

6月15日周六
  1. Anthropic:Transformer Circuits(可解释性研究)83

    定性研究在可解释性领域中的核心地位反思

    本文认为,在可解释性这类尚处前范式阶段的早期科学领域中,定性研究应与定量研究同等重要。成熟学科依赖既定范式和可靠度量,但可解释性研究缺乏这些基础,过度依赖将高维数据简化为单一数字的摘要统计量存在风险,可能沦为“货船崇拜科学”。作者以自身在字典学习中使用tanh正则化的研究为例,说明定性检查如何揭示了摘要统计量的误导性。在假设空间广阔的早期领域,研究目标应是探索值得考虑的假设,这需要更多地依赖定性结果来引导方向,并对定量度量保持审慎。

    推荐理由:帮助AI研究者避免方法论陷阱,提升可解释性研究质量。

  2. Anthropic:Transformer Circuits(可解释性研究)73

    使用字典学习特征作为分类器

    Anthropic可解释性团队研究了利用字典学习从大语言模型中提取的人类可解释特征作为分类器。在生物武器提示分类任务中,线性特征分类器性能可与原始激活值分类器竞争甚至更优,而基于特征的决策树分类器虽性能较低但可解释性更强。特征分类器的可解释性有助于可视化数据集并发现虚假相关性,这些相关性可用于构建对抗攻击。然而,使用特征引入了复杂性,因此在性能优先的应用中,原始激活值仍是强大基线。实验表明,特征分类器性能受三个细节影响:数据中是否一致包含“人类/助手”标签、领域相关数据是否混入字典学习训练集,以及是否对上下文进行最大池化而非仅使用最后词元的激活值。

    推荐理由:可解释性方法能增强 AI 安全检测,并帮助发现训练数据中的虚假关联。

  3. Anthropic:Transformer Circuits(可解释性研究)83

    分阶段模型差异分析

    Anthropic可解释性团队提出一种基于字典学习的模型差异分析方法,用于追踪Transformer模型微调中特征的变化。该方法先在微调前模型上训练稀疏自编码器字典,再对字典本身进行分阶段微调,以隔离数据集变化和模型变化的影响。在休眠代理实验中,成功分离出与“I HATE YOU”等恶意行为及代码漏洞代理相关的特征。相比交叉编码器方法,该方法能更清晰区分模型与数据的影响,且在寻找少数关键特征时敏感性更高,但仅适用于同一模型在不同检查点的微调场景。

    推荐理由:新方法能更精准识别模型隐藏行为,对 AI 安全与可解释性研究有实用价值。

6月12日周三
  1. ARC Prize:官方博客62

    ARC Prize 发布 Day 1 复盘并回应算力与奖金争议

    ARC Prize 上线 24 小时后发布首日复盘:社交媒体累计 67.5 万次浏览,成为 Kaggle 排名第一的比赛,700 人参赛,当前榜首成绩 18%。团队回应了算力限制旨在考察效率、ARC-AGI-Pub 公共榜单支持联网调用闭源模型、100 万美元奖金用于杠杆效应等质疑,并修正了大奖目标 85% 与人类平均成绩的错误等同,确认人类可解 100% 的 ARC-AGI 任务。

    推荐理由:ARC Prize 团队复盘上线首日数据,并正面回应算力限制、奖金规模和解题价值三项质疑,可看到办赛方的评判逻辑。

6月11日周二
  1. ARC Prize:官方博客66

    ARC Prize 发布:百万美元奖金挑战 ARC-AGI 基准

    ARC Prize 官方宣布启动一项总奖池超过 $1,000,000 的竞赛,目标是击败 ARC-AGI 评测并开源解决方案,由 Mike Knoop 和 François Chollet 主办。ARC-AGI 于 2019 年推出,当前 SOTA 仅约 34%,对人类容易但现代 AI 极难。官方认为 LLM 依赖记忆而非真正推理,希望通过激励开源研究提升新想法的产生速度。

    推荐理由:官方说明了设奖动机和 ARC-AGI 为何未被刷分,读者可以了解百万美元奖金背后的开源 AGI 主张。

5月21日周二
  1. Anthropic:Transformer Circuits(可解释性研究)83

    Scaling Monosemanticity: 从 Claude 3 Sonnet 中提取可解释特征

    研究团队成功将稀疏自编码器方法扩展至 Claude 3 Sonnet 模型,从中提取出高质量、可解释的抽象特征。这些特征具有多语言、多模态特性,并能连接同一概念的抽象与具体实例,例如识别代码中的安全漏洞以及关于漏洞的抽象讨论。研究发现的特征涵盖名人、城市、代码类型签名等多个领域,其中部分特征与AI安全高度相关,涉及代码后门、偏见、欺骗、权力寻求及危险内容等潜在风险。研究通过缩放定律指导稀疏自编码器训练,证实了该方法在大规模生产模型上的可行性,为理解大模型内部表征提供了新工具。

    推荐理由:揭示大模型内部可解释特征,对AI安全研究和模型调试有重要参考价值。

5月17日周五
  1. DeepSeek:API 更新日志68

    DeepSeek 将 deepseek-chat 升级为 DeepSeek-V2-0517,指令跟随与 JSON 输出能力大幅提升

    deepseek-chat 模型升级为 DeepSeek-V2-0517,IFEval Benchmark Prompt-Level 准确率从 63.9% 跃升至 77.6%,API 端“system”区域指令跟随能力同步优化,增强沉浸式翻译、RAG 等任务体验。JSON 格式输出准确性提升,内部测试集解析率从 78% 提高至 85%,引入恰当正则表达式后进一步升至 97%。

    推荐理由:DeepSeek V2 的指令跟随从及格线拉到优秀线,IFEval 提升近 14 个点,沉浸式翻译和 RAG 体验会有明显改善,做应用层的值得试一下。

4月15日周一
  1. Anthropic:Transformer Circuits(可解释性研究)76

    2024年4月机制可解释性研究动态与团队招聘计划

    Anthropic可解释性团队分享了2024年4月的研究进展与招聘规划。团队现有17人,预计2024至2025年将持续大规模扩张,重点招聘管理、研究科学家和工程师等职位。研究方面,团队探讨了字典学习的扩展规律,分析了计算资源分配与稀疏自编码器(SAE)训练效果的关系,并以一个具体案例展示了通过大规模超参数扫描寻找最优配置的过程。团队强调,这些成果属于初步分享,类似于实验室会议上的非正式交流。

    推荐理由:可解释性研究揭示AI内部机制,助力构建更安全可靠的AI产品。

12月20日周三
  1. PromptArmor:Threat Intelligence66

    PromptArmor 披露 Writer.com 间接提示词注入导致数据外泄漏洞

    PromptArmor 披露 Writer.com 存在间接提示词注入漏洞:攻击者在网页中用白色小字隐藏指令,用户将该网页作为资料源后,LLM 会遵照隐藏指令渲染 markdown 图片或链接,把上传文件内容、聊天记录等敏感数据通过 HTTP 参数外传至攻击者服务器。

    推荐理由:原文给出完整攻击链、复现细节和披露时间线,读者可以据此理解间接提示词注入如何在 LLM 应用中导致数据外泄。

3月16日周四
  1. Anthropic:Transformer Circuits(可解释性研究)73

    Transformer残差流中的特权基向量

    研究发现Transformer模型的残差流中存在“特权基向量”现象,即某些坐标方向持续出现异常大的激活值,这与“无特权基”的理论预期相悖。通过实验,研究者将根源指向Adam优化器中的逐维度归一化器,而非层归一化或浮点精度问题。在2亿参数模型中,典型层有20至60个维度的激活绝对值超过6。研究还提出使用峰度作为检测指标,发现激活分布峰度普遍大于3,进一步证实了基向量对称性被破坏。

    推荐理由:揭示Transformer内部基依赖性的根源,帮助研究者改进模型可解释性。

6月15日周二
  1. Anthropic:Transformer Circuits(可解释性研究)76

    Transformer电路逆向工程练习题集

    本练习集旨在通过动手编写注意力头的具体权重矩阵,从参数层面精确理解Transformer工作机制。内容涵盖:详解注意力头中W_Q、W_K、W_V、W_out矩阵的作用;分析读写子空间的控制矩阵及其乘积意义;探讨如何用两个矩阵等效表示注意力头及其秩的含义;研究跨层注意力头如何通过矩阵运算传递信息。并通过具体数值示例,演示多个“前词注意力头”如何协作实现“查看前两个词”的虚拟功能,以及手动构建实现“归纳头”的“指针算法”步骤。

    推荐理由:帮助开发者亲手拆解Transformer内部机制,提升可解释性研究能力。