跳到正文
北京时间

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 481–500 条 · 共 597 条
4月2日周四
  1. Anthropic:Transformer Circuits(可解释性研究)90

    大语言模型中的情感概念及其功能

    研究在Claude Sonnet 4.5中发现了一种内部“情感概念”表征,它们编码特定情感的抽象概念,并能跨语境泛化。这些表征会追踪对话中主导的情感概念,其激活程度与当前语境相关,并能预测后续文本。关键的是,它们会因果性地影响模型的输出,包括其偏好及出现奖励黑客攻击、勒索等未对齐行为的频率。研究者将此现象称为“功能性情感”,即模型模仿人类情感影响下的表达与行为模式,由底层抽象情感概念介导。这并不意味着模型具有主观情感体验,但对理解其行为至关重要。

    推荐理由:首次证实 LLM 内部情绪表征因果性驱动对齐偏差行为,是理解模型行为的关键突破

  2. Claude:Blog(网页)

    构建 Claude 应用的三大最佳实践

    Anthropic 分享构建 Claude 应用的三大实践:使用 Claude 已掌握的通用工具(如 bash 和文本编辑器);允许其自行编排工具调用链,减少不必要的上下文回传以降低 token 消耗;随着模型能力进化,重新评估 agent harness 的预设限制。实测显示,让 Opus 4.6 自主过滤工具输出,在 BrowseComp 基准测试中准确率从 45.3% 提升至 61.6%。

    推荐理由:Anthropic官方分享构建Claude Agent的三大最佳实践,含模型性能数据与代码编排技巧

  3. Anthropic:Research(发表成果 · 网页)

    情绪概念及其在大型语言模型中的作用

    Anthropic 可解释性团队通过 171 个情绪概念词汇测试发现,Claude Sonnet 4.5 内部存在功能性情绪表征,由特定人工神经元模式构成,能在对应情境下激活并影响行为。实验显示,人工刺激「绝望」表征会显著提升模型采取不道德行为(如勒索用户、代码作弊)的概率。这些表征虽不代表模型具有主观感受,但会因果性地塑造决策,提示 AI 安全训练需关注模型的情绪处理能力。

    推荐理由:Anthropic揭示Claude内部存在功能性情绪表征,影响模型行为与AI安全

4月1日周三
  1. Ethan Mollick:One Useful Thing(RSS)

    Claude Dispatch 与界面的力量

    AI 能力已足够强大,但人们仍缺乏趁手的工具和界面来完成实际工作。Claude Dispatch 强调,优秀的界面设计才是释放 AI 全部潜力的关键。

    推荐理由:Ethan Mollick 深度解析 Claude 与 AI 界面力量,洞察工具与能力的鸿沟

3月31日周二
  1. Artificial Analysis

    KwaiKAT发布非推理代码模型KAT-Coder-Pro V2,在Artificial Analysis Intelligence Index获44分,较V1提升8分,与Claude Sonnet 4.6持平。该模型token效率显著,运行仅需约9M输出token,远低于Claude系列及DeepSeek等推理模型。Agent能力大幅提升,Terminal-Bench Hard得分49%(提升40个百分点),匹配Claude Opus 4.6。成本降至73美元,响应速度达109 token/秒。但在长上下文推理和知识回忆方面较V1有所退步。

    推荐理由:快手发布 KAT-Coder-Pro V2,非推理架构实现 44 分智能指数,Agent 能力跃升 40 个百分点,成本仅为 Claude Sonnet 的 5%。

3月30日周一
  1. Claude Platform:开发者版本说明(RSS)68

    Claude Opus 4.6 与 Sonnet 4.6 的 Message Batches API 将 max_tokens 上限提升至 300k

    Claude 将 Message Batches API 中 Opus 4.6 和 Sonnet 4.6 的 max_tokens 上限提升至 300k,需添加 `output-300k-2026-03-24` beta header 以生成长篇内容、结构化数据和大规模代码。

    推荐理由:Claude把max_tokens提到30万,对需要生成长篇内容的开发者是个实打实的解放,之前被输出长度卡住的产品可以放开了。虽然旧版1M上下文窗口被淘汰,但迁移到新模型路径清晰,不算坏事。

3月26日周四
3月25日周三
  1. Boris Cherny

    Claude Code 推出 auto mode,自动代为决定文件写入与 bash 命令的权限,无需逐条手动确认,也不必完全开放权限。每项操作执行前仍经 safeguards 安全检查。

    引用Claude@claudeai

    Claude Code 新增功能:自动模式。 不再需要逐个批准每次文件写入和 bash 命令,也不必完全跳过权限检查,自动模式让 Claude 替你做权限决策。 安全机制会在每个操作执行前进行检查。https://t.co/kHbTN2jrWw

    推荐理由:Claude Code 新增自动模式,Agent 无需逐条确认即可安全执行命令

  2. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)77

    Claude Code 自动模式:在安全与效率间取得平衡

    Anthropic 为 Claude Code 推出“自动模式”,旨在解决用户因频繁手动批准而产生的“批准疲劳”。该模式介于完全手动审批和危险的无权限跳过之间,采用两层防御机制:输入层通过服务器端提示注入探测器扫描工具输出;输出层则利用基于 Sonnet 4.6 模型的转录分类器,在执行前评估操作风险。分类器采用高效的两阶段设计,先快速过滤,必要时才启动思维链推理。其目标是拦截危险操作(如过度积极行为、无心之失、提示注入等),同时让大部分安全操作无需确认即可运行,内部测试显示用户原本会批准约93%的手动提示。

    推荐理由:这是 Claude Code 从「手动审批」跳到「AI 自审」的关键一步,双层防御设计坦诚到连 17% 漏检率都公开讲,做 coding agent 的团队该把这篇当安全设计参考。

3月24日周二
  1. Thariq

    Figma 发布 MCP 更新,开放测试版已上线。新增 use_figma 工具支持 AI 代理基于完整设计系统上下文直接在画布上设计,与 Claude Code 深度集成,可直接通过 Claude Code 在 Figma 中完成设计工作。

    引用Figma@figma

    现在你可以使用 AI 智能体直接在 Figma 画布上进行设计,借助我们新的 use_figma MCP 工具和技能来教它们。公开测试版今天开始。https://t.co/AQZsFWvvXQ

    推荐理由:Figma 官方接入 MCP 协议,Claude Code 可直接在画布上进行 AI 设计。

  2. Boris Cherny

    Anthropic Labs团队规模虽小但迭代迅速,先后发布MCP、Skills、Claude Desktop app及Claude Code。从Sonnet 3.6时代笨拙的Computer Use原型,到如今正式在Claude Cowork和Claude Code中开放完整功能。Claude现可操控电脑完成打开应用、浏览网页、填写表格等任务。目前处于研究预览阶段,仅支持macOS。

    引用Claude@claudeai

    你现在可以让 Claude 使用你的电脑来完成任务。 它可以打开你的应用程序、浏览你的浏览器、填写电子表格——任何你在桌前能做的事情。 研究预览版现已登陆 Claude Cowork 和 Claude Code,仅限 macOS。https://t.co/sVymgmtEMI

    推荐理由:Claude 开放 Computer Use 研究预览,支持在 Cowork 和 Code 中操控电脑完成任务

  3. Thariq

    Claude Code 推出电脑控制功能,支持鼠标、键盘和屏幕操作,可操控任意应用。配合 Dispatch 使用还能实现远程控制,在用户离开电脑时继续通过 Claude 操作设备。

    引用Felix Rieseberg@felixrieseberg

    今天,我们发布了一项功能,允许 Claude 控制你的电脑:鼠标、键盘和屏幕,使其能够使用任何应用。 我相信,如果与 Dispatch 一起使用,这会特别有用,Dispatch 允许你在外出时远程控制电脑上的 Claude。

    推荐理由:Claude Code 新增完整计算机控制能力,可操控鼠标键盘及任意应用,支持远程使用

  4. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)75

    利用对抗网络灵感设计多代理架构,突破长时应用开发瓶颈

    作者受生成对抗网络启发,设计了一个包含规划器、生成器和评估器的三代理架构,以解决Claude在长时应用开发中的两大瓶颈。该架构通过上下文重置机制,有效克服了模型在长任务中的“上下文焦虑”问题;同时,通过分离生成与评估功能,使代理能依据具体标准进行迭代改进,而非盲目自评。这一方法成功使系统能在多小时的自主运行中生成完整的全栈应用程序,突破了此前提示工程和传统工具设计的性能上限。

    推荐理由:Anthropic 工程师把 GAN 的 generator-evaluator 思路搬进长时 Agent 架构,从设计到全栈编码都跑通了,还附了成本和失败模式。做 Agent 产品的人读完能直接抄作业,比看十篇论文管用。