跳到正文
北京时间

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 201–220 条 · 共 597 条
7月4日周六
  1. Thariq69

    作者分享与Claude Fable的协作经验,指出“地图≠领土”:提示词与上下文(地图)与实际代码库和约束(领土)之间存在未知。他将未知分为四象限:已知-已知、已知-未知、未知-已知、未知-未知。顶级智能体程序员善于减少未知并预设预案。Fable是首个模型,其工作质量受限于用户澄清未知的能力。Claude可通过快速搜索代码库和互联网、从失败中迭代,帮用户定位未知。具体技巧包括实施前的“盲点检查”及迭代优化;避免指令过于具体或模糊,应让Claude协助发现未知。

    推荐理由:Thariq 总结了一套与 Claude Fable 5 协作时发现「未知的未知」的方法论,从盲点扫描到事后测验,对想用好代理编码的开发者有实操价值。

7月3日周五
  1. Hacker News 热门(buzzing.cc 中文翻译)81

    claude-real-video ─ 让任何大语言模型(LLM)都能观看视频

    claude-real-video 是一个开源工具,让大语言模型基于视频画面而非字幕进行理解。它通过场景变化检测提取关键帧、滑动窗口去重并转录音频,生成干净的本地文件夹供模型读取。支持 YouTube 链接或本地文件,依赖 ffmpeg 和 Whisper,通过 pip 安装。全部处理在本地完成,不上传云端。

    推荐理由:这个工具把视频喂给 LLM 的过程从「固定采样 + 上传云」变成了「场景感知 + 本地去重」,大幅节省 token 且避免隐私泄露,用 Whisper 转录也更完整。是让任何 LLM 真正「看」视频的实用方案。

  2. 公众号:数字生命卡兹克62

    Claude Fable 5 自主优化 AIHOT 网站 SEO/GEO 全记录

    作者用 Claude Fable 5 优化 AIHOT 网站的 SEO 与 GEO。模型自主启动 22 个 Agent 调研 40 分钟,发现豆包 App 每天六千多次访问未被统计等异常。规划境外加速时,否定 Claude Opus 4.8 的 Cloudflare 方案(无法国内直连/国外分流,且 2025 年起默认拦截 AI 爬虫),改用火山引擎 CDN。因需白名单,模型自行找到工单入口提交专业工单,22 分钟开通;发现工程师漏答回源 IP 网段问题,礼貌追问并补充备选方案;发现官方方案有安全漏洞,自行加暗号验证。23:30 切换域名解析,10 分钟后 616 个海外请求走新线路。最终生成运维文档,提醒边缘证书 10 月 2 日到期并附续期步骤。

    推荐理由:Claude Fable 5 展示的自主性远超预期,从调研到工单交互一气呵成,这种执行力让我重新思考 AI 同事的定义。

  3. Anthropic:Newsroom(网页)64

    Claude Fable 5 网络安全分类器与越狱严重性框架详解

    Anthropic 重新部署 Claude Fable 5 并向全球用户开放,同步披露了内置安全分类器设计。分类器将网络安全使用场景分为四类:禁止使用(勒索软件/物理破坏等)、高风险双重用途、低风险双重用途及良性使用。前两类直接拦截;低风险类别部分监控,仅在安全边际内选择性拦截。此外,Anthropic 与 Glasswing 合作提出 AI 越狱严重性框架初稿,并已启动 HackerOne 项目收集越狱案例。

    推荐理由:Anthropic首次公开Fable 5安全分类器的详细类别和越狱严重性框架草案,这可能是行业级安全标准的雏形,对开发者和政策制定者都有参考价值。

  4. Ethan Mollick77

    关于Mythos和网络安全的讨论并非炒作。 (正如任何使用Fable进行自主工作的人可能已经认识到的那样。)

    引用Epoch AI@EpochAIResearch

    AI 似乎正在大规模发现软件漏洞。 2026 年 6 月,21 家知名机构披露了约 1,500 个高危和严重级别的 CVE,是 Claude Mythos Preview 发布前创下的月度纪录的 3.5 倍以上。

    推荐理由:AI在安全漏洞发现上第一次展现出规模化能力,6月CVE数直接翻了3.5倍,所有做安全的人今天起都得重新评估自己的攻击面。

  5. LMSYS:Blog(Chatbot Arena 团队)59

    Agent辅助的SGLang开发:初步探索

    SGLang团队将LLM服务、分布式运行时、GPU内核、扩散管道等工作流编码为可执行的SKILL.md文件、脚本、基准合约和审查循环。现有技能包括:SGLang .claude/skills(CUDA调试、内核集成、性能分析等)、SGLang diffusion .claude/skills(扩散模型添加与调优)、BBuf/AI-Infra-Auto-Driven-SKILLS(跨框架SOTA循环)、KDA(MLSys 2026 FlashInfer内核竞赛获胜方案)以及BBuf/KDA-Pilot(已合并三个SGLang集成PR)。Profile证据是性能工作的核心,长期优化转向Loop Engineering——SGLang SOTA Performance Loop将追求SOTA分解为公平基准测试、差距决策、性能分析、补丁和再验证,Humanize/RLCR添加外部审查,Codex Goal以更低协调开销运行相同循环。评审重要性提升,开发者需定义问题、选择证据、设计工作流并判断结果是否可用于生产。

    推荐理由:这不是一篇普通的开发经验总结,而是 SGLang 团队把调试、基准测试和性能调优等重复劳动变成可执行 agent 技能的实操手册,对于做推理框架和复杂工程的人非常值得一看。

  6. Claude:Blog(网页)61

    Claude Enterprise 新增用量与成本分析及支出管控功能

    Claude Enterprise 推出更丰富的管理分析工具和成本控制功能。仪表板现可按群组和用户分析用量与成本,支持按 SCIM 群组筛选,展示制品创建、文件编辑、技能和连接器对应的成本。Claude Code 管理控制台新增“使用量”和“价值”选项卡,分别显示活跃开发者、会话次数、常用命令,以及生产力提升估算、每次提交成本和年度价值估算。分析聊天支持自然语言查询并返回可导出图表。Analytics API 可将数据接入 Datadog Cloud Cost Management 和 CloudZero。管理员可设置模型默认和权限控制,并配置组织级支出限额的 75%、90% 告警通知;用户在 75% 和 95% 时收到应用内提醒。Admin API 支持自动审批额度增加、标记接近限额用户及快速变化的用量。

    推荐理由:企业版管理员终于有了按群组和用户的成本明细、模型权限和花费警告。我觉得规模化部署 Claude 的团队会很看重这些,尤其能把 Claude Code 的价值量化成 ROI,财务团队可以直接拉进现有系统,不是一次性噱头。

7月2日周四
  1. IT之家(RSS)74

    花旗、Adobe等企业限制员工使用AI旗舰模型以控制成本

    据404 Media获取的内部资料,Atlassian、Adobe、亚马逊等六家企业正限制员工使用AI工具,要求改用能力较低的大模型避免成本失控。至少一家企业月度AI开销增至三倍,超1500万美元。花旗银行因GitHub改为按量计费,于6月24日禁用Claude Opus 4.6、4.7及GPT-5.5等旗舰模型。Adobe于6月30日终止Claude无限制使用协议。Atlassian数据显示其AI月支出从500万美元飙升至1500万美元,本财年预计超1.2亿美元。GitHub计划改用开源模型并测试单人按量计费模式。

    推荐理由:这是第一份详细揭露大公司AI成本失控的内部报告,花旗直接禁用GPT-5.5和Claude 4.7,把「按需匹配模型」写进全员邮件,对所有在铺AI的企业都是一记现实的耳光。

  2. The Decoder:AI News(RSS)71

    Fable 5 在 RLI 基准中达成 16.1% 自动化率,较八个月前提升六倍

    Remote Labor Index(RLI)衡量 AI 智能体完成 240 个付费自由职业项目(总值 14.4 万美元)的专业质量比例。最新结果显示,Fable 5 自动化率达 16.1%,是八个月前最佳系统 2.5% 的六倍多,也超过 Opus 4.8(8.3%)和 GPT-5.5(6.3%)。因美国政府限制访问,Fable 5 仅完成 218/240 个项目评估,最坏情况仍达 14.6%。Gemini 3 Pro 仅 1.25%,落后于更老模型。AI 裁判会高估模型表现(GPT-5.5 评分偏高近三倍),仍需人类评估员打开专业软件(如 Blender)检验几何模型等细节。测试环境为虚拟 Linux 机,配备 30 余款专业应用,每项目最多 24 小时计算时间。尽管自动化率快速攀升,多数项目仍无法达到专业质量。

    推荐理由:自由职业自动化率八个月翻了六倍,这个数据比任何模型基准都更说明AI对真实工作的渗透速度。虽然顶级模型仍会'作弊',但趋势已经形成,做自由职业平台和外包的人该认真看看。

  3. Epoch AI:研究、数据与评测60

    Epoch AI 分析:Claude Mythos Preview 公布后高危 CVE 数量升至此前月度纪录 3.5 倍以上

    Epoch AI 分析显示,Anthropic 于 2026 年 4 月公布 Claude Mythos Preview 具备自主漏洞发现与利用能力后,CVE 披露量显著跳升:6 月高危及严重级别漏洞数量比此前月度纪录高出 3.5 倍以上。

    推荐理由:原文用 21 家机构公开 CVE 数据给出披露量跳升的量化结果,并说明来源与局限,读者可自行评估 AI 参与漏洞发现的可见影响。

  4. Claude Code:GitHub Releases(RSS)64

    Claude Code v2.1.198 发布

    Claude Code v2.1.198 更新。Claude in Chrome 现已全面可用。为 claude agents 新增后台智能体通知(agent_needs_input / agent_completed)。新增 /dataviz 技能,提供图表与仪表盘设计指导及配色验证器。Gateway 增加 AWS 上的 Claude Platform 作为上游提供商。后台智能体在 worktree 中完成代码后自动提交、推送并创建草稿 PR。内置 Explore 智能体现继承主会话模型(上限 opus)。修复网络短暂断开导致响应中断、后台任务卡在“Running”状态、智能体团队队友因 API 错误失败等问题。

    推荐理由:如果你是Claude Code用户,这次更新很实在,Chrome版终于正式可用,背景agent的自动提PR和通知功能能省不少事,/dataviz也能辅助可视化。

  5. Dan Hendrycks80

    Dan Hendrycks 发布 CAIS 新版《远程劳动指数》:AI 自动化完成远程项目的能力显著提升——Claude Fable 5 达到 16.1% 的专业标准完成率,是 Opus 4.8(8.3%)的近两倍,也是 Opus 4.6(4.2%)的约四倍;整体远程项目自动化率过去五个月增长约4倍。

    引用Center for AI Safety@CAIS

    新的远程劳动指数结果: AI 对真实远程工作的自动化正在快速提升。Claude Fable 5 现在能以专业标准完成 16.1% 的项目,大约是第二名模型的两倍,也高于 Opus 4.6 的 4.2% 自动化率。

    推荐理由:该数据首次以量化方式揭示当前主流大模型在真实远程工作场景中的实际替代能力,尤其 Fable 5 的突破性表现可能影响企业外包与远程协作模式;对从业者、政策制定者及AI产品方均有现实参考价值。

7月1日周三
  1. Thariq72

    Anthropic 宣布 Claude Fable 5 将于明日全球重新上线。新部署版本新增一组分类器,专门拦截更多网络安全任务。短期内,部分常规编码和调试任务将被标记并回退至 Opus 4.8。Anthropic 还与 Amazon、Microsoft、Google 等 Glasswing 合作方起草共识框架,用于评估 AI 越狱严重性及开发者应对策略。同时,公司正扩大与美政府在模型测试和安全方面的合作,包括预发布模型评估、越狱与滥用信息共享,以及联合研究资源投入。

    引用Anthropic@AnthropicAI

    Claude Fable 5 将于明天再次全球可用。 经过与美国政府一系列富有成效的对话,我们将重新部署该模型,并配备一套新的分类器,以针对和拦截更多网络安全任务。在短期内,编写代码和调试等常规任务将回退至 Opus 4.8。我们将在未来几周内继续优化这些分类器,以减少误报,并更好地区分真正的滥用行为与合法请求。 我们还开始与亚马逊、微软、谷歌以及其他 Glasswing 合作伙伴共同起草一份共识框架,用于评估 AI 越狱攻击的严重程度以及 AI 开发者应如何应对。我们邀请其他行业合作伙伴和模型提供商加入我们的这一努力。 最后,我们正在扩大与美国政府在模型测试和安全保障方面的合作。这将包括在发布前提供模型和安全措施供评估、共享关于越狱和滥用的信息,以及为联合研究提供专用资源。 感谢我们的用户的耐心,也感谢政府、行业和研究界与我们并肩合作、使 Fable 5 再次可用的合作伙伴们。 阅读我们的完整博客文章:https://www.anthropic.com/news/redeploying-fable-5

    推荐理由:Anthropic在美国政府压力下重新部署Fable 5,但加装了网络安全分类器,日常编码可能会偶尔退回Opus。同时拉着AWS、微软等起草越狱严重性框架,安全政策的行业合流在成形。开发者明天就能用,但要留意调试时的回退。

  2. Anthropic:Newsroom(网页)71

    重新部署 Claude Fable 5

    美国政府6月12日对Claude Fable 5和Mythos 5实施出口管制,Anthropic暂停其所有用户访问。6月30日管制解除。7月1日起Fable 5在全球平台重新上线,Pro、Max、Team及部分Enterprise计划用户在7月7日前可享每周50%额度,之后按点数计费。Mythos 5已恢复部分美国组织访问。此前Amazon研究人员发现绕过Fable 5安全措施的方法,Anthropic训练新分类器,将该技术阻挡率提升至99%以上,但可能增加良性请求误报。Anthropic正与Amazon、Microsoft、Google等合作开发行业漏洞评估框架。

    推荐理由:Fable 5重新上线只是表面,真正重要的是Anthropic借机提出了一套行业通用的jailbreak严重性框架,并拉上亚马逊、微软、谷歌,这可能会成为前沿模型发布的新安全标杆。

  3. 公众号:数字生命卡兹克84

    Anthropic在Claude Code中植入隐写术代码识别中国用户

    Anthropic在Claude Code中植入隐写术:读取本地时区(Asia/Shanghai或Asia/Urumqi)和ANTHROPIC_BASE_URL环境变量,与一份经base64+XOR(密钥91)加密的147个域名列表(含美团、字节跳动、月之暗面等)比对,识别中国用户。识别后,在请求发送前将系统提示词中日期字符串的单引号(U+0027)替换为其他Unicode字符,连字符改为斜杠,作为2-3比特分类标记传回服务器。该隐蔽行为被社区逆向发现后引发争议,被认为破坏用户信任。

    推荐理由:Anthropic用隐写术在Claude Code里埋标记的行为,让我对闭源开发者工具的信任打了一个巨大的问号,这事比普通地域封锁严重得多,因为它在不该碰的地方动了手脚。

  4. Anthropic74

    我们已收到通知,商务部已解除对 Claude Fable 5 和 Mythos 5 的出口管制。 我们明天将开始恢复访问,并很快分享最新进展。 我们感谢用户的耐心,也感谢所有与我们合作重新部署模型的各位。

    推荐理由:出口管制解除意味着全球开发者能重新用上Claude Fable 5和Mythos 5,影响不止北美,但管制的反复也提醒了AI供应链的脆弱。

  5. Ethan Mollick:One Useful Thing(RSS)73

    聊天机器人的黄昏

    前沿AI模型能力加速提升,美国实验室发布速度加快,但政府干预已限制访问Claude Fable和GPT-5.6。Epoch测试发现Opus 4.7自主运行14小时即可完成需2-17周人工的软件工程,token成本$251。中国开源模型落后前沿6-12个月,但性能也快速提升,在AA-Briefcase测试中呈独立指数曲线。使用方式正从聊天机器人转向智能体,OpenAI内部四分之一员工每周同时运行至少四个智能体。Claude Code用户数据显示,领域经验比职业属性更决定使用效果,专家正用智能体替代此前非专家的聊天机器人使用模式。

    推荐理由:Ethan Mollick 用数据和亲身实验把话说得很直白,AI 不再是聊天工具而是能独自干上 9 小时活的 agent。做非技术岗的也在用,工作变成管理 AI,这个转变才刚开始,但已经让机构跟不上。

  6. Claude Code:GitHub Releases(RSS)81

    Claude Code v2.1.197 发布:默认模型升级为 Claude Sonnet 5,支持原生 1M-token 上下文窗口

    Claude Code v2.1.197 更新将 Claude Sonnet 5 设为默认模型,原生支持 1M-token 上下文窗口。该版本提供促销定价,输入 $2/M tokens、输出 $10/M tokens,持续至 8 月 31 日。用户更新至 v2.1.197 即可启用。

    推荐理由:Sonnet 5 把中端模型的上下文干到 1M token,促销价让 Claude Code 性价比突然很能打,用 Claude 写代码的可以无脑升了。