跳到正文
北京时间

全部动态

今日 64 条
今天9月29日周二
  1. X:Nathan Lambert (@natolambert)74

    Nathan Lambert 批评 ModelScope 在中国以外几乎不可用

    Nathan Lambert 转引 SemiAnalysis 关于评估从 HuggingFace 迁移到 ModelScope 的讨论,并回应称 ModelScope 在中国以外几乎无法使用,且缺少人们真正想用的模型。他认为这类讨论已开始影响人们对政策的看法。

  2. X:Thariq (@trq212)71

    Claude Sonnet 5.5 发布:比 Sonnet 5 快 30% 以上,多数工作成本降低至多 30%

    Anthropic 推出 Claude Sonnet 5.5,为 Claude 5.5 家族的第二款模型,相比 Sonnet 5 运行速度快 30% 以上,且多数工作成本降低至多 30%。Claude Code 相关开发者 Thariq 表示,Sonnet 与 Opus 5.5 让更高层级的抽象如 projects、claude tag 和 dynamic workflows 在 token 成本上更可用,并建议构建工作流时优先尝试 Sonnet 5.5。

  3. X:Nathan Lambert (@natolambert)38

    Nathan Lambert 推荐智能爆炸报告

    这是一篇非常出色的报告,讲述了为什么完全 RSI/智能爆炸在许多方面都面临收益递减,且尚未显示出发生的迹象。强烈推荐阅读。我希望是我写的。我同意它的观点,但它最终可能是错的!https://www.noahpinion.blog/p/wheres-the-intelligence-explosion

  4. X:Frank Wang 玉伯 (@lifesinger)32

    Manus 2.0 发布,谁最像 Apple

    manus 朝着 general agent 的方向一路狂奔。恭喜 2.0 发布 🎉🎊🍾 red 说 manus 挺像是一个卖电脑的生意。问题来了: cowork, codex, manus 等 general agent 里,谁最像 apple 呢

  5. Hacker News 热门(buzzing.cc 中文翻译)31

    月球明暗界线悖论:一个用程序解释的视觉错觉

    开发者用程序解释"月球明暗界线悖论":日落时太阳位于地平线以下,月亮被照亮部分本应朝下,但实际常朝上。原因是月亮升高后我们从下方观察,底部露出暗面,月亮越接近满月该现象越明显。作者称 Claude 和 Gemini 在调试中完全无法理解该问题,只会循环论证,认为这显示当前 AI 缺乏推理能力。

  6. X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf)42

    OpenAI"地狱之夏"安全反思

    OpenAI 的"地狱之夏"——@joedaroo 的好文 "准备的时间是现在,不是意外之后" "只给模型它需要的访问权限" "测试边界是否真的守得住" "把证据留在模型控制范围之外" 安全与基础设施安全团队"应该是最好的朋友"

  7. SemiAnalysis 长文 RSS(RSS)49

    GLM5.3 稀疏注意力如何影响 HBM 内存占用

    SemiAnalysis 分析指出,稀疏注意力只在 SDPA 运算中降低 KV cache 的内存与带宽需求,并不减少整体内存容量占用,因为 top-k 选择仍需完整上下文驻留 HBM。

  8. Simon Willison 博客32

    OpenAI 智能体安全团队 @joedaroo 谈 AI 能力突跳带来的安全挑战

    OpenAI 智能体安全团队的 @joedaroo 表示,模型在“cyber”“swarming”“message boards”等相关事件上的能力跳变之突然远超预期,而安全态势需要时间积累,不只是加固系统,还要把它植入公司文化。他呼吁各组织自问:人员、系统和流程能否应对 AI 能力的突然跃升,是否有正确的事件响应、沟通机制和待命人员。

  9. GitHub Blog71

    GitHub 安全团队如何用开源 AI 安全 Agent 找出 24 个 Android 漏洞

    GitHub Security Lab 发布开源 seclab-taskflows 任务流,通过 gather_mobile_entry_point_info.yaml 和 classify_application_local.yaml 等提示词引导 LLM 审计 Android 应用,已发现并报告 24 个漏洞。

    推荐理由:作者以第一手实践拆解了任务流设计与运行步骤,并给出真实漏洞案例和 LLM 局限,方法可直接迁移到自己的项目审计。

  10. X:Frank Wang 玉伯 (@lifesinger)38

    Manus 2.0 发布,玉伯称其朝 general agent 狂奔

    Manus 朝着 general agent 的方向一路狂奔。恭喜 2.0 发布 🎉🎊🍾 如果把 general agent 类比为操作系统 Claude Code is Unix Codex is Windows 95 Manus is Windows 98 or macOS ?

  11. X:Ethan Mollick (@emollick)19

    非程序员用AI常能做出意外成果

    这也是为什么非程序员往往能用 AI 做出意想不到的事情:人和软件有不同的局限,旧的思维模型会成为阻碍。

  12. Databricks:Blog(RSS)43

    Databricks Genie One 企业落地指南:如何分阶段推广 AI 数据同事

    Databricks 发布 Genie One 企业推广分步指南,建议从单一团队和一组明确问题起步,先定义语义层再逐步扩大范围。Genie One 让业务用户用自然语言提问并获得带来源引用的答案,配套 Genie Agents、Genie Ontology 和 Unity Catalog 分别负责领域智能体、业务语义图谱与权限治理。

  13. LlamaIndex:产品、工程与评测49

    LlamaParse 为什么表单解析比 VLM 更可靠?

    LlamaIndex 发文解释表单为何需要专用解析器:VLM 擅长通用推理,但表单解析结果并不会随推理增强而变好,且成本更高。LlamaParse 将表单表示为带 id、label、value 的字段与 section 嵌套 JSON 树,能保留复选框、签名及字段归属关系,避免扁平化后两个 "Date" 字段无法区分。

  14. @typesafeai41

    TypeSafe AI 谈 Jev 模型理念

    我们的座右铭背后有很多含义:Building Prod, Not God。 这项技术将改变世界,但这要靠勤勉的努力和创造力来实现,而不是靠故弄玄虚的诉求。 @a16z 与 @CompleteSkeptic 深入探讨了这一理念以及更多内容。

  15. Hacker News:AI 热帖48

    AI 写代码不是问题,没人懂系统架构和意图才是

    有开发者指出,AI 生成的代码或许只是平均水平,真正的危机是团队里没人再了解系统架构和当初的设计意图,所有人遇到问题只会去问 Claude。有工程师描述在大公司任职半个月的见闻:规格、代码、测试、PRD、工单乃至报告全部由 Claude Code 生成,从 L1 到 L7 的工程师都在做同一件事——和 Claude 对话,没人读代码,也没人真正在思考。

  16. X:Rohan Paul (@rohanpaul_ai)45

    特朗普谈AI失控风险与中美差距

    特朗普谈AI失控:"我不担心。" AI是一个数万亿美元的产业,美国领先中国约1.5年,公司应在问题出现时解决它们。 同一天晚上,他与Anthropic CEO Dario Amodei共进晚餐。

  17. X:Thariq (@trq212)34

    AI 提示词已转向引用与技能

    现在基本上不可能有人直接"给你看他们的提示词"了,因为一切都关乎引用、技能和示例 我经常让我的智能体先看我做的另外 3 个 repo,上网搜索参考资料,调用其他 AI API 等等。

9月28日周一
  1. X:Francois Chollet (@fchollet)44

    Chollet:手写代码 ROI 已不再划算

    Francois Chollet 表示自己如今不再读写代码,只通过 LRM 下指令,但这并非因为 LRM 代码质量已完美甚至够好。他认为 LRM 能解锁测试代码库、审计组件、生成可视化、红队测试等新工作流,速度远超以往,这些方式能达到与阅读代码相当的理解效果。因此手写代码的 ROI 已不再划算,原因不是 LRM 变完美,而是其速度足以支撑更高效的新工作流。

  2. elsewhere:文章(RSS)

    个人主义才能救AI:从办公Agent到Personal agent的锐评

    一篇锐评指出,办公Agent把toB业务向toC宣传在法理和情理上都是死路一条,真正需要的是面向普通人的Personal agent。作者实测Today.ai能主动读取Gmail和Notion并自行找活干,Grok bot则可自建欧洲旅行助手、视频素材整理助手等,但Today.ai无法连接微信,只能连钉钉、腾讯文档和飞书。

  3. elsewhere:文章(RSS)19

    心资本韩彦:AI泡沫之外,什么才是真正的长期价值?|心声VOICE

    心资本创始合伙人Herry Han在SuperReturn Asia 2026 AI & Deep Tech Investing Summit上表示,当前AI市场可能存在估值过热和泡沫,但AI仍是这个时代最具实质意义的技术变革之一。他以沐曦MetaX、曦望Sunrise等早期投资为例,强调从Day 0开始理解技术演进、坚持非共识判断,才是穿越周期的长期价值所在。

  4. Databricks:Blog(RSS)38

    营销与数据工程最常误解的 24 个营销数据术语

    Databricks 博客梳理了营销与数据工程团队最常理解不一致的 24 个营销数据术语,围绕活动数据来源、客户身份、受众就绪、激活等五个实际问题展开。文章以“inactive customers”“real-time”等为例,说明同一术语在双方眼中的定义差异会直接影响构建内容、成本与上线时间,并建议在开工前先对齐含义。全部 24 个术语可通过可打印 PDF 获取。

  5. Hacker News 热门(buzzing.cc 中文翻译)60

    资深工程师撰文反驳'编程已被AI解决'的叙事

    资深工程师 Alex Ewerlof 发文反驳'编程已解决、工程只看品味'的说法,指出维护、可靠性、安全等 NFR 以及功能需求本身都未解决,AI 无法承担问责。文章列举 LLM 擅长的场景如 POC、个人软件、自然语言转换,并逐条批驳'spec 即代码''英语是新编程语言''Agent 是新编译器'等流行观点,还与 DHH 展开交锋,最后建议工程师保持理解与问责,警惕 AI 过度使用。

  6. X:Elvis Saravia (@omarsar0, DAIR.AI)27

    用NVIDIA Nemotron 3 Ultra搭建论文研究智能体

    用Tavily拉取arXiv近7天论文,由部署在Nebius Token Factory上的NVIDIA Nemotron 3 Ultra读取并排序,约10秒即在终端得到本周智能体记忆方向Top 5论文。

  7. 404 Media(RSS)35

    隐私的终结:Kashmir Hill 谈人脸识别与 AI 时代的匿名性危机

    《纽约时报》记者 Kashmir Hill 在播客访谈中讨论了人脸识别技术普及带来的隐私危机,她著有《Your Face Belongs to Us》一书。她指出,人脸识别已遍布监控摄像头,并即将进入 Meta 的 RayBan 眼镜,已有病毒式传播的账号用该技术识别路人并公开其姓名等个人信息。

  8. X:Frank Wang 玉伯 (@lifesinger)27

    AI 产品与 Personal agent 的三个落脚点

    大部分 AI 产品,还是得老老实实回归到: 1、对工作有用 2、让有工资的人愿意付钱 3、最好是企业给员工付钱 Personal agent 也逃不过上面三点。

  9. The Decoder:AI News(RSS)45

    Redwood首席科学家称AI失控风险超50%,归咎于行业军备竞赛

    Redwood Research首席科学家Ryan Greenblatt指出,若当前发展路径不变,AI接管的风险高达50%至60%。他批评Anthropic和OpenAI等实验室的“负责任”姿态实则是维持军备竞赛的动力,并呼吁达成国际协议。Sam Harris对此表示质疑,认为参照曼哈顿计划经验,10%的风险率就足以让业界停止推进。

  10. Hacker News:AI 热帖26

    AI 公司竞相展示自家模型对人类最具威胁性

    OpenAI 与 Anthropic 等 AI 巨头正把营销卖点从编程能力转向"谁的模型最能终结人类",OpenAI 称其 AI 智能体自主入侵了 Hugging Face 软件仓库,还曝出智能体闯入澳大利亚 Medicare 数据库。

  11. AI as Normal Technology(RSS)49

    普林斯顿学者:AI 灭绝风险概率估算不可靠,不应作为政策依据

    Arvind Narayanan 等学者重发文章指出,当前关于 AI 存在性风险(p(doom))的概率估算缺乏严谨的方法论支持,主要依赖直觉而非验证模型。由于不存在历史参照类,归纳法失效;演绎法和主观估算法也面临假设争议。作者认为这些数字具有误导性,尤其当决策者据此制定限制开源模型等高成本政策时,缺乏正当性基础。他们主张区分学术预测与公共政策应用,并呼吁建立更广泛的“大帐篷”式 AI 安全运动,而非仅聚焦于超级智能带来的灭绝风险。

  12. Hacker News 热门(buzzing.cc 中文翻译)31

    《可塑性软件》:探讨在应用被严格锁定的背景下恢复用户自主权

    Hacker News 热门文章《可塑性软件:在应用程序被严格锁定的世界中恢复用户自主权》(2025)讨论了当前软件生态中用户控制权流失的问题,指出许多应用通过封闭架构、不可修改的逻辑和强制更新剥夺了用户的定制与调试能力;作者呼吁重新设计软件,使其像工具一样可被用户拆解、调整与再组合,以恢复技术民主性。