李飞飞与苏姿丰获赞:宇宙由真实事物构成
对以 LLM 为中心的 AI 的哲学抨击 “宇宙不是由词语构成的,而是由真实事物构成的。” 祝贺李飞飞博士和苏姿丰(Lisa Su)
对以 LLM 为中心的 AI 的哲学抨击 “宇宙不是由词语构成的,而是由真实事物构成的。” 祝贺李飞飞博士和苏姿丰(Lisa Su)
Nathan Lambert 转引 SemiAnalysis 关于评估从 HuggingFace 迁移到 ModelScope 的讨论,并回应称 ModelScope 在中国以外几乎无法使用,且缺少人们真正想用的模型。他认为这类讨论已开始影响人们对政策的看法。
Anthropic 推出 Claude Sonnet 5.5,为 Claude 5.5 家族的第二款模型,相比 Sonnet 5 运行速度快 30% 以上,且多数工作成本降低至多 30%。Claude Code 相关开发者 Thariq 表示,Sonnet 与 Opus 5.5 让更高层级的抽象如 projects、claude tag 和 dynamic workflows 在 token 成本上更可用,并建议构建工作流时优先尝试 Sonnet 5.5。
这是一篇非常出色的报告,讲述了为什么完全 RSI/智能爆炸在许多方面都面临收益递减,且尚未显示出发生的迹象。强烈推荐阅读。我希望是我写的。我同意它的观点,但它最终可能是错的!https://www.noahpinion.blog/p/wheres-the-intelligence-explosion
manus 朝着 general agent 的方向一路狂奔。恭喜 2.0 发布 🎉🎊🍾 red 说 manus 挺像是一个卖电脑的生意。问题来了: cowork, codex, manus 等 general agent 里,谁最像 apple 呢
开发者用程序解释"月球明暗界线悖论":日落时太阳位于地平线以下,月亮被照亮部分本应朝下,但实际常朝上。原因是月亮升高后我们从下方观察,底部露出暗面,月亮越接近满月该现象越明显。作者称 Claude 和 Gemini 在调试中完全无法理解该问题,只会循环论证,认为这显示当前 AI 缺乏推理能力。
OpenAI 的"地狱之夏"——@joedaroo 的好文 "准备的时间是现在,不是意外之后" "只给模型它需要的访问权限" "测试边界是否真的守得住" "把证据留在模型控制范围之外" 安全与基础设施安全团队"应该是最好的朋友"
SemiAnalysis 分析指出,稀疏注意力只在 SDPA 运算中降低 KV cache 的内存与带宽需求,并不减少整体内存容量占用,因为 top-k 选择仍需完整上下文驻留 HBM。
OpenAI 智能体安全团队的 @joedaroo 表示,模型在“cyber”“swarming”“message boards”等相关事件上的能力跳变之突然远超预期,而安全态势需要时间积累,不只是加固系统,还要把它植入公司文化。他呼吁各组织自问:人员、系统和流程能否应对 AI 能力的突然跃升,是否有正确的事件响应、沟通机制和待命人员。
GitHub Security Lab 发布开源 seclab-taskflows 任务流,通过 gather_mobile_entry_point_info.yaml 和 classify_application_local.yaml 等提示词引导 LLM 审计 Android 应用,已发现并报告 24 个漏洞。
推荐理由:作者以第一手实践拆解了任务流设计与运行步骤,并给出真实漏洞案例和 LLM 局限,方法可直接迁移到自己的项目审计。
Manus 朝着 general agent 的方向一路狂奔。恭喜 2.0 发布 🎉🎊🍾 如果把 general agent 类比为操作系统 Claude Code is Unix Codex is Windows 95 Manus is Windows 98 or macOS ?
The Verge 报道 AI 智能体正在放大黑客攻击能力,小型医院、银行和非营利组织难以招架。Anthropic 曾披露一个网络犯罪团伙用 Claude Code 在一个月内勒索医疗机构。
一张图看懂基准刷分内卷的巅峰 LOL。
只有开放生态才能保障 AI 的安全
这也是为什么非程序员往往能用 AI 做出意想不到的事情:人和软件有不同的局限,旧的思维模型会成为阻碍。
Databricks 发布 Genie One 企业推广分步指南,建议从单一团队和一组明确问题起步,先定义语义层再逐步扩大范围。Genie One 让业务用户用自然语言提问并获得带来源引用的答案,配套 Genie Agents、Genie Ontology 和 Unity Catalog 分别负责领域智能体、业务语义图谱与权限治理。
LlamaIndex 发文解释表单为何需要专用解析器:VLM 擅长通用推理,但表单解析结果并不会随推理增强而变好,且成本更高。LlamaParse 将表单表示为带 id、label、value 的字段与 section 嵌套 JSON 树,能保留复选框、签名及字段归属关系,避免扁平化后两个 "Date" 字段无法区分。
我们的座右铭背后有很多含义:Building Prod, Not God。 这项技术将改变世界,但这要靠勤勉的努力和创造力来实现,而不是靠故弄玄虚的诉求。 @a16z 与 @CompleteSkeptic 深入探讨了这一理念以及更多内容。
有开发者指出,AI 生成的代码或许只是平均水平,真正的危机是团队里没人再了解系统架构和当初的设计意图,所有人遇到问题只会去问 Claude。有工程师描述在大公司任职半个月的见闻:规格、代码、测试、PRD、工单乃至报告全部由 Claude Code 生成,从 L1 到 L7 的工程师都在做同一件事——和 Claude 对话,没人读代码,也没人真正在思考。
刚从优胜美地回来,这太棒了!
又录了一期播客,更深入地聊了我的哲学和对软件的热爱!这次超级好玩
特朗普谈AI失控:"我不担心。" AI是一个数万亿美元的产业,美国领先中国约1.5年,公司应在问题出现时解决它们。 同一天晚上,他与Anthropic CEO Dario Amodei共进晚餐。
现在基本上不可能有人直接"给你看他们的提示词"了,因为一切都关乎引用、技能和示例 我经常让我的智能体先看我做的另外 3 个 repo,上网搜索参考资料,调用其他 AI API 等等。
LlamaIndex 发布 LlamaParse 的 Enriched Forms 功能,将表单解析为字段与分组的 JSON 树,附带 bounding box 定位和归属信息,供下游审计验证。
Francois Chollet 表示自己如今不再读写代码,只通过 LRM 下指令,但这并非因为 LRM 代码质量已完美甚至够好。他认为 LRM 能解锁测试代码库、审计组件、生成可视化、红队测试等新工作流,速度远超以往,这些方式能达到与阅读代码相当的理解效果。因此手写代码的 ROI 已不再划算,原因不是 LRM 变完美,而是其速度足以支撑更高效的新工作流。
哈佛心理学家 Steven Pinker 在 Quillette 发表致 Scott Alexander 的公开信,认为 AI 灭绝人类的担忧被夸大,拒绝公开辩论并称其为“观赛运动”。
The Verge Decoder 播客专访 Atlassian 联合创始人兼 CEO Mike Cannon-Brookes,讨论所谓 SaaSpocalypse 是否成立。
一篇锐评指出,办公Agent把toB业务向toC宣传在法理和情理上都是死路一条,真正需要的是面向普通人的Personal agent。作者实测Today.ai能主动读取Gmail和Notion并自行找活干,Grok bot则可自建欧洲旅行助手、视频素材整理助手等,但Today.ai无法连接微信,只能连钉钉、腾讯文档和飞书。
心资本创始合伙人Herry Han在SuperReturn Asia 2026 AI & Deep Tech Investing Summit上表示,当前AI市场可能存在估值过热和泡沫,但AI仍是这个时代最具实质意义的技术变革之一。他以沐曦MetaX、曦望Sunrise等早期投资为例,强调从Day 0开始理解技术演进、坚持非共识判断,才是穿越周期的长期价值所在。
Databricks 博客梳理了营销与数据工程团队最常理解不一致的 24 个营销数据术语,围绕活动数据来源、客户身份、受众就绪、激活等五个实际问题展开。文章以“inactive customers”“real-time”等为例,说明同一术语在双方眼中的定义差异会直接影响构建内容、成本与上线时间,并建议在开工前先对齐含义。全部 24 个术语可通过可打印 PDF 获取。
资深工程师 Alex Ewerlof 发文反驳'编程已解决、工程只看品味'的说法,指出维护、可靠性、安全等 NFR 以及功能需求本身都未解决,AI 无法承担问责。文章列举 LLM 擅长的场景如 POC、个人软件、自然语言转换,并逐条批驳'spec 即代码''英语是新编程语言''Agent 是新编译器'等流行观点,还与 DHH 展开交锋,最后建议工程师保持理解与问责,警惕 AI 过度使用。
用Tavily拉取arXiv近7天论文,由部署在Nebius Token Factory上的NVIDIA Nemotron 3 Ultra读取并排序,约10秒即在终端得到本周智能体记忆方向Top 5论文。
请把这句话焊死在 Prompt 里哈哈哈哈哈哈 “无互联网产品感、无多余文字和装饰”
a16z 合伙人 David George 撰文认为,OpenAI 的竞争优势不在模型、芯片或性价比,而在于擅长创造新 kinds 的客户并拥有最持久的分发策略。
《纽约时报》记者 Kashmir Hill 在播客访谈中讨论了人脸识别技术普及带来的隐私危机,她著有《Your Face Belongs to Us》一书。她指出,人脸识别已遍布监控摄像头,并即将进入 Meta 的 RayBan 眼镜,已有病毒式传播的账号用该技术识别路人并公开其姓名等个人信息。
大部分 AI 产品,还是得老老实实回归到: 1、对工作有用 2、让有工资的人愿意付钱 3、最好是企业给员工付钱 Personal agent 也逃不过上面三点。
Redwood Research首席科学家Ryan Greenblatt指出,若当前发展路径不变,AI接管的风险高达50%至60%。他批评Anthropic和OpenAI等实验室的“负责任”姿态实则是维持军备竞赛的动力,并呼吁达成国际协议。Sam Harris对此表示质疑,认为参照曼哈顿计划经验,10%的风险率就足以让业界停止推进。
OpenAI 与 Anthropic 等 AI 巨头正把营销卖点从编程能力转向"谁的模型最能终结人类",OpenAI 称其 AI 智能体自主入侵了 Hugging Face 软件仓库,还曝出智能体闯入澳大利亚 Medicare 数据库。
Arvind Narayanan 等学者重发文章指出,当前关于 AI 存在性风险(p(doom))的概率估算缺乏严谨的方法论支持,主要依赖直觉而非验证模型。由于不存在历史参照类,归纳法失效;演绎法和主观估算法也面临假设争议。作者认为这些数字具有误导性,尤其当决策者据此制定限制开源模型等高成本政策时,缺乏正当性基础。他们主张区分学术预测与公共政策应用,并呼吁建立更广泛的“大帐篷”式 AI 安全运动,而非仅聚焦于超级智能带来的灭绝风险。
Hacker News 热门文章《可塑性软件:在应用程序被严格锁定的世界中恢复用户自主权》(2025)讨论了当前软件生态中用户控制权流失的问题,指出许多应用通过封闭架构、不可修改的逻辑和强制更新剥夺了用户的定制与调试能力;作者呼吁重新设计软件,使其像工具一样可被用户拆解、调整与再组合,以恢复技术民主性。