最新精选
第 241–260 条 · 共 294 条- Google Research:Blog(网页)精选AI 评分5757
自去年秋季推出实证研究辅助(ERA)工具以来,谷歌研究团队已将其应用于多个科学领域以解决实际问题。在流行病学中,它助力流感与新冠预测;在宇宙学里,协助分析星系数据以探究暗能量;在大气监测方面,提升了二氧化碳排放的追踪精度;在神经科学领域,则用于解析大脑活动数据。这些实践表明,ERA能帮助科学家生成专家级的实证软件,其成果超越了黑箱模型,可发现兼具可解释性与机制准确性的解决方案,从而有效加速科学发现进程。
推荐理由:Google 把自家 ERA 工具在流行病学、宇宙学、气候监测、神经科学四个方向的实战案例摊开讲,虽然不是新模型发布,但对做 AI for Science 的人来说,这是一份难得的「AI 科研助手到底能干嘛」的全景参考。
Rohan Paul@rohanpaul_ai精选AI 评分7171《哈佛商业评论》文章指出,AI的首要经济影响并非自动化,而是制造了巨大的不确定性“迷雾”,导致“预见能力的崩溃”。这动摇了现代资本主义依赖未来“可读性”的根基,使得个人对教育投资、企业对长期雇佣与资本开支、金融市场对终值的评估均陷入犹豫。其结果是行为模式迅速转向短期视野:更倾向于模块化、可调整的投入,而非长期、不可逆的重大承诺。
推荐理由:HBR这篇文章点明了一个被忽视的效应,AI先动摇的不是就业而是经济决策的可见性。当远期现金流变得不可读,学位、招聘、投资都得重新算账,管理者和投资者的时间窗正在被动缩短。
- Hugging Face:Blog(RSS)精选AI 评分6262
AI评估成本已突破关键阈值,正重塑其可及性。Holistic Agent Leaderboard花费约4万美元运行了2万多次智能体推演,单次前沿模型测试成本可达2829美元。研究显示,相同任务成本差异可达33倍,脚手架选择是核心成本驱动因素。虽然静态基准可通过压缩技术实现百倍成本缩减,但智能体评估因轨迹长、噪声大而压缩有限。高支出未必带来更好结果:例如在GAIA测试中,2828美元方案准确率28.5%,而1686美元方案反达57.6%。当评估包含模型训练时,成本将完全超越常规API框架。
推荐理由:这篇把分散的评估成本数据拉通了算总账,曾经便宜的评测现在动辄上万美元,独立评估正被价格挤出牌桌,做Agent的人必须意识到排行榜的代价。
- Tomer Tunguz 博客(VC 分析)精选AI 评分6363
AI销售策略正从询问软件预算转向三个核心问题:软件总预算、劳动力总预算,以及客户期望三年后两者的比例。这一转变将销售对话提升至战略层面。当前数据显示,销售、支持和工程部门的人力与软件成本比分别为10:1、4:1和最高25:1,高比率意味着巨大的AI替代潜力。新的销售流程分为两步:先切入现有软件预算,再拓展至AI所释放的劳动力预算,最终目标是重新定义企业对成本结构的认知。
推荐理由:Tunguz 用一张劳动力/软件支出比率表把 AI 销售的底层逻辑讲透了,做 ToB SaaS 或 Agent 产品的人看完会重新想自己的定价天花板在哪。
OpenRouter@OpenRouter精选AI 评分6161我们研究了市场上Opus 4.7的数据,发现成本增加了12-27%,但短提示除外,实际上短提示的成本效益更高。
完整文章:https://openrouter.ai/announcements/opus-47-tokenizer-analysis
推荐理由:OpenRouter 用自家平台数据实测 Opus 4.7 的真实成本变化,不是官方 PR 而是第三方视角,做成本预算的产品人和开发者值得看一眼再决定要不要迁移。
- IT之家(RSS)精选AI 评分7676
中国外商投资安全审查工作机制办公室依法禁止了Meta对AI公司Manus的收购交易。央视解读指出,此举主要针对企业“洗澡式出海”的不合规做法。Manus在推出后,将总部迁至新加坡并裁减国内团队,随后在获得美国投资后试图将核心人员、技术等关键资产转移境外,触发了跨境投资安全审查。依据《外商投资安全审查办法》,此类涉及技术、数据跨境转移的交易需接受安全审查,以平衡对外开放与国家安全。目前Meta正计划解除交易并剥离相关数据。
推荐理由:Manus 从爆火到出海再到被禁,是中国 AI 公司跨境资本操作的标志性案例。做 AI 创业的都该看看这条红线画在哪,别等交易谈完才发现过不了审。
- IT之家(RSS)精选AI 评分7171
教育部发布《普通高等学校本科专业目录(2026年)》,新增38种本科专业,目录现涵盖13个门类、883种专业。为适应新兴交叉学科发展,目录在“交叉学科”门类中首批列入未来机器人、具身智能、脑机科学与技术等15种专业。新增专业精准对接国家战略与产业需求,包括能源科学与工程、深地科学与工程、农业机器人、生物制造、数字文旅、商业人工智能等。其中,具身智能专业获哈尔滨工业大学等9所高校增设。“十四五”期间全国高校专业调整幅度超30%,今年调整比例首次突破10%。
推荐理由:教育部把具身智能列为本科专业,9所高校首批开设,这是AI人才供给端的结构性信号。做具身智能的团队,未来几年招人会容易很多。
- Tomer Tunguz 博客(VC 分析)精选AI 评分6464
根据Ornn Compute Price Index数据,NVIDIA B200 GPU的现货租赁价格在六周内飙升114%,从三月初的2.31美元涨至本周的4.95美元/小时。此次价格暴涨与GPT-5.5等前沿模型发布带来的需求冲击紧密相关,这些模型需要Blackwell架构提供的内存支持。与此同时,B200与上一代H200的价差从0.28美元大幅扩大至1.80美元,不同云服务商之间的报价差距也扩大了一倍以上,反映出市场供应紧张。预计夏季B200价格将维持在5美元以上,云端推理成本持续上升。
推荐理由:Tomer Tunguz 用 Ornn 真实价格指数拆出 B200 六周涨 114% 的供需逻辑,做 AI infra 选型或算力采购的人该把这张图存下来,夏天 B200 破 5 刀基本板上钉钉。
- IT之家(RSS)精选AI 评分7373
欧盟委员会初步认定,谷歌在安卓系统中给予其AI助手Gemini系统级优先待遇,限制了第三方AI服务调用系统功能、屏幕上下文、本地数据和硬件的能力。为此,欧盟要求谷歌开放安卓的AI相关权限,允许第三方AI工具通过唤醒词或按键启动、读取屏幕内容、访问本地数据并控制已安装应用,同时为开发者提供必要的硬件访问以支持本地模型运行。欧盟将在收集反馈后,最晚于7月27日公布最终决定。若谷歌未按要求调整,可能面临最高相当于其全球年收入10%的罚款。
推荐理由:欧盟这次盯的不是搜索而是 AI 入口,如果裁定落地,安卓上的 AI 竞争格局会从「谷歌一家独大」变成「谁都能接系统级权限」,做移动端 AI 产品的人都该盯着 7 月的最终决定。
- IT之家(RSS)精选AI 评分7474
OpenAI 2025年未能实现ChatGPT的内部营收和周活用户突破10亿的目标,主要面临谷歌Gemini和Anthropic的竞争。尽管近期融资1220亿美元,但其高达1.4万亿美元的数据中心支出承诺带来巨大财务压力,到2030年或需2070亿美元新融资。公司内部对算力支出和IPO时间表存在分歧,同时还需应对马斯克的巨额索赔诉讼。尽管有GPT-5.5表现优异等利好,但平衡巨额支出与营收增长仍是其IPO的核心挑战。
推荐理由:华尔街日报独家披露 OpenAI 收入和用户目标双双落空,叠加 1.4 万亿美元算力豪赌和 IPO 内部分歧,这是理解 OpenAI 商业模式是否可持续的关键切片,做 AI 投资和竞品分析的值得细读。
- Simon Willison 博客精选AI 评分7575
微软与OpenAI的长期合作曾包含一项特殊条款:一旦实现通用人工智能(AGI),微软的商业知识产权将失效。AGI最初被模糊定义,后在2024年被具体量化为能为早期投资者产生约1000亿美元利润的系统。2025年,双方修订协议,规定AGI需经独立专家小组核实。2026年4月27日,双方宣布新合作阶段,微软对OpenAI知识产权的许可将延续至2032年(转为非独家),并停止收入分成,而OpenAI向微软的分成支付将持续至2030年且“独立于技术进展”。此举被广泛视为原有的AGI条款实质上已被废止。
推荐理由:Simon Willison 把 OpenAI 和微软之间那个「AGI 条款」从诞生到死亡的完整时间线扒了出来,这种一手资料级别的梳理比任何分析都有说服力,关心 AI 商业格局的人值得花五分钟读完。
- IT之家(RSS)精选AI 评分7272
马斯克起诉OpenAI及其CEO奥尔特曼等一案即将在加州开庭,索赔金额高达1500亿美元。案件核心争议在于OpenAI被指控背弃最初的非营利使命,转为营利性实体。关键证据包括联合创始人格雷格·布罗克曼2017年的私人日记,其中内容显示管理层早期已考虑摆脱马斯克影响并追求经济利益。马斯克要求OpenAI恢复非营利性质并罢免奥尔特曼等人职务。OpenAI则反驳称马斯克意图掌控公司并为自己的xAI造势。此案可能动摇OpenAI管理层公信力,影响其万亿估值上市计划。
推荐理由:马斯克索赔 1500 亿美元的官司明天开庭,布罗克曼日记里那句「摆脱埃隆控制」可能是整场审判的胜负手。OpenAI 的 IPO 节奏和治理公信力都悬在这场庭审上,做 AI 的人都该盯着。
- The Decoder:AI News(RSS)精选AI 评分7171
Google 计划向人工智能公司 Anthropic 投资高达 400 亿美元。Anthropic 是聊天机器人 Claude 的开发商,被视为 ChatGPT 的主要竞争对手。加上亚马逊此前承诺的 250 亿美元投资,这意味着在短短几周内,Anthropic 将获得高达 650 亿美元的巨额资金注入。这笔投资将极大增强 Anthropic 在 AI 领域的研发与竞争实力。
推荐理由:Google 和 Amazon 两周内砸 650 亿美元给 Anthropic,这个量级意味着 Claude 不再是挑战者而是被资本选中的正统,做 AI 产品的人该重新评估押注哪家 API 了。
- Gary Marcus:The Road to AI We Can Trust(RSS)精选AI 评分6060
四项独立研究一致表明,不应信任聊天机器人提供的医疗建议。这些研究均指向同一结论,显示AI对话系统在医疗咨询场景中存在显著的可靠性缺陷与安全隐患,可能给出不准确甚至危险的健康指导。专家强烈警告用户避免依赖ChatGPT等工具进行疾病诊断或用药决策,强调寻求专业医疗人员帮助的必要性。
推荐理由:Gary Marcus 用四篇新研究再加个人悲剧,把“别用聊天机器人看病”这件事讲成了必须认真对待的警告。数据扎实,故事揪心,值得每一个随手问 AI 的普通人读一下。
- Cursor Blog精选AI 评分5555
Cursor 团队针对用户全天依赖应用、崩溃影响严重的问题,聚焦内存不足导致的崩溃。通过为多进程架构设计细粒度监控系统,实时追踪版本发布后的崩溃指标。采用双重调试策略:自上而下关联功能与崩溃数据,监控大消息负载;自下而上通过崩溃观察服务、堆快照等定位根本原因。自2月底以来,全版本会话OOM率下降80%,自3月1日起请求OOM率下降73%。具体措施包括处理大文件加载和修复资源泄漏,以应对突发与渐进性内存耗尽。
推荐理由:Cursor 把自家 OOM 问题的排查方法论完整公开了,自顶向下加自底向上的双线调试思路对做桌面端 Agent 产品的人有参考价值,但本质上是工程复盘而非行业事件。
- Nathan Lambert:Interconnects(RSS)精选AI 评分6060
文章剖析了决定开源与闭源AI模型单一评估数字的复杂因素,探讨了当前两者之间的性能鸿沟及其成因,同时预测了未来这一差距的演变趋势。分析指出,评估指标背后涉及数据质量、训练规模、架构优化等多重变量,而随着开源社区技术迭代和评估体系完善,开放模型与封闭模型的能力边界将持续动态变化。
推荐理由:Nathan Lambert 把开源闭源差距从单一数字拉回到任务演化的动态里,做产品的人读完后会对那些追赶 benchmark 的宣传多一层怀疑,值得一读。
- Epoch AI:研究、数据与评测精选AI 评分6565
Epoch AI 梳理了 OpenAI Stargate 项目在美国的七个站点,均为 5000 亿美元基建计划的一部分,目前仅得州 Abilene 站点投入运营,当前容量约 0.3 GW,八栋建筑中约四栋已启用并搭载 Nvidia Blackwell 芯片。
推荐理由:原文逐站点梳理了 Stargate 七个 US 选址的容量、工期和供电方案,读者可据此了解巨型 AI 数据中心建设的真实进展与约束。
- Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7474
Andon Labs 启动一项为期三年的实体零售实验,为人工智能系统签订真实店铺租赁合同,要求其独立运营并实现盈利。该实验将 AI 从数字场景延伸至实体商业环境,需自主处理选品、库存、定价及客户服务等环节,在真实租金成本和市场竞争压力下验证其商业决策与持续经营能力。
推荐理由:AI当老板,从装修面试到选品营销一手包办,还学会在招聘时隐瞒身份——这个真实实验让我们看到AI管理人类的未来可能比预想的更近,也暴露了伦理上的灰色地带。
- TensorZero:实验与工程博客精选AI 评分6767
TensorZero 测量发现同一输入在不同厂商的 token 计数相差可达 2.65 倍,按每百万 token 单价比较 LLM API 成本会产生误导。
推荐理由:作者用各家官方 token 计数 API 实测同一输入的成本差异,给出可复用的比价方法,提醒只看每百万 token 单价会误判。
- Cursor Blog精选AI 评分7070
一项针对500家公司开发者使用Cursor的八个月研究发现,在Opus 4.5和GPT-5.2等先进模型发布后,人均周AI使用量增长44%。开发者初期用更强模型完成更多同复杂度任务,4-6周后开始转向更高复杂度工作,高复杂度任务量激增68%,远超低复杂度任务的22%。媒体广告、软件工具和金融科技行业增长最为显著。任务分布呈现结构性变化:文档编写、架构设计等管理性任务增长超50%,而UI设计等独立任务仅增15%,表明开发者角色正从代码生成转向代码库管理。研究揭示了类似杰文斯悖论的效应——AI效率提升反而刺激了总需求,并可能创造新的经济活动空间。
推荐理由:Cursor 拿 500 家公司八个月的真实数据证明了一个反直觉结论,AI 越好开发者用得越多,而且是从做更多简单活慢慢转向啃硬骨头。做 AI 产品的人该认真想想这个杰文斯效应。