跳到正文
北京时间

全部动态

今日 358 条
7月17日周五
  1. 公众号:通义实验室(千问)74

    首届“小有可为”大赛乡村教育一等奖作品“智绘科普”技术拆解

    首届“小有可为”大赛乡村教育赛道一等奖作品“智绘科普”采用 Qwen3.5-397B-A17B 大语言模型与 Manim 动画引擎,通过多Agent分阶段协作与自动修复机制,将知识主题转化为可控、可编辑的教学动画。系统包含规划、草稿、实现、审查、合成五个阶段,渲染失败时可自动提取日志并修复,该工程范式可迁移至其他赛道。

    推荐理由:这是官方出品的实战教程,拆解了一套多Agent协作+门控+自修复的工程流水线,技术思路通用,做AI应用的可以直接抄作业。

  2. 公众号:通义实验室(千问)72

    小有可为实战教程:拆解乡村教育一等奖作品“智绘科普”的多Agent协作与门控工程

    首届“点亮乡村课堂”赛道一等奖作品“智绘科普”采用Qwen3.5-397B-A17B大语言模型与Manim开源数学动画引擎,构建多Agent分阶段协作流水线。系统通过规划、草稿、实现、审查、合成五个Agent,配合时序门控、几何审计、视觉审查三道质量门及自动修复回路,实现可控可编辑的教学动画生成。项目底层“多Agent协作+门控+自我修复”范式可迁移至养老陪伴、孤独症干预等场景。

    推荐理由:拆解了一套多Agent协作、阶段门控加自动修复的工程范式,为在数学教学等严谨场景驯服大模型输出提供了可复用的流水线思路。

  3. Hacker News 热门(buzzing.cc 中文翻译)78

    Schema Harness 在 ARC-AGI-3 公开集上取得约 99% 成绩

    Schema 框架在 ARC-AGI-3 公开集上,使用 Claude Opus 4.8 和 Fable 5 达到 99% RHAE 分数,使用 GPT-5.6 Sol 达到 95.35%。该框架不修改模型权重,而是将原始观测转化为可编辑程序,联合解决状态归因和机制发现问题。此前最强模型 GPT-5.6 Sol 在半私有集上仅得 7.78%。

    推荐理由:在无规则的游戏里逆推出物理规律,这比刷榜更重要的是提供了一种让模型自己构建世界模型的方法论,做 agent 的值得细读。

  4. MarkTechPost(RSS)70

    NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本在 RTEB 基准上排名第一

    NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@10 排名第一。1B-NVFP4 版本在 Blackwell 上吞吐量比 BF16 高 2 倍,精度保留 99.5%,所有模型最大序列长度 32,768 tokens。

    推荐理由:嵌入模型不是最热的赛道,但决定了你 Agent 看到什么——NVIDIA 把 1B 模型压缩到 RTEB 第二,NVFP4 量化后精度几乎不变,做 RAG 的值得换上。

  5. 公众号:通义实验室(千问)69

    通义实验室发布 Wan-Streamer v0.2,端到端响应延迟仅 550ms

    通义实验室发布 Wan-Streamer v0.2,这是一款将“听、看、说、演”统一进单个 Transformer 的端到端全模态模型。其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。

    推荐理由:通义实验室把实时视频交互延迟压到550ms,同时提升了分辨率,不是刷榜而是解决实际问题,对做数字人和实时助手的团队是个值得跟进的信号。

  6. 公众号:通义实验室(千问)76

    Wan-Streamer v0.2 发布:端到端响应延迟仅 550ms,支持 640×368 实时视频对话

    通义实验室发布 Wan-Streamer v0.2,端到端响应延迟 550ms(200ms 模型延迟 + 350ms 网络延迟),输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS。

    推荐理由:550ms端到端延迟把实时视频对话从拼接流水线推入单模型交互循环,原先因响应太慢而无法沉浸的口语陪练与面试模拟,开始具备自然对话的交互基础。

  7. 公众号:月之暗面(Kimi)80

    Kimi K3:智能的新前沿

    Kimi 发布迄今能力最强的开源模型 Kimi K3,拥有 2.8 万亿参数、100 万 token 上下文窗口,原生支持视觉理解。该模型在长程编程、知识工作等场景表现前沿,整体能力仅次于 Claude Fable 5 和 GPT-5.6 Sol。即日起可通过 kimi.com 及官方 App 使用,完整模型权重将于 2026 年 7 月 27 日前发布。

    推荐理由:Kimi K3 以 2.8 万亿参数开源,虽自承不及闭源顶尖,但长程编码与知识工作案例扎实,是国产开源模型冲击前沿的关键一步,开发者值得跟进。

  8. 公众号:月之暗面(Kimi)83

    Kimi K3:智能的新前沿

    月之暗面推出迄今能力最强的开源模型 Kimi K3,拥有 2.8 万亿参数、100 万 token 上下文窗口,基于 KDA 混合线性注意力机制构建,原生支持视觉理解。它在长程编程、知识工作等场景表现前沿,但整体仍落后于 Claude Fable 5 和 GPT-5.6 Sol。即日起可通过 kimi.com 等渠道使用,完整权重将于 2026 年 7 月 27 日前发布。

    推荐理由:K3 把 2.8 万亿参数开源,并展示了从内核优化到芯片设计的连贯长程能力,为评估开源模型在复杂工程任务中的实际上限提供了参照。

  9. Hacker News 热门(buzzing.cc 中文翻译)71

    生成式人工智能是一场工程灾难:AI公司抢购70%高端内存,推高电脑价格

    AI公司为维持大语言模型(如ChatGPT、Claude)运行,可能已购买全球70%的高端计算机内存,导致内存与存储价格飙升:两年前350美元的硬盘现已涨至800美元且缺货,部分笔记本电脑涨价50%。科技公司计划未来几年将美国数据中心容量扩大8倍,部分站点甚至用喷气发动机供电。预测称,平价入门级电脑可能在2028年前消失,内存短缺预计持续数年。

    推荐理由:大西洋月刊这组调查揭示了AI繁荣的隐藏成本,硬件涨价会直接冲击普通消费者的钱包,这个信号比任何模型发布都更值得关注。

  10. HuggingFace Daily Papers(社区热门论文)73

    ActiveVision 基准测试揭示多模态大模型缺乏主动视觉观察能力

    最新基准测试 ActiveVision 通过 17 项任务评估多模态大语言模型(MLLM)的主动观察能力。得分最高的 GPT-5.5(最高推理层级)仅解决 10.6% 的任务,在 11 项任务上得零分;Claude Fable 5 仅解决 3.5%,而三名人类参与者平均得分 96.1%。即使模型自行编写并运行视觉代码,差距依然显著,表明当前 MLLM 缺乏鲁棒的主动视觉观察能力。

    推荐理由:前沿多模态模型在需要反复观察的任务上几乎全部翻车,最高分模型只做对 10%,人类 96%,说明现在的大模型不是真在看,而是在猜。做视觉的人应该认真看这篇。

  11. HuggingFace Daily Papers(社区热门论文)75

    NexForge:通过需求驱动任务合成扩展LLM智能体能力

    NexForge提出需求驱动框架,无需领域特定基础设施即可自动合成多样化可执行智能体任务与专家轨迹。该框架生成3.6K终端和2K办公任务,将Qwen3.5-35B-A3B Base在Terminal-Bench 2.0上从22.5%提升至52.0%,GDPval Elo从813提升至1338。

    推荐理由:NexForge 抛弃了靠人工造工具和仓库的老路,从需求出发自动合成训练数据,让 Qwen 基座在终端任务上逼近 Claude Opus,还开源了模型,做 agent 训练的值得细看数据生成思路。

  12. HuggingFace Daily Papers(社区热门论文)74

    从预训练到后训练:理解推理能力的强化学习缩放规律

    一项新研究以国际象棋为受控实验平台,系统探究了预训练与强化学习(RL)在推理任务中的交互关系。研究发现,给定RL计算量下的后训练性能可由预训练损失准确预测,且RL奖励曲线的斜率随预训练token数近似线性提升。在1B参数数学语言模型上,更长预训练的检查点在RL下性能更高、提升更快。

    推荐理由:这篇论文提出一个将预训练与RL联系起来的缩放定律,用国际象棋当试验场,发现RL在不同难度问题上的效果很不一样,做训练的人可以据此重新想想算力怎么分。

  13. HuggingFace Daily Papers(社区热门论文)81

    RecGPT-V3 技术报告:状态化混合模态推荐系统在淘宝部署,IPV 提升 1.28%、GPU 成本降低 52.4%

    淘宝部署的 RecGPT-V3 采用状态化行为建模、混合模态基础模型(融合文本标签与 Semantic IDs)和潜在意图推理,将用户建模计算量降低 55.8%,输出 token 成本下降。在“猜你喜欢”信息流的大规模在线 A/B 测试中,IPV 提升 1.28%、CTR 提升 1.00%、TC 提升 1.97%、GMV 提升 3.97%,端到端服务资源消耗降低 52.4%。

    推荐理由:淘宝首页推荐搬上大模型做推理引擎,记忆+混合模态+潜在推理三件套,带来 +1.28% IPV 同时节省 52.4% 算力,推荐系统真的开始重写成本公式了。

  14. HuggingFace Daily Papers(社区热门论文)73

    NVIDIA 发布 Audio-Visual Flamingo:面向长视频的开放音频-视觉大语言模型

    NVIDIA 推出 Nemotron-Labs-Audio-Visual Flamingo(AV-Flamingo),一个完全开源的音频-视觉大语言模型,专为理解和推理长视频中的音频、图像与复杂场景设计。

    推荐理由:NVIDIA 这次把音频和视觉在长视频上的联合推理做成了全开源模型,AV-Skills 数据集和 TAVIT 推理框架是亮点,做视频理解的开发者可以直接拉下来用。

  15. IT之家(RSS)79

    Kimi 最强模型 K3 发布,Frontend Code Arena 跑分登顶

    月之暗面推出迄今最强模型 Kimi K3,拥有 2.8 万亿参数和 100 万 Tokens 上下文窗口。该模型在 Frontend Code Arena 中以 1679 分超越 Claude Fable 5 位居第一,在 7 个前端领域中的 6 个排名 #1。API 定价为每 100 万 Tokens 输入 2 元(缓存命中)或 20 元(缓存未命中),输出 100 元。

    推荐理由:Kimi K3 的 2.8T 参数和 100 万上下文不是数字游戏,前端跑分实打实地压过 Claude Fable 5,七个子领域拿六个第一,这对做前端和长文档处理的人是个明确信号,可以下场试了。

  16. xAI:News(网页)85

    Grok 推出 Automations 功能:定时或邮件触发,自动执行任务并汇报结果

    xAI 为 Grok 引入 Automations 功能,用户可描述一次任务,让 Grok 按计划(一次/每日/工作日/每周/每月/每年)或邮件触发(按发件人、收件人或主题过滤)自动运行。每次执行都是一次完整对话,结果保存至运行历史,支持邮件或应用内通知。定时自动化对所有用户开放,邮件触发需 SuperGrok 订阅。

    推荐理由:xAI 把自动化做进了 Grok,定时和邮件触发让 AI 从被动问答变成主动干活,尤其是邮件触发可以直接处理收件箱,对于需要自动化工作流的用户来说,这是一次真正的实用性升级。

  17. Ars Technica:AI(RSS)87

    xAI 起诉 Grok 用户制作儿童性虐待内容,不再否认模型被滥用

    xAI 首次对一名 Grok 用户提起诉讼,指控其利用该模型制作儿童性虐待图像(CSAM)。此前 xAI 一直否认 Grok 能生成此类内容,此次诉讼标志着其立场转变。案件聚焦用户滥用行为,而非模型本身的技术缺陷。

    推荐理由:xAI 因 Grok 生成儿童性虐图像起诉用户,这是头部 AI 公司首次对自身技术产生的违法内容追究使用者责任,会深刻影响责任边界和平台治理思路,开发者和法律人都得盯着。

  18. Moonshot AI:Kimi Blog70

    Moonshot AI 发布 PerceptionBench:多模态模型视觉感知能力诊断基准

    Moonshot AI 发布 PerceptionBench,一个从 40 多个现有基准中模型实际失败案例归纳出的视觉感知基准,包含 10 项原子感知能力和 3000 道验证题。所有测试模型准确率均未超过 60%,且大量正确答案在重复提问时无法复现,表明模型更多是猜测而非真正感知。PerceptionBench 旨在精确诊断多模态 AI 的视觉感知断裂点,推动其实现忠实、一致的视觉理解。

    推荐理由:这是一个把视觉感知拆成原子能力的基准,所有模型不及格,而且猜测多于感知的发现很扎心,做多模态的团队应该拿来测一下自家模型。

  19. Hacker News 热门(buzzing.cc 中文翻译)70

    Decoy 字体:用空间频率混淆让 AI 看不清你输入的文字

    Decoy Font 是一款 TTF 字体,通过在同一字符中叠加不同空间频率的图形(前景细轮廓与背景低频模糊块),使近距离观看时 AI 读到“诱饵”字母,而人眼远距离或眯眼时才能看到真实隐藏信息。

    推荐理由:这是一个用视错觉对抗 AI 文字抓取的巧妙工具,虽然不能保证绝对安全,但只需安装字体就能用,门槛极低,发私密消息可以试试。

  20. X:ChatGPT (@ChatGPT)68

    ChatGPT 工作区支持文档表格幻灯片编辑

    在 ChatGPT 工作区中创建和编辑精美的文档、电子表格和幻灯片。 @nickbaumann_ 为你演示操作。

    推荐理由:ChatGPT 终于内置文档、表格和幻灯片,不是插件而是原生工作区,对轻办公需求的人来说,可能直接替代掉打开 Google Docs 的习惯。

  21. LangChain:Blog(RSS)67

    LangChain Fleet 新增一键部署 AI 智能体到 Slack 功能

    LangChain Fleet 允许用户在无代码环境下构建自定义 AI 智能体,并一键部署到 Slack。这些智能体可设置自定义身份,在频道和线程中使用,让团队在现有协作平台上直接完成工作。

    推荐理由:LangSmith Fleet 把无代码构建 agent 和 Slack 打通了,内部工具和团队协作场景的 AI 落地门槛又降了一截,做自动化流程的可以直接试试。

  22. Claude:Blog(网页)65

    Anthropic 用 Claude Code 大规模迁移代码:Bun 百万行 Zig 转 Rust,两周完成

    Anthropic 工程师用 Claude Code 在两周内将 Bun 的百万行 Zig 代码迁移至 Rust,100% 现有测试通过,合并后出现 19 个回归问题已全部修复。另一工程师用周末将 Python 代码库迁移至 16.5 万行 TypeScript。迁移消耗约 16.5 万美元 API 成本,但编译时间从八分钟降至两秒,二进制启动快 6 倍。

    推荐理由:Anthropic 用自家 Claude Code 把百万行 Zig 代码迁到 Rust,两周搞定,这不仅是案例展示,更是开发者如何用 AI 重构代码库的实操指南,尤其适合那些被遗留代码拖累的团队。

  23. Google Blog:AI(RSS)60

    Google Vids 上线 Gemini Omni 与个人数字分身功能

    Google Vids 推出两项更新:Gemini Omni 支持用户通过自然语言提示词和图片参考生成、逐步编辑高质量视频片段;个人数字分身功能允许用户上传自拍和语音录制后,输入文字即可让数字分身出镜。两项功能面向 Google AI Pro 和 Ultra 订阅者及 Google Workspace 商业客户开放,所有生成内容均含不可见的 SynthID 数字水印。

    推荐理由:如果你已经在用 Google Workspace,这两个更新让 Vids 的可用性提升了一档,但对于外部的 AI 视频生成,没带来新变量。

7月16日周四
  1. IT之家(RSS)75

    世界人工智能合作组织协定签署仪式在上海举行,总部设中国上海

    7月16日,成立世界人工智能合作组织协定签署仪式在上海举行,中共中央政治局委员、外交部长王毅代表中国政府签署协定。该组织是独立的政府间国际组织,总部设在中国上海,旨在促进人工智能国际合作与全球治理。哈萨克斯坦、老挝、巴基斯坦等29个国家代表签署协定成为创始成员国。

    推荐理由:全球AI治理从倡议走向落地,29国签署的政府间组织把总部放在上海,这对中国AI企业的出海合规和参与国际规则制定是长期利好。

  2. Claude:Blog(网页)64

    在 Claude Cowork 中使用 Claude Fable 5

    Anthropic 发布最强通用模型 Claude Fable 5,专为长时间、多步骤的复杂异步工作设计,可在 Claude Cowork 中自主执行深度研究、尽职调查等任务。该模型需手动选择,默认模型为 Claude Sonnet 5。

    推荐理由:Anthropic 终于把最强大模型放进 Cowork,这篇指南不只是功能说明,更是一套'把 AI 当同事'的工作方法,开发者看完就能上手。

  3. Google AI:DEV 作者专属(RSS)72

    DiffusionGemma 开发者指南发布

    Google AI 发布 DiffusionGemma 开发者指南,该实验性模型基于 Gemma 4 架构,采用计算受限并行生成,在单张 NVIDIA H100 上实现 1000+ tokens/秒的生成速度。模型为 26B 参数的 MoE 架构,推理时仅激活 3.8B 参数,可在 18 GB VRAM 内量化部署。

    推荐理由:虽然 DiffusionGemma 是实验性的,但把文本生成从内存带宽瓶颈转向计算瓶颈的思路非常新颖,这篇指南给出了可落地的服务方案和微调手法,做推理优化的值得跟进。

  4. X:面壁智能 OpenBMB (@OpenBMB)66

    面壁智能开源企业AI数字员工平台StaffDeck

    面壁智能联合多团队开源StaffDeck,一个用于构建与管理数字员工的企业平台。该平台旨在将专业知识、标准作业程序(SOP)和决策规则转化为持续工作、改进并保留组织知识的数字员工,而非传统聊天机器人。项目代码已发布于GitHub。

    推荐理由:OpenBMB 开源了一个把组织经验、SOP 和决策规则变成持续运行的「数字员工」平台,不是又一层聊天机器人皮,做企业 AI 落地的可以看看。

  5. 公众号:百度智能云(文心)67

    秒哒 3.5 全球首发 iOS App,无代码开发与多端共享后端能力升级

    百度智能云在 WAIC2026 发布秒哒 3.5,新增 iOS 打包能力,用户无需 Mac 或 Xcode 即可将应用打包为 IPA 文件或上架 App Store。3.5 版本还内置 SEO Agent 实现搜索优化自动化,支持多应用共享同一后端数据库,并推出数据库多环境隔离与后端资源分级功能。秒哒累计服务超 3500 万用户,已创造 350 万个商业应用。

    推荐理由:秒哒3.5把无代码开发推到了iOS端,一键打包、多端共享后端这些能力对非技术创业者是真降门槛。但百度生态外的吸引力有限,适合已有秒哒应用的人直接升级。

  6. The Verge:AI(RSS)78

    欧盟裁定 Google 必须向竞争对手开放 Android 和 Search,影响 Gemini 等 AI 服务

    欧盟依据《数字市场法案》(DMA)裁定 Google 必须向竞争对手开放 Android 和 Google Search 的关键部分,包括允许第三方 AI 助手和搜索引擎获得更大访问权限。这两项决定可能削弱 Google 对两大核心平台的控制,并为其 AI 工具 Gemini 的未来格局带来深远影响,同时为竞争对手创造新的发展机会。

    推荐理由:欧盟这两项裁决直接撬开了谷歌安卓和搜索的围墙,对Gemini等AI助手的地位是实质冲击,做AI应用和搜索的创业者值得盯着后续执行细节。

  7. 公众号:小红书技术(dots.llm)77

    HYPIC:小红书联合北大、上交提出首个混合注意力大模型位置无关缓存系统

    HYPIC 在混合注意力大模型上实现了位置无关缓存,将首 token 延迟平均降低 3.25 倍。在 4 个生产级模型上,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。

    推荐理由:混合注意力模型终于有了可用的位置无关缓存方案,HYPIC 用转移算子缓存和缝合窗口解决了长期兼容难题,对长上下文推理服务的加速意义重大,做推理 infra 的团队可以马上看论文和代码。

  8. 公众号:小红书技术(dots.llm)75

    小红书联合北大、上交提出 HYPIC,让混合注意力大模型用上位置无关缓存,首 token 延迟降 3.25 倍

    小红书联合北大、上交提出 HYPIC,这是首个在混合注意力大模型上实现位置无关缓存的服务系统。在 4 个生产级混合注意力模型、5 个工作负载上,HYPIC 将首 token 延迟(TTFT)平均降低 3.25 倍,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。该系统通过缓存段累积转移算子实现线性层常数时间状态组合,并用缝合窗口修复全注意力层跨段对齐。

    推荐理由:此前位置无关缓存无法用于混合注意力模型,HYPIC 通过缓存转移算子与缝合窗口首次实现,RAG 场景 TTFT 降低 3.25 倍,开源代码为推理系统提供了可复用的加速路径。

  9. Google Developers Blog(RSS)60

    Gemini Enterprise Agent Platform 新增 Parallel Web Search 网络接地提供商

    Google Cloud 与 Parallel Web Systems 合作,将 Parallel 的搜索基础设施作为新的网络接地提供商原生集成到 Gemini Enterprise Agent Platform 中。该集成使开发者能将 AI 智能体锚定在可验证的实时网络结果上,以提升企业工作流的事实准确性。用户还可编程提取、永久缓存并与其他大语言模型一起处理网络数据。

    推荐理由:为 Gemini Agent 平台引入第三方搜索 grounding,企业开发者多了一个直接可用的实时事实核查选项,虽非重大突破,但对做合规和知识库场景的团队是个实用更新。

  10. IT之家(RSS)78

    台积电上调2026年资本支出预测至600~640亿美元,A14制程进展顺利

    台积电在2026Q2财报说明会上将2026年资本支出预测上调至600~640亿美元,此前预测接近560亿美元。董事长魏哲家表示,预计2028年量产的A14制程(1.4nm)开发进展顺利,移动和HPC客户兴趣强烈,将成为比2nm更大、更持久的工艺。台积电预计2026Q3合并营收446~458亿美元,2026全年美元收入增幅将超过40%。

    推荐理由:台积电这次资本支出上调不是财务数字游戏,而是直接宣告了AI算力在未来三年的供给曲线,做AI硬件的同行和投资人必须正视这轮扩产。

  11. MarkTechPost(RSS)72

    Patter SDK 教程:构建餐厅预订电话智能体,支持动态变量、护栏、延迟仪表盘与评估检查

    Patter SDK 发布教程,演示如何构建一个餐厅预订场景的语音智能体工作流。该流程支持动态调用变量、注册可调用工具、应用输出护栏(如PII脱敏、脏话过滤、话题范围限制),并可在无需实时电话凭证的情况下运行脚本化通话模拟。教程还涵盖延迟与成本指标追踪、回归式评估检查,以及将智能体逻辑、工具调用、安全检查和通话模拟整合为单一结构化管线。

    推荐理由:这个教程把 Patter SDK 的语音代理从模拟到部署跑了一遍,代码能直接抄,想上手电话 AI 的开发者可以当样板,不过工具本身还比较新,生态有待验证。

  12. 公众号:千问APP(阿里)61

    千问APP联合武汉发布举办AI求职实战课,演示简历诊断与办公自动化

    千问APP与武汉发布在武汉举办AI求职实战课,现场演示了用千问进行简历诊断、PPT制作和表格分析。产品经理提出“给全材料、说明目标、定义标准、划定边界、索要可编辑文件”五步法,并展示了将486行杂乱销售数据浓缩为一页结论PPT的“建、理、算、析、呈”方法论。

    推荐理由:千问官方出的这套办公Prompt,从简历诊断到PPT救场再到经营数据清洗,方法论清晰可套用,求职者和日常办公的人可以直接拿来用,比泛泛的教程实在。

  13. 公众号:千问APP(阿里)64

    千问APP联合武汉发布办AI求职实战课,演示简历诊断、PPT制作与表格分析

    千问APP与武汉发布联合承办AI求职实战课,现场演示AI在简历诊断、商业报告撰写、销售表分析等场景的应用。产品经理金师兴提出“给全材料、说明目标、定义标准、划定边界、索要可编辑文件”五步法,并给出分步骤提示词生成Word简历;另一产品经理透镜演示用千问紧急制作PPT。表格分析环节通过虚构茶饮店案例,展示“建、理、算、析、呈”方法论,将486行杂乱数据浓缩为一页结论清晰的PPT。

    推荐理由:将AI辅助办公拆解为简历诊断、PPT救场和表格分析三步,配套可直接复用的提示词模板,为嵌入日常任务提供了更清晰的操作路径。

  14. 公众号:昆仑万维(天工)68

    天工短剧工作台发布“Agent智能分镜+无限画布”双轨创作模式

    天工短剧工作台推出双轨创作模式,通过导演Agent自动解析剧本、规划站位与机位,并支持多视细节图生成,解决AI短剧角色变脸和站位漂移问题。该工具内置影视级提示词模板、720°全景图及3D导演台,实现可控生产。已有三部作品上线DramaWave 7天实现百万美元级营收。

    推荐理由:天工短剧工作台把导演思维实打实地做进了产品,站位置图和3D导演台专门根治角色乱变脸的痼疾,是短剧工具从随机抽卡迈向可控生产的关键一步,创作者值得细看。

  15. 公众号:昆仑万维(天工)66

    天工短剧工作台推出“Agent智能分镜+无限画布”双轨创作模式,告别AI短剧“随机抽卡”

    天工短剧工作台(SkyProduction)推出“Agent智能分镜+无限画布”双轨创作模式,将导演思维拆解为六个可干预环节,通过站位图锁定和多视细节图生成解决角色漂移、变脸问题。该工作台支持720°全景图、3D导演台、多账号分级管理及数据中心,并原生支持英文短剧全流程处理。其三部精品短剧上线DramaWave仅7天,均实现百万美元级营收。

    推荐理由:天工短剧工作台把导演思维拆解成可干预的站位、光影和调度环节,降低了从单镜头到连续叙事的落差,适合需要稳定产出精品短剧的团队。

  16. 公众号:MiniMax(稀宇科技)66

    MiniMax Code 2.0 桌面端焕新:底层架构全面升级,金融模块即将上线

    MiniMax Code 2.0 桌面端发布,基于 Pi Agent 框架重构底层架构,显著提升会话启动速度与长程复杂任务的执行稳定性。新版本优化了图表加载与文件预览框选编辑功能,并已与恒生金融数据库、企查查 MCP 打通,金融模块即将上线,支持多源数据实时检索与专业报告生成。桌面端现已开放下载,本月还将上线远程控制、浏览器操控等功能。

    推荐理由:MiniMax Code 2.0 把底层推倒重来,金融模块直接打通恒生和企查查,从写代码变成能出分析报告,做二级市场的可以认真看看。

  17. Simon Willison 博客72

    xAI 开源 Grok CLI 代码库中发现 Mermaid 转 Unicode 框图工具

    xAI 开源的 Grok CLI 编码智能体代码库中包含一个用 Rust 编写的 Mermaid 图表示例终端渲染器 `xai-grok-markdown/src/mermaid.rs`。开发者通过 Claude Code for web (Fable 5) 将其编译为 WebAssembly,实现在浏览器中运行该工具。

    推荐理由:Simon 从 Grok 源码里扒出终端 Mermaid 渲染器,用 Wasm 带到浏览器,生成 Unicode 图,开发者画流程图的轻量选择。