最新精选
第 121–140 条 · 共 697 条- NVIDIA Blog(RSS)精选AI 评分6262
NVIDIA 在 FMS 大会上宣布开源 cuFile API 及底层存储软件栈,让 GPU 可直接读写存储,访问延迟降至微秒级。其 Vera CPU 在两级压缩与加密流水线中吞吐量比 x86 CPU 最高提升 3.21 倍,并联合 40 多家厂商推出 Storage-Next 计划。
推荐理由:cuFile 开源让 GPU 直存访问成为可跨平台协作的开放标准,这会改变 AI 基础设施团队评估存储架构的方式,不再只绑定单一厂商的实现。
- NVIDIA Blog(RSS)精选AI 评分6868
NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。
推荐理由:开放商业许可与可解释推理输出结合,自动驾驶团队能直接审查模型决策链,为安全验证提供透明度,降低从研发到商用部署的转换成本。
- Mistral AI:News(网页)精选AI 评分6363
Mistral 发布 3B 开源权重多模态安全分类器 Shieldstral,以 Apache 2.0 协议开放下载。它把内容审核建模为政策自适应问答任务,推理时用自然语言问题传入政策即可返回校准的安全分数,无需重训练,统一覆盖文本、图像及 prompt-response 对的审核、拒答检测和毒性检测。
推荐理由:原文给出了把内容审核改为推理时自适应问答的方法、数据构建思路和基准表现,适合想自建安全审核方案的开发者参考。
- Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7676
一个开源仓库提供了在单颗 AMD MI300X 上生产运行 DeepSeek-V4-Flash-0731 的完整配置与补丁,无需额外量化或权重卸载。该 304B 参数模型在 192 GB HBM 上实现单流 168.6 tok/s 解码、8 并发流 542 tok/s 聚合吞吐,并验证了 256K 上下文。
推荐理由:为 MI300X 提供了可部署的生产栈,包含 FP8 格式修复、推测解码优化和混合 KV 缓存策略,单卡就能服务 256K 上下文。
- MarkTechPost(RSS)精选AI 评分7979
Reflex AI 发布 Apache-2.0 许可的 Python 交互式 2D 绘图库 XY,通过 Rust 原生核心、二进制缓冲传输和 WebGL2 渲染,在 1 万至 1 亿点范围内保持约 0.08 秒的渲染时间。
推荐理由:通过Rust核心和二进制输出,XY将千万级点的交互渲染稳定在0.08秒,并让HTML导出体积从259 MiB缩至258 KiB,这对金融、基因组学等需原始数据钻取的大数据场景有直接落地价值。
- Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分8181
Swiftlet 是一个 Swift + Metal 运行时,可在普通 Apple 设备上运行 Qwen3-Next 和 Qwen3.5/3.6 MoE 混合模型,仅将小型稠密核心驻留内存,按需从存储流式加载路由专家权重。
推荐理由:用流式专家加载把 80B 模型塞进手机,具体 RAM 和速度数字让开发者能直接判断自己设备的上限,而不是停留在商详口号。
- 公众号:面壁智能(MiniCPM)精选AI 评分7878
面壁智能联合 OpenBMB 开源全球首个支持 Stencil 自动研究、自动部署的 AI 优化系统 ForgeStencil,由 Kernel Agent 与 App Agent 闭环协作,实现从算子优化到应用集成的全自动流程。
推荐理由:ForgeStencil 把决定工业软件效率的 Stencil 优化从专家手工调教变成 AI 自动闭环,开源后多个行业的真实应用可直接复用其加速实现。
Microsoft Research@MSFTResearch精选AI 评分6565Orchard 是一个面向研究社区的开源框架,用于跨任务类型训练和评估 AI 智能体。它降低了复杂性,同时通过让研究人员复用同一套基础设施,支持较小模型也能实现强劲性能。https://msft.it/6019a8fqP
推荐理由:框架将 agent 训练评估所需基础设施统一,降低重复工程成本,尤其适合资源有限但需要强性能 agent 的研究场景,但本次发布未给出具体性能基准,尚需实际验证。
- Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7676
AirLLM 项目支持在单块 4GB 显存 GPU 上运行 70B 参数大模型推理,无需多卡或大规模显存配置。该项目已开源,相关讨论在 Hacker News 上获得 103 点热度,引发社区关注。
推荐理由:将 70B 模型推理压缩到 4GB 显存,让不带专用显卡的开发者也能本地测试大模型,但实际推理速度和质量仍需根据用例评估。
- Microsoft Research 博客(RSS)精选AI 评分8282
微软研究院发布开源框架 Orchard,旨在解决智能体(Agent)研究中的基础设施瓶颈。核心组件 Orchard Env 提供可复用的 Kubernetes 环境服务,支持在 Codex、OpenClaw 等真实部署环境中直接训练和评估智能体。项目发布了针对软件工程、网页导航和个人助手的三个训练配方及数据。其中,仅约 30 亿活跃参数的 Orchard-SWE 模型在 SWE-bench Verified 基准上达到 69.7%(结合价值模型重排序可达 73.0%),性能接近参数量大 10 倍的前沿系统,展示了小模型在复杂现实任务中的潜力。
推荐理由:微软开源了完整的智能体训练与评估基础设施,并证明了小参数模型通过特定训练策略可在高难度代码修复基准上逼近前沿大模型,对降低 Agent 研发门槛有重要参考价值。
- Liquid AI 模型与工程博客(网页)精选AI 评分7070
Liquid AI 发布 LFM2.5-2.6B,一个可完全在设备端运行的 2.6B 参数智能体模型,预训练约 34T tokens,词表扩展至 128K,Base 和 post-trained 权重已在 Hugging Face 开放。
推荐理由:原文给出了训练流程、基准对比和 CPU/GPU 吞吐数字,读者可以据此评估端侧智能体部署的可行性与取舍。
- MiniMax:Blog(网页)精选AI 评分7878
MiniMax 正式推出全能多模态生成模型 H3,可联合理解文本、图像、视频和音频,生成最高 2K 分辨率、15 秒时长且带原生立体声的视频。H3 在指令跟随、文字与品牌呈现、V2V 动作迁移上表现突出,2K 下每秒价格低于主流模型三分之一,768p 下低于主流 720p 价格一半。官方计划近日开源模型权重,以支持开源社区并加速硬件兼容。
推荐理由:MiniMax H3 把全模态生成打到了 2K 分辨率且价格不到主流三分之一,还计划开源权重,这对闭源视频模型是实打实的压力,开发者可以重点关注。
- Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7878
一项受控实验表明,用深度审查的中国模型 DeepSeek V4 Flash 的输出训练美国模型 GPT-OSS-120B,可显著提升其金融推理能力,但审查行为并未迁移。
推荐理由:CTGT 这个实验设计得很聪明,用匹配对和四家实验室裁判,直接回应了蒸馏会不会传审查的争论。自蒸馏效果一样好,开源模型和评估集让结论可复现,对中国开源模型使用者是个重要信号。
腾讯混元上周推出的科研智能体 Hyra,基于本月开源的 Hy3 模型(总参数 295B、激活参数 21B),为加法组合学中悬置半个多世纪的开放问题给出完整答案,证明 2 是该问题指数的上确界。Hyra 先在有限搜索中将最好结果从约 1.14 提高到 1.21,经约 24 小时运行提出核心构造思路,并给出 Lean 4 形式化证明。论文预印本、显式构造和形式化证明均已公开。
推荐理由:构造不再依赖暴力搜索,而是从数学结构入手自主推理,同时给出可形式化证明,让AI在定理型科学问题上从辅助工具转向共同研究者。
- 公众号:数字生命卡兹克精选AI 评分6969
MiniMax 发布 AI 视频模型 H3,并宣布开源。该模型主打视觉包装与后期特效,可生成动态 MV、动态海报、Vlog、电影片头、游戏 UI 等,语义遵循能力极强,在广告与动效领域表现优于 Seedance 2.0,但影视级张力镜头稍逊。H3 开源后预计将出现大量垂直领域特化版本。
推荐理由:在 Seedance 统治的前期创作之外,H3 用语义强控制补上了视觉包装与后期特效这块拼图,广告和社媒短片的后期流程可能因此从剪辑软件迁移到提示词。
- Simon Willison 博客精选AI 评分7272
Simon Willison 发布 llm-chat-completions-server 0.1a0 插件,可在本地 9001 端口启动一个兼容 OpenAI Chat Completions API 的服务器,暴露 LLM 工具中所有已安装的模型。
推荐理由:Simon 把 LLM 工具变成了兼容 OpenAI 的 API 服务器,开发者可以本地直接用任何模型,省去适配工作,安装即用,实用性强。
- HuggingFace Daily Papers(社区热门论文)精选AI 评分8080
Zero-Mem 提出零 token 记忆操作,除最终问答外,记忆构建、检索与校准等所有环节均不调用 LLM 或消耗其输入输出 token,仅用编码器计算。该方法保留原始交互轨迹,通过实体-上下文图与时间层级双视图组织证据,在长记忆与长上下文问答基准上达到竞争性表现,并将记忆操作时间成本较最快基线降低 57.6%。代码将在同行评审后公开。
推荐理由:Zero-Mem将记忆操作与LLM完全解耦,通过实体图和时序层级互补检索,在LoCoMo和HotpotQA上全面超越生成式记忆基线,效率提升明显,对Agent记忆系统设计有直接借鉴意义。