跳到正文

全部动态

今日 12 条
9月29日周二
  1. Microsoft Research49

    Microsoft Research Asia – Singapore 一周年:推进研究、合作与人才培养以实现现实影响

    Microsoft Research Asia – Singapore 成立一周年,正通过前沿 AI 研究、合作伙伴关系和人才培养,推动研究成果在现实场景中落地。实验室聚焦下一代 AI 模型与智能体系统、领域 AI、AI-native 研究实践及生态与人才发展,并已在医疗、金融、教育和科技等领域开展合作。

  2. AWS Machine Learning Blog75

    AWS 上线 Claude Sonnet 5.5

    AWS 宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 AWS 上的 Claude Platform 提供。该模型面向范围明确的编码与知识工作,强调更快速度和大多数任务更低的单任务成本,并支持 AWS 的数据驻留、权限、审计与监控控制。

    推荐理由:文章同时给出 Claude Sonnet 5.5 的适用任务、与 Opus 5.5 的分工及 AWS 上的调用步骤,便于评估部署路径。

  3. AWS Machine Learning Blog73

    AWS 在 SageMaker AI 上使用 vLLM-Omni 部署 Qwen3-TTS 实时语音应用

    AWS 介绍如何在 SageMaker AI 上使用 AWS vLLM-Omni Deep Learning Container 部署 Qwen3-TTS,通过持久双向连接流式发送文本并接收音频。教程提供仓库、部署脚本和 Gradio 客户端,音频以 24 kHz PCM chunks 返回,并说明 SageMaker 实例池、环境配置、端点调用与资源清理流程。

    推荐理由:文章给出从环境配置到资源清理的完整部署路径,并说明双向流式连接与实例池配置,便于复现实时语音输出方案。

9月28日周一
  1. Mistral AI73

    Mistral 在慕尼黑开设德国中心,推进欧洲工业 AI 与 Physics AI

    Mistral 宣布在慕尼黑开设德国中心,组建 Physics AI 和 Industrial AI 研究团队,并为企业伙伴提供应用工程支持。公司称计划到 2030 年建设 1 gigawatt 的欧洲算力,并依托 open-weight 架构支持客户在自有基础设施上运行模型。

    推荐理由:Mistral 将德国据点、Physics AI 研发和本地算力主权结合起来,呈现其切入欧洲工业场景的具体路径。

  2. Hugging Face Blog84

    Holo4 发布,面向通用计算机操作智能体

    Holo4 发布 27B dense 和 35B-A3B MoE 两种规格,可通过 GUI、代码、MCP 和 API 操作软件,并在 H Models API 提供服务。Holo4 27B 在 OSWorld 2.0 上得分 61.7%,35B-A3B 得分 30.9%;官方同时发布 Holotron4 Nano、模型权重、训练轨迹和评测成本信息。

    推荐理由:Holo4把 GUI、代码、MCP 和 API 操作整合到同一模型中,并公开轨迹与成本对比,便于评估其在真实工作流中的适用范围。

9月26日周六
  1. GitHub Blog · AI & ML69

    GitHub Copilot 如何用 canvases 构建自定义工作流

    GitHub Copilot app 支持通过 `/create-canvas` skill 用自然语言创建可定制的 canvas,无需手动编写代码或设计界面。用户和 Agent 可以同时操作共享界面,创建看板、发布清单、问题分流板等工作流,并将其保存为团队共享或个人使用的 extension。

    推荐理由:文章以具体命令演示如何用自然语言创建并迭代 canvas,说明用户与 Agent 可共享状态并协作更新工作流。

9月25日周五
  1. GitHub Blog · AI & ML74

    GitHub Copilot 如何用 canvases 构建聊天之外的交互界面

    GitHub Copilot 介绍 canvases,这类运行在应用内的全栈应用可与智能体双向通信,用于构建 Connect 4、管理本地 Winget 软件包和操作 SQLite 数据库。文章还展示了 canvas 如何支持研究、原型、实现和迭代等开发流程自动化,减少用户持续停留在聊天界面的需要。

    推荐理由:文章通过 Connect 4、SQLite 和开发工作流案例,说明可定制界面如何让 GitHub Copilot 智能体承担更适合自动化的任务。

  2. Google Research78

    Google Research 介绍用于连贯长视频生成的多智能体框架

    Google Research 介绍了一套基于 Gemini 和 Veo 的 AI 视频联合导演多智能体框架,用于自动规划多镜头叙事并减少角色、场景和物体状态漂移。框架包含 Co-Director、CANVAS、A²RD 和 VQQA,分别覆盖创意编排、视觉连续性、分钟级视频生成和闭环提示词优化,并在多个视频基准上报告了质量与一致性提升。

    推荐理由:Google 将长视频生成拆解为创意编排、视觉记忆、时间扩展和闭环优化四个环节,展示了缓解跨镜头一致性问题的系统化路径。

  3. GitHub Blog · AI & ML83

    GitHub Security Lab 发布 Fuzzing Taskflow 自动化 C/C++ 模糊测试

    GitHub Security Lab 发布基于 Taskflow Agent 的 Fuzzing Taskflow,面向 C/C++ 项目自动识别入口、分析构建系统、编写 harness、运行 AFL++、迭代覆盖率并整理崩溃报告。

    推荐理由:文章拆解了从建 harness、覆盖率反馈到崩溃归因的自动化链路,也明确说明了主机执行和模型判断带来的安全边界。

  4. Google DeepMind83

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时语音对话结合,生成具备唇形同步、表情和连续对话能力的动态视觉化身。该功能支持异步工具调用、97 种语言间切换,并已在 Gemini Enterprise 提供;自定义化身目前仅通过企业 allowlisting 开放,所有输出均带有 SynthID 水印。

    推荐理由:Google DeepMind 展示了 Live Avatar 在实时对话、异步工具调用、多语言同步和品牌定制上的企业应用方式。

9月24日周四
  1. GitHub Blog · AI & ML82

    GitHub Copilot 重构超大 Pull Request 的渲染体验

    GitHub Copilot 重构了 Pull Request 视图,使包含 2,200 个文件、超过一百万行变更和 400 多条行内评论的大型变更仍能流畅打开和滚动。文章介绍了将确定性代码几何与动态评论块分离、按需测量高度、保持滚动锚定,以及通过缓存和后台处理优化数据管线的方法;团队还使用真实运行信号和自动化测试持续定位性能问题。

    推荐理由:文章拆解了 GitHub Copilot 如何处理超大 Pull Request 的虚拟化、动态测量与滚动锚定,为构建高性能代码审查界面提供了可迁移的工程方法。

  2. Microsoft Research79

    Microsoft Research 为 Physical AI Toolchain 增加机器人推理卸载能力

    Microsoft Research 宣布 Physical AI Toolchain 新增面向机器人的物理 AI 推理卸载能力,可将推理部署到机器人、边缘 GPU 或云端。研究显示,卸载推理能够提升移动操作任务的成功率、响应速度和电池续航,并支持运行更大的 AI 模型。该工具集基于 Kubernetes,支持容器化、自动卸载和分布式编排,并提供 SO-101 与 UR10e 的示例项目。

    推荐理由:文章以移动操作任务的测量结果说明推理卸载对成功率、响应、续航和模型规模的影响,并介绍了基于 Kubernetes 的部署工具。

  3. Google DeepMind85

    Google DeepMind 更新 Private AI Compute,支持私有的跨设备持久记忆

    Google DeepMind 发布 Private AI Compute 技术更新,引入服务器端持久记忆,让 AI 可在设备间保留上下文,同时维持端侧隐私标准。用户数据存放在加密存储中,解密密钥仅由个人设备持有,云端通过硬件强制的安全隔离环境临时处理数据。Google DeepMind 还发布更新后的技术白皮书、服务器软件的防篡改公开记录,并提供独立网络安全审计结果。

    推荐理由:文章具体说明了云端持久记忆如何结合设备密钥、加密通道与安全隔离环境,在跨设备连续体验和隐私控制之间取得平衡。

9月23日周三
  1. Google DeepMind83

    Google 发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS

    Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,用于生成可定制的角色声音、逐句指导场景对白和大规模语音内容。

    推荐理由:两款模型分别覆盖创意驱动与高量低成本语音生成,并提供声音定制、逐句导演和同意验证,展示了语音模型面向生产应用的能力边界。

9月22日周二
  1. NVIDIA Blog80

    NVIDIA Isaac ROS 5.0 推出智能体工作流并支持 ROS Lyrical

    NVIDIA 发布 Isaac ROS 5.0,为基于 ROS 的机器人开发加入智能体工作流,并支持 ROS Lyrical 和 Ubuntu 24.04。新版提供用于设置、操作和 FoundationStereo 微调的技能,以及 agent-ready 文档和 FoundationPose 推理库,后者可将物体位姿感知与跟踪速度提升至 5.5x。

    推荐理由:Isaac ROS 5.0把智能体工作流、ROS Lyrical支持和Jetson部署整合到开源机器人开发中,呈现了从模型适配到实体运行的完整路径。

  2. Hugging Face Blog60

    oMLX 创作者 Jun Kim 加入 Hugging Face 支持 MLX 社区

    oMLX 创作者兼维护者 Jun Kim 加入 Hugging Face,继续领导该项目并获得稳定维护与资金支持。oMLX 将保持 Apache 2.0 许可,Hugging Face 计划以其作为新想法的测试平台,并推动 transformers 模型定义更快转为可供不同引擎使用的 MLX 实现。

    推荐理由:Hugging Face 对 oMLX 的维护支持将 MLX 生态中的个人项目纳入长期投入,并明确了模型定义向 MLX 实现迁移的协作方向。

  3. Hugging Face Blog83

    Hugging Face Transformers 支持运行 llama.cpp GGUF 模型

    Hugging Face 为 transformers 增加 GGUF 模型支持,用户可从 Hub 加载量化 checkpoint,并通过熟悉的 Python、PyTorch 和 transformers API 在 Apple Silicon Mac 上进行本地推理。

    推荐理由:Hugging Face 将 GGUF 与 transformers API 结合,并给出 Apple Silicon 上的安装、调用和基准细节,便于开发者评估本地部署方案。

  4. NVIDIA Blog43

    NVIDIA:大规模部署 Physical AI 需要覆盖每一层的安全保障

    NVIDIA指出,Physical AI从研究走向规模化部署后,自动驾驶汽车和机器人必须在硬件、软件、AI行为、运行环境及全生命周期建立安全保障,而非部署前一次性检查。NVIDIA Halos提供覆盖设计、验证与部署的全栈安全系统,支持自动驾驶和机器人开发,并结合仿真、合成数据与真实世界验证。

  5. NVIDIA Blog45

    从赋能到执行,埃及 AI 生态迈向生产规模

    NVIDIA 表示,埃及 AI 生态正从“潜力”走向生产规模,覆盖开发者、研究人员、初创企业和企业。NVIDIA Deep Learning Institute 在埃及的学习者数量一年增长逾十倍;非洲一年内已有 4 座 AI 工厂宣布或上线,另有 656 megawatts capacity 在建设中。NVIDIA 已在非洲培训超过 85,000 名开发者。

9月21日周一
  1. Microsoft Research74

    Microsoft Research 发布 RetroChimera 合成预测模型

    Microsoft Research 发布 RetroChimera,用于从目标分子反向预测合成路线。该模型结合 Transformer 模型 R-SMILES 2 与图神经网络模型 NeuralLoc,通过学习排序整合两者预测;在十个具有挑战性的目标上成功完成九个多步路线,优于文中列出的其他模型。

    推荐理由:文章同时介绍了 RetroChimera 的集成架构、专家盲测结果和开源入口,便于了解其在稀有反应与多步合成规划中的实际表现。

  2. NVIDIA Blog43

    AI 安全是工程问题:如何覆盖智能体技术栈的每一层

    AI 智能体安全需要在模型、工具编排和运行时等每一层设置可执行边界,由明确负责人管理,并用受保护的日志和可重复测试验证防护有效。NVIDIA OpenShell 是开源安全运行时,可在智能体无法干预的范围外执行策略并提供沙箱;Open Secure AI Alliance 合作伙伴正围绕其扩展治理、技能扫描与策略控制。

9月19日周六
  1. Google Research65

    Google Research 发布 MilleMiglia 中程物流实例生成器

    Google Research 介绍 MilleMiglia,这是一个用 C++ 编写的中程物流实例生成器,可创建包含固定车辆时刻表、配送中心吞吐限制和复杂同步约束的现实基准数据。它通过空间分布、需求和车辆班次等统计分布生成隐私保护的合成网络,覆盖从小型测试到洲际规模实例,并可用于训练 ML 算法。项目代码和文档已在 GitHub 开源,Google 及学术合作伙伴还在开发专用求解器和 API。

    推荐理由:文章解释了中程物流为何难以套用传统 VRP,并展示 MilleMiglia 如何用隐私保护的合成数据支持统一基准与后续求解器研究。

9月18日周五
  1. Google Research74

    Google Research 研究生成式 UI 如何帮助教师创建互动学习内容

    Google Research 发布一项研究实验,利用面向学习优化的生成式 UI,帮助教师按课程目标创建定制的互动教育模拟。研究同时发布了 30 多个英文 STEM 学习互动内容,涵盖物理、化学、生物和数学,并由教师审核。实验包含迭代式生成、自我纠错和 Agent 式自动评估;一项涉及 12 名美国教师的初步研究中,互动内容质量平均评分为 8/10。

    推荐理由:Google 以教师审核和教学护栏为核心,展示了 GenUI 如何生成可定制的 STEM 互动练习及其早期教师反馈。

9月17日周四
  1. GitHub Blog · AI & ML91

    GitHub Copilot 将智能体运行时迁移为 800,000 多行 Rust

    GitHub 将 GitHub Copilot 的智能体运行时从 TypeScript、Node.js 和 V8 重写为超过 800,000 行生产 Rust 代码,主要由 AI 智能体完成,并通过 128 个拉取请求逐步合入。

    推荐理由:文章以 GitHub Copilot 运行时迁移为案例,具体展示了增量重写、并行智能体协作和人工质量把关如何共同支撑大型工程改造。

9月16日周三
  1. NVIDIA Blog63

    Emerald AI、Google与NVIDIA成立联盟推动灵活用电的AI数据中心

    Emerald AI、Google与NVIDIA宣布成立AI Energy Management Alliance(AEMA),推动可根据电网状况动态调整用电的AI数据中心。联盟提出技术中立、以性能为基础的要求,涵盖响应速度、持续时间、可预测性、应急行为、技术标准和运营数据共享,并计划与公用事业及电网运营商合作,探索更快的AI基础设施并网路径。

    推荐理由:文章介绍了AEMA面向AI数据中心的性能化灵活用电框架,涵盖响应指标、互联成本和电网协作,为理解AI基础设施扩张中的电力约束提供了具体背景。

  2. Mistral AI71

    Mistral AI 与 Mozilla 合作,将开放模型接入 Firefox Smart Window

    Mistral AI 宣布与 Mozilla 合作,由 Mistral 模型为 Firefox Smart Window(beta)提供支持,帮助用户理解复杂搜索、找回浏览记录中的重要内容,并根据浏览器标签页整理信息。该功能将先面向法国和北美用户,英国和德国预计于今年晚些时候跟进;对话默认不会保存到 Mozilla 服务器,Mistral 等合作方同意零数据保留。

    推荐理由:Mistral AI 与 Mozilla 将开放模型接入 Firefox Smart Window,材料同时交代了地区范围、隐私机制和本地化语言方向。

  3. Google Research70

    Google Research 提出 Retrieve-for-Train,用扩散模型加速复杂 AI 搜索

    Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train,通过离线 RL 生成监督数据,再将集合级检索行为蒸馏到 53.9M 参数的扩散模型中。该模型可在单次非自回归推理中生成完整目标嵌入集合,相比自回归方法实现 12 到 20 倍加速,并在时延规模扩大时保持亚秒至数秒响应。

    推荐理由:论文展示了如何把离线 RL 学到的集合级检索行为蒸馏进扩散模型,以降低复杂搜索的推理延迟并减少人工标注依赖。