跳到正文

全部动态

今日 42 条
7月9日周四
  1. Google Research80

    Google Research 发布 SensorFM,探索可穿戴健康数据的通用基础模型

    Google Research 介绍 SensorFM,这一 Large Sensor Foundation Model 在五百万名参与者、超过一万亿分钟的多模态可穿戴传感器数据上预训练。

    推荐理由:文章展示了 SensorFM 如何以大规模无标签可穿戴数据学习通用生理表征,并通过多任务评估和 Personal Health Agent 验证其适配价值。

7月8日周三
  1. Mistral AI79

    Mistral AI 发布具身导航模型 Robostral Navigate

    Mistral AI 发布 Robostral Navigate,这是一个 8B 具身导航模型,仅使用单个 RGB 摄像头和自然语言指令控制机器人移动。在未见过的 R2R-CE 验证环境中成功率为 76.6%,比最佳单摄像头方案高 9.7 个百分点,比使用深度或多摄像头的最佳系统高 4.5 个百分点。

    推荐理由:Robostral Navigate 展示了单 RGB 相机与 8B 模型在连续环境导航中的组合方案,并公开了训练数据与方法细节。

  2. Google Research78

    Google Research 通过导航改道实验缓解城市交通拥堵

    Google Research 在10个美国城市开展为期六个月的导航改道实验,通过引导不到2%的出行避开约100个拥堵路段,评估系统性交通改善效果。目标路段车速中位数提高约2%,燃料消耗率中位数下降0.5%至1.0%;受影响路段整体车速中位数提高约0.35%,高峰时段提高0.5%,每个城市每年可能节省数千吨 CO2e。

    推荐理由:研究通过10个美国城市的长期对照实验,量化了少量改道对整体车速、燃耗和排放的系统性影响。

7月7日周二
  1. Berkeley AI Research67

    Berkeley AI Research:近乎免费的智能如何重塑智能体数据系统

    Berkeley AI Research 的文章认为,AI 推理成本快速下降将推动智能体成为数据系统的主要工作负载,并带来三类问题:为智能体设计数据系统、为大规模智能体群构建状态与协作基础设施,以及由智能体合成定制数据系统。文章讨论了 agentic speculation、结构化记忆、多智能体协调与故障处理,以及通过验证智能体和证明系统保障自动生成系统的可靠性。

    推荐理由:文章将智能体数据系统拆成支持智能体、承载智能体和由智能体构建三类问题,为理解多智能体规模化运行的工程瓶颈提供了清晰框架。

  2. Hugging Face Blog80

    Hugging Face Storage 与 SkyPilot 打通跨云 AI 工作负载

    Hugging Face Storage 与 SkyPilot 联合推出 `hf://` 存储后端,让模型、数据集和 Bucket 可挂载到 20+ 云、Kubernetes、Slurm 及本地环境中的 GPU 任务,并免收读取数据的 egress 和 CDN 费用。

    推荐理由:Hugging Face Storage 与 SkyPilot 打通了跨云训练和推理的数据访问,文章同时给出配置方式、费用差异与实测吞吐数据。

  3. Hugging Face Blog87

    Hugging Face 发布 LeRobot v0.6.0,加入世界模型、奖励模型与六项仿真基准

    Hugging Face 发布 LeRobot v0.6.0,新增可在行动前想象未来的 VLA-JEPA、LingBot-VA 和 FastWAM,以及 Robometer、TOPReward 奖励模型 API。

    推荐理由:LeRobot v0.6.0把世界模型、奖励模型、仿真评测与部署回流整合进同一套开源工作流,便于复现实验并持续改进机器人策略。

7月6日周一
  1. Hugging Face Blog79

    PRX Part 4:Photoroom 详解 PRX 的数据策略

    Photoroom 在 PRX 系列第 4 部分介绍了预训练数据管线:混合公共与内部数据集,用 VLM 为图像生成 100–200 词的详细描述,再通过 Lance 构建数据集、用 Mosaic Data Shards 流式训练。

    推荐理由:文章系统拆解了 PRX 7B 预训练数据管线,从数据格式、VLM 重标注到过滤去重,提供了可复用的工程取舍与实测依据。

  2. Hugging Face Blog76

    Hugging Face Kernels 完成重大更新

    Hugging Face 对 Kernels 项目进行了重大更新,新增 Hub 的 kernel 仓库类型,并通过可信发布者、代码签名和可复现构建改进安全性。项目还重构了 kernels 与 kernel-builder 的 CLI,支持 Torch Stable ABI 和 Apache TVM FFI,并为 Agent 构建、基准测试和迭代优化 kernel 提供工作流基础。

    推荐理由:文章集中说明了 Kernels 在安全、框架兼容和 Agent 工作流上的改造,能帮助开发者判断其对自定义 kernel 开发与分发的实际作用。

7月3日周五
7月2日周四
7月1日周三
  1. Berkeley AI Research26

    2026 BAIR 博士毕业生展示

    Berkeley Artificial Intelligence Research(BAIR)公布 2026 届博士毕业生展示,研究覆盖机器人与具身智能、LLM 与推理、计算机视觉、生成模型、AI 安全、人机交互及 AI for science and healthcare 等方向。

  2. Hugging Face Blog72

    ScarfBench 发布企业 Java 框架迁移基准,评估 AI 智能体的构建、部署与行为保持能力

    ScarfBench 是一个面向企业 Java 跨框架迁移的开放基准,覆盖 Spring、Jakarta EE 和 Quarkus,包含 34 个应用、204 个迁移任务和 1,331 个专家编写的测试。

    推荐理由:ScarfBench把企业 Java 框架迁移拆解为构建、部署和行为验证,为比较编码智能体的真实现代化能力提供了可复用基准。

  3. Google Research77

    Google Research 发布覆盖50多个城市的 Heat Resilience 屋顶反射率数据与 Earth Engine App

    Google Research 发布覆盖50多个全球城市的建筑级屋顶反射率数据,并上线 Heat Resilience Earth Engine App,帮助城市规划者识别适合部署凉屋顶的建筑和区域。

    推荐理由:Google Research 将建筑级屋顶反射率数据扩展至50多个城市,并开放 Earth Engine App,为城市规划者定位高优先级降温改造提供了可操作的数据基础。

6月30日周二
  1. Hugging Face Blog45

    为什么专业化不可避免

    优化理论、进化生物学、竞争市场与机器学习共同指向同一结论:在资源有限、目标存在差异时,专注特定任务的系统往往胜过追求全面覆盖的通用系统。Goldfeder、Wyder、LeCun 和 Shwartz-Ziv 的 2026 年研究指出,通用性并非性能优势,真正可行的路径是让系统匹配目标问题。

  2. Google Research82

    Google Research 发布 TabFM 表格数据零样本基础模型

    Google Research 发布 TabFM,一款面向表格数据分类和回归的零样本基础模型,可将训练示例与目标行作为统一上下文,在单次前向计算中生成预测。

    推荐理由:TabFM将表格预测转化为上下文学习任务,并通过合成数据训练与混合注意力架构减少传统建模流程中的调参和特征工程工作。

6月27日周六
6月25日周四
  1. Google Research58

    Google Research 提出线性弹性缓存以优化云成本

    Google Research 提出线性弹性缓存,将页面驱逐建模为滑雪租赁问题,并根据实时工作负载动态调整缓存大小和 TTL。该方法在 Spanner 生产服务器中使内存使用量降低 15.5%,缓存未命中增加 5.5%,总拥有成本降低约 5%,实际 I/O 成本仅增加 0.5%。在公开缓存轨迹上,弹性缓存也持续优于固定大小缓存。

  2. Google Research60

    Google Research 研究推理如何解锁大语言模型中的参数化知识

    Google Research 的论文研究发现,在 Gemini-2.5、Qwen3-32B 等推理模型上,即使面对简单单跳事实问题,生成推理轨迹也能召回关闭推理时难以获得的参数化知识。实验将作用归因于计算缓冲和事实启动,并发现中间推理中的幻觉事实会显著降低最终答案正确率;筛选无幻觉轨迹或通过过程奖励鼓励事实支持的中间步骤可提升准确性。

    推荐理由:研究用受控实验区分了额外计算与事实启动两种机制,并展示中间事实的准确性如何影响最终答案可靠性。

  3. Google DeepMind85

    Google DeepMind 将 computer use 集成至 Gemini 3.5 Flash

    Google DeepMind 宣布 Gemini 3.5 Flash 内置 computer use 工具,可用于构建跨浏览器、移动端和桌面环境执行操作的智能体。开发者和企业可通过 Gemini API 与 Gemini Enterprise Agent Platform 使用该功能,并可启用敏感操作确认和间接提示词注入检测后自动停止等安全措施。

    推荐理由:Gemini 3.5 Flash 将 computer use 纳入内置工具,并配套企业安全措施,展示了构建跨平台智能体时的能力与防护边界。

6月24日周三
  1. Mistral AI75

    Mistral AI 为 Connectors 增加企业连接治理与调试能力

    Mistral AI 为 Connectors 推出多项企业能力,包括按组织或工作区管理连接器及单个工具权限、带 connector scopes 的 API keys、多账户连接器和 Connectors Debugger。

    推荐理由:这次更新覆盖权限治理、自动化身份、多账户连接和故障诊断,较完整地回应了企业部署智能体时的连接管理需求。

6月23日周二
6月17日周三
  1. Google DeepMind75

    Google DeepMind与英国政府测试AI规划工具,目标将申请处理时间缩短50%

    Google DeepMind与英国政府等合作开发基于Gemini的AI规划原型,目标帮助规划人员将住宅规划申请的决策时间缩短50%。工具可整理历史文件、识别相关政策、总结咨询反馈并起草评估报告,但最终决定仍由规划人员作出;英国政府计划在早期试验后于2027年向全国所有地方政府开放。

    推荐理由:Google DeepMind与英国政府共同测试的原型把规划资料整理、政策核对和报告起草串成一套流程,呈现了AI介入公共服务时的人工复核与审计安排。

  2. Google Research77

    Google 发布用于自然恢复的 Earth AI 矢量数据集

    Google 发布一套面向英国自然恢复的矢量化数据集,可识别并分类树篱、石墙和小片林地等细尺度生态特征。该系统基于 Remote Sensing Foundations 的 ViT Backbone,结合亚米级影像和 1 米 LiDAR 数据,并通过 Polsby–Popper 紧致度评分区分林地、木本斑块和线性木本特征。

    推荐理由:Google 将高分辨率栅格地图转为可操作的矢量数据集,展示了 AI 如何把生态特征识别推进到保护规划与碳核算。

6月16日周二
  1. Google DeepMind84

    Google DeepMind 发布 AI Control Roadmap,构建智能体纵深安全防线

    Google DeepMind 发布 AI Control Roadmap,用纵深防御管理内部 AI 智能体,即使模型对齐不完善,也通过权限控制、威胁建模、监测和阻断降低风险。

    推荐理由:文章系统梳理了 Google DeepMind 的 AI Control Roadmap,展示其如何用监测、阻断和分级响应应对智能体对齐不完善带来的风险。

6月13日周六
  1. Google Research74

    Google Research 研究 AI 如何帮助用户理解皮肤状况

    Google Research 汇总两项关于皮肤状况信息工具的研究,考察图像型 AI 如何帮助用户识别病症并判断后续行动。在一项包含 2,345 名参与者的调查中,AI 辅助下的病症命名准确率为 23%,高于标准搜索的 8%,但标准 AI 对下一步行动准确率没有显著提升。

    推荐理由:两项研究分别从大规模调查和真实社区使用出发,展示了图像型 AI 在识别皮肤状况上的帮助及其在下一步医疗决策上的局限。

6月11日周四
  1. Google Research66

    Google Research 提出机器遗忘审计新框架

    Google Research 提出 Regularized f-Divergence Kernel Tests,用于更灵敏地审计差分隐私和机器遗忘。该框架通过相对三样本检验,判断未学习模型更接近安全重训模型还是原始模型,并在 SVT3 隐私机制中用几千个样本检测违规,而既有方法需要 millions 个样本。

    推荐理由:这项工作把机器遗忘审计从简单的两样本比较转向相对三样本检验,并展示了更少样本和更少调参下识别隐私违规的方法。

6月10日周三
  1. Google DeepMind65

    Google DeepMind 联合伙伴启动最高 $10M 的多智能体 AI 安全研究资助

    Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,宣布面向全球研究者、最高 $10M 的多智能体 AI 安全研究资助计划。

    推荐理由:这项资助计划把多智能体安全拆分为测试环境、网络行为、基础设施和监督控制四个研究方向,为相关研究提供了明确的问题框架。

6月9日周二
  1. Google DeepMind87

    Google 发布 Gemini 3.5 Live Translate 语音翻译模型

    Google 发布 Gemini 3.5 Live Translate,可自动识别 70+ 种语言并进行接近实时的语音到语音翻译,同时保留说话者的语调、语速和音高。

    推荐理由:Gemini 3.5 Live Translate 将连续语音翻译、音色节奏保留与多端接入结合,文中也列出开发者、企业和普通用户的使用入口。

  2. Google DeepMind86

    Google DeepMind 发布 Gemma 4 12B 多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款采用统一、无编码器架构的多模态模型,支持原生音频输入,并面向本地 Agent 工作流。模型性能接近 26B MoE,运行所需内存低于其一半,可在 16GB RAM 或统一内存的笔记本上本地运行。

    推荐理由:Gemma 4 12B把原生音频与视觉输入、Agent 工作流和本地运行结合在一起,材料也给出了部署与开发入口。

6月8日周一
  1. Google DeepMind82

    Google DeepMind 发布塞拉利昂 AI 辅助学习试验结果

    Google DeepMind 发布一项在塞拉利昂开展的预注册试验结果,显示 Guided Learning 组数学成绩较对照组提高 +0.258 个标准差。超过 113,000 次互动分析显示,Gemini 在 76% 的消息中提出支架式问题,仅在 2% 的情况下直接给出答案;教师仍负责设计课程、设定目标和组织讨论。

    推荐理由:这项预注册试验提供了 Guided Learning 介入数学学习的量化结果,也呈现了教师参与和学生提问方式变化。

6月5日周五