跳到正文

全部动态

今日 12 条
7月23日周四
  1. Google Research78

    Google Research 发布 SymptomAI 研究,探索面向日常症状评估的对话式 AI 智能体

    Google Research 介绍 SymptomAI,一组用于日常症状访谈和鉴别诊断的实验性对话式 AI 智能体,并在 n=13,917 的随机研究中与临床专家评估进行比较。

    推荐理由:这项大规模研究把日常症状对话、临床专家评估与 Fitbit 生理信号结合起来,呈现了 SymptomAI 在真实场景中的评估方法与边界。

  2. Google Research83

    Google Research 发表强化学习量子纠错控制研究

    Google Research 在 Nature 发表研究,展示一种利用量子纠错检测事件训练强化学习智能体、在计算持续进行时动态校准控制参数的方法。该方法在 Willow 超导处理器上使逻辑稳定性提高 3.5 倍,并在人工校准后进一步将逻辑错误率降低 20%;数值模拟显示,训练迭代次数与系统规模无关。

    推荐理由:论文展示了强化学习如何利用量子纠错检测事件持续校准控制参数,并用 Willow 实验和大规模模拟检验其稳定性与扩展性。

7月22日周三
7月21日周二
  1. Hugging Face Blog85

    Hugging Face 发布开源机器人操作数据采集系统 Grabette

    Hugging Face 发布开源、低成本的 Grabette,用手持夹爪记录操作示范并自动生成可供机器人训练的 LeRobot 数据集。Grabette 配备两台摄像头、IMU 和夹爪传感器,硬件 BOM 成本约为 490€,数据可通过 Hugging Face Hub 和浏览器端流程处理与分享。

    推荐理由:Grabette把机器人操作示范采集拆成可自制硬件和浏览器处理流程,为构建开放、多样的机器人学习数据集提供了可复用路径。

7月17日周五
7月16日周四
  1. Hugging Face Blog56

    DharmaOCR 对比 Mistral OCR4 与 Unlimited-OCR,展示领域专门化优势

    Hugging Face Blog 介绍 DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 的得分超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。文章将优势归因于面向巴西葡萄牙语的监督微调,以及用于降低文本退化、提升输出稳定性的 DPO 训练;文中还通过 ENEM 手写作文和小字体文档示例说明多语言模型的识别与稳定性问题。

  2. Google DeepMind75

    Google DeepMind 与 Isomorphic Labs 发布生物韧性方案

    Google DeepMind 与 Isomorphic Labs 发布联合生物韧性方案,围绕防止模型被滥用、快速检测疫情和设计医疗应对措施展开。过去 12 个月,双方推进了与政府机构、生物安全组织和研究团队的 15 项以上合作,并计划向可信合作伙伴开放 AI 模型和智能体。

    推荐理由:文章系统说明了 Google DeepMind 与 Isomorphic Labs 如何将 AI 用于生物安全,并将防滥用、疫情检测与医疗响应连接起来。

  3. Hugging Face Blog88

    Hugging Face披露AI智能体驱动的生产基础设施入侵

    Hugging Face披露,其部分生产基础设施此前遭到由自主AI智能体系统端到端驱动的入侵,攻击者通过数据集处理中的两条代码执行路径取得初始访问并横向移动。公司表示,部分内部数据集和服务凭据曾被未授权访问,但尚未发现公开模型、数据集、Spaces或软件供应链遭到篡改;受影响凭据已撤销并轮换,相关节点也已重建。

    推荐理由:Hugging Face披露了AI智能体驱动入侵的入口、影响范围与处置过程,也总结了防守方预先准备本地模型的实践经验。

  4. Hugging Face Blog66

    模型路由并不简单:Hugging Face Blog 解析智能体系统的优化难题

    Hugging Face Blog 介绍其在智能体系统中构建模型路由器的经验,指出路由不应被视为单纯的分类问题,而是要同时优化成本、质量和延迟。

    推荐理由:文章用 AppWorld 实验说明,模型路由的真实成本和延迟受缓存、基础设施及治理约束共同影响,不能只按模型价格或任务难度决策。

7月15日周三
  1. Hugging Face Blog92

    Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small

    Thinking Machines 发布 Inkling 及 Inkling-Small,前者是具备 975B 总参数、41B 激活参数和 1M 上下文窗口的多模态 MoE 模型,可接收图像、文本和音频输入;Inkling-Small 为 276B 总参数、12B 激活参数。

    推荐理由:文章同时给出 Inkling 的多模态架构、部署门槛与推理支持,便于评估其从实验体验走向实际应用的条件。

  2. Hugging Face Blog76

    Hugging Face 发布 Real World VoiceEQ,评估语音 AI 的人类化交互质量

    Hugging Face 发布 Real World VoiceEQ 基准,用于评估语音系统识别、生成和响应语气、情绪、说话人身份及背景信息的能力。该基准覆盖 40 多个语音模型、15+ 个评估维度和 60 多项指标,并基于超过 1 million 条人工评分构建。研究发现,不同模型在技术准确性、情绪理解、对话智能、表现力和鲁棒性上各有侧重,传统基准可能高估真实对话表现,人工听评仍不可替代。

    推荐理由:Real World VoiceEQ 将语音交互拆分为多项能力并引入大规模人工评分,为理解模型在情绪、身份和真实环境中的差异提供了更贴近使用场景的测量框架。

7月13日周一
7月10日周五
7月9日周四
  1. Google Research80

    Google Research 发布 SensorFM,探索可穿戴健康数据的通用基础模型

    Google Research 介绍 SensorFM,这一 Large Sensor Foundation Model 在五百万名参与者、超过一万亿分钟的多模态可穿戴传感器数据上预训练。

    推荐理由:文章展示了 SensorFM 如何以大规模无标签可穿戴数据学习通用生理表征,并通过多任务评估和 Personal Health Agent 验证其适配价值。

7月8日周三
  1. Mistral AI79

    Mistral AI 发布具身导航模型 Robostral Navigate

    Mistral AI 发布 Robostral Navigate,这是一个 8B 具身导航模型,仅使用单个 RGB 摄像头和自然语言指令控制机器人移动。在未见过的 R2R-CE 验证环境中成功率为 76.6%,比最佳单摄像头方案高 9.7 个百分点,比使用深度或多摄像头的最佳系统高 4.5 个百分点。

    推荐理由:Robostral Navigate 展示了单 RGB 相机与 8B 模型在连续环境导航中的组合方案,并公开了训练数据与方法细节。

  2. Google Research78

    Google Research 通过导航改道实验缓解城市交通拥堵

    Google Research 在10个美国城市开展为期六个月的导航改道实验,通过引导不到2%的出行避开约100个拥堵路段,评估系统性交通改善效果。目标路段车速中位数提高约2%,燃料消耗率中位数下降0.5%至1.0%;受影响路段整体车速中位数提高约0.35%,高峰时段提高0.5%,每个城市每年可能节省数千吨 CO2e。

    推荐理由:研究通过10个美国城市的长期对照实验,量化了少量改道对整体车速、燃耗和排放的系统性影响。

7月7日周二
  1. Berkeley AI Research67

    Berkeley AI Research:近乎免费的智能如何重塑智能体数据系统

    Berkeley AI Research 的文章认为,AI 推理成本快速下降将推动智能体成为数据系统的主要工作负载,并带来三类问题:为智能体设计数据系统、为大规模智能体群构建状态与协作基础设施,以及由智能体合成定制数据系统。文章讨论了 agentic speculation、结构化记忆、多智能体协调与故障处理,以及通过验证智能体和证明系统保障自动生成系统的可靠性。

    推荐理由:文章将智能体数据系统拆成支持智能体、承载智能体和由智能体构建三类问题,为理解多智能体规模化运行的工程瓶颈提供了清晰框架。

  2. Hugging Face Blog80

    Hugging Face Storage 与 SkyPilot 打通跨云 AI 工作负载

    Hugging Face Storage 与 SkyPilot 联合推出 `hf://` 存储后端,让模型、数据集和 Bucket 可挂载到 20+ 云、Kubernetes、Slurm 及本地环境中的 GPU 任务,并免收读取数据的 egress 和 CDN 费用。

    推荐理由:Hugging Face Storage 与 SkyPilot 打通了跨云训练和推理的数据访问,文章同时给出配置方式、费用差异与实测吞吐数据。

  3. Hugging Face Blog87

    Hugging Face 发布 LeRobot v0.6.0,加入世界模型、奖励模型与六项仿真基准

    Hugging Face 发布 LeRobot v0.6.0,新增可在行动前想象未来的 VLA-JEPA、LingBot-VA 和 FastWAM,以及 Robometer、TOPReward 奖励模型 API。

    推荐理由:LeRobot v0.6.0把世界模型、奖励模型、仿真评测与部署回流整合进同一套开源工作流,便于复现实验并持续改进机器人策略。

7月6日周一
  1. Hugging Face Blog79

    PRX Part 4:Photoroom 详解 PRX 的数据策略

    Photoroom 在 PRX 系列第 4 部分介绍了预训练数据管线:混合公共与内部数据集,用 VLM 为图像生成 100–200 词的详细描述,再通过 Lance 构建数据集、用 Mosaic Data Shards 流式训练。

    推荐理由:文章系统拆解了 PRX 7B 预训练数据管线,从数据格式、VLM 重标注到过滤去重,提供了可复用的工程取舍与实测依据。

  2. Hugging Face Blog76

    Hugging Face Kernels 完成重大更新

    Hugging Face 对 Kernels 项目进行了重大更新,新增 Hub 的 kernel 仓库类型,并通过可信发布者、代码签名和可复现构建改进安全性。项目还重构了 kernels 与 kernel-builder 的 CLI,支持 Torch Stable ABI 和 Apache TVM FFI,并为 Agent 构建、基准测试和迭代优化 kernel 提供工作流基础。

    推荐理由:文章集中说明了 Kernels 在安全、框架兼容和 Agent 工作流上的改造,能帮助开发者判断其对自定义 kernel 开发与分发的实际作用。

7月3日周五
7月2日周四
7月1日周三
  1. Berkeley AI Research26

    2026 BAIR 博士毕业生展示

    Berkeley Artificial Intelligence Research(BAIR)公布 2026 届博士毕业生展示,研究覆盖机器人与具身智能、LLM 与推理、计算机视觉、生成模型、AI 安全、人机交互及 AI for science and healthcare 等方向。

  2. Hugging Face Blog72

    ScarfBench 发布企业 Java 框架迁移基准,评估 AI 智能体的构建、部署与行为保持能力

    ScarfBench 是一个面向企业 Java 跨框架迁移的开放基准,覆盖 Spring、Jakarta EE 和 Quarkus,包含 34 个应用、204 个迁移任务和 1,331 个专家编写的测试。

    推荐理由:ScarfBench把企业 Java 框架迁移拆解为构建、部署和行为验证,为比较编码智能体的真实现代化能力提供了可复用基准。

  3. Google Research77

    Google Research 发布覆盖50多个城市的 Heat Resilience 屋顶反射率数据与 Earth Engine App

    Google Research 发布覆盖50多个全球城市的建筑级屋顶反射率数据,并上线 Heat Resilience Earth Engine App,帮助城市规划者识别适合部署凉屋顶的建筑和区域。

    推荐理由:Google Research 将建筑级屋顶反射率数据扩展至50多个城市,并开放 Earth Engine App,为城市规划者定位高优先级降温改造提供了可操作的数据基础。

6月30日周二
  1. Hugging Face Blog45

    为什么专业化不可避免

    优化理论、进化生物学、竞争市场与机器学习共同指向同一结论:在资源有限、目标存在差异时,专注特定任务的系统往往胜过追求全面覆盖的通用系统。Goldfeder、Wyder、LeCun 和 Shwartz-Ziv 的 2026 年研究指出,通用性并非性能优势,真正可行的路径是让系统匹配目标问题。

  2. Google Research82

    Google Research 发布 TabFM 表格数据零样本基础模型

    Google Research 发布 TabFM,一款面向表格数据分类和回归的零样本基础模型,可将训练示例与目标行作为统一上下文,在单次前向计算中生成预测。

    推荐理由:TabFM将表格预测转化为上下文学习任务,并通过合成数据训练与混合注意力架构减少传统建模流程中的调参和特征工程工作。

6月27日周六
6月25日周四
  1. Google Research58

    Google Research 提出线性弹性缓存以优化云成本

    Google Research 提出线性弹性缓存,将页面驱逐建模为滑雪租赁问题,并根据实时工作负载动态调整缓存大小和 TTL。该方法在 Spanner 生产服务器中使内存使用量降低 15.5%,缓存未命中增加 5.5%,总拥有成本降低约 5%,实际 I/O 成本仅增加 0.5%。在公开缓存轨迹上,弹性缓存也持续优于固定大小缓存。