跳到正文

#数据/训练

今日 0 条
9月24日周四
9月16日周三
  1. Google Research70

    Google Research 提出 Retrieve-for-Train,用扩散模型加速复杂 AI 搜索

    Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train,通过离线 RL 生成监督数据,再将集合级检索行为蒸馏到 53.9M 参数的扩散模型中。该模型可在单次非自回归推理中生成完整目标嵌入集合,相比自回归方法实现 12 到 20 倍加速,并在时延规模扩大时保持亚秒至数秒响应。

    推荐理由:论文展示了如何把离线 RL 学到的集合级检索行为蒸馏进扩散模型,以降低复杂搜索的推理延迟并减少人工标注依赖。

9月4日周五
  1. Google Research84

    Google Research 发布完整雄性果蝇大脑连接组图谱

    Google Research 与 HHMI Janelia及剑桥等机构合作,发布了雄性果蝇大脑和中枢神经系统的完整连接图谱。该图谱包含超过166,000个神经元和1.25亿个突触连接,是按神经元数量计最大的脑图谱,并可通过 Neuroglancer 查看、探索和下载。研究团队使用计算机和 AI 将电子显微镜图像重建为三维神经结构,图谱经过人类专家标注和校验。

    推荐理由:这项工作展示了 AI 如何协助构建细胞尺度的完整神经连接图,并提供了可视化、探索和下载的数据资源。

9月1日周二
  1. Google Research77

    Google Research 发布 TimesFM-3 多变量时间序列基础模型

    Google Research 发布 TimesFM-3,这是一个原生支持多变量预测的时间序列基础模型,拥有 330 million parameters,并在超过 1 trillion 个时间点上预训练。

    推荐理由:TimesFM-3把多变量输入、已知未来特征与单次推理结合起来,并在三个公开基准上进行比较,便于了解其适用场景与技术取舍。

  2. Microsoft Research76

    Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 病理基础模型

    Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 两款 Apache 2.0 开放权重病理基础模型,分别用于全切片表征学习和从 H&E 预测空间蛋白组。

    推荐理由:两款开放权重模型用蒸馏和轻量编码器降低病理分析成本,并给出不同队列上的性能与资源对比,便于评估其研究用途。

8月28日周五
  1. Google Research82

    Google Research 推出 Planetary Prediction Engine,自动化全球地理预测建模

    Google Research 介绍 Planetary Prediction Engine(PPE),这是 Google Earth AI 旗下的实验性研究能力,可根据自然语言查询自主完成地理数据发现、清理、特征工程、模型训练与评估。

    推荐理由:文章展示了 PPE 如何把地理数据发现、特征构建和模型评估串成自动化流程,并用多个领域的基准结果说明其应用价值。

8月27日周四
  1. Google Research61

    Google Research 发布 GlucoFM,用于连续血糖监测的基础模型

    Google Research 介绍 GlucoFM,一种采用双流设计的自监督连续血糖监测基础模型,用于分离较慢的血糖趋势与短期偏差。模型在四个队列的七项临床预测任务中进行评估,平均 PR-AUC 比同语料预训练的最佳 GluFormer 变体高 5.8 个百分点,并在餐后血糖反应预测中取得最低 MAE。GlucoFM 还展示了跨数据集迁移和少样本适应能力。

    推荐理由:文章系统比较了 GlucoFM 在临床预测、餐后血糖预测、跨队列迁移和少样本适应中的表现,并说明双流设计如何利用 CGM 的多时间尺度信号。

8月12日周三
  1. Google Research79

    Google Research 研究发现,前沿大模型的事实性瓶颈在召回而非编码

    Google Research 发布研究,提出 knowledge profiling 框架和包含 2,150 个事实的 WikiProfile 基准,用于区分大语言模型的事实编码、召回与识别能力。

    推荐理由:研究将事实错误拆分为编码与召回两类,并用 WikiProfile 展示思考机制如何恢复部分已编码但难以直接提取的事实。

8月10日周一
  1. Hugging Face Blog66

    论文提出高效知识蒸馏方法,降低长上下文训练显存与成本

    Multiverse Computing 的论文提出离线 top-K logits 缓存与融合分块 KL loss,使知识蒸馏无需同时驻留 teacher 和 student,并避免构建完整词表与序列的 logits 矩阵。

    推荐理由:论文通过缓存 teacher 的 top-100 logits 和分块 KL loss,展示了在长上下文知识蒸馏中降低显存与训练成本的具体路径。

7月31日周五
  1. Google Research75

    Google Research 发布 Science One Framework,以 Chain-of-Evidence 提升自主科研可验证性

    Google Research 介绍 Science One Framework 和 Chain-of-Evidence(CoE)框架,通过证据链记录研究声明与论文、代码及实验结果的对应关系。

    推荐理由:文章将自主科研系统的可验证性拆解为证据链完整性与正确性,并用统一审计比较了引用、代码和实验分数的一致性。

7月16日周四
7月6日周一
  1. Hugging Face Blog79

    PRX Part 4:Photoroom 详解 PRX 的数据策略

    Photoroom 在 PRX 系列第 4 部分介绍了预训练数据管线:混合公共与内部数据集,用 VLM 为图像生成 100–200 词的详细描述,再通过 Lance 构建数据集、用 Mosaic Data Shards 流式训练。

    推荐理由:文章系统拆解了 PRX 7B 预训练数据管线,从数据格式、VLM 重标注到过滤去重,提供了可复用的工程取舍与实测依据。

6月30日周二
  1. Hugging Face Blog45

    为什么专业化不可避免

    优化理论、进化生物学、竞争市场与机器学习共同指向同一结论:在资源有限、目标存在差异时,专注特定任务的系统往往胜过追求全面覆盖的通用系统。Goldfeder、Wyder、LeCun 和 Shwartz-Ziv 的 2026 年研究指出,通用性并非性能优势,真正可行的路径是让系统匹配目标问题。

  2. Google Research82

    Google Research 发布 TabFM 表格数据零样本基础模型

    Google Research 发布 TabFM,一款面向表格数据分类和回归的零样本基础模型,可将训练示例与目标行作为统一上下文,在单次前向计算中生成预测。

    推荐理由:TabFM将表格预测转化为上下文学习任务,并通过合成数据训练与混合注意力架构减少传统建模流程中的调参和特征工程工作。

6月25日周四
  1. Google Research58

    Google Research 提出线性弹性缓存以优化云成本

    Google Research 提出线性弹性缓存,将页面驱逐建模为滑雪租赁问题,并根据实时工作负载动态调整缓存大小和 TTL。该方法在 Spanner 生产服务器中使内存使用量降低 15.5%,缓存未命中增加 5.5%,总拥有成本降低约 5%,实际 I/O 成本仅增加 0.5%。在公开缓存轨迹上,弹性缓存也持续优于固定大小缓存。

  2. Google Research60

    Google Research 研究推理如何解锁大语言模型中的参数化知识

    Google Research 的论文研究发现,在 Gemini-2.5、Qwen3-32B 等推理模型上,即使面对简单单跳事实问题,生成推理轨迹也能召回关闭推理时难以获得的参数化知识。实验将作用归因于计算缓冲和事实启动,并发现中间推理中的幻觉事实会显著降低最终答案正确率;筛选无幻觉轨迹或通过过程奖励鼓励事实支持的中间步骤可提升准确性。

    推荐理由:研究用受控实验区分了额外计算与事实启动两种机制,并展示中间事实的准确性如何影响最终答案可靠性。

6月17日周三
  1. Google Research77

    Google 发布用于自然恢复的 Earth AI 矢量数据集

    Google 发布一套面向英国自然恢复的矢量化数据集,可识别并分类树篱、石墙和小片林地等细尺度生态特征。该系统基于 Remote Sensing Foundations 的 ViT Backbone,结合亚米级影像和 1 米 LiDAR 数据,并通过 Polsby–Popper 紧致度评分区分林地、木本斑块和线性木本特征。

    推荐理由:Google 将高分辨率栅格地图转为可操作的矢量数据集,展示了 AI 如何把生态特征识别推进到保护规划与碳核算。

6月11日周四
  1. Google Research66

    Google Research 提出机器遗忘审计新框架

    Google Research 提出 Regularized f-Divergence Kernel Tests,用于更灵敏地审计差分隐私和机器遗忘。该框架通过相对三样本检验,判断未学习模型更接近安全重训模型还是原始模型,并在 SVT3 隐私机制中用几千个样本检测违规,而既有方法需要 millions 个样本。

    推荐理由:这项工作把机器遗忘审计从简单的两样本比较转向相对三样本检验,并展示了更少样本和更少调参下识别隐私违规的方法。

5月27日周三
5月16日周六
  1. Google DeepMind78

    Google DeepMind 的 Co-Scientist 从既有药物中发现肝纤维化候选疗法

    Stanford University School of Medicine 的 Gary Peltz 团队使用 Co-Scientist,从既有药物文献中提出三种肝纤维化候选药物,并与两种人工选药一同进行活体人类肝细胞实验。Co-Scientist 选出的三种药物中有两种阻断了纤维化并促进肝细胞再生,其中抗癌药 vorinostat 阻断了 91% 的相关损伤反应。

    推荐理由:研究展示了 Co-Scientist 如何从既有药物文献中筛选候选,并通过人类肝细胞实验验证其发现。

5月2日周六
  1. Google Research43

    Google Research 如何通过全球合作与开放资源推动科学影响力

    Google Research 通过全球合作伙伴关系、开源软件和开放数据推动开放科学,相关资源已服务全球超过250,000名研究人员和开发者。其成果涵盖基因组学、神经科学、地球与大气建模、生物多样性及医疗健康,包括处理250万名个体基因组数据的工具、MedGemma 和 NeuralGCM。 Open Health Stack 已在超过10个国家部署,覆盖超过6500万名受益者。

4月22日周三
4月16日周四
  1. Google Research68

    Google Research 发布 Simula:用机制设计和推理从零构建合成数据集

    Google Research 在 Transactions on Machine Learning Research 发表论文“Reasoning-Driven Synthetic Data Generation and Evaluation”,提出推理优先的 Simula 框架,从第一原则构建无需种子数据的合成数据集。

    推荐理由:文章将合成数据生成重构为机制设计问题,展示如何分别控制覆盖度、多样性、复杂度与质量,为构建专业领域数据集提供可迁移框架。

4月1日周三
3月25日周三
3月13日周五
  1. Berkeley AI Research69

    SPEX 与 ProxySPEX 将 LLM 交互识别扩展至数千个组件

    Berkeley AI Research 介绍 SPEX 和 ProxySPEX,两种通过消融与稀疏恢复识别模型关键交互的算法。ProxySPEX 利用层级结构,在约 10x 更少的消融次数下达到 SPEX 的性能,并被用于特征归因、数据归因和注意力头归因。两者的代码已集成到 SHAP-IQ 仓库。

    推荐理由:文章系统说明 SPEX 与 ProxySPEX 如何用较少的消融识别特征、训练数据和模型组件之间的关键交互,并展示其解释性应用。

3月12日周四
  1. Google Research83

    Google Research推出Groundsource,用Gemini将新闻报道转化为洪水数据

    Google Research推出Groundsource,利用Gemini从80种语言的新闻报道中提取洪水事件,构建覆盖150多个国家、从2000年至今的2.6 million条历史记录。人工复核显示,60%的事件在地点和时间上均准确,82%达到实际分析可用程度;相关数据集已开放,并用于支持最多提前24小时的城市暴洪预测及Google Flood Hub的覆盖扩展。

    推荐理由:Groundsource展示了如何用Gemini从多语言新闻中提取并校验灾害时空信息,为缺乏统一观测体系的洪水研究补充历史数据。

3月7日周六
  1. Google Research79

    Google Research 发布 WAXAL:覆盖27种非洲语言的开放语音资源

    Google Research 发布 WAXAL,这是一个覆盖27种撒哈拉以南非洲语言的开放语音数据集,服务于自动语音识别(ASR)和文本转语音(TTS)。首批资源包含约1,846小时转录自然语音和超过565小时高保真录音,覆盖超过100 million speakers,并以 CC-BY-4.0 许可开放。数据由非洲学术与社区组织参与采集,Google 计划持续扩展语言覆盖范围。

    推荐理由:WAXAL同时覆盖自然语音识别与高保真语音合成数据,并以开放许可面向27种非洲语言,为低资源语音技术研究提供了可复用基础。