跳到正文

全部动态

今日 12 条
9月16日周三
9月12日周六
  1. GitHub Blog · AI & ML81

    GitHub 如何用 GitHub Copilot 将活动运营自动化

    GitHub 日本和韩国市场的营销负责人介绍了如何用 GitHub Copilot、Issues、Labels 和 GitHub Actions,把活动从规划、报名筛选到会后跟进串成自动化流程。流程通过 API 或 CLI 连接外部工具,以 DRY_RUN、测试套件和代码审查降低风险,并用 SKILL.md 描述可复用的会后操作。文章还提醒,定时自动化必须设置明确的失败告警。

    推荐理由:文章展示了如何用 GitHub Issues、Actions、SKILL.md 和 DRY_RUN 把跨工具的活动运营流程自动化,并保留人工审批与代码审查。

9月11日周五
  1. Google Research71

    Google Research 发布 ToolGrad:用文本“梯度”高效生成工具使用数据集

    Google Research 在 ACL 2026 介绍 ToolGrad,通过先生成经验证的 API 工具链、再标注对应用户查询的 answer-first 范式生成工具使用数据。

    推荐理由:ToolGrad 将工具链生成与用户查询标注拆开,并用文本反馈迭代 API 工作流,为降低工具使用数据的生成成本提供了可复用思路。

  2. GitHub Blog · AI & ML68

    GitHub Copilot app 初学者指南:使用 diff、终端和浏览器

    GitHub Copilot app 将 diff、终端和浏览器面板整合在同一处,帮助用户审查 Agent 生成的代码、运行项目并验证界面效果。用户可在 diff 面板接受或评论改动,在终端面板运行命令和 `npm run dev`,再通过浏览器面板测试功能并使用 Pick & Polish 继续调整,完成后直接接受修改并创建 pull request。

    推荐理由:文章把 AI 编码变更的审查、运行和浏览器验证整合为一套流程,适合了解 GitHub Copilot app 如何减少工具切换。

9月10日周四
  1. Mistral AI48

    Cloudera 与 Mistral 合作,为企业数据提供专业化主权智能

    Cloudera 与 Mistral 宣布合作,将 Mistral 模型集成至 Cloudera 混合数据平台,支持企业在公有云、私有云、本地及完全隔离环境中部署推理并保持控制权。企业还可在受控环境中基于专有数据训练定制模型,拥有数据与模型智能;合作面向主权 AI 需求,覆盖数据、算力、运营和模型治理。

  2. Hugging Face Blog86

    Hugging Face 用 Gradio Workflow 重建 AUTOMATIC1111 功能集

    Hugging Face 发布 Workflow1111,用单一 Gradio Workflow 画布重建 AUTOMATIC1111 的大部分功能,包含 11 条媒体管线和 73 个节点,覆盖文生图、图生图、放大、检测、背景移除及图生视频。

    推荐理由:文章以完整案例展示 Gradio Workflow 如何把多种媒体管线组合为可编辑画布,并自动提供 REST 与 MCP 接口,便于迁移到实际应用。

  3. Hugging Face Blog84

    Hugging Face Jobs 如何用 LoRA 实现跨节点 Async GRPO 训练

    Hugging Face 介绍了在分离机器的 Hugging Face Jobs 上运行 AsyncGRPO 的方案:训练端仅将 LoRA adapter 通过 Storage Bucket 同步到 vLLM,并用代理完成鉴权、KV 前缀路由和多副本广播。

    推荐理由:文章给出了跨 Hugging Face Jobs 部署 AsyncGRPO 与 LoRA 的完整方案,并用多轮指标定位瓶颈和优化路径。

9月9日周三
  1. Mistral AI69

    Mistral AI 如何用 AI 智能体现代化复杂遗留代码

    Mistral AI 帮助一家欧洲能源运营商将40,000行Fortran 77迁移到C++,对象是没有测试套件和集中式文档的物理密集型储层模拟器。项目先建立数值一致性校验框架并整理代码文档,再由规划、编码、测试和代码质量审查智能体按模块协作,配合人工审核合并。首个冲刺覆盖300,000行代码中的40,000行,团队总结出先建校验框架、先整理文档,以及采用带人工审核门的结构化工作流三项原则。

    推荐理由:文章以40,000行Fortran 77迁移为例,拆解校验、文档整理和人机协作流程,为复杂遗留代码现代化提供可复用方法。

9月8日周二
  1. Google DeepMind88

    Google DeepMind 发布 AlphaGenome Atlas,预测人类基因组每种单字母 DNA 变化的影响

    Google DeepMind 发布 AlphaGenome Atlas,为人类基因组约 9 billion 个单核苷酸变体预计算分子影响预测,并通过网站、AlphaGenome API 和 Google Antigravity skill 提供访问。

    推荐理由:AlphaGenome Atlas 将约 9 billion 个单核苷酸变体的预测整合为可检索资源,并展示了其在罕见病和群体遗传研究中的应用。

9月5日周六
9月4日周五
  1. GitHub Blog · AI & ML51

    GitHub Copilot app 教程:同时运行多个智能体

    GitHub Copilot app 支持通过独立会话和 Git worktrees 同时运行多个智能体任务,彼此不会干扰。每个会话保留自己的上下文,用户可在会话视图中跟踪进度并切换任务。文章以 tailspin-toys 项目为例,演示并行开发 funded sort、进行无障碍审查和运行测试。

  2. Google Research84

    Google Research 发布完整雄性果蝇大脑连接组图谱

    Google Research 与 HHMI Janelia及剑桥等机构合作,发布了雄性果蝇大脑和中枢神经系统的完整连接图谱。该图谱包含超过166,000个神经元和1.25亿个突触连接,是按神经元数量计最大的脑图谱,并可通过 Neuroglancer 查看、探索和下载。研究团队使用计算机和 AI 将电子显微镜图像重建为三维神经结构,图谱经过人类专家标注和校验。

    推荐理由:这项工作展示了 AI 如何协助构建细胞尺度的完整神经连接图,并提供了可视化、探索和下载的数据资源。

9月3日周四
  1. Google DeepMind87

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 和 Google Research 发布 WeatherNext 3 全球天气模型,使用实时卫星数据每小时生成高分辨率预报。模型可在最高 5-kilometer 分辨率下预测天气变量,并提供 100-meter 风速、云量和太阳辐射等清洁能源相关数据。

    推荐理由:WeatherNext 3 将实时卫星观测、小时级更新和更高空间分辨率结合起来,并延伸到降水与可再生能源预测。

  2. Hugging Face Blog78

    Hugging Face发布NeoMME多模态多语言编码器

    Hugging Face发布NeoMME系列多模态多语言编码器,提供260M和800M两种规模,使用单个双向Transformer处理文本token与原始图像patch,并从零开始训练。

    推荐理由:NeoMME同时展示了单塔多模态编码、视觉文档检索和索引压缩方案,便于比较效率、检索质量与存储成本之间的取舍。

  3. Hugging Face Blog84

    Hugging Face 发布 funes,让编码智能体拥有可迁移的持久记忆

    Hugging Face 发布 funes,为 Claude Code、Codex、pi 和 Hermes 提供基于本地会话轨迹的持久记忆层。funes通过向量与 BM25 搜索、重排序和来源追踪,让智能体可在本机或 Hugging Face 私有数据集中检索原始会话;作者称在 handoff-vs-recall 基准中,recall 的成本分别低至书面交接的 1/8 和 1/4。

    推荐理由:funes把多个编码智能体的会话轨迹转为可检索、可溯源的本地记忆,并支持同步到用户拥有的私有数据集。

  4. Hugging Face Blog80

    Hugging Face 用 TRL 和 OpenEnv 开源复现代码绘制水彩画的训练流程

    Hugging Face Blog 介绍了用 TRL、OpenEnv 和 Qwen/Qwen3.5-35B-A3B 训练代码模型绘制水彩画的完整开源流程。项目公开了参考图池、RL 环境、训练脚本、模型和画廊,并比较了 judge-led、hps-led 与 hps-only 三种奖励配比。

    推荐理由:文章完整拆解了用 TRL 和 OpenEnv 复现水彩画代码模型的训练管线,并比较了三种审美奖励配比的训练结果。

  5. Google DeepMind77

    Google DeepMind 推出 Fairwind Program,开放 Gemini 3.8 Flash Cyber 网络防御能力

    Google DeepMind 推出 Fairwind Program,向政府、Google Cloud 客户和可信网络安全伙伴限量开放 Gemini 3.8 Flash Cyber 与 CodeMender,用于自主发现、验证和修复漏洞。该项目声称可在组织的安全云环境中于数分钟内生成经过验证、可部署的补丁,并要求参与机构限制内部网络安全团队访问及启用多因素认证。已有超过 650 家合作伙伴参与。

    推荐理由:Fairwind Program 将 Gemini 3.8 Flash Cyber 与 CodeMender 结合,展示了受控环境中自动发现、验证并修复漏洞的企业级路径。

  6. Google DeepMind91

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者面向长程编码、智能体任务与多步推理,后者面向漏洞发现和自动修复。

    推荐理由:Gemini 3.8 将通用推理编码与网络安全能力拆分为两个版本,并给出价格、基准和实际使用案例,便于比较其适用场景与成本。

9月2日周三
  1. Hugging Face Blog69

    BenchMIRT:LLM 基准测试究竟测量了什么?

    Allen Institute 介绍 BenchMIRT,一种在单个提示词和任务层面审计 LLM 基准测试的方法。它基于 100 个 LLM、16 个基准和超过 34K 道题的结果,独立识别出安全与通用推理两个主要维度,并发现 BBQ、WMDP 等基准的得分可能混合了不同能力信号。

    推荐理由:BenchMIRT 将多维 IRT 应用于 100 个 LLM 和 34K 多道题,展示了如何拆解基准分数中的推理与安全信号。

  2. Google Research80

    Google Research 发布 MAPL-EMIT 甲烷羽流全球监测方法

    Google Research 与 NASA JPL 合作提出 MAPL-EMIT,用基于 Swin-S Transformer 的深度学习框架分析 NASA EMIT 高光谱数据,自动完成甲烷增强量化、羽流分割和排放源定位。

    推荐理由:论文展示了如何用深度学习处理 EMIT 高光谱数据,将甲烷羽流检测、范围分割与源头定位整合到可扩展的全球监测流程中。

  3. Google DeepMind87

    Google DeepMind推出Gemini Agentic视频理解功能

    Google DeepMind推出Agentic视频理解功能,覆盖Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite,可动态搜索视频中的画面、音频和转录内容。

    推荐理由:Google DeepMind给出了Agentic视频理解的工作方式、基准变化和接入示例,便于开发者评估长视频分析的成本与实现路径。

9月1日周二
  1. Hugging Face Blog86

    Hugging Face 发布 @huggingface/kernels,提供 207 个 WebGPU Kernels

    Hugging Face 发布 @huggingface/kernels,并在 Hub 上提供 207 个 Apache-2.0 授权的 WebGPU kernels,每个 kernel 都配有接口契约、WGSL shader 模板、正确性测试和 benchmark 用例。

    推荐理由:Hugging Face 将 WebGPU kernel 做成可版本化、可测试和可复用的 Hub 资源,并用 Fleet 收集真实设备证据,为浏览器推理优化提供了清晰的工程路径。

  2. Google Research77

    Google Research 发布 TimesFM-3 多变量时间序列基础模型

    Google Research 发布 TimesFM-3,这是一个原生支持多变量预测的时间序列基础模型,拥有 330 million parameters,并在超过 1 trillion 个时间点上预训练。

    推荐理由:TimesFM-3把多变量输入、已知未来特征与单次推理结合起来,并在三个公开基准上进行比较,便于了解其适用场景与技术取舍。

  3. Microsoft Research76

    Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 病理基础模型

    Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 两款 Apache 2.0 开放权重病理基础模型,分别用于全切片表征学习和从 H&E 预测空间蛋白组。

    推荐理由:两款开放权重模型用蒸馏和轻量编码器降低病理分析成本,并给出不同队列上的性能与资源对比,便于评估其研究用途。

8月28日周五
  1. Google Research82

    Google Research 推出 Planetary Prediction Engine,自动化全球地理预测建模

    Google Research 介绍 Planetary Prediction Engine(PPE),这是 Google Earth AI 旗下的实验性研究能力,可根据自然语言查询自主完成地理数据发现、清理、特征工程、模型训练与评估。

    推荐理由:文章展示了 PPE 如何把地理数据发现、特征构建和模型评估串成自动化流程,并用多个领域的基准结果说明其应用价值。

  2. Google DeepMind82

    Google DeepMind 发布 Gemini Omni 1.1 Flash,新增可控视频生成能力

    Google DeepMind 推出 Gemini Omni 1.1 Flash,为开发者提供场景延展、首尾帧插值、视频参考和最高4K输出等生成视频能力。模型可分析最多10秒的既有上下文,视频可按10秒增量延展至累计40秒;360p预览生成速度最高提升60%,成本为720p的三分之一。

    推荐理由:Gemini Omni 1.1 Flash把场景延展、首尾帧控制、视频参考和4K输出整合进开发接口,呈现了生成视频从原型到制作的具体工作流。

8月27日周四
  1. Google DeepMind77

    Google DeepMind 试点全球首个专有前沿模型双盲 AI 评测

    Google DeepMind 宣布试点针对专有前沿级 AI 模型的双盲评测,将外部评测限制在密码学“盒子”中,避免模型提前接触测试内容并据此优化。该项目与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境中使用机密基准测试 Gemini Flash Lite,以降低基准污染对评测完整性的影响。

    推荐理由:文章介绍了将外部评测置于密码学环境中的双盲方案,回应了基准污染对模型能力与安全评估可信度的影响。

  2. Google Research61

    Google Research 发布 GlucoFM,用于连续血糖监测的基础模型

    Google Research 介绍 GlucoFM,一种采用双流设计的自监督连续血糖监测基础模型,用于分离较慢的血糖趋势与短期偏差。模型在四个队列的七项临床预测任务中进行评估,平均 PR-AUC 比同语料预训练的最佳 GluFormer 变体高 5.8 个百分点,并在餐后血糖反应预测中取得最低 MAE。GlucoFM 还展示了跨数据集迁移和少样本适应能力。

    推荐理由:文章系统比较了 GlucoFM 在临床预测、餐后血糖预测、跨队列迁移和少样本适应中的表现,并说明双流设计如何利用 CGM 的多时间尺度信号。

  3. Google DeepMind84

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转写模型

    Google DeepMind 发布 Gemini 3.5 Transcribe,用于精确的实时语音转写和智能语音交互。模型通过 Gemini API 提供实时流式与预录音频处理两类 API,支持自定义词汇、自动检测和转写超过 85 种语言,以及最多三位说话人的识别。

    推荐理由:Gemini 3.5 Transcribe同时覆盖实时流式和预录音频处理,并给出WER、延迟及多语言支持等指标,便于评估其开发适用场景。

8月26日周三
8月25日周二
  1. Hugging Face Blog85

    Granite 4.2 推理模型家族构建方法解析

    IBM Granite Team 介绍 Granite 4.2 推理模型家族的构建过程,模型分为 3B、8B 和 30B 三种规模,均基于 Granite-4.1 基座模型进行后训练。

    推荐理由:文章系统梳理了 Granite 4.2 从预训练、SFT 到多阶段 RL 的构建流程,并说明不同规模模型的智能体训练差异。

  2. Hugging Face Blog82

    Quantization-Aware Healing 让压缩后的 4-bit GPT-OSS 60B 在 9 项基准中 7 项超过 BF16 版本

    Multiverse Computing 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 压缩至 60B 参数并量化为 MXFP4,使 4-bit 模型在 9 项基准中的 7 项超过同架构的 60B bfloat16 版本。

    推荐理由:论文通过 GPT-OSS 120B 压缩实验和 QAH、QAT 对照,具体展示了 4-bit 模型恢复精度与训练稳定性的路径。

  3. Mistral AI57

    Mistral 与 HUMAIN 宣布战略合作推进沙特及中东主权 AI

    Mistral 与 HUMAIN 宣布战略合作,将在沙特及中东推进 AI 基础设施、先进模型开发和解决方案部署。双方计划本地化开发模型,重点关注网络安全和语音,并探索利用 HUMAIN 的数据中心支持当地算力需求;合作金额达数亿欧元。双方还将面向沙特受监管行业制定联合市场策略,开发阿拉伯语表现强劲的 frontier models。

8月22日周六
  1. Google Research71

    Google Research 发布 Biomarker Discovery Framework,用于筛选可穿戴数据中的候选生物标志物

    Google Research 介绍 Biomarker Discovery Framework,这是一个在人工监督下运行的多智能体系统,用于从可穿戴设备数据中迭代生成、分析和验证候选生物标志物。

    推荐理由:文章展示了如何将多智能体协作、确定性统计计算与对抗验证结合,用于在可穿戴传感器数据中筛选候选生物标志物。