Google Research 用高温超导问题评测六个 LLM 的科学问答能力
Google Research 与 Cornell University 合作,使用 67 个高温超导研究问题评测六个 LLM,并由专家按观点平衡、完整性、简洁性和证据等指标评分。
推荐理由:这项研究比较了开放网络数据与专家精选文献对专业问答的影响,为评估科学领域 LLM 的证据完整性和观点平衡提供了具体案例。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Google Research 与 Cornell University 合作,使用 67 个高温超导研究问题评测六个 LLM,并由专家按观点平衡、完整性、简洁性和证据等指标评分。
推荐理由:这项研究比较了开放网络数据与专家精选文献对专业问答的影响,为评估科学领域 LLM 的证据完整性和观点平衡提供了具体案例。
Google Research推出Groundsource,利用Gemini从80种语言的新闻报道中提取洪水事件,构建覆盖150多个国家、从2000年至今的2.6 million条历史记录。人工复核显示,60%的事件在地点和时间上均准确,82%达到实际分析可用程度;相关数据集已开放,并用于支持最多提前24小时的城市暴洪预测及Google Flood Hub的覆盖扩展。
推荐理由:Groundsource展示了如何用Gemini从多语言新闻中提取并校验灾害时空信息,为缺乏统一观测体系的洪水研究补充历史数据。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展前瞻性单中心可行性研究,评估 AMIE 在基层医疗就诊前采集病史的安全性、诊断推理和用户体验。
推荐理由:研究把 AMIE 从模拟场景带入真实基层医疗流程,呈现了监督式部署的安全结果、诊断表现与实际局限。
Google开发的SpeciesNet模型可对相机陷阱图像中的2,498类动物进行分类,并已作为开源工具供下载、适配和改进。模型基于超过65M张标注图像训练,可在标准笔记本上每天处理约30,000张图像;在测试中,99.4%的含动物图像被识别,83%的预测达到物种级别,其中94.5%正确。过去一年,研究团队已将其用于哥伦比亚、美国爱达荷州、澳大利亚和坦桑尼亚等地的野生动物监测。
推荐理由:SpeciesNet将大规模相机陷阱图像识别转为可本地运行和适配的开放工具,文中数据与项目案例展示了它在野生动物监测中的实际用法。
Berkeley AI Research 的 NeurIPS 2025 论文提出从带噪测量中直接估计互信息,用于评估成像系统包含的有效信息。该方法在彩色摄影、射电天文学、无透镜成像和显微镜四个领域预测了下游解码性能;其 IDEAL 方法通过优化信息估计来设计成像参数,在滤色器设计中达到与端到端优化相当的结果,同时不需要任务特定的解码器设计。代码已在 GitHub 开源。
推荐理由:论文将成像系统的分辨率、噪声和采样等因素统一到互信息指标中,并展示了该指标评估与优化多类系统的方式。
Mistral AI 发布 Mistral OCR 3,相较 Mistral OCR 2 在表单、扫描文档、复杂表格和手写内容上取得 74% 的整体胜率。模型支持提取文本与嵌入图像、Markdown 和结构化 JSON 输出,并以 $2 per 1,000 pages 提供 API,Batch API 价格为 $1 per 1,000 pages。
推荐理由:Mistral OCR 3 给出了相较 OCR 2 的具体提升、价格和 API 入口,便于评估文档解析场景的部署成本与迁移路径。
Mistral AI 发布 Mistral 3,包含14B、8B和3B的Ministral 3小型稠密模型,以及激活41B、总计675B参数的Mistral Large 3,全部采用Apache 2.0许可。
推荐理由:Mistral 3同时覆盖3B至675B参数规模,并提供Apache 2.0许可、量化格式和多种部署路径,便于比较开放模型的性能与落地成本。