Granite 4.1 LLMs:Granite Team 详解模型构建方法
IBM Granite Team 介绍 Granite 4.1 系列的构建过程,包括 3B、8B 和 30B dense decoder-only LLMs,以及约 15T tokens 的五阶段预训练流程,最长上下文扩展至 512K tokens。
推荐理由:文章完整拆解了 Granite 4.1 从数据配比、长上下文训练到多阶段强化学习的流程,适合了解小型 dense 模型如何通过数据和后训练提升能力。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
IBM Granite Team 介绍 Granite 4.1 系列的构建过程,包括 3B、8B 和 30B dense decoder-only LLMs,以及约 15T tokens 的五阶段预训练流程,最长上下文扩展至 512K tokens。
推荐理由:文章完整拆解了 Granite 4.1 从数据配比、长上下文训练到多阶段强化学习的流程,适合了解小型 dense 模型如何通过数据和后训练提升能力。
Hugging Face 介绍了如何使用 OpenAI 的开源 Privacy Filter 和 gradio.Server 构建三个 Web 应用:文档隐私浏览器、图像匿名化工具和 SmartRedact Paste。
推荐理由:文章通过三个可运行应用展示 Privacy Filter 与 gradio.Server 的组合方式,覆盖文档、图片和文本脱敏场景,并给出可复用的接口设计。
DeepSeek 发布 DeepSeek-V4,推出 DeepSeek-V4-Pro 和 DeepSeek-V4-Flash 两个 MoE 模型,均支持 1M-token 上下文窗口。
推荐理由:文章将 DeepSeek-V4 的长上下文架构、智能体训练基础设施与工具调用设计放在一起,便于理解其面向长期任务的工程取舍。
Hugging Face 介绍如何在 Manifest V3 Chrome 扩展中使用 Transformers.js 和 Gemma 4 E2B 构建本地 AI 浏览器助手。
推荐理由:文章以完整项目为例拆解 Manifest V3 下的运行时分工、模型缓存和工具调用循环,提供了可迁移的 Chrome 扩展架构方案。
Hugging Face发布QIMMA阿拉伯语LLM评测套件,在评估模型前先验证基准质量。QIMMA整合14个来源基准的109个子集,覆盖超过52,000个样本和7个领域,并通过两种LLM与人工复核筛除质量问题。结果显示,Qwen/Qwen3.5-397B-A17B-FP8在截至2026年4月的前10模型中排名第一。
推荐理由:QIMMA展示了在模型评测前筛查基准质量的完整流程,并公开样本级输出与代码,便于复核阿拉伯语LLM排名。
Hugging Face 认为,Mythos 展示的网络安全能力主要来自模型、算力、软件数据、漏洞探测与修补脚手架以及一定程度的系统自主性,而非单一模型。文章主张使用开放代码和工具构建半自主智能体,在预设权限与人工审批下辅助漏洞发现和修补,并通过可审计组件、决策日志和私有化部署保持控制。
推荐理由:文章以 Mythos 为切入点,解释模型、系统与自主性如何共同影响网络安全,并提出开放生态支持半自主防御的路径。
Google Research 发布 MoGen 神经元形态生成模型,用合成神经元形状增强 PATHFINDER 的训练数据,使小鼠轴突重建错误率降低 4.4%。按完整小鼠脑的规模估算,这相当于节省 157 person-years 的人工校对工作;MoGen 及其不同物种的训练模型已开源。
推荐理由:论文展示了合成神经元形状如何降低 PATHFINDER 的重建错误,并将模型改进换算为完整小鼠脑图谱中的人工校对节省量。
Hugging Face 提供 transformers-to-mlx Skill 和独立测试工具,帮助贡献者将 transformers 中的语言模型移植到 mlx-lm。
推荐理由:文章展示了 Skill 如何把模型移植、数值对比和可复现测试串成审查流程,也明确了代理辅助提交仍需人工判断的边界。
Hugging Face 发布 EcomRLVE-GYM,将 RLVE 从单轮推理题扩展到多轮、工具增强的电商对话,提供商品发现、替换、购物车构建、退换货、订单追踪、政策问答、套餐规划和多意图旅程 8 类可验证环境。
推荐理由:文章展示了如何把可验证奖励、工具调用和自适应难度结合起来训练电商智能体,并提供了可复现的开源环境与初步结果。
Hugging Face 介绍如何使用 Sentence Transformers 在自有数据上训练或微调多模态嵌入与重排模型,并以 Qwen/Qwen3-VL-Embedding-2B 完成 Visual Document Retrieval 实践。
推荐理由:文章给出从数据集、损失函数到评估器的完整微调流程,并用实验展示领域数据如何提升多模态文档检索效果。
HCompany 发布 HoloTab,一款可直接在 Chrome 浏览器中操作网页的 AI 智能体,无需设置或技术技能即可执行跨网站任务。用户还能通过录制点击和讲解生成 routines,之后重新运行或安排任务。
推荐理由:HoloTab 将计算机使用型智能体封装进 Chrome 扩展,并用录制生成可重复运行的 routines,降低了自动化网页任务的使用门槛。
Overworld 发布 Waypoint-1.5 实时视频世界模型,支持在 RTX 3090 至 5090 等桌面硬件上以最高 720p 和 60 FPS 生成实时环境,并推出面向更广泛消费级硬件的 360p 模型。
推荐理由:Waypoint-1.5同时提供720p与360p模型,并面向消费级硬件优化本地运行,展示了实时生成世界从演示走向可用体验的路径。
Safetensors 宣布加入 Linux Foundation 旗下的 PyTorch Foundation,成为基金会托管项目,商标、仓库和治理转由 Linux Foundation 管理。
推荐理由:Safetensors 加入 PyTorch Foundation 后获得中立治理,正文还交代了兼容性承诺与后续面向加速器、并行加载和量化格式的路线。
Google DeepMind 发布 Gemma 4,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,面向高级推理、Agent工作流和端侧部署。模型支持函数调用、结构化 JSON 输出、图像与视频处理,E2B 和 E4B 还支持音频输入;上下文窗口覆盖 128K 至 256K,并以 Apache 2.0 许可开放。
推荐理由:Gemma 4同时覆盖端侧设备与开发者硬件,并提供Agent工作流、长上下文和Apache 2.0许可,呈现了开放模型的完整落地路径。
Hugging Face Blog 介绍了 TII 发布的 Falcon Perception 和 Falcon OCR:前者是 0.6B 参数的早期融合 Transformer,用于开放词汇定位与分割,在 SA-Co 上取得 68.0 Macro-F1;后者是 0.3B 参数 OCR 模型,在 olmOCR 和 OmniDocBench 上分别取得 80.3 和 88.64。
推荐理由:文章同时给出 Falcon Perception 的架构取舍、分层基准结果和训练配方,便于比较早期融合方案在复杂视觉指代与密集场景中的表现。
Hugging Face 介绍 gradio.Server,它扩展 FastAPI,让 React、Svelte 或原生 HTML/JS 前端接入 Gradio 的排队、SSE、并发控制、gradio_client 和 ZeroGPU 能力。
推荐理由:文章用完整示例展示 gradio.Server 如何将自定义前端与 Gradio 的排队、并发控制和 ZeroGPU 能力结合,方法可直接迁移到 Spaces 应用。
Hugging Face 发布 Granite 4.0 3B Vision,这款 3B 视觉语言模型面向企业文档理解,支持表格提取、图表理解和语义键值对抽取。模型以 LoRA adapter 形式构建在 Granite 4.0 Micro 之上,可单独使用或与 Docling 集成。
推荐理由:这款 3B 视觉语言模型将图表、表格和语义键值抽取结合起来,并以 LoRA adapter 形式支持文本与视觉任务切换,适合评估企业文档处理方案。
Hugging Face 发布 TRL v1.0,将 TRL 从研究代码库明确升级为面向生产使用的后训练库,支持超过 75 种后训练方法。新版本让稳定 API 与实验 API 共存,稳定层涵盖 SFT、DPO、Reward modeling、RLOO 和 GRPO 等训练器,最近一个 0.x 版本的迁移工作量较小。
推荐理由:文章解释了 TRL v1.0 如何以稳定与实验并存的契约应对后训练方法快速变化,并给出异步 GRPO 等后续方向。
Hugging Face 介绍了把 OpenClaw、Pi 或 Open Code 智能体迁移到开放模型的两条路径:通过 Inference Providers 托管运行,或使用 llama.cpp 在本地运行。托管方案可配置 GLM-5,本地方案示例使用 Qwen3.5-35B-A3B-GGUF,并提供了安装、启动服务器和 OpenClaw 配置命令。
推荐理由:文章提供了将 OpenClaw 迁移到 Hugging Face 托管模型或本地 llama.cpp 的具体命令与配置,便于读者按硬件和隐私需求选择路径。
Hugging Face 发布 EVA,用 bot-to-bot 音频架构评估语音智能体的任务准确性与对话体验。框架包含 EVA-A 和 EVA-X 两项主分数,随附覆盖 50 个航空场景、15 个工具的数据集,并评测了 20 个级联和音频原生系统。结果显示,任务完成表现与用户体验之间存在持续权衡,命名实体转录错误和多步骤工作流是主要失效点。
推荐理由:EVA将任务完成、语音准确性与对话体验纳入同一套端到端评估,并用航空场景数据展示准确性与体验之间的权衡。