跳到正文
原文
The Decoder· Matthias Bastian·· 2 小时前精选AI 评分77

Reka AI发布Rho-1全模态模型,统一处理文本、图像、视频与机器人控制

Reka AI's omni-model Rho-1 handles text, images, video, and robot control in a single model

AI 导读

Reka AI发布Rho-1研究预览版,这个190亿参数的全模态模型可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。Rho-1将所有模态作为token放入共享上下文窗口,无需工具调用或外部模型,并可实时生成连续视频、根据新指令调整动作。为缓解机器人训练数据稀缺,Reka AI从普通互联网视频中提取控制信号;模型使用320块H100 GPU训练约三个月。

推荐理由

Rho-1将文本、图像、视频与机器人控制统一到同一上下文中,文章也交代了其训练数据和训练资源来源。

来源:The Decoder · the-decoder.com