资讯
H Company Releases NeoMME: A Family of 260M and 800M Single-Tower Multimodal Encoders That Drop the Vision Tower and Causal Decoder
📋总体概括
H 公司发布 NeoMME 多模态编码器系列,包含 260M 与 800M 两种规格的双向编码器。其最大特点是抛弃了预训练视觉塔与因果解码器,在单一 Transformer 中同时处理多语言文本 token 与 32×32 原始图像块,采用掩码离散扩散预训练目标,并配备稠密与 late-interaction 双检索头。在 ViDoRe v3 视觉文档检索基准上,260M 模型达到 0.523 nDCG@10,索引压缩达 255 倍,单张 L40S 上索引吞吐为每秒 51.3 页,但作者也承认纯文本检索仍存在差距。
⚡关键信息
- ▸NeoMME 提供 260M 和 800M 两个规格,采用单塔双向编码器架构,去掉视觉塔和因果解码器
- ▸单一 Transformer 同时处理多语言文本 token 和 32×32 原始图像块,无需预训练视觉骨干
- ▸预训练使用掩码离散扩散目标,检索端配备稠密检索与 late-interaction 双头
- ▸ViDoRe v3 上 260M 模型取得 0.523 nDCG@10,索引压缩达 255 倍,单张 L40S 每秒索引 51.3 页
- ▸作者承认 NeoMME 在纯文本检索任务上与专门模型仍存在差距
🔥犀利点评
去掉视觉塔和因果解码器,本质是在赌一件事:文档检索不需要理解世界,只需要对齐像素和文字。255 倍索引压缩加单卡每秒 51 页的吞吐,说明这是冲着企业级文档库量产去的,不是刷榜玩具。但 260M 的小模型去抢检索赛道,护城河存疑——对手是带大视觉塔的 ColPali 系,文本检索短板也自己承认了。单塔架构能不能在规模化后反超,才是这场豪赌真正的胜负手。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文 →