HyperAIHyperAI

Command Palette

Search for a command to run...

NeoMME:高效多模态原生多语言编码器发布

近日,H Company 研究团队发布 NeoMME 系列多模态原生多语言编码器,涵盖 2.6 亿与 8 亿参数版本。该工作由 Aurélien Lac 与 Tony Wu 主导,已在 Hugging Face 平台以 Apache 2.0 协议开源。区别于传统依赖独立视觉塔与因果解码器的多模态架构,NeoMME 采用单一双向 Transformer 同步处理文本令牌与原始图像块,并基于掩码离散扩散目标从零训练,有效削减计算冗余。 基于该底座微调的 NeoMME-Retriever 聚焦视觉文档检索,直接输入页面截图以绕过 OCR 环节。模型单次前向传播可同步输出稠密与晚期交互向量,在 ViDoRe v3 榜单上,2.6 亿参数版本取得 0.523 的 nDCG@10 得分,位居同参数量级首位;8 亿版本得分 0.556,两者均位于性能与体积的帕累托前沿。实测显示,在单张 NVIDIA L40S 显卡上,模型处理 2048×2048 图像时吞吐量达每秒 51 页,速度约为同类方案的 2 倍。针对晚期交互嵌入存储开销大的痛点,团队结合分层标记池化与非对称量化技术,将索引体积从约 1.5 MB 压缩至每页 6 KB,降幅达 255 倍且精度损失不足 5%。该架构显著降低了视觉检索增强生成的算力门槛,相关代码与权重现已全面开放。

相关链接