聚焦电竞赛场,掌握一手游戏竞技资讯

SpatioLM开源了!!!ICML 2026 Oral

作者:SpatioLM开源了!!!ICML 2026 Oral

欢迎大家Star 现在的视觉语言模型很会“认东西”,但一问距离、尺度、方向和路径,往往就不那么可靠了。尤其到了机器人操作、自动驾驶等真实场景,空间感不是加分项,而是基础能力。 我们开源了SpatioLM:一个面向 VLM 物理空间智能的参数高效框架,论文入选ICML 2026 Oral。 它的核心思路很直接: 1. 冻结预训练 VLM 主干,尽量保留原有通用能力; 2. 插入可按需启用的 Spatio-Vision Module,从视觉 token 中提取几何结构; 3. 训练时用伪深度和相机射线进行监督,让表征更符合物理空间; 4. 推理时仍然只需要 RGB 图像或视频,不需要额外输入深度图、点云或相机参数。 实验结果: - VSI-Bench 71.6,论文报告的首个超过 70 的结果; - 能力覆盖空间感知、空间理解,并可迁移到具身操作; - LIBERO 上,离散动作设置从 79.2 提升到 91.0,连续动作设置从 95.3 提升到 96.3; - 代码、训练与评测流程,以及 5 个 Understanding / Perception / Action 模型权重均已发布。 项目入口: - GitHub:https://github.com/xiaomi-research/spatio-lm - 论文:https://arxiv.org/abs/2608.01899 - 模型:https://huggingface.co/collections/xiaomi-research/spatiolm 欢迎试用、Star,也欢迎交流空间智能、VLM 与具身方向的问题。 #人工智能 #多模态大模型 #视觉语言模型 #空间智能 #具身智能 #机器人 #ICML2026

返回资讯列表