空间智能与智能体 AI
空间智能 × 智能体 AI
从长时序三维建模
到自进化智能体。
构建理解三维空间、借助世界模型推演与行动,并能从经验中持续进化的智能体。

香港科技大学(广州)人工智能学域长聘轨助理教授,博士毕业于新加坡南洋理工大学。团队聚焦结合空间智能与智能体 AI,已发表 70 余篇学术论文。担任 ACL ARR Area Chair、AAAI 高级程序委员会委员(SPC)。入选广东省青年拔尖人才。
空间智能世界模型多模态智能体自进化智能体
最新进展
仅 RGB 输入 · 10K+ 帧
01Plausible状态一致性
02Controllable干预保真度
03Actionable决策效用
改进者成为被改进者
代表工作
01 空间智能长时序三维感知、场景重建、SLAM 与人体空间理解
HorizonStream
仅以 RGB 视频为输入,实现万帧级稳定流式三维重建。
KiloGS-SLAM
面向公里级室外场景的单目 3D Gaussian SLAM。
LongStream
面向长序列的流式自回归视觉几何建模。
VGGT4D
从视觉几何 Transformer 中挖掘运动线索,实现免训练的四维场景重建。
MultiGO++
通过几何与纹理协同,从单张图像重建带纹理的三维服装人体。
MotionGRPO
以强化学习后训练提升扩散式第一视角人体运动恢复。
FastAnimate
以可学习模板与姿态变形实现高效三维人体动画。
S3PO-GS
以全局尺度一致的三维高斯点图提升室外单目 SLAM。
RegGS
通过 3DGS 配准,从稀疏且无相机位姿的图像中重建场景。
OpenGS-SLAM
仅以 RGB 图像为输入,面向无边界室外场景的 Gaussian SLAM。
GraphGS
利用相机图结构,从图像中高效重建大规模开放场景。
GVKF
以高斯体素核函数高效重建开放场景表面。
02 世界模型从环境预测走向行动决策与智能体自进化
03 游戏智能多模态交互、策略推理与社会智能
CaM-Wolf
面向社交推理游戏的因果感知多模态智能体。
The Stackelberg Speaker
利用博弈建模优化社交推理智能体的说服性沟通。
VistaWise
以跨模态知识图谱构建高效、低成本的 Minecraft 智能体。
CausalMACE
以因果推理增强 Minecraft 多智能体协作。
MultiMind
融合多模态推理与心智理论的狼人杀智能体。
LLM-Based Agent Society
以 Avalon 为试验场,研究大语言模型智能体之间的协作、对抗与社会行为。
共同推动空间智能与智能体研究落地。
期待与学界和产业界围绕长时序三维建模、数字孪生、具身智能与游戏智能、世界模型和自进化系统开展合作。