论文-借助混合思维与主动感知提升基于视觉语言模型的自动驾驶技术(英)_14页_2mb
报告摘要
DriveAgent-R1: Advancing VLM-based Autonomous Driving with Hybrid Thinking and Active Perception
核心内容概述
DriveAgent-R1 是一种基于视觉语言模型(VLM)的高级自动驾驶代理,旨在解决现有VLM在复杂环境下的决策局限性和被动感知问题。该代理通过引入混合思维框架和主动感知机制,实现了在不同驾驶场景下灵活切换高效文本推理与深度工具推理,从而提升决策效率与可靠性。
主要观点
- 混合思维框架:DriveAgent-R1 提出了一种Hybrid-Thinking框架,首次实现文本推理($\mathcal{M}{\mathrm{text}}$)与工具推理($\mathcal{M}{\mathrm{tool}}$)的动态切换,适应不同复杂度的驾驶场景。
- 主动感知机制:通过集成视觉工具包(Vision Toolkit),DriveAgent-R1 可以主动获取高分辨率图像、区域感兴趣(RoI)信息、深度估计和3D目标检测等关键视觉证据,以增强感知能力和决策可靠性。
- 三阶段渐进式强化学习策略:为了培养混合思维能力,DriveAgent-R1 采用了一个三阶段渐进式强化学习(RL)策略,包括基础构建(DM-SFT)、强制对比式模式强化学习(FCM-RL)和自适应模式选择强化学习(AMS-RL),以系统化地提升模型在复杂驾驶场景中的表现。
关键信息
1. 混合思维框架
- 文本推理($\mathcal{M}_{\mathrm{text}}$):适用于常规驾驶场景,仅需低分辨率视觉信息和文本上下文即可完成决策,计算效率高。
- 工具推理($\mathcal{M}_{\mathrm{tool}}$):适用于复杂或不确定场景,通过调用外部视觉工具获取额外信息,增强推理深度。
- 推理结构:所有推理过程遵循统一的**三阶段链式推理(Description → Reasoning → Prediction)**框架,确保逻辑连贯性和决策可靠性。
2. 视觉工具包(Vision Toolkit)
- 高分辨率视图检索:允许代理请求特定视角的高清图像,用于关键操作前的环境评估。
- 区域感兴趣(RoI)检查:支持对图像中特定区域进行裁剪和放大,用于细致分析交通标志、信号灯等关键信息。
- 深度估计:使用Depth Anything V2算法生成深度图,帮助模型理解3D空间关系,提高路径规划和避障能力。
- 3D目标检测:集成开放词汇、单目3D目标检测工具,可识别包括车辆、行人和交通标志在内的多种对象,并支持动态检测需求。
3. 三阶段训练策略
- 阶段1:双模式监督微调(DM-SFT)
通过自动化数据构建流程,生成高质量的文本和工具推理数据集,为模型打下基础。 - 阶段2:强制对比式模式强化学习(FCM-RL)
采用MP-GRPO算法,强制模型在两种模式下生成响应,增强对比信号,提升两种推理方式的性能。 - 阶段3:自适应模式选择强化学习(AMS-RL)
在无模式强制的前提下,训练模型根据场景自主选择最优推理模式,提高决策的灵活性与适应性。
4. 实验结果与贡献
- 性能表现:在SUP-AD数据集上达到最先进水平,超越了包括Claude Sonnet 4在内的领先私有大模态模型。
- 贡献总结:
- 提出并实现首个用于自动驾驶的混合思维架构。
- 引入主动感知概念,提升模型在不确定环境中的感知能力。
- 设计完整的三阶段渐进式训练策略,并构建全面的评估体系。
- 通过消融实验验证了混合推理和主动感知对决策可靠性的提升作用,为更安全、智能的自动驾驶系统提供了可行路径。
结构与流程
- 输入处理:代理接收六帧同步的低分辨率周围视图和文本上下文(包括当前车速和导航指令)。
- 输出形式:生成一个8秒的元动作序列,由四个2秒时间步组成,每个元动作包含速度和轨迹信息。
- 推理流程:代理根据输入自动选择推理模式,并在推理过程中动态调用视觉工具,获取更多信息以支持决策。
总结
DriveAgent-R1 通过结合混合思维框架和主动感知机制,在复杂驾驶环境中实现了高效且可靠的决策。其创新的三阶段训练策略有效提升了模型的推理能力和环境适应性,为未来自动驾驶系统的发展提供了新的方向与方法。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载