物理AI成AI最大增量方向 智能驾驶迎确定性机遇
一份研报观点认为,CNN通过局部连接、权值共享和平移不变性等视觉归纳偏置,在数据相对有限的情况下展现出更高效率,更适合端侧实时部署;而ViT利用自注意力机制实现第一层全局交互,弱先验强规模化特点使其在大规模预训练下上限更高。研报指出,虽然ViT在多模态大模型如CLIP、Qwen-VL中成为主流,但ConvNeXt等纯卷积模型结合现代训练技巧已能追平部分ViT性能,表明视觉架构正走向任务、数据、算力约束下的动态平衡。 研报认为,产业落地呈现明显分层,多模态大模型和研究前沿偏好ViT类视觉编码器,而自动驾驶量产系统受算力、时延和安全要求影响,更多采用CNN前端加BEV与Transformer融合的混合架构。数字AI底座发展路径已逐渐清晰,但难以完成物理世界建模闭环。相比之下,物理AI有望成为当前AI阶段增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,其确定性正在快速提升,相关产业链投资价值值得重点关注。 中财网
![]() |