杏彩体育科技股份有限公司-工程机械智能化解决方案

您好,欢迎来到杏彩体育科技股份有限公司官网!

联系电话0769-87921175 联系邮箱dglc17@126.com

新闻资讯  |   NEWS
小鹏集团发布TuringViT宣称重构视觉大模型训练范式

来源:小编  |  发布时间: 2026-07-30  |   次浏览

  

小鹏集团发布TuringViT宣称重构视觉大模型训练范式(图1)

  ,面向 VLM / VLA 时代系统性重构视觉编码器的架构设计、数据范式与训练流程。

  小鹏集团表示,TuringViT 将全面支撑智能驾驶、智能座舱、IRON 人形机器人三大业务场景,同时为行业提供了一条可复现、低成本训练 SOTA 级(State-of-the-Art,最新技术水平)视觉 Transformer 的技术路径,推动先进视觉大模型从“头部团队专属”走向“行业普惠”。

  据介绍,TuringViT 从架构、数据、训练三个维度同步突破,打造了“线性注意力主导 + 高质量数据治理 + 原生动态分辨率”的完整技术体系,实现了效果、效率与落地性的三重提升。

  实测数据显示,随着输入分辨率提升,TuringViT 的延迟增长曲线远平缓于标准 softmax ViT,高分辨率下的效率优势愈发显著。在 1536×1536 分辨率下,TuringViT-18L 的推理吞吐量达到 Seed1.5-ViT 的 3.04 倍,相比 SigLIP2-ViT-L 提升 2.16 倍,为高分辨率感知、多摄像头输入、长时序视频处理的端侧部署扫清了核心障碍。

  不同于行业“堆数据规模”的粗放路线,TuringViT 打造了 VISTA-Curation 多模态数据治理流水线,通过提升单样本的监督价值实现数据效率的量级提升,从“用更多数据”转向“用更优质的监督”。

  针对视频数据,流水线同样进行全流程治理:先将长视频切分为连续短片段并均匀采样代表帧;再通过语义一致性与运动一致性双重过滤,保留语义连贯、变化信息有效的片段;最后融合局部帧级细节字幕与全局时序语义字幕,生成具备变换感知能力的视频标注,让模型从连续画面中学习更鲁棒的视觉表征。

  最终,TuringViT 仅用 0.85B 图文对(约为 SigLIP2-L 训练数据规模的 10%),便在 ImageNet-1K 等六项零样本分类基准上取得 83.6% 的平均准确率,超越使用 10B 数据训练的主流开源基线;在 COCO、Flickr30K 图文检索任务上同样优势显著,真正实现了“十分之一数据,更优效果”的突破。

  TuringViT 还采用四阶段渐进式原生动态分辨率训练范式,从预训练之初就适配下游 VLM / VLA 的输入特性,告别“固定分辨率预训练 + 事后适配”的传统模式。


上一篇: 工业机器人
上一篇: 孩童视功能相关阅读障碍专家建议专业视光干预可有效矫正