XPeng’s tweede generatie VLA voegt ‘tijd’ toe voor 4D-ruimtetijdperceptie
XPeng (XPeng) heeft de grootste upgrade tot nu toe voor zijn Vision-Language-Action (VLA)-model van de tweede generatie gepresenteerd. De kernverandering is verrassend eenvoudig: de kunstmatige intelligentie begrijpt nu tijd. Tijdens een showcase over fysieke AI met als thema ‘TIJD’ liet het bedrijf weten dat zijn fundamentele model is geëvolueerd van statisch 3D-ruimtelijk begrip naar dynamisch 4D-ruimtetijdbegrip. De nieuwe XOS 6.3.0-software zal wereldwijd debuteren op de G9L.
Drie technologieën vormen de basis van deze sprong. Infini-VLA, een architectuur met lange horizon, onthoudt tot 30 seconden van het wegsignaal, waardoor continue rijgebeurtenissen worden samengevoegd tot een coherent tijdelijk begrip. Streaming Inference verschuift het model van discrete redenering naar continue, parallelle verwerking, wat de end-to-end reactielatentie met 300 procent vermindert. X-Foresight, een voorspellend wereldmodel, anticipeert op het gedrag van omringende verkeersdeelnemers tot zes seconden vooruit, waardoor reacties op plotseling invoegen en hard remmen worden verscherpt. De on-device parameters groeiden 3,5 keer – meer dan 15 keer die van gangbare VLA-modellen – en de uitgebreide multidimensionale veiligheid verbeterde twintigvoudig.
XPeng introduceerde ook Master Agent, een voertuigagnostisch ‘brein’ gebouwd op zijn Omni multimodale model. Dit combineert VLA-perceptie met de VLM-cockpit, waarbij automatisch de intentie van de gebruiker wordt ontleed en autonome rij-, chassis- en cabinesystemen worden gecoördineerd. Nieuwe stemgestuurde functies, zoals het aanvragen van stoppen langs de weg via spraak, brengen effectief Robotaxi-grade L4-mogelijkheden naar serieproductieauto’s.
De upgrade komt op een moment dat XPeng zich breder richt op fysieke AI. Zijn robotica-onderneming sloot onlangs een eerste private financieringsronde af van meer dan 900 miljoen CHF tegen een waardering van meer dan 6,3 miljard CHF – een record voor een enkele ronde in de Chinese sector voor belichaamde intelligentie – met steun van onder meer IDG, Gaorong, Tencent en Alibaba.
Voor XPeng is de ambitie een uniform fysiek wereldmodel dat rijden, robots en cabine-intelligentie behandelt als één continu, tijdgericht redeneerprobleem in plaats van afzonderlijke, puntgerichte taken. Door tijd in het model te coderen, verwacht het merk dat de volgende sprong in autonomie minder lijkt op waarnemen en meer op het begrijpen van de wereld zoals die zich ontvouwt.
