دخلت شركة شاومي الصينية مرحلة جديدة في تطوير الروبوتات عبر إطلاق نموذجها الضخم الجديد Xiaomi-Robotics-0، الذي يمثل دمجاً متطوراً بين الفهم اللغوي والرؤية الحاسوبية والتنفيذ الحركي. يعتمد النموذج على 4.7 مليار معلمة، ويستند إلى معمارية Mixture-of-Transformers، مما يجعله قادراً على معالجة التعليمات البشرية المعقدة وتحويلها إلى أفعال دقيقة.

يتكون النظام من جزأين رئيسيين؛ الأول هو نموذج بصري لغوي يعمل كدماغ للروبوت، والثاني هو خبير حركة يعتمد على تقنية Diffusion Transformer لضمان سلاسة الأداء. كما ابتكرت شاومي تقنية Λ-shaped attention mask لتقليل زمن الاستجابة، مما يتيح للروبوت التركيز على المدخلات البصرية اللحظية بدلاً من الاعتماد على البيانات السابقة فقط.

أثبت النموذج كفاءته في اختبارات المحاكاة العالمية مثل LIBERO وCALVIN، متفوقاً على أكثر من 30 نموذجاً منافساً. وفي التجارب الواقعية باستخدام روبوت ذي ذراعين، أظهر النظام قدرة فائقة على تنفيذ مهام معقدة مثل التعامل مع المواد المرنة وتفكيك المكعبات، مما يعكس طموح شاومي في قيادة أبحاث الذكاء الفيزيائي وتطوير روبوتات قادرة على التفاعل بذكاء مع البيئة المحيطة.