Prima di avviare un POC con un robot Unitree in università o in un reparto R&D conviene sapere cosa la ricerca ha già dimostrato su queste piattaforme. Go1, A1, Go2, H1 e G1 sono tra i robot più usati nei preprint di robotica degli ultimi anni: costano meno delle alternative, hanno un SDK accessibile e molti gruppi pubblicano codice e modelli. Leggere i paper giusti aiuta a fissare obiettivi realistici, a scegliere lo stack software e a stimare quanto lavoro di integrazione serve davvero.
Questa è una lista di lettura ragionata: 12 preprint arXiv che abbiamo aperto e verificato uno per uno (titolo, primo autore, anno di prima sottomissione su arXiv, ID e robot Unitree usato negli esperimenti). Per ognuno trovi in breve cosa mostra e cosa significa per chi pianifica un POC.
Come leggere questi paper (e cosa non aspettarsi)
- Demo non vuol dire prodotto: un video di parkour è il risultato di mesi di lavoro di un gruppo specializzato, con hardware spesso modificato (telecamere di profondità aggiunte, calcolo esterno, batterie di ricambio).
- Controlla il modello esatto: molti lavori del 2021–2023 usano A1 o Go1, modelli di generazioni precedenti. Le idee si trasferiscono a Go2, ma interfacce, sensori e limiti di coppia cambiano.
- Cerca il codice: un paper con repository pubblico e istruzioni per il robot reale vale molto di più, per un POC, di uno solo descrittivo.
- Serve la variante EDU: quasi tutti questi lavori controllano i giunti a basso livello, cosa possibile solo con le versioni che espongono l'SDK.
1. Locomozione con reinforcement learning (quadrupedi)
RMA: Rapid Motor Adaptation for Legged Robots
Kumar et al., 2021 — arXiv:2107.04034 — Unitree A1.
Una policy addestrata interamente in simulazione, più un modulo che stima in tempo reale le condizioni (terreno, carico, usura) e adatta il controllo in frazioni di secondo, senza fine-tuning sul robot reale. Per un POC è il riferimento concettuale del sim-to-real: mostra che la robustezza nasce dalla varietà degli scenari simulati, non dalla taratura manuale.
Walk These Ways: Tuning Robot Control for Generalization with Multiplicity of Behavior
Margolis e Agrawal, 2022 — arXiv:2212.03238 — Unitree Go1.
Un solo controller che espone parametri regolabili a runtime (andatura, altezza del passo, postura, velocità), così si può adattare il comportamento a un nuovo ambiente senza riaddestrare. Il codice è pubblico: per un laboratorio è uno dei punti di partenza più pratici per avere una locomozione learning-based su un quadrupede Unitree.
2. Parkour e terreni estremi
Robot Parkour Learning
Zhuang et al., 2023 — arXiv:2309.05665 — Unitree A1 e Go1.
Abilità di parkour diverse (arrampicarsi, saltare buche, passare sotto ostacoli bassi) imparate con RL e poi distillate in un'unica policy che usa la telecamera di profondità a bordo. Dimostra che anche robot a basso costo possono scegliere da soli l'abilità giusta; per un POC indica quanto conta la pipeline di percezione egocentrica, non solo il controllo.
Extreme Parkour with Legged Robots
Cheng et al., 2023 — arXiv:2309.14341 — Unitree A1.
Una singola rete neurale che va direttamente dall'immagine di profondità ai comandi dei motori, con salti su ostacoli alti il doppio del robot. Il messaggio pratico: un sensore economico e rumoroso basta, se l'addestramento in simulazione è fatto su larga scala; ma servono GPU e competenze RL solide.
Humanoid Parkour Learning
Zhuang et al., 2024 — arXiv:2406.10759 — Unitree H1.
Porta lo stesso approccio sugli umanoidi: una policy whole-body basata sulla visione che salta su piattaforme e oltre ostacoli, senza dati di movimento umano. Gli autori mostrano anche che si possono sovrascrivere le braccia per compiti di manipolazione mobile: utile per chi vuole un umanoide che cammini in modo robusto mentre esegue un task.
3. Teleoperazione whole-body e raccolta dati
Learning Human-to-Humanoid Real-Time Whole-Body Teleoperation (H2O)
He et al., 2024 — arXiv:2403.04436 — Unitree H1.
Teleoperazione in tempo reale di tutto il corpo di un umanoide usando solo una telecamera RGB che riprende l'operatore. Interessante per POC di dimostrazione o di raccolta dati: mostra quanto lavoro serve per filtrare i movimenti umani non replicabili dal robot (il processo "sim-to-data").
OmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and Learning
He et al., 2024 — arXiv:2406.08858 — Unitree H1 con mani destre.
Estende H2O a visore VR, comandi vocali e telecamera, e usa le dimostrazioni teleoperate per addestrare comportamenti autonomi. Per un'azienda è il modello del flusso "teleoperazione → dataset → policy" che oggi sta dietro a molti progetti di imitation learning.
Open-TeleVision: Teleoperation with Immersive Active Visual Feedback
Cheng et al., 2024 — arXiv:2407.01512 — Unitree H1 (e un secondo umanoide).
Teleoperazione immersiva con visione stereo: l'operatore vede ciò che vede il robot e le sue braccia e mani vengono replicate. Il sistema è open source ed è stato usato per compiti lunghi e precisi (smistare lattine, piegare, scaricare): un buon riferimento per stimare l'hardware necessario a raccogliere dimostrazioni di qualità.
4. Controllo degli umanoidi e sim-to-real
ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills
He et al., 2025 — arXiv:2502.01143 — Unitree G1.
Le policy vengono prima addestrate in simulazione su movimenti umani, poi si raccolgono dati sul robot reale per imparare un modello correttivo che riduce il divario tra simulatore e realtà. È uno dei lavori più rilevanti per chi ha un G1: spiega perché una policy che funziona in Isaac Gym può comportarsi diversamente sul robot e come misurarlo.
BeyondMimic: From Motion Tracking to Versatile Humanoid Control via Guided Diffusion
Liao et al., 2025 — arXiv:2508.08241 — Unitree G1.
Un framework di motion tracking che riproduce movimenti molto dinamici con un'unica configurazione, e un modello a diffusione che li ricombina per compiti nuovi (per esempio teleoperazione via joystick o evitamento ostacoli) trasferiti sul robot reale. Indica dove sta andando il controllo umanoide: meno tuning per singolo movimento, più modelli generali.
5. Navigazione
ViNT: A Foundation Model for Visual Navigation
Shah et al., 2023 — arXiv:2306.14846 — tra le piattaforme di test c'è Unitree Go1.
Un modello di navigazione visiva addestrato su centinaia di ore di dati da robot diversi, che funziona anche su piattaforme non viste in training, incluso un Go1 con la sola telecamera frontale. Per un POC di ispezione mostra che un modello pre-addestrato può essere un punto di partenza, ma va validato nel proprio ambiente.
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
Cheng et al., 2024 — arXiv:2412.04453 — Unitree Go2 e H1.
Un modello visione-linguaggio-azione traduce istruzioni in linguaggio naturale in comandi intermedi ("avanza di 75 cm") eseguiti da una policy di locomozione RL; i test reali includono un Go2 e un H1. Per un'azienda è un buon esempio di architettura a due livelli: il modello "intelligente" decide, la policy di basso livello resta separata e verificabile.
Tabella riassuntiva
| Tema | Paper | Robot | Utile per |
|---|---|---|---|
| Locomozione RL | RMA, Walk These Ways | A1, Go1 | Base sim-to-real su quadrupede |
| Parkour | Robot Parkour, Extreme Parkour, Humanoid Parkour | A1, Go1, H1 | Percezione + controllo end-to-end |
| Teleoperazione | H2O, OmniH2O, Open-TeleVision | H1 | Raccolta dati e imitation learning |
| Controllo umanoide | ASAP, BeyondMimic | G1 | Movimenti agili, divario sim-real |
| Navigazione | ViNT, NaVILA | Go1, Go2, H1 | Navigazione visiva e da linguaggio |
Dal paper al POC: come lo usiamo in CALIGO
- Definiamo il KPI: cosa deve fare il robot, in quale ambiente, con quale tasso di successo.
- Scegliamo 2–3 paper di riferimento con codice pubblico e lo stesso modello (o uno vicino) di quello disponibile.
- Riproduciamo in simulazione prima di toccare il robot, poi passiamo all'hardware con protocolli di sicurezza.
- Integriamo con SDK Unitree e ROS 2, che è la parte che i paper descrivono meno e che richiede più tempo.
Se vuoi approfondire gli aspetti pratici, vedi anche la guida su come impostare un POC con un umanoide, la programmazione del G1 e la guida rapida ROS 2 su Unitree.
Domande frequenti
I risultati di questi paper si possono riprodurre su un Go2 o un G1 acquistato oggi?
Spesso sì nei principi, raramente "così come sono". I lavori su A1 e Go1 vanno adattati a interfacce e sensori del Go2; quelli su G1 usano versioni EDU e talvolta hardware aggiuntivo. Conviene partire dai progetti con codice pubblico e prevedere tempo di adattamento.
Serve una variante EDU per fare ricerca?
Per il controllo a basso livello dei giunti, sì: le versioni base non espongono l'SDK di sviluppo. Quasi tutti i paper di questa lista presuppongono l'accesso completo ai motori.
Che risorse di calcolo servono?
L'addestramento RL avviene in simulazione e richiede almeno una GPU recente; i tempi dipendono dal compito e dal simulatore. Sul robot gira poi solo l'inferenza della policy, sul computer di bordo o su uno esterno.
arXiv è affidabile?
arXiv ospita preprint: molti di questi lavori sono stati poi pubblicati in conferenze, ma non tutti sono passati per revisione. Video e codice pubblico sono il modo più rapido per valutare quanto un risultato sia solido.
Vuoi trasformare un paper in un POC?
CALIGO offre assistenza tecnica e sviluppo software su robot Unitree: configurazione, SDK, ROS 2, POC e formazione. Se hai individuato un lavoro da riprodurre o un caso d'uso da validare, scrivici e ne parliamo.
Panoramica commerciale e catalogo: Abra Robotics.