Google DeepMind ha presentat Gemini Robotics 2, un salt quàntic en el control de robots que permet a les màquines coordinar tasques complexes, interactuar amb humans i dominar moviments de cos complet amb una destresa sense precedents.
Google DeepMind ha donat un cop sobre la taula aquesta setmana amb el llançament de Gemini Robotics 2, el seu model d'intel·ligència artificial més avançat fins avui per al control de robots. Aquesta no és una actualització menor; estem parlant d'una IA dissenyada per permetre que els robots no només executin tasques, sinó que les 'pensin' i coordinin de forma complexa, marcant una fita en la interacció humà-robot i l'autonomia de les màquines.
El model, presentat el 30 de juliol de 2026, promet alliberar el veritable potencial de la robòtica, acostant-nos a la visió de la intel·ligència artificial de propòsit general. La clau rau en la seva capacitat per actuar com un 'cervell' d'alt nivell, permetent als robots conversar amb persones, entendre el seu entorn físic i planificar seqüències d'accions de diversos passos.
Més enllà de la manipulació: el control total del cos
Mentre que les versions anteriors de Gemini Robotics se centraven en la manipulació d'objectes sobre superfícies, Gemini Robotics 2 amplia dràsticament aquest domini. Ara, els robots humanoides poden realitzar moviments de cos complet, des de caminar i ajupir-se fins a mantenir l'equilibri i manipular objectes amb una precisió sorprenent. Això representa una bretxa significativa entre els pilots controlats i el desplegament en entorns de producció, un desafiament constant per a la indústria.
L'arquitectura d'aquest nou sistema és fascinant. Gemini Robotics ER 2, una de les capes de raonament encarnat, delega el control dels moviments a models de visió-llenguatge-acció (VLA) de baix nivell. Això significa que el robot pot 'pensar' en el seu següent pas mentre ja està executant una acció, reduint les pauses i millorant la fluïdesa.
- Coordinació multi-robot: Permet que diversos robots col·laborin en tasques complexes.
- Interacció avançada: Habilitat per conversar amb humans i comprendre instruccions verbals.
- Planificació de tasques: Capacitat per planificar i executar seqüències d'accions de diversos passos.
- Adaptabilitat: S'adapta a diferents plataformes robòtiques amb només unes hores d'entrenament.
Implicacions per a la indústria i el futur de la IA física
Aquest avenç té ecos profunds per a sectors com la logística, la manufactura i l'assistència a la llar. La capacitat dels robots per raonar sobre seqüències de treball completes i adaptar-se a entorns desconeguts amb un reentrenament mínim és un canvi de paradigma. Ja no es tracta de màquines programades per a una tasca específica, sinó d''agents' capaços de resoldre problemes dinàmicament.
“La robòtica sempre ha estat el banc de proves definitiu per a la intel·ligència artificial. Amb Gemini Robotics 2, Google no només està millorant els robots, està redefinint el que significa que una màquina sigui intel·ligent i adaptable en el món físic”, comenta un analista de la indústria.
La integració amb l'API de Gemini Live també és crucial, ja que utilitza streaming bidireccional per reduir la latència, eliminant les interrupcions en les quals el robot s'aturava a processar abans de cada acció. Això es tradueix en moviments més naturals i eficients.
Estem davant l'inici d'una era on els robots humanoides no només imitaran les nostres capacitats físiques, sinó que les superaran amb una eficiència 'pensada' en temps real? El camí cap a la intel·ligència artificial de propòsit general en l'àmbit físic sembla ara una mica més clar, però les preguntes sobre el seu impacte en la força laboral i la societat amb prou feines comencen.
LaIA de VilaTec