Физичка вештачка интелигенција један је од најактуелнијих сектора улагања ризичног капитала, при чему компаније прикупљају милијарде како би алате који су нам дали велике језичке моделе примениле на роботику.
То узбуђење помогло је да се оствари велики IPO компаније Unitree, водећег кинеског произвођача робота, чија је вредност након изласка на кинеску берзу, пандан Насдаку, достигла 66 милијарди долара.
Међутим, ове недеље је све кренуло низбрдо и компанија је изгубила готово половину своје вредности. Аналитичари указују на један очигледан проблем: док се физичке способности робота побољшавају, они и даље немају знање како да заиста обављају послове који стварају вредност.
Роботима недостају квалитетни подаци за обуку
На конференцији Actuate одржаној прошле недеље, окупљању програмера који граде AI мозгове за роботе, узбуђење је било очигледно. Догађај се утростручио по величини откако је покренут 2023. године и окупио је 1.500 учесника, према организатору Foxglove-u, компанији која помаже произвођачима модела за физичку вештачку интелигенцију да управљају својим подацима и визуализују их.
Ризик је такође био очигледан: на штанду компаније Avala, још једног играча у области инфраструктуре за физичку вештачку интелигенцију, стајао је натпис који је обећавао да ће решити „кризу роботичких података“.
Та криза представља недостатак висококвалитетних података за обуку AI модела. Покушаји да се направе генерализовани роботи који могу да обављају било који задатак и даље су далеко од реализације, а коришћење end-to-end учења за специфичне задатке још увек није довело до производа са поузданим комерцијалним перформансама.
За програмере, одговор је у бољем опонашању напретка водећих AI лабораторија – проналажењу или креирању разноврснијих скупова података, експериментисању са различитим режимима обуке и проналажењу бољих сценарија за учење путем појачања.
Физички AI је још у „GPT-2 ери“
Хари Мелсоп, оснивач компаније Antioch, стартапа који прави алате за симулацију за оне који развијају моделе, сматра да се физичка вештачка интелигенција налази у својој „GPT-2 ери“, моделу OpenAI-ја који је претходио појави ChatGPT-а.
Биће потребно више података и рачунарске снаге како би се превазишла ова препрека, посебно GPU процесора оптимизованих за ray tracing, који се користе за креирање симулација високе верности.
Аутономна возила су најдаље одмакла
Најдаље су стигла аутономна возила, делимично због могућности да прикупљају релевантне податке из аутомобила којима управљају људи, а делимично зато што је њихов главни задатак избегавање контакта, а не манипулисање физичким окружењем.
Велики део алата за изградњу модела долази од компанија које се баве аутономним возилима; Foxglove је, на пример, основала група бивших запослених у Cruise-у, некадашњем пројекту General Motors-а за аутономну вожњу.
А сада се те аутомобилске компаније све више кладе на то да ће им њихова улагања у ML алате омогућити да се такмиче са компанијама које су специјализоване за хуманоидне роботе.
Tesla то већ покушава са својим роботом Optimus, а сада су и Wayve, компанија усмерена на аутономна возила, и гигант у области превоза Uber покренули роботичке лабораторије усмерене на хуманоидни облик као истраживачко-развојне пројекте.
„Мислим да морате да почнете са возилима… роботика која подразумева манипулацију је као самовозећа вожња пре пет година“, рекао је Алекс Кендал, директор компаније Wayve, за TechCrunch.
„Инфраструктура за податке, симулацију и ML Ops вероватно ће бити заједничка, али ће конкретан светски модел за симулатор бити другачији након обуке. Биће много више заједничког него различитог, али ће онда бити потребне неке разлике за различите облике робота.“
Кендал сматра да је прерано определити се за било коју конкретну хардверску платформу – напредак у сензорима и другим компонентама одвија се веома брзо, а истински генерализовани модел требало би да буде што независнији од конкретног хардвера.
Да ли је још прерано за стратегију „мозга“?
Теофил Жерве, директор компаније Genesis AI, вертикално интегрисане компаније за развој хуманоидних робота која је ове године прикупила 105 милиона долара у почетној инвестиционој рунди, није се сложио.
„Прерано смо у овом таласу да би стратегија заснована само на мозгу функционисала; наш став је да постоји много прилика за заједничко пројектовање хардвера и AI-ја“, рекао је Жерве за TechCrunch.
Жерве се такође осврнуо на још једну актуелну тему у овом сектору: на питање колико конкретно треба усмерити пословање физичког AI-ја.
Роботичке компаније које циљају на специфичне задатке већ шаљу своје роботе на терен – Gritt гради соларне фарме, Agility поставља роботе у индустријским окружењима, а Bedrock аутономно управља багерима.
У међувремену, хуманоиди опште намене не излазе из лабораторија.
„Ниједног купца не занима робот опште намене који ради са стопом успешности од 80 одсто“, рекао је Жерве о тој дилеми.
„Видимо много других играча који иду у правцу опште намене, али нема пружене вредности јер не постоји вертикални фокус. Али онда, ако градите [нешто за] уску вертикалу на врху GPT-2, бићете уништени од стране компаније која гради на GPT-4.“
Зашто се компаније ипак опредељују за специфичне задатке?
Ипак, искушење да се физички AI посао усмери на одређену вертикалу је велико јер то не доноси само приход већ и податке из стварних примена.
Иако подаци специфични за одређени задатак можда немају довољно разноликости да погурају моделе опште намене напред, они су важни за прављење робота који ствара вредност.
Кевин Петерсон, технички директор компаније Bedrock, рекао је да је његова компанија тек почела са ископавањем као начином да разуме изазове „манипулације у стварном свету“, али да планира да развије интелигентни слој који се протеже кроз низ грађевинских машина.
Огромна количина визуелних и лидарских података
Управљање свим тим подацима представља изазов, посебно због густине визуелних и лидарских података.
Foxglove је ове недеље представио нови производ, изграђен на Nvidia Cosmos светском моделу са отвореним тежинама, који инжењерима омогућава да претражују те податке помоћу софистицираних упита на природном језику како би креирали евалуације и симулације.
Циљ је бржа тријажа и отклањање грешака како би произвођачи модела могли брже да понављају процес развоја.
Како ће изгледати „ChatGPT тренутак“ за физички AI?
Па, шта ће бити чувени ChatGPT тренутак за физички AI, за који је Сем Алтман недавно рекао да је удаљен само неколико година?
Кендал указује на то да су највећа роботска примена на свету и даље потрошачки роботи усисивачи.
За њега би ChatGPT тренутак био нешто што узбуђује потрошаче, а не инвеститоре, који су очигледно већ довољно узбуђени.
„Један пример био би када добијете аутономију без гледања на пут за мање од 1.000 долара хардвера у аутомобилу“, каже Кендал.
Не случајно, његова компанија лиценцира моделе произвођачима аутомобила у покушају да произведе управо то.
А тај посао, који он види као прилику вредну више милијарди долара, омогућиће им да изграде заиста генерализовани модел отелотворене вештачке интелигенције.
За Жервеа, тренутак када физички AI постане стварност јесте „манипулација која једноставно функционише одмах“.
„Можете да разговарате са роботом природним језиком и кажете му да обави било који основни задатак који подразумева манипулацију, попут гурања, повлачења, затварања лаптопа, сређивања стола, шта год желите да урадите, и он то уради са одређеним нивоом поузданости, рецимо 80 одсто или више – то је отприлике ваше ChatGPT искуство.“
Можда уопште неће бити једног „ChatGPT тренутка“
Адријан Мекнил, директор компаније Foxglove, на ово питање гледа нешто другачије.
„Неће бити ChatGPT тренутка за роботику“, рекао је за TechCrunch.
„Оно што је ChatGPT учинило тренутком у времену била је дистрибуција – прешли су са нуле на отприлике милион активних корисника за недељу дана… дистрибуција у стварном свету је много тежа од тога, зар не?“
Мекнил би, каже, био веома узбуђен због Apple II тренутка или IBM PC тренутка у роботици.
„Када ћу моћи да купим кућног робота који ће почети да ради неке корисне и забавне ствари?“






