🧔🏻‍♂️ GPT-4 Creator Ilya Sutskever

Зараз дивлюся недавнє інтерв’ю з Іллею Сатскевером, головним ресерчером в OpenAI і кофаундером компанії. Топовий чувак, якого я безмежно поважаю за його внесок у розвиток AI, починаючи з архітектури Alexnet і закінчуючи GPT.

Ілля стверджує, що навчання глибокої моделі передбачати наступне слово в межі може призвести до дуже докладного розуміння світу. Потрібно тільки щоб модель була дуже потужна і навчальна вибірка всеосяжна. Його думка в тому, що якщо ти добре вивчив розподіл слів і фраз у мові, то ти натурально вже почав розуміти, як влаштований світ, дивлячись на нього через призму тексту.

Я не зовсім згоден, адже тут усе дуже залежить від того, які тексти увійшли в трейн. Вигадка може плутатися з реальністю. Тоді це не є дійсним розуміння світу.

Боротися з галюцинаціями моделей Ілля пропонує за допомогою донавчання їх людським фідбеком (RLHF). Він сподівається що так вони зможуть навчити моделі не галлюцинирвать. Але це ще належить дослідити і зрозуміти, чи так це.

Відео – обов’язкове до перегляду всім, хто цікавиться AI і адептам швидкого приходу AGI.

Ось ще цікаво, Ілля каже, що він згоден з Лекуном у тому, що навчатися розуміти світ простіше, якщо є доступ до даних з декількох модальностей. Наприклад текст, аудіо та картинки разом. Але водночас він вірить, що всього можна навчитися суто за текстом, однак це буде складніше і довше.

Далі він наводить цікавий експеримент. Після навчання LLM, вони подивилися на ембединги, що відповідають за кольори. Виявилося, що модель, яка в очі ніколи не бачила візуальну інформацію, вивчила такі ембединги, де фіолетовий ближчий за блакитний, ніж за червоний, що червоний ближчий за помаранчевий, ніж за фіолетовий, і т.д. І все це модель вивчила тільки на основі тексту.

Ще Ілля визнає, що файнтюнінг RLHF (huggingface.co/blog/rlhf) не додає в модель нових знань про світ. Модель і так уже все вивчила на основі статистичних патернів у тексті під час large-scale тренування. RLHF файнтюнінг же всього лише “робить відповіді моделі надійнішими”, тобто під час файнтюну модель б’ють по руках, якщо вона щось неугодне ляпає.

Від себе додам, що RLHF так само дає змогу ефективніше взаємодіяти з моделлю в режимі інструкцій. Тобто в режим запитання-відповідь або завдання-рішення. Але цього, начебто, можна досягти і без RL, а за допомогою звичайного self-instruct fine-tuning.

Додати коментар