Как на самом деле работают LLM
Х@habr_comмедиа / агрегатор
1 месРазбор принципов работы LLM: от токенизации и векторных представлений до механизма внимания и весов модели.
Как на самом деле работают LLM
Раньше на вопрос, сколько букв «R» в слове «strawberry», модель уверенно называла неверное число. Выглядело так, будто она не умеет считать. На деле она вообще не видит отдельных букв, потому что работает не с текстом, а с токенами, числовыми идентификаторами кусков слова, и слово для неё распадается на несколько фрагментов.
Отсюда тянется всё остальное устройство. Токены превращаются в векторы, где king − man + woman даёт примерно queen, дальше их сравнивает механизм внимания, а сами знания вроде «Париж столица Франции» лежат конкретными весами, которые можно точечно переписать и переселить Эйфелеву башню в Рим без переобучения.
Разберёмся, как из токенов и векторов собирается вся работа модели до предсказания следующего слова.
Кратко (AI)
Автор объясняет, почему LLM испытывают трудности с подсчетом букв в словах, связывая это с принципом работы через токены, а не символы. Также кратко описываются механизмы векторных представлений, внимания и хранения знаний в весах модели.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖