← к ленте

Анализ внутренних мыслей Claude при попытке игнорировать концепцию

D@data_secretsAI-инженер
1 мес

Исследование внутренних процессов модели Claude: как нейросеть реагирует на запретные темы и проявляет человекоподобные реакции.

Смешной пример из исследования: Claude говорят не думать о мосте в Сан-Франциско во время ответа на вопрос, и в ответ на это во внутреннем пространстве мыслей модели сначала появляется слово «мост», а зачем «damn» («черт»). Ближе к человеку, чем кажется

Кратко (AI)

В ходе исследования внутренних процессов модели Claude было замечено, что при попытке запретить модели думать о мосте в Сан-Франциско, она сначала фиксирует это понятие, а затем выдает эмоциональную реакцию. Этот пример демонстрирует особенности работы внутреннего пространства мыслей нейросети.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖