Анализ внутренних мыслей Claude при попытке игнорировать концепцию
D@data_secretsAI-инженер
1 месИсследование внутренних процессов модели Claude: как нейросеть реагирует на запретные темы и проявляет человекоподобные реакции.
Смешной пример из исследования: Claude говорят не думать о мосте в Сан-Франциско во время ответа на вопрос, и в ответ на это во внутреннем пространстве мыслей модели сначала появляется слово «мост», а зачем «damn» («черт»).
Ближе к человеку, чем кажется
Кратко (AI)
В ходе исследования внутренних процессов модели Claude было замечено, что при попытке запретить модели думать о мосте в Сан-Франциско, она сначала фиксирует это понятие, а затем выдает эмоциональную реакцию. Этот пример демонстрирует особенности работы внутреннего пространства мыслей нейросети.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖