Обучение без ошибок

Перевод главы из второй части сборника «Experimentos Clássicos em Análise do Comportamento» про классические эксперименты поведенческих аналитиков.

«Несомненно, мы учимся на своих ошибках (по крайней мере, чтобы не совершать их снова), но правильное поведение — это не только отсутствие неправильных реакций» — Б. Ф. Скиннер.

Обучение без ошибок, image #1

Контекст эксперимента

Нужно ли совершать ошибки, чтобы научиться различать цвета, например красный и зелёный? В повседневной жизни мы говорим, что «учимся методом проб и ошибок», которые подразумевают, что ошибки могут способствовать выявлению тех форм поведения, которые приведут к успеху. В академической среде ошибки обычно рассматриваются как возможности для приобретения новых моделей поведения и могут указывать преподавателям на то, на каком этапе обучения находятся студенты. Такой образ мышления предполагает, что в процессе изменения поведения неправильные реакцию (ошибки) дают студенту полезную «информацию» о том, как исправиться и дать правильные ответы.

Беррес Фредерик Скиннер в «Технологии обучения» писал, что если чему-то и можно научиться на ошибках, так это перестать их совершать, но «ошибочно полагать, что обучение происходит только тогда, когда совершаются ошибки». Иными словами, реакция, считающиеся неправильной, может вызвать определенные последствия в окружающей среде — например, учитель говорит «Это неправильно!» или ставит красный крестик напротив ответа ученика) — которые повлияют на появление ошибок в будущем (например, не давать или давать такой ответ реже), но не факт, что возникновение этих ситуаций действительно необходимо для формирования правильных реакций.

В анализе поведения взаимосвязь между обучением, возникновением ошибок и возможными последствиями ошибок изучается как проблема стимульного контроля или, техническими терминами, дискриминации. Как правило, для обучения дискриминации используется дифференцированное подкрепление. В этой процедуре сочетаются, по крайней мере, два условия: в присутствии определенного стимула (SD или S+) появление реакции подкрепляется, а в контексте других стимулов (S-) появление той же реакции остается без подкрепления. Реакции на S+ называются попаданиями или правильными реакциями, а ответы на S- — ошибками или неправильными реакциями.

Некоторые авторы считают, что возникновение реакций в присутствии S- (или ошибок) является необходимым условием формирования дискриминации. Фред Келлер и Уильям Шенфельд подчеркивали, что «гашение является отличительной чертой дискриминации», т.е. для формирования дискриминации реакция на S- должна случиться и привести поведение в контакт с гашением. По их мнению, в начале обучения дискриминации предъявление подкрепления за ответы на S+ увеличивает вероятность реакций в его присутствии, а также на другие стимулы со сходными характеристиками (например, форма, цвет, размер). Поскольку реакции в присутствии S- не подкрепляются, вероятность появления реакций в присутствии этого стимула и других со сходными характеристиками снижается. Таким образом, обучение дискриминации подразумевает появление более частых реакций в присутствии S+ и уменьшение количества таких же реакций в присутствии S-, что является уменьшением количества ошибок.

Герберт Террас заинтересовался, нужны ли ошибки для появления дискриминации. Полученные данные поставили показали, что возможно обучение с небольшим количеством ошибок или вообще без них.

Обучение без ошибок, image #2

Описание экспериментов

В двух экспериментах, проведенных Террасом с голубями, обучение цветовой дискриминации проводилось с использованием процедуры последовательной дискриминации — чередования цветов на одной и той же кнопке. Исследовались две переменные: количество проб до введения S- (рано или поздно) и разница между S+ и S- (способ введения S-: постоянный или постепенный). Анализировалось количество реакций в присутствии S- (ошибок). Если S- вводился рано, обучение дискриминации начиналось с первой сессии, а если S- вводился поздно, то обучение начиналось после нескольких сессий, в течение которых предъявлялся только S+. Если разница между S+ и S- была постоянной, то два стимула имели одинаковую длительность и яркость, отличались только цветом.

При прогрессирующем предъявлении длительность и яркость S- изменялась, до тех пор, пока единственным отличием от S+ не оставался цвет, например, S- мог появляться как тусклый зеленый свет и постепенно нарастать в интенсивности. Чтобы оценить влияние этих переменных, голубей подвергали одной из четырех процедур:

  • прогрессивное обучение с постепенным введением S- с начала обучения дискриминации (прогрессивно-ранее обучение);
  • прогрессивное обучение с предъявлением S- после нескольких сессий, в которых предъявлялись только S+ (прогрессивно-позднее обучение);
  • постоянное обучение с предъявлением S+ и S- с начала обучения (постоянно-раннее обучение);
  • постоянное обучение с предъявлением S- после нескольких сессий S+ (постоянно-позднее обучение).

Эксперимент с интервальным подкреплением

Шестнадцать голубей были разделены на четыре экспериментальные и две контрольные группы. Трое испытуемых каждой экспериментальной группе подвергались только одной из процедур обучения дискриминации: прогрессивно-раннего, прогрессивно-позднего, постоянно-раннего или постоянно-позднего обучения. Одна контрольная группа подвергалась прогрессивно-раннему обучению, а другая — постоянно-позднему обучению.

Все процедуры обучения состояли из двух типов сессий: без обучения дискриминации и с обучением дискриминации. В сессиях без обучения дискриминации предъявляли только S+ (сессии S+), а реакции клевания подкреплялись (доступ к зерну в кормушке в течение 4 сек.) в среднем через одну минуту после выдачи последнего подкрепления (режим с переменным интервалом, VI 1 мин.).

В сеансах обучения дискриминации (сеансы S+/S-) голубей подвергали воздействию множественного режима подкрепления из двух компонентов. Во время первого компонента предъявляли S+ (красный цвет) и подкрепляли реакцию клевания по правилам VI 1 мин. Компонент был активен 3 мин., после чего начинался второй компонент (S-: зелёный). Во время работы S- ответы не подкреплялись (гашение), а продолжительность S- зависела от результатов испытуемого: если реакции не было, то S- предъявлялся 3 минуты; если же реакции в присутствии S- возникали, то таймер на 3 минуты перезапускался, то есть переключение с S- на S+ происходило спустя 3 минуты без клевков (это называется процедурой коррекции). Все сессии завершались после выдачи 60 подкреплений.

При прогрессивном обучении S+ и S- изначально различались по яркости, продолжительности и цвету. Продолжительность и интенсивность S- постепенно изменялись в течение трёх сессий, пока не становились похожими на S+. Изменение свойств S- происходило в три этапа:

  • клавиша для реакций всегда была тёмной, но компонент S- был активен не 3 минуты, а от 5 до 30 секунд;
  • на втором этапе продолжительность S- возвращалась к 5 секундам, но клавиша постепенно становилась подсвеченной, от темного к аналогичному по яркости S+ зелёному;
  • когда достигалась максимальная яркость S-, продолжительность компонента увеличивалась от 5 сек. до 3 мин.

В этих фазах нажатие на клавишу во время S- приводило к повторному предъявлению S- с той же продолжительностью и интенсивностью. В первых трёх сессиях прогрессивно-раннего обучения продолжительность S+ увеличивалась с 30 сек. до 3 мин., а режим подкрепления менялся с непрерывного подкрепления на VI 1 мин. Прогрессивно-позднему обучению предшествовала 21 сессия с предъявлением только S+, в которых подкрепление было запрограммировано в соответствии с VI 3 мин. В последующих сессиях обучения дискриминации (сеансы S+/S-) длительность компонента с S+ составляла 3 мин., а реакции подкреплялись по VI 1 мин. В сессиях постоянного обучения S+ и S- предъявлялись с одинаковой яркостью и продолжительностью, различия были только в цвете.

Два голубя в каждой контрольной группе были подвергнуты прогрессивно-раннему обучению или постоянно-позднему обучению, как и вышеописанных сессиям обучения у экспериментальных групп. Однако процедура коррекции в контрольных группах не использовалась, что обеспечивало постоянство продолжительности компонентов S+ (VI) и S- (гашение) множественного режима (3 минуты). При использовании процедуры коррекции в экспериментальных группах каждая неправильная реакция приводила к началу нового 3-минутного периода предъявления S-, который повторялся до тех пор, пока не отсутствовали реакции. Таким образом, ошибки приводили к увеличению продолжительности воздействия S-, а также к увеличению вероятности появления «ошибки» (то есть реакции в присутствии S-). Чтобы проконтролировать возможное предпочтение красного цвета, в контрольных группах была изменена цветовая дискриминация, т.е. в этих двух группах клевки зелёной клавиши (S+) подкреплялись в течение VI 1 мин., а реакции на красную клавишу (S-) не подкреплялись (гашение).

Обучение без ошибок, image #3

Эксперимент с дискретными пробами

В первом эксперименте не все реакции в присутствии S+ подкреплялись, поскольку был запрограммирован режим VI 1 мин. Чтобы повысить временное разрешение собранных данных, Террас воспроизвел первый эксперимент, но подкреплял каждую реакцию на S+.

Аналогично первому эксперименту, 16 голубей были разделены на четыре экспериментальные группы по три испытуемых и две контрольные группы по два испытуемых в каждой. Четыре экспериментальные группы различались по процедурам обучения дискриминации, проводимым во время первой серии сеансов S+ и S-, но вместо множественного режима подкрепления использовалась процедура дискретных проб. Под испытанием понимался период времени, в течение которого клавиша реакции подсвечивалась красным (S+) или зелёным (S-) цветом. Реакция S+ немедленно подкреплялась. Отсутствие реакций на S+ в течение 5 сек. и реакции на S- сопровождались повторным предъявлением этих стимулов в новой пробе (т.е. процедурой коррекции). Между пробами свет в экспериментальном боксе включался, а клавиша реакции затемнялась. Реакции в течение этого интервала между пробами задерживали начало следующего испытания на 10 сек.

Тактика введения S- в прогрессивных форматах обучения дискриминации напоминала первый эксперимент, но с поправкой на изменившуюся процедуру. В первой фазе менялась интенсивность — продолжительность S- поддерживалась постоянной на уровне 5 секунд, а интенсивность постепенно увеличивалась от затемненной клавиши к зелёному, пока яркость S- (зелёный) не сравнивалась с яркостью S+ (красный). Затем яркость S- фиксировалась и варьировалась продолжительность пробы, с 0.5 до 5 сек. В контрольных группах цветовая дискриминация была изменена на противоположную (S+: зеленый; S-: красный) и не использовалась процедура коррекции.

Обучение без ошибок, image #4

Результаты

Террас обнаружил, что количество реакций в ответ на S- (ошибок) зависит от того, как S- вводится в обучение дискриминации, что можно увидеть в показателях голубей, подвергшихся прогрессивно-раннему и постоянно-позднему обучению (рис. 1). Для групп прогрессивно-раннего обучения в обоих экспериментах (первые три сессии; тёмные столбики) характерно крайне низкое количество реакций в присутствии S- (Эксперимент 1: от 5 до 9 реакций; Эксперимент 2: от 2 до 8 реакций). При постоянном постоянно-позднем обучении частота ошибок, по сравнению с «безошибочным» форматом, была огромной — от 2 до 4 тысяч в первом эксперименте и от 175 до 228 во втором.

Рисунок 1. Количество реакций в ответ на S- (ошибки) в экспериментах 1 и 2 для экспериментальной и контрольной групп в зависимости от типа обучения дискриминации для первых трёх сессий (тёмные столбики) и всех 28 сессий воздействия процедуры (светлые столбики).
Рисунок 1. Количество реакций в ответ на S- (ошибки) в экспериментах 1 и 2 для экспериментальной и контрольной групп в зависимости от типа обучения дискриминации для первых трёх сессий (тёмные столбики) и всех 28 сессий воздействия процедуры (светлые столбики).

В контрольных группах (последние два ряда столбиков справа) дискриминация была усвоена с минимальным количеством реакций в ответ на S- в прогрессивно-раннем обучении и с большим количеством ошибок в постоянно-позднем обучении, что совпадает с показателями соответствующих экспериментальных групп в обоих экспериментах. Важно отметить, что шкалы на вертикальной оси графиков экспериментов отличаются, поэтому количество реакций на S- в первом эксперименте (множественный режим VI-EXT) было значительно выше, чем во втором (дискретные пробы), за исключением прогрессивно-раннего обучения.

Как для экспериментальных, так и для контрольных групп в двух экспериментах, при прогрессивно-раннем дискриминативном обучении количество ошибок оставалось очень низким во всех сессиях воздействия процедуры. В других группах наблюдалась разница между количеством реакций на S- в первых трех сессиях и последующих попытках. В контрольных группах при постоянно-поздним обучении количество реакций на S- после первых трёх сеансов (см. разницу между тёмными и светлыми столбиками) было выше, чем в соответствующих экспериментальных группах, то есть реакции на S- в отсутствие коррекции сохранялись после начальных сеансов обучения, но только в случае постоянно-позднего обучения.

В обоих экспериментах, анализируя первые 10 сеансов обучения дискриминации, Террас обнаружил, что при прогрессивно-раннем и постоянно-позднем обучении реакции на S- были более частыми в первых сеансах и уменьшались в последующих. Напротив, количество ошибок в постоянно-ранних и прогрессивно-поздних группах менялось несистематически. В начале обучения реакции на S- были редкими, а в некоторых последующих сессиях наблюдалось резкое увеличение частоты реакций с последующим резким снижением.

Ещё одно различие между показателями в прогрессивно-раннем обучении и других способах формирования дискриминации наблюдалось в начале второй серии S+/S- сессий. При прогрессивно-раннем обучении (экспериментальная и контрольная группы) в обоих экспериментах точность реакций сохранялась и в последующих сеансах обучения дискриминации (вторая серия сеансов S+/S-). Однако в других группах наблюдалась высокая частота реакций в ответ на S-(ошибки) при переходе от сеансов только с S+ ко второй серии сеансов S+/S-. Другими словами, обучение дискриминаций с ошибками повлияло на количество реакций на S-, демонстрируемых во второй серии сессий обучения дискриминации.

Помимо количественных наблюдений, Террас сообщил, что при предъявлении S- голуби в прогрессивно-ранних группах отходили в сторону и оставались неподвижными перед клавишей ответа до следующего предъявления S+. Учитывая, что в начале обучения тёмная клавиша предъявлялась на короткий промежуток времени, реакцией голубей обычно было отведение головы от клавиши. Через 5 секунд предъявляли S+. Анализируя эту последовательность событий, Террас предположил, что показ S+ мог подкреплять реакцию отведения головы, которая была несовместима с клеванием кнопки. С другой стороны, поведение испытуемых, подвергшихся другим процедурам обучения, было «гораздо более возбужденным». Голуби хлопали крыльями, стучали лапами по полу экспериментальной камеры и отходили от клавиши ответа при предъявлении S-. Иногда это поведение прерывалось спорадическими реакциями клевания S-. Эти особенности поведения испытуемых, которые обучались цветовой дискриминации с большим количеством ошибок, заставили Терраса предположить, что ошибки не только не помогают формированию дискриминации, но и усложняют его, потому что придают S- аверсивные свойства.

Когда дискриминация формировалась с небольшим количеством ошибок или вообще без них (прогрессивно-раннее обучение в экспериментах 1 и 2), частота реакций (т.е. количество реакций, делённое на данный период времени — эксперимент 1) и задержки реакций на S+ (интервал времени между предъявлением стимула и возникновением реакции — эксперимент 2) не зависели от типа обучения дискриминации. В других группах появление реакций на S- во время обучения дискриминации (первая серия S+/S- сеансов) сопровождалось увеличением частоты реакций на S+, затем снижением в сеансах только с S+ и возвращением к высоким показателям во второй серии сеансов S+/S-. Противоположные изменения наблюдались для задержек реакций в эксперименте: за реакциями на S- во время обучения дискриминации следовало снижение задержки реакций на S+, увеличение задержки в начале сессий только с S+ и снижение во второй сессии обучения дискриминации. Основываясь на этих результатах, Террас определил, что увеличение частоты и уменьшение задержки реакций S+ коррелирует с появлением реакций S- во время обучения дискриминации.

Эти два эксперимента свидетельствуют, что дискриминация может происходить с небольшим количеством реакций на S- (ошибок) или вообще без них и что количество реакций в ответ на S-, демонстрируемых во время обучения дискриминации, зависит от способа введения S-. Как было описано ранее, дискриминация, сформированная в условиях с небольшим количеством ошибок в процессе прогрессивно-раннего обучения, отличается от дискриминации, приобретенной с большим количеством ошибок, тремя основными характеристиками:

  • точные показатели, без или с небольшим количеством реакций на S-, на этапе обучения дискриминации, которые сохранялись при последующем тестировании дискриминации;
  • отсутствие изменений в частоте или скорости реакции на S+ между этапом обучения и дополнительными сеансами обучения дискриминации;
  • отсутствие реакций в присутствии S-, рассматриваемых как реакции на аверсивные стимулы, например, отпрыгиваний от кнопки и хлопанье крыльями у голубей.

Результаты, полученные Террасом, противоречат предположению, что ошибки существенны для процесса обучения, и, в частности, утверждению Келлера и Шенфельда, что исчезновение реакций S- является необходимым условием для формирования дискриминации. Возникновение реакций на S- связано с типом процедуры обучения, т.е. с запрограммированными условиями обучения, что согласуется с аргументами Скиннера. В этом смысле ошибки являются результатом процесса обучения дискриминации и не присущи процессу обучения. В отличие от других точек зрения, которые рассматривают ошибки как возможности для приобретения новых форм поведения, было обнаружено, что ошибки могут препятствовать приобретению дискриминации и сохраняться при последующем выполнении аналогичных задач.

Обучение без ошибок, image #6

Дальнейшее развитие

Террас провёл ещё один эксперимент с голубями. Сначала процедура, аналогичная описанной ранее (постепенное введение S-, т.е. прогрессивно-раннее обучение), была использована для обучения дискриминации между красным (S+) и зелёным (S-). Затем на красный фон накладывалась вертикальная линия, а на зелёный — горизонтальная, после чего цвета фонов постепенно удалялись. Испытуемые, подвергшиеся этой процедуре обучения, осваивали дискриминацию вертикальных (S+) и горизонтальных (S-) стимулов без демонстрации реакции в присутствии S- (ошибок), в то время как испытуемые, подвергшиеся обучению только с дифференцированным подкреплением (постоянное обучение), научились различать линии с большим количеством ошибок (404 и 2609 реакций на S-).

В другой фазе эксперимента, испытуемые, ранее подвергавшиеся только постоянному обучению, были подвергнуты новой серии сессий, в которых предъявлялись только цвета. Наблюдалась положительная корреляция между количеством ошибок во время обучения вертикальной и горизонтальной дискриминации и количеством ошибок во второй серии с красно-зелёной дискриминацией. Эти результаты повторяют результаты двух ранних экспериментов Терраса, в которых было обнаружено, что в группах, подвергшихся постоянно-позднему обучению, ошибки при овладении цветовой дискриминацией сохранялось и во второй серии обучения дискриминации. Это свидетельствует, что при возникновении ошибок последующая производительность также страдает.

Исследования Терраса повлияли на дальнейшие исследования и пересмотр прежних представлений о роли ошибок в обучении. Несколько исследований, приведенных в литературе, показывают, что процедуры обучения, минимизирующие ошибки, эффективны для обучения различным видам дискриминации, например, детей дошкольного возраста, детей с аутизмом и людей с умственной отсталостью. Эти результаты актуальны, поскольку они позволили проанализировать процесс обучения, основанный на запрограммированных условиях обучения, и дали возможность разработать безошибочные технологии обучения для людей с нетипичным развитием или тех, у кого не получается обучаться с помощью традиционных процедур.

Основными характеристиками процедуры безошибочной дискриминации являются:

  • постепенное изменение размеров стимулов (например, цвета, размера, формы, яркости), предъявляемых в начале обучения, которое осуществляется на S+, S- или обоих стимулах;
  • уменьшение различий между стимулами, используемыми в начале и в конце обучения дискриминации;
  • изменение стимульного контроля с помощью изменения одних характеристик исходных стимулов в виде появления новых характеристик (например, от цвета к форме).

В начале обучения используются стимулы, имеющие преувеличенно разные характеристики, что позволяет испытуемым точно не путать их (например, S+: красный цвет и S-: кнопка без подсветки; S+: буква b с размером x и S-: буква p с размером 10x). Важно определить, что человек уже умеет делать (история индивида), и стимулы, которые потенциально могут выступать в качестве подкрепления. Если история не проверена, их необходимо изучить до начала обучения дискриминации. Кроме того, важно тщательно выбрать S+ и S- стимулы, определить, на каком стимуле или стимулах будет использоваться процедура, и выбрать характеристики, которые будут меняться, каким образом и за сколько шагов. Прежде чем использовать процедуры безошибочной дискриминации, необходимо проверить, эффективны ли более простые процедуры для обучения дискриминации, которую вы хотите сформировать.

Основные процедуры безошибочной дискриминации — это затухание, изменение формы стимула и отсроченная подача подсказки. Чтобы облегчить дифференциацию, будут описаны разные процедуры для обучения одному и тому же различению геометрических фигур — круга (S+) и треугольника (S-). При исчезновении и изменении формы стимулов постепенные изменения происходили в характеристик стимула, определенного как S- (в присутствии которого реакции не подкрепляются), хотя изменения могли происходить и у S+ или в обоих стимулах (S+ и S-).

В примере на рис. 2 (два столбца слева) затухание начинается с предъявления только S+, что предполагает различение присутствия S+ и отсутствия другого стимула (S-) и гарантирует 100% точность. Впоследствии S- постепенно вводится путём увеличения интенсивности контурной линии треугольника, в то время как S+ остается неизменным на протяжении всего дискриминативного обучения. Помимо этого, затухание может осуществляться путём удаления добавленного стимула (например, цвета в исследовании Терраса) или путём уменьшения характеристик одного из стимулов (например, размера стимула или толщины линий), что называется устранением подсказки. В отличие от этого, стимульный контроль при помощи изменения формы предполагает постепенное изменение топографии или конфигурации начальных дискриминируемых стимулов до тех пор, пока они не превратятся в конечные стимулы дискриминации, например, форма дерева (начальный S-) изменяется до тех пор, пока не станет треугольником (рис. 2; две колонки справа).

Рисунок 2. Этапы обучения различению форм круга (S+) и треугольника (S-) с помощью процедур: (а) исчезновения контура S- (слева); (б) изменения формы стимула S- (справа). Показаны исходные стимулы, два этапа постепенного изменения стимулов S- и конечные стимулы процедуры обучения дискриминации.
Рисунок 2. Этапы обучения различению форм круга (S+) и треугольника (S-) с помощью процедур: (а) исчезновения контура S- (слева); (б) изменения формы стимула S- (справа). Показаны исходные стимулы, два этапа постепенного изменения стимулов S- и конечные стимулы процедуры обучения дискриминации.

В процедуре отсроченной подсказки стимулы (S+ и S-) всегда предъявляются в их окончательной форме. Одновременно с S+ (например, кружок) предъявляется дополнительный стимул — подсказка — например, красная стрелка или палец инструктора в направлении правильной альтернативы. На протяжении всех обучающих испытаний интервал между предъявлением стимулов (круг: S+ и треугольник: S-) и подсказкой увеличивается, пока участник не выберет правильный стимул в отсутствие подсказки. При возникновении ошибок временной интервал уменьшается, либо участник возвращается на предыдущий этап.

На эксперименты Герберт Террас вдохновился теоретическими работами Чарльза Ферстера по безошибочному обучению. Как и работы Б. Ф. Скиннера по запрограммированному обучению, они выглядят достаточно невзрачно и самоочевидно, но это впечатление возникает потому, что они внесли решающий вклад в понимание процесса формирования дискриминации и ими пользуются во всех сферах, в которых хоть сколько-то важно, чтобы кто-то чему-то научился — от школьного обучения и игр до летных симуляторов и психотерапии. В психотерапии подбор начальных стимулов для экспозиционной терапии может занимать большую часть процесса. Как выяснил Террас, ошибки придают аверсивную функцию ситуации обучения и мешают образовательному процессу, что еще более актуально в терапевтическом сеттинге, в котором клиент подвергается стрессовым нагрузкам и склонен переносить ошибки болезненнее. Время чтения — 15 минут.

Переводил Артем Ефремов, редактировал Иван Чистяков, иллюстрации Вероники Романовой. Подписывайтесь на не.психологию, чтобы не пропустить новые материалы!

182 views·12 shares