Я-в-будущем: как отсрочка подкрепления влияет на поведение
Текст является переводом главы 'O cheque está no correio: investigando como o reforço atrasado afeta o desempenho' за авторством Kennon A. Lattal из сборника 'Experimentos Clássicos em Análise do Comportamento'. Сборник представляет собой изложение классических экспериментов из анализа поведения.
Введение в исследование и контекст эксперимента
Эдвард Ли Торндайк заложил основу для будущих исследований отложенного подкрепления, заявив, что реакции, которые сопровождаются удовлетворением, подкрепляются. Однако, изучением временной близости для отношений «реакция-подкрепление» занимались другие исследователи, сменившие Торндайка.
Кларк Халл подробно обсуждал проблему отложенного подкрепления в своей книге «Принципы поведения», уделяя особое внимание механизмам, ответственным за поддержание поведения в условиях отсроченного подкрепления. Отсроченное подкрепление также фигурирует в качестве исследовательской проблемы в книге Берреса Скиннера «Поведение организмов». Анализ Скиннера был более эмпирическим, тогда как Халл предпринимал теоретические попытки описать механизмы в основе отложенного подкрепления.
Эксперименты, в которых вводилась временная задержка между реакцией, вызывающей подкрепление, и выдачей этого подкрепления, описаны в двух разделах книги «Поведение организмов» Скиннера. Задержки, исследованные Скиннером (1938), были несигнальными, т.е. никакие изменения стимула не сопровождали начало задержки. В первом эксперименте ответная реакция приводила в действие «маятник, который обеспечивает срабатывание магазина [т.е. устройства, выдающего корм] по истечению желаемого времени». Скиннер показал данные по восьми крысам с использованием задержек в 1, 2, 3 и 4 секунды. При таких задержках частота поведения сравнима со мгновенным подкреплением.
Из книги Скиннера напрямую неясно, сбрасывался ли промежуток времени в случае, если крыса нажимала рычаг повторно до предъявления подкрепления, когда «начинается отсчёт нового промежутка, иначе вторая реакция будет подкреплена слишком быстро, но тогда первая реакция остаётся неподкреплённой вовсе». В этом эксперименте Скиннер не смог решить проблему неподкреплённых реакций и интервал, видимо, был несбрасываемым: «Мне удавалось обусловить реакцию даже с промежутком в 8 секунд, но ввиду наличия неподкреплённых реакций трудно сказать, снизилась ли частота».
Далее в книге он описал ещё два эксперимента с отложенным подкреплением. Он начал с того, что напомнил о проблеме процедуры, о которой говорилось выше: «Не принято мер предосторожности против возможного совпадения второй реакции с отложенным подкреплением. В таком случае реакция подкрепляется мгновенно», что делало более вероятным то, что итоговая задержка будет короче запрограммированной.
Но была и вторая проблема, связанная с крысами, которые держали планку нажатой. В экспериментах отчёт задержки начинался с первоначального нажатия на планку, хотя иногда планка продолжала нажиматься во время задержки и отпускалась только в конце интервала. Это заставило Скиннера задаться вопросом о том, приводит ли это к немедленному или отсроченному подкреплению, он отмечает, что «это больше, чем просто техническая сложность».
Оборудование, использовавшееся в этом эксперименте, было таким же, как и в описанном выше, но здесь Скиннер приводит уточнение о механизме работе устройства: «оборудование обладает следующим важным свойством: если в течение промежутка совершалась вторая реакция, отсчёт начинался заново, и перед подкреплением должен был вновь истечь целый промежуток». Используя эту процедуру, крысы прошли «обычное обусловливание» (вероятно, Скиннер имел в виду мгновенное подкрепление) по схеме с фиксированным интервалом (FI) 5 мин. После этого обучения в течение трех сессий с разными крысами использовались задержки в 2, 4, 6 и 8 с. При действии задержек частота реакции снижалась, причем две более короткие задержки снижали реакцию меньше, чем две более длинные. В последнем эксперименте с отложенным подкреплением Скиннер проанализировал эффекты от различных изменений в обучении и использовании задержек.
Следующее важное исследования эффекта задержки подкрепления провёл Чарльз Ферстер. Большинство теоретиков научения до этого, включая Скиннера, были сосредоточены на пагубном влиянии отложенного подкрепления на обучение. Ферстер изменил постановку вопроса и исследовал возможность сохранить частоту поведения при появлении задержки перед подкреплением. Он провел серию экспериментов с голубями, в которых сначала поддерживал реакцию клевания с помощью схемы подкрепления с переменным интервалом (VI).
В первом и втором экспериментах между подкреплением и реакцией, вызвавшей его, возникали задержки, которые сигнализировались отключением света в экспериментальной камере c голубем. Отключение света использовалось для предотвращения дополнительный клевков клавиши голубев и непосредственно следовало за клевком. Таким образом выключение света выполняло функцию стимула, который коррелировал с предъявлением подкрепителя. В результате задержка подкрепления была сопряжена с условной подкрепляющей функцией отключения света. Это сопряжением позволяет рассматривать данный эксперимент и все эксперименты с сигнальной задержкой подкрепления как проверку влияния «чистой» задержки подкрепления на реагирование. Так Ферстер смог решить проблему Скиннера с повторными клевками во время задержки.
В первом эксперименте Ферстер наблюдал, что задержки в 60 сек. вызывали «небольшое падение» частоты реакции, но при задержках в 120 сек. частота реакций падала примерно вдвое по сравнению с немедленным подкреплением.
Во втором эксперименте Ферстер пытался поддерживать высокую частоту реакций, постепенно вводя задержку, увеличивая их продолжительность с 1 до 60 сек. в течение 90-часового периода обучения.
Он сообщил: «Три испытуемых, которые сохранили нормальную частоту реакции при 60-секундных задержках, были подвергнуты этой процедуре в течение нескольких сотен экспериментальных часов каждый». По мнению Ферстера, реакция четвертого голубя не сохранилась, поскольку «задержка увеличивались слишком быстро». В описании своих экспериментов он не приводил количественных данных, полагаясь на словесные описания происходящего, подкрепленные лишь несколькими суммирующими графиками с показателями голубей.
Направления исследования Скиннера и Ферстера создают контекст для темы данной главы — эксперимента Аззи, Фикса, Роша э Сильва и Келлера.
Важной частью истории эксперимента Аззи и др. является связь Фреда Келлера с Бразилией, которая возникла после его приезда в качестве преподавателя программы Фулбрайта в университет Сан-Паулу в начале 1961 года. Его научным ассистентом был Родольфо Аззи, который вместе с Келлером и другими бразильскими исследователями изображен на фотографии.
Об Аззи Келлер сказал:
«Он быстро стал моим консультантом и гидом, ввёл меня в курс всего, что я должен был знать о своих студентах, преподавателях и административном персонале. Он помогал мне отвечать на вопросы, писать отчеты и оценивать успехи моих студентов. Он готовил меня к важным встречам, информировал о новых событиях и оберегал от неприятностей любого рода».
Вскоре после начала преподавательской деятельности Келлер получил посылку с исследовательским оборудованием, которое он приобрел у компании Grason-Stadler из Уолтхэма, штат Массачусетс.
Он вспоминал, что для оборудования «не было инструкции, поэтому нам пришлось определять, как оно работает, методом проб и ошибок. Мы с Родольфо [Ацци] и Марио Гуиди, студентом нашего курса, разбирались несколько дней, прежде чем наконец поняли, как автоматизировать длительное исследование влияния различных задержек подкрепления на реакцию трех белых крыс (которых Родольфо назвал Альфа, Бета и Гамма) на нажатие на планку. Результаты были опубликованы в журнале Journal of the Experimental Analysis of Behavior».
Мы можем только предполагать, почему именно задержка подкрепления стала предметом первого исследования, опубликованного в Journal of the Experimental Analysis of Behavior с первым бразильским автором (Аззи).
Вернемся ко второму эксперименту Скиннера с задержкой подкрепления, описанному в «Поведении организмов». Вспомним, что он использовал процедуру сбрасываемой задержки, при которой каждая реакция, возникшая после той, которая инициировала задержку, возобновляла интервал задержки. Для снижения частоты реакций сделали так, чтобы «ни одна реакция не подкреплялась, если в течение 15 секунд возникала другая реакция», положив тем самым начало схеме дифференцированного подкрепления низкой частоты реакций (DRL).
Впоследствии Уилсон и Келлер (1953 г.) изучали влияние схем DRL на нажатие крысами планки при различных значениях «задержки» (т.е. значениях DRL). Эксперимент Уилсона и Келлера вырос из первоначальной демонстрации схемы дифференцированного подкрепления отсутствия реакций (DRO), в которой начало периода SD происходило только при отсутствии реакций в непосредственно предшествующем периоде S-дельта в течение определенного периода времени.
Сбрасываемая процедура задержки подкрепления — это схема DRL без обязательной реакции в конце интервала, а схема DRO — это процедура задержки с возможностью сброса, но без требования наличия реакции для начала каждого интервала DRO (подкрепление происходит до тех пор, пока не возникает целевая реакция; если целевая реакция возникает, она перезапускает интервал DRO). Объедините все эти идеи и добавьте тот факт, что Ферстер (один из аспирантов Келлера в Колумбийском университете) ранее изучал эффекты сигнального отложенного подкрепления, и, вуаля, возникли процедуры, использованные Аззи и др. Мы не знаем наверняка, как возникла идея эксперимента, но, несомненно и неудивительно, она может быть тесно связана с некоторыми из более ранних работ Келлера и его студентов в Колумбийском университете.
Описание эксперимента
Цель и метод
Аззи и др. (1964) стремились сделать две вещи:
- исследовать оперантное реагирование в условиях, когда интервал между подкреплением и реакцией, вызывающей его, изменялся;
- сравнить условия, в которых задержка сопровождалась изменением стимулов (сигнальная задержка) или происходила без каких-либо изменений в течение интервала задержки (несигнальная).
Эксперимент представлял собой сравнение сигнальной и несигнальной задержек подкрепления, использованных в экспериментах Скиннера и Ферстера.
Для этого эксперимента три крысы сначала обучили нажимать на планку по схеме с фиксированным соотношением (FR) 1, в которой подкреплением было появление доступа к воде. Полагаем, что в это время в Бразилии не было ни пищевых гранул, которые использовались экспериментах Скиннера, ни средств для выдачи этих гранул. Воду было легко достать, и Келлер привез с собой так называемый «ковш Бреннера», который позволял автоматизировать подачу воды в экспериментальную камеру в качестве подкрепления. После первоначального обучения «в слабоосвещенной камере каждая крыса последовательно получала задержки подкрепления на 1, 3, 5, 7,5, 10, 15 и 20 секунд, именно в таком порядке, по 150 подкреплений для каждого интервала задержки». Такая схема подкрепления, если использовать техническую терминологию, представляла собой тандем FR 1 и DRO t-s, где t соответствовало одному из значений задержки, представленных выше. Схема «тандем» (латинское слово, означающее «один сразу за другим») идентична схеме подкрепления поведенческой цепи, поскольку для возникновения подкрепления необходимо, чтобы два или более компонентов схемы были завершены в фиксированной последовательности. Однако в схеме «цепь» каждый компонент связан с отдельным стимулом, а в схеме «тандем» стимул, связанный с каждым компонентом, идентичен.
В методике Аззи и соавторов каждая задержка возобновлялась, если в течение интервала задержки происходила реакция (сбрасываемая задержка), и стимул не менялся в течение периода задержки. Затем для двух крыс были проведены различные манипуляции с длительностью задержки. Третья крыса, по-видимому, подвергалась воздействию только 20-секундной схемы DRL с немедленным подкреплением.
Как и в первой, так и во второй части эксперимента схема подкрепления представляла собой тандем FR 1 DRO t-s, где t составляло 20 сек. в течение десяти дней, а затем шесть дней с t=30 сек. В течение половины каждого сеанса «каждое животное работало в камере с пониженным освещением». В другой половине сеанса «во время каждого интервала задержки была полная темнота каждый раз, когда происходило нажатие на планку, и свет не включался до тех пор, пока не заканчивалась задержка и происходило подкрепление». В этой части эксперимента исследовалось наличие влияние задержек, коррелирующих с изменением стимула (темнотой и отсутствие изменений в освещении), на сохранение частоты реакции.
Результаты и обсуждение
Было получено два результата. Во-первых, частота реакций поддерживаемая при тандемной схеме FR 1 DRO t-s приводила к тому, что при увеличении задержки с 1 до 10 сек. частота реакции резко падала, но достигала асимптоты в этой точке и не падала дальше, когда задержки длились 15 или 20 сек. Эта зависимость называется градиентом задержки подкрепления и является характерной для связи между измерениями реакции и длительностью задержки при самых разных задержках подкрепления и параметрах схемы подкрепления. Выключение света во время задержки «давало значительный эффект, упорядочивая и увеличивая частоту реакции [по сравнению с наблюдаемой в условиях отсутствия сигнала задержки] во всех случаях, кроме нескольких».
В ходе обсуждения была рассмотрена роль промежуточного поведения в поддержании реакции во время задержки — наблюдения, сделанного ранее Ферстером. В том анализе, который впоследствии стал стандартом, изменение стимула (при сигнальной задержке) понимается как условное подкрепление, поддерживающее реакцию, которое его вызвало. До сих пор это общепринятая интерпретацией роли изменения стимула в процедурах с сигнальной задержкой подкрепления. Хотя такая интерпретация и ставилась под сомнения, в своём исследовании Бен Уильямс отмечает: «Очевидно, что полученные результаты не могут служить убедительным доказательством того, что эффект маркировки не имеет места. Однако полученные результаты демонстрируют, что мощные эффекты условного подкрепления могут быть получены в ситуациях, для которых маркировка не может быть объяснением. <…>
Приведенные данные являются убедительным доказательством правомерности использования условного подкрепления в качестве фундаментальной концепции теории обусловливания. <…> в других исследованиях [напр., Вильямса и Данна] с использованием аналогичных методов показано, что облегчение обучения, полученное с помощью данной процедуры [маркировки], в значительной степени зависит от сопряжения звукового сигнала с пищей, поскольку звуковые сигналы, не сопряженные с пищей, но связанные с правильным выбором, не облегчают обучение».
Перспективы
Результаты обоих экспериментов позволяют считать эксперимент Аззи и соавторов основополагающим в изучении отложенного подкрепления. Градиенты задержки подкрепления, представленные Аззи и др., были воспроизведены при использовании различных схем подкрепления для поддержания реакции и при более широкой вариации значений задержки. Аззи и др. также предвосхитили несколько последующих сравнений задержки подкрепления с сигналом и без него, которые дали примерно те же результаты: сигнальные задержки поддерживают более надежное реагирование, чем несигнальные. Особенно интересной особенностью работы Аззи и др. является внутрисубъектное сравнение сигнальных и несигнальных задержек, т.е. условия сигнальными и несигнальными задержками применялись к каждому испытуемому. Они первыми сравнили одновременно (внутри сессии) эффекты сигнальных и несигнальных задержек подкрепления. Задолго до Аззи и др. Рейли и Латталь разработали метод получения градиентов внутрисубъектной задержки подкрепления в течение одной сессии. Они поддерживали реакцию по схеме VI и в начале каждой сессии программировали короткую задержку до появления подкрепления. Каждое последующее подкрепление предоставлялось после все большей задержки.
Эксперимент Аззи и др. проводился в традициях Колумбийского университета по систематическому параметрическому анализу переменных, контролирующих поведение. В данном случае в последовательно манипулировали длительностью задержки. Поскольку во время последовательного увеличения задержки не было возврата к исходному уровню, дальнейшие задержки вводились при различной частоте реакции между манипуляциями, что неизвестным образом влияло на градиент задержки подкрепления. Однако эти градиенты задержки подкрепления по форме несколько схожи с градиентами, полученными при нажатии на планку крысой или клевании диска голубем при других схемах подкрепления из других исследований, что позволяет предположить, что частота реакций на исходном уровне может играть менее важную роль в форме градиента, чем сама величина задержки.
Потенциальной посторонней переменной в эксперименте была частота подкрепления. Как и во многих ранних экспериментах с задержкой подкрепления, в работе Аззи и др. не сообщалось о частоте подкрепления при каждом значении задержки. Можно с уверенностью сказать, что частота подкрепления различалась при увеличении задержки в первой части эксперимента и при наличии и отсутствии стимула во второй части. Однако более поздние исследования показали, что различия в частоте подкрепления, как правило, не объясняют различий в частоте реакций, наблюдаемых при изменении длительности задержки.
Латталь и Глисон использовали методику, аналогичную методике Скиннера и Аззи и др., для исследования приобретения реакций крысами и голубями, ранее не участвовавшими в экспериментах, в условиях несигнализированных, сбрасываемых и несбрасываемых задержках подкрепления, когда оперантные реакции формировались без вмешательства исследователей. В этих условиях развивалась устойчивая реакция, что свидетельствует о силе отсроченного подкрепления в развитии и поддержании оперантного поведения. Это еще один способ показать, что немедленное подкрепление не является необходимым для обучения. Тем не менее немедленное подкрепление приводит к гораздо более надежным реакциям. Вопрос о том, насколько «быстрее» приобретается реакция при мгновенном или отложенном подкреплении, остается открытым.
Задержка подкрепления является одним из основных параметров, влияющих на эффективность подкрепления в формировании и поддержании поведения. По этой причине её роль, как отдельно, так и в сочетании с другими параметрами подкрепления, такими как величина подкрепления, подвергалась широкому изучению. Одним из результатов такого анализа взаимодействия является откробесценивание отдалённых во времени последствий, при которых систематическое увеличение задержки подкрепления для подкрепления большей величины или вероятности при фиксированной задержке для другого подкрепления меньшей величины или вероятности позволяет определить точку безразличия, в которой с равной вероятностью будет выбрана одна из двух альтернатив. Исследования дисконтирования с задержкой дают представление о том, как можно масштабировать различные комбинации параметров подкрепления. Аналогичным образом, отсрочка подкрепления (иногда называемая также «вознаграждением в экспериментах, не связанных с анализом поведения) играет важную роль в развитии стратегий управления собой или самоконтроля. Основой этой области исследований и применения является экспериментальный анализ задержки подкрепления.
Другой областью, в которой исследования задержки подкрепления имеют большое значение, является изучение условного подкрепления. Фундаментальной теорией этого типа подкрепления является теория сокращения задержки, которая предполагает, что стимулы функционируют как подкрепления в той степени, в какой они указывают на сокращение времени доступа к первичному подкреплению.
Уроки отсроченного подкрепления не остались незамеченными для прикладного анализа поведения, где по-прежнему справедливо подчеркивается важность немедленного подкрепления после соответствующего поведения. Хотя немедленное подкрепление может быть идеальным для лечения и управления поведением человека в целом, многие формы поведения сохраняются, несмотря на то, что подкрепление отсрочено от реакции, которая их вызывает. Основные исследования в области задержки подкрепления предполагают ряд условий, при которых задержка уменьшает (например, более длительные или несигнальные задержки) или не уменьшает (например, более короткие или сигнальные задержки) ответную реакцию, однако прикладных исследований, расширяющих эти выводы и изучающих, как они могут быть связаны с программами лечения, было проведено мало.
Особенно важным и нерешенным вопросом при анализе задержки подкрепления у людей как в исследовательском, так и в прикладном контексте является вопрос об опосредовании поведения во время задержки вербальным поведением. Ферстер и Аззи и др. предположили, что поведение во время задержки подкрепления поддерживается в той мере, в какой во время задержки возникают определенные стереотипы поведения, что приводит к развитию цепочки поведения, в которой за реакцией, инициирующей задержку, следует некоторая регулярная модель поведения (не требуемая, но поддерживаемая случайным подкреплением), которая заканчивается вместе с подкреплением. Таким образом, суеверные цепочки гарантируют «связь» между начальной оперантной реакцией и подкреплением в конце задержки.
Возникло предположение, что вербальное поведение человека также может опосредовать задержку. То, что человек делает сейчас, может не дать эффекта через час, день или даже позже, но эти два события остаются связанными, и человек продолжает участвовать в поведении, имеющем отсроченное подкрепление. Возможно, это связано с тем, что человек говорит себе или другим людям в период отсрочки. А может быть, и нет. Некоторые современные критики такой интерпретации задержки подкрепления предполагают, что временная близость между реакцией и подкреплением играет относительно небольшую роль в приобретении и поддержании реакции по сравнению с тем фактом, что существует общая корреляция между частотой реакций и подкреплениями, которые возникают сразу или после задержки. Эксперимент Латталя и Глисона, описанный выше, показывает, что обучение может происходить при наличии корреляции только между реакцией и подкреплением, а не только при мгновенном следовании подкрепления за реакцией. Последнее замечание поднимает более широкий вопрос, на который пока нет ответа, — характеризуется ли подкрепление, возникающее после задержки, как отсроченное по отношению к конкретной реакции, или же оно коррелирует с группами реакций, организованных по признаку частоты реакций или времени, отведенного на реакции конкретной топографии.
И последнее, но не менее важное замечание: с исторической точки зрения этот эксперимент важен тем, что он стал первым отчетом об исследованиях бразильских аналитиков поведения, опубликованных в Journal of the Experimental Analysis of Behavior.
Дополнительная литература
- Azzi, R., Fix, D. S. R., Keller, F. S., & Rocha e Silva, M. I. (1964). Exteroceptive control of response under delayed reinforcement. Journal of the Experimental Analysis of Behavior, 7, 159-162.
- Ferster, C. B. (1953). Sustained behavior under delayed reinforcement. Journal of Expe- rimental Psychology, 45, 218-224.
- Skinner, B. F. (1938). The behavior or organisms: An experimental analysis. New York: Appleton Century Crofts.
Автор перевода Артем Ефремов, редакция Иван Чистяков, Иван Воронин, иллюстрация и обложка — Вероника Романова. Подписывайтесь на не.психологию, чтобы не пропустить новые материалы!
