5. Прогнозирование действий и целей с учетом собственных энергетических затрат.
Когнитивные формы научения, включая в себя репертуар более простых форм научения, выступают в качестве одного из фундаментальных свойств высшей нервной деятельности.
Под способом понимают такое воздействие на животное, которое приводит к воспроизведению (появлению) нужных дрессировщику действий или сохранению необходимых поз.
Хотя, по словам К. Прайор, «способов дрессировки существует столько, сколько дрессировщиков, способных их придумать», однако наиболее употребимы следующие.
Способ наведения, который заключается в том, что дрессировщик вызывает нужное ему движение, предлагая животному следовать за кусочком пищи или рукой. В.Л. Дуров называл этот способ «жестикуляцией» и понимал под этим «комплекс движений, которые наводят животное на нужное движение». К этому способу относится и способ «мишени», описанный К. Прайор, заключающийся в инициировании двигательной реакции животного при помощи движения рукой или каким-либо предметом (мишенью), манипулируя которыми можно вызывать достаточно сложное двигательное поведение животных. Мы часто инстинктивно используем этот способ — похлопываем рукой по бедру, приглашая собаку подойти или по дивану, когда хотим, чтобы она вспрыгнула на него. Когда мы берем в руку кусочек лакомства и предлагаем собаке следовать за ним — мы пользуемся способом наведения.
Способ наталкивания, когда дрессировщик при помощи направляющих (подталкивающих) воздействий рук, поводка, не приводящих к боли или неприятным ощущениям для животного, добивается воспроизведения нужного действия. Таким образом мы можем дать понять собаке, что от нее требуется, главное вовремя прекратить вспомогательные действия, иначе собака включит их в состав вашей команды.
Способ пассивной флексии, суть которого заключается в том, чтобы придать животному необходимую позу или помочь ему сделать нужное движение. Такой способ возможен при условии если животное не сопротивляется воздействиям дрессировщика, например, при научении собаки подавать лапу. В оперантной дрессировке этот способ получил название «лепки», так как дрессировщик как был лепит ту или иную позу. Именно таким способом иногда обучают детей писать буквы — взрослый человек берет руку ребенка в свою и помогает ему совершить правильные движения.
Способ отбора поведения, когда при естественном поведении животного положительно подкрепляются нужные и отрицательно — ненужные действия. А.В. Дурова-Садовская назвала этот способ «подлавливанием». По Скиннеру этот способ заключается в том, что весь путь от исходного поведения (еще до начала обучения) до конечной реакции, которую исследователь стремится выработать у животного, разбивается на несколько этапов.
Допустим, что нам нужно обучить голубя ударять клювом по маленькому светящемуся кружку, используя пищевое подкрепление в виде зернышка. Вначале мы будем давать ему зернышко каждый раз, когда он зайдет в ту половину клетки, где находится светящийся кружок. Далее мы будем подкреплять его лишь в том случае, если он не только зашел в эту половину клетки, но еще и повернулся головой к стенке, на которой находится кружок. На третьем этапе можно, например, давать зернышко при сочетании этих двух условий, если вдобавок еще клюв животного направлен в сторону кружка. Затем постепенно можно заставить голубя касаться клювом кружка и, наконец, ударять по нему с целью получить подкрепление. Как мы видим, при таком методе обучения к очередному этапу переходят лишь тогда, когда уже сформировалась поведенческая реакция, необходимая на предыдущем этапе.
Способ отбора поведения служит базой для способов, позволяющих не только отрабатывать свойственные (видоспецифические) реакции животных, но и осваивать навыки, необычные для их нормального поведения:
Способ усиления поведенческого признака, который заключается в том, что подкрепляется все более отличающийся в нужном направлении (или более выраженный) вариант поведенческого акта. К. Прайор называет такой способ «способом последовательного приближения» именно этот способ она использовала как основной для дрессировки дельфинов, например для увеличения высоты прыжка;
Способ сокращения (редукции) поведенческого акта до его отдельного элемента. Например, путем положительного подкрепления только одного из элементов. Редуцируя поведенческий акт, В.Л. Дурову удалось отработать навыки дутья в музыкальную трубу и произнесение слова «мама» собакой.
Способ альтернативы(альтернативного поведения), при котором дрессировщик создает такие условия (иногда даже непосредственно не воздействуя на животное: например, при помощи реквизита), которые допускают совершение лишь единственно возможного движения. Именно так называется один из старинных способов обучения собаки двигаться рядом с дрессировщиком, когда он движется с ней вдоль забора — собакой к забору.
Способ игрового поведения(особенно эффективен для молодых или любящих играть животных). При этом используется потребность в игре, когда возможность поиграть является и подкреплением. Для применения такого способа создается игровая ситуация и предлагается форма игры, которая должна представлять нужное дрессировщику действие.
Имитационный способ(способ подражания), особенностью которого является то, что оно одновременно выступает и как метод (имитационный метод научения).
Способ оборонительного поведения или избегания, когда добиваются нужного поведения при помощи болевых или неприятных воздействий, избегая которые, животные и совершают желаемое действие. Например, неприятные или болевые рывки, удары, болезненные надавливания, ожидание боли (страх), способные вызвать изменение поведения животного, нужные дрессировщику — оборонительное поведение. Как правило при помощи этого способа отрабатывается движение собаки рядом с дрессировщиком, посадки и укладки.
Способ агрессивно-оборонительного поведения: при нем на животное оказывают воздействия такого качества и такой силы, избавиться от которого собака может только посредством агрессивно-оборонительного поведения. Эффект способа заключается в том, что от опасного раздражителя можно избавиться двояко — 1) уйти (убежать) из сферы его действия; 2) уничтожить его атакуя. Ваша задача заключается в том, чтобы вызвать у собаки желание следовать второму пути. Со временем команда, предшествующая агрессивному состоянию и соответствующему инструментальному действию, или ситуация, связанная с этим, становятся сигнальными, то есть образуются не только инструментальные рефлексы, но и условные рефлексы на состояние.
Указанные способы можно использовать при любой форме научения (методе дрессировке), но эффективность их при этом будет различной. Очень часто при отработке конкретного навыка последовательно или параллельно используются несколько способов.
Выбор того или иного способа дрессировки определяется возрастом и породой собаки, стоящей перед дрессировщиком задачей, его опытом, интуицией, а то и вкусом. И очень часто «быстрые» способы не являются самыми лучшими.
ПОДКРЕПЛЕНИЕ
Вопрос о подкреплении в научении еще окончательно не разработан и в разных школах, изучающих поведение, решается неоднозначно.
В школе классических условных рефлексов подкреплением считается безусловное воздействие на животное, связанное во времени с условным сигналом. Причем подкреплением может быть любая вызванная деятельность организма.
В случае наличия подкрепления условный рефлекс называют положительным (подкрепляемым). А в случае отсутствия безусловного воздействия — отрицательным или тормозным (неподкрепляемым). При таком подходе болевое воздействие служит положительным подкреплением оборонительному поведению.
В оперантном научении подкреплением считается любое воздействие, увеличивающее или уменьшающее вероятность повторения в будущем предшествующего его воздействию поведения, то есть любое поведение определяется своими последствиями. В зависимости от того, будут ли эти последствия приятными, безразличными или неприятными, животное проявит тенденцию повторять данный поведенческий акт, не придавать ему никакого значения или же избегать его повторения в дальнейшем. В таком случае положительным подкреплением считается воздействие, которое увеличивает в будущем вероятность предшествующего ему действия, другими словами, животное стремится к получению положительного подкрепления. Момент получения положительного подкрепления всегда положительно эмоционален. И, наоборот, животное стремится избежать отрицательного подкрепления. Факт отрицательного подкрепления вызывает отрицательные (негативные) эмоции и снижает вероятность повторения в будущем поведения, приводящего к нему. Как уже упоминалось, само эмоциональное состояние может иметь выраженный подкрепляющий характер.
Надо сказать, что некоторые ученые считают, что этот термин «отрицательное подкрепление» несколько неудачен, так как всякое подкрепление по определению должно способствовать выработке какой-то формы поведения, т. е. оказывать положительное действие. Видимо, правильнее было бы в обоих случаях говорить о подкреплении, но не о положительном и отрицательном, а о положительном и аверсивном (в зависимости от его значения для организма).
С точки зрения мотивированного поведения, подкреплением считается любое событие, увеличивающее, уменьшающее или исключающее вероятность удовлетворения наличной потребности. Событие, связанное с удовлетворением потребности, и сам факт удовлетворения потребности являются положительным подкреплением. Факт неудовлетворения потребности считается отрицательным подкреплением. Такой подход объясняет существование форм научения без выраженного подкрепления, например, импринтинга или латентного научения.
Событие, регулярно предшествующее факту подкрепления, начинает нести информацию о его наступлении и, по законам развития условного рефлекса, само становится подкреплением. Такое подкрепление называется условным. Различают положительное и отрицательное условное подкрепление (известные всем «ХОРОШО!» и «ФУ!»). Таким образом различают натуральное (первичное в оперантном научении) подкрепление, заключающееся в непосредственном воздействии на животное (кормление, поение, оглаживание, причинение боли или неприятных ощущений) и условное (вторичное в оперантном научении) подкрепление, образующееся по законам классических условных рефлексов.
По мере тренированности, свойства условного подкрепления могут приобретать команда, а при инструментальных рефлексах — действия животного или даже данные обстановочной афферентации — потому, что, чаще или реже, их результатом бывает подкрепление. Чтобы условное подкрепление не потеряло своего сигнального значения, время от времени его необходимо подтверждать непосредственным воздействием на животное, то есть натуральным подкреплением.
Особое значение имеет время подачи подкрепления. Следует отметить, что закрепляется только непосредственно предшествующее подкреплению поведение. В оперантном научении считается, что разрыв между нужной формой поведения и фактом подкрепления не должен составлять более 10 секунд. Если этот разрыв больше, научение может не произойти.
Школой И.П. Павлова были описаны так называемые «отставленные рефлексы», когда разрыв между действием условного раздражителя и подкрепления составлял минуты и десятки минут. Выработка «отставленных рефлексов» осуществима только в специфических условиях павловской «башни молчания», но и при этом была отмечена закономерность — чем дальше во времени оставляется подкрепление, тем медленней вырабатывается условнорефлекторная реакция. В реальных условиях избежать факта оставления подкрепления помогает использование условного подкрепления.
Оказалось, что частичное подкрепление условных сигналов (до 50% случаев, а по некоторым данным до 33—25%), не затрудняет выработку условного рефлекса, но значительно замедляет его угашение при последующей отмене подкрепления. Но при свободном выборе режима положительного подкрепления, животные выбирают режим с большей вероятностью его получения. Возможно общее число случаев подкрепления важно только для упрочения реакции до навыка. Однако вариационный (вариабельный) режим подкрепления значительно закрепляет отработанный навык.
Значимость подкрепления, то есть его способность оказывать влияние на модификацию поведения определяется, с одной стороны его величиной. Оказалось, что животные при условии свободы выбора величины подкрепления, выбирают те случаи, в которых величина положительного подкрепления больше. Учитывая закон сохранения (экономии) энергии, животное может прийти к выводу, что величина подкрепления не окупает энергитические затраты связанные с его достижением. С другой стороны, величина подкрепления должна быть такой, чтобы вызвать безусловную реакцию животного. Например, отрицательное подкрепление только тогда эффективно, когда способно вызывать оборонительную реакцию.
Следует всегда помнить об относительности биологической значимости подкрепления. Так для совершенно сытого животного вряд ли значимым будет пищевое подкрепление, как для некоторых собак ласковое слово или поглаживание хозяина бывает безразличным и, следовательно, не воспринимается подкреплением. Для одних животных игра является сильным подкрепляющим фактором, для других возможность свободы и физической активности, одни собаки воспринимают рывок поводком средней силы как значимое отрицательное подкрепление, другие не обращают внимание и продолжают тянуть.
Относительность подкрепления также связана с потребностью, испытываемой организмом. Если ваша собака очень хочет погнаться за кошкой, то ваш кусочек сыра вряд ли будет подкреплением команде подхода.
Но связь выбранного подкрепления с насущной потребностью гораздо глубже. Дело в том, что потребность и способы ее удовлетворения достаточно жестко наследуемы и возможности, например, пищевого подкрепления не всесильны. Мак-Фарленд в своей книге «Поведение животных» приводит случай произошедший с супругами Бреланд почитателями и последователями Скиннера. Бреланд были уверены, что с помощью метода Скиннера можно выработать и закрепить у животных совершенно необычные и несвойственные для них реакции и в доказательство этого выработали у нескольких видов животных — енотов-полоскунов, свиней, кур и др. — различные формы поведения с помощью оперантного обусловливания. Вначале работа шла легко. Еноты подбирали монетку и переносили ее в металлическую коробку. Свиньи рылом подталкивали деревянную монетку к большой копилке в виде поросенка. Куры дергали за резиновое кольцо и высвобождали таким образом капсулу, которую они клювом выталкивали из клетки. Разумеется, каждая такая поведенческая реакция сопровождалась подкреплением.
Однако по прошествии некоторого времени еноты уже не так охотно опускали свои монетки, а предпочитали оставлять их у себя, манипулируя ими, потирая их передними лапами, а если и опускали их в коробку, то затем снова вынимали обратно. Свиньи уже не так спешили подтолкнуть монету к кормушке, для того чтобы получить себе пищу, а по дороге подбрасывали ее в воздух или пытались зарыть в землю, а затем снова выкопать. Куры же стали поклевывать свои капсулы, вместо того чтобы выталкивать их из клетки. То есть так или иначе, но оказалось, что вид подкрепления генетически связан с ограниченным поведенческим репертуаром.
Значимость подкрепления определяется также положением связанной с ним потребности в иерархии потребностей. Например, витальные потребности более значимы, чем потребности саморазвития. А в опытах по изучению влияния различных видов подкрепления на осуществление реакции экстраполяции оказалось, что при подкреплении самостимуляцией положительных зон мозга крысы оказались способными не только к многократному решению задачи, но и усложненного ее варианта, тогда как при пищевом подкреплении они этого не могли.
На значимость подкрепления также оказывают влияние индивидуальные особенности животного и его ранний опыт. Как уже упоминалось, для животных, выращенных в условиях ранней сенсорной депривации, отрицательное подкрепление более значимо, чем для животных, выращенных в нормальной или обогащенной среде. Кроме того, значимость подкрепления определяется величиной базовой для него потребности. Кстати, при отработке какого-либо действия, использование подкреплений, ориентированных к различным потребностям, способствует более быстрому научению.
Как при реактивном (классическом), так и при оперантном научении приобретенная реакция сохраняется лишь до тех пор, пока ее поддерживают безусловным раздражителем (в первом случае) или специальным подкреплением (во втором случае). Если же эти подкрепляющие факторы перестают действовать, то выработанное на их основе поведение быстро угасает и после нескольких попыток прекращается вовсе. Важно отметить, что речь здесь идет именно об угасании, а не об исчезновении или «стирании следов». Дело в том, что если снова начать предъявлять безусловный раздражитель или подкрепляющий фактор, то исчезнувшее поведение почти сразу же восстанавливается.
НАКАЗАНИЕ
Наказание чисто человеческое понятие, имеющее свои человеческие особенности, может быть и пригодно для человечества, но в дрессировке не только бесполезно, но и опасно. Привнесение этого «человеческого» понятия в дрессировку имеет следующие отрицательные стороны:
1. Наказание неизбежно (в отличие от отрицательного подкрепления), поэтому оно не влияет на модификацию поведения. Наказание учит только как не попадаться или как принимать такую позу подчинения, которая снижает его интенсивность или исключает его.
А отрицательное подкрепление, в отличие от наказания, это событие, которое можно прекратить или избежать, изменив поведение сейчас же.
Целью дрессировки является не применение наказания, как впрочем и отрицательного подкрепления, а создание таких возможностей для животного, в которых оно могло бы избежать их, изменив поведение.
2. Как правило, наказание используется после того как поведенческий акт уже завершен. По своему физиологическому действию наказание является отсроченным отрицательным подкреплением, а, как известно, чем далее во времени отсрочено подкрепление, тем с большим трудом модифицируется поведение.
3. Как считает К. Прайор, «если наказание помогло прекратить нежелательное поведение, то такое воздействие служит мощным подкреплением для наказывающего. В дальнейшем наказывающий будет стремиться к наказанию».
4. Наказывающий может быть бессознательно заинтересован не в исправлении поведения, а в получении доказательств своего лидерства, так как наказание способствует сохранению и упрочнению доминирующего положения наказывающего.
Наказание может оказаться эффективным, если мотивация ненужного нам действия (поведения) невелика, если это поведение еще не упрочилось, а наказание неожиданно, ново, необычно или очень сильно.
Можно сформировать поведение, используя только отрицательное подкрепление, как это характерно для классической дрессировки, при этом образуются типичные оборонительные рефлексы. В такой ситуации животные, в той или иной степени, будут стремиться избегать те места где происходило получение отрицательного подкрепления, а исполнять команды будет с неохотой, так как команды с большой долей вероятности становятся предвестниками болевых или неприятных последствий. К тому же избыток отрицательного подкрепления снижает скорость научения, а у животных со слабой нервной системой может вызвать невроз, у щенков — появление робости, трусости и неуверенности в себе.