Рубрикатор
— Концепция — FACS - Система и ее ограничения
- FACS в первом «Аватаре»: наследие Голлума
- FACS и 100 проблем
- Первый «Аватар»: Решение проблем — APFS: Анатомическая достоверная лицевая система
- APFS: Контроль и возможности
- «Огонь и пепел»: Эволюция APFS
- Технический анализ APFS — Итог
Концепция
Данное исследование рассматривает эволюцию лицевой анимации в трилогии Джеймса Кэмерона как последовательный переход от трёх технологических парадигм, каждая из которых по-своему отвечала на вопрос: как перенести актёрский перформанс на цифрового персонажа, не утратив эмоциональной достоверности?
Первая волна, реализованная в фильме 2009 года — симуляция лица через внешние проявления. Система FACS и блендшейпы воспроизводили видимый результат работы мышц, не моделируя сами мышцы. Прорывной для своего времени метод имел врождённый потолок: переходы между выражениями оставались зоной неопределённости, а композитные эмоции разрушали геометрию лица.
Вторая волна, внедрённая в «Пути воды» — симуляция через внутреннюю анатомическую модель. Система APFS (Anatomically Plausible Facial System) заменила блендшейпы сетью из 178 мышечных кривых, взаимосвязанных через солвер. Лицо перестало быть поверхностью, на которую проецируются выражения; оно стало объёмом с собственной мускулатурой.
Третья волна, достигнутая к «Огню и Пеплу» — интеграция накопленных данных и творческой культуры. APFS вышла на уровень стабильности, при котором аниматор получил полный контроль над каждой мышечной кривой, создавая более удобный инструмент контроля.

FACS-Система и ее ограничения

Facial Action Coding System (FACS) была разработана Полом Экманом и Уоллесом Фризеном в 1978 году как таксономия человеческих лицевых движений. Система выделяет 46 базовых единиц действия (Action Units, AU), каждая из которых соответствует сокращению одной или нескольких лицевых мышц. Например, AU4 — опускание бровей, AU6 — поднятие щёк, AU12 — поднятие уголков губ.
В анимационную индустрию FACS пришла через Weta Digital в начале 2000-х. Для Голлума во «Властелине Колец» была построена система, где каждая AU реализовывалась как отдельный блендшейп — статичная форма лица, соответствующая максимальному сокращению данной мышечной группы. Аниматор управлял лицом персонажа, смешивая веса этих блендшейпов. Система работала и дала революционный для своего времени результат, за который Голлум был признан первым убедительным цифровым персонажем в истории кино.


FACS в первом «Аватаре»: наследие Голлума
К моменту запуска производства «Аватара» в 2006 году FACS-система Weta Digital была зрелым, отлаженным инструментом. Она успешно применялась не только к Голлуму, но и к Кинг-Конгу (2005). Для На'ви система была адаптирована с учётом иной анатомии — более крупные глаза, выступающие скулы, уплощённый нос, — но архитектурно осталась той же: набор блендшейпов, соответствующих единицам действия, смешиваемых аниматором через весовые коэффициенты.
На момент создания первого фильма это был передовой метод. Ни одна другая студия не располагала сопоставимой библиотекой лицевых форм для нефотореалистичных персонажей. Однако уже в процессе производства начали проявляться фундаментальные ограничения, которые стали очевидны лишь постфактум.
«Властелин Колец: Возвращение короля»
«Аватара» 2009
FACS и 100 проблем
Коренная слабость FACS-подхода заключалась не в качестве блендшейпов, а в том, что система создавалась для классификации статичных выражений, а не для временной анимации. Экман разрабатывал FACS, чтобы кодировать эмоции на фотографиях, — он не проектировал инструмент для покадрового управления лицом в движении.
Когда аниматор выставлял вес AU12 (поднятие уголков губ) на 70% и вес AU6 (поднятие щёк) на 40%, система вычисляла результирующую форму как взвешенную сумму двух статичных блендшейпов. Но в реальном лице эти две мышцы связаны фасциально: когда сокращается скуловая мышца, круговая мышца глаза реагирует не линейно, а через сложную сеть натяжений. FACS ничего не знала об этих связях — система смешивала две формы, и результат часто оказывался нефизиологичным.
«FACS-система только симулирует лицо снаружи и имеет очень ограниченные возможности... она кодирует выражения. В FACS не закодирован диалог, а мы по большей части работаем именно с диалогом» ©Джо Леттери.


сравнение FACS с реальным человеком
Леттери указал на критический аспект, который часто упускается при обсуждении FACS: система кодирует эмоциональные выражения, но не движения, связанные с речью. Когда человек говорит, его лицо находится в непрерывном движении: челюсть опускается и поднимается, губы смыкаются и размыкаются, язык меняет форму ротовой полости, щёки надуваются и опадают.
FACS содержит единицы действия для некоторых из этих движений (например, AU25 — размыкание губ), но не описывает их как непрерывный речевой поток. Для диалоговой сцены аниматор, работающий в FACS-парадигме, вынужден вручную выставлять ключевые кадры для каждого фонетического перехода — а затем вручную же сглаживать неизбежные артефакты. Это было трудоёмко и никогда не давало результата, полностью свободного от «резиновости».


внимание на анимацию рта и лица Нейтири, при смене выражение лица или слов есть микроартифакты
Наиболее остро ограничения FACS проявлялись в сценах, где персонаж испытывал сложную, смешанную эмоцию. Гнев, смешанный со страхом. Печаль с отвращением. Радость, омрачённая тревогой. В реальном лице эти эмоции не накладываются друг на друга как слои в Photoshop — они создают новое, уникальное выражение, в котором одни мышцы активированы, другие заторможены, третьи пассивно растянуты.
В FACS-системе аниматор был вынужден смешивать блендшейпы для гнева и страха, получая неестественную комбинацию. Лицо «разрушалось»: кожа в одних зонах чрезмерно натягивалась, в других — неестественно собиралась складками, глаза приобретали пугающее выражение. Эти правки требовали часы ручной коррекции — и даже после неё результат редко был идеальным.


Помимо качественных проблем, FACS имела жёсткие количественные ограничения. Каждый блендшейп требовал ручной лепки высококвалифицированным моделлером. Для базового набора из 24–30 выражений это было приемлемо. Но с увеличением числа персонажей, каждый из которых требовал собственного набора блендшейпов, трудозатраты росли экспоненциально.
Более того, каждый новый блендшейп увеличивал размерность пространства смешивания, делая его всё менее предсказуемым. При 10 блендшейпах комбинаторика была обозримой. При 30 — количество возможных сочетаний исчислялось миллионами, и проверить каждое на анатомическую корректность было невозможно. Система достигла потолка сложности, за которым терялся контроль над результатом.
Первый «Аватар»: Решение проблем
Осознав ограничения FACS, команда первого «Аватара» сделала важнейший шаг, который предопределил всё дальнейшее развитие. Традиционная система захвата лицевой анимации использовала пассивные ретрорефлективные маркеры, наклеенные на ключевые точки лица актёра — брови, скулы, уголки губ, подбородок. Камеры в павильоне отслеживали перемещение этих маркеров, и данные проецировались на блендшейпы цифрового персонажа.
Кэмерон и команда сочли этот подход недостаточным. Маркерная система давала информацию о движении примерно 80–100 дискретных точек, теряя все нюансы между ними. Складка кожи, находящаяяся между двумя маркерами, оставалась невидимой для системы. Кэмерон требовал большего — и команда предложила решение, которое на тот момент казалось рискованным экспериментом.


как выглядело лицо актера в фильмах «Аватар» и «Аватар: Путь воды»
Инженерным ответом на запрос Кэмерона стала Head Rig Camera — миниатюрная камера, закреплённая на карбоновом шлеме непосредственно перед лицом актёра. В первом фильме использовалась одиночная камера стандартного разрешения. Она записывала видео лица актёра покадрово, и программное обеспечение анализировало не движение маркеров, а изменение всего поля пикселей — всего лица.
Это был радикальный сдвиг. Вместо дискретных точек система получала непрерывное поле данных о движении всей видимой поверхности лица.
«Вместо светоотражающих маркеров мы использовали захват на основе изображений пора за порой» ©Джон Ландау, продюсер фильма.


Head Rig Camera первого поколения в фильме «Аватар»(самый первый и итоговый, что использовался в съемках фильма)
Алгоритм обработки изображений с Head Rig Camera был основан на технике оптического потока (optical flow). Для каждой пары последовательных кадров программа вычисляла векторное поле смещения пикселей. Каждый пиксель получал вектор — направление и амплитуду своего движения между кадрами. Сумма этих векторов по всей поверхности лица давала карту деформации, которая затем проецировалась на риг цифрового персонажа.
В отличие от маркерной системы, которая давала данные о перемещении 80 точек, оптический анализ порождал десятки тысяч векторов смещения. Все микровыражения лица регистрировались и переносились на аватара. Разрешение захвата выросло на два порядка.


Одним из наиболее значимых частных достижений первого «Аватара» стал прямой захват движения глазных яблок. Предыдущие фильмы с цифровыми персонажами страдали от эффекта «мёртвого глаза» — взгляд был либо статичным, либо анимированным вручную и потому неестественным.
Глаз — чрезвычайно сложный объект для захвата. Он постоянно совершает микродвижения: саккады (быстрые скачки), тремор (высокочастотное дрожание), дрейф (медленное смещение между саккадами). Человеческий мозг безошибочно считывает паттерн этих движений как признак жизни, и отсутствие любого из компонентов делает взгляд «мёртвым». Камера HMC фиксировала движение глаз актёра, и специальный алгоритм выделял из видеопотока положение зрачка и радужки относительно глазной щели.


«Аватар» 2005. Нейтири, анимация глаз
При всём новаторстве HMC-камеры, фундаментальная архитектура лицевого рига в первом «Аватаре» осталась FACS-блендшейповой. Камера дала беспрецедентно детальные входные данные, но эти данные проецировались на ту же самую систему дискретных выражений, которая была разработана для Голлума.
Данные с камеры интерпретировались в терминах активации FACS-единиц: программа анализировала карту деформации и определяла, что в данном кадре AU4 активирована на 65%, AU6 на 20%, AU12 на 40%. Затем эти веса применялись к блендшейпам На'ви. Проблема заключалась в том, что сама процедура интерпретации непрерывного поля смещений в терминах дискретных единиц была приблизительной. Данные о движении кожи между ключевыми точками, которые HMC так тщательно собирала, на этапе конвертации в FACS частично терялись.


К моменту завершения первого фильма сложился парадоксальный результат. Технология захвата (HMC-камера, оптический анализ) значительно опередила технологию воспроизведения (FACS-блендшейпы). Входные данные содержали информацию о мимике с разрешением в тысячи точек; выходная система могла воспроизвести лишь несколько десятков предустановленных форм, интерполируя между ними.
Этот разрыв между захватом и воспроизведением стал главной технологической проблемой, которую предстояло решить перед сиквелом. Требовалась система лицевой анимации, которая могла бы использовать всю полноту данных, поставляемых HMC-камерой, без редукции к дискретным единицам. Иными словами, требовалась система, основанная не на классификации выражений, а на симуляции анатомии.




