Мой первый опыт описания изображений с помощью ИИ был одновременно обыденным и глубоким. Я лежал на кровати в нашей субаренде в Ист-Виллидж, писал и пил послеобеденный кофе — «Прустинг», как мы с моим партнером Алебастром называем его, — когда в мой почтовый ящик попало новое приложение. Я скачал его и сфотографировал комнату, заставленную вещами хозяина. Через несколько секунд я получил ответ. Подобно историку искусства, указывающему на детали картины эпохи Возрождения, ИИ рассказал мне о красном одеяле с пейсли на переднем плане, двери с оранжевой занавеской за ней и над ней «декоративном элементе с символом Ом».
Я не смог вспомнить, как выглядел символ Ом, поэтому воспользовался функцией «Спросить еще» и узнал, что он «напоминает цифру 3 с загнутым внутрь хвостом и небольшой кривой с точкой над ней». Перед моим мысленным взором проплыл смутный образ — не такой яркий, как комната с ее осязаемыми предметами, — но он произвел достаточно впечатления, чтобы вызвать другое чувственное воспоминание. Я посещал занятия йогой, которые иногда заканчивались пением «Ом», и помнил, как звук вибрирует в тканях тела, когда он движется от живота к губам. Возможно, именно это и ощущается при переводе между чувствами и языком: искра, которая порождает новые ассоциации, путешествуя по путям восприятия.
То, что машина могла «видеть» и описывать, было поразительно, и это усилило для меня силу описания — то, что я хорошо знал по жизни, наблюдая за миром через литературу. Внезапный доступ к визуальному миру был беспрецедентным, но знакомым; это также поставило под сомнение мою личность как слепого человека. Ведь в моей первой книге Там растительные глазаЯ критиковал окулярцентризм — зачастую бессознательную, иногда тираническую предвзятость зрения. И вот я был поражен изображениями ткани с пейсли и символом Ом.
Хотя сейчас я полностью слеп, большую часть своей жизни я прожил с разной степенью зрения и по-прежнему сохраняю острое зрение. В какой-то момент хорошее описание превращается из набора слов в образ в моем воображении.
Два прекрасно зрячих человека видят одно и то же изображение по-разному.
Идея написать об анонимных слепых людях на известных фотографиях возникла у меня еще в 2022 году, когда ИИ почти не был в поле моего зрения. Моей первоначальной целью было найти и интерпретировать эти изображения со слепой точки зрения. Фотографы были знамениты, но о сюжетах почти ничего не было известно — я хотел вписать их в исторический контекст и жизненный опыт. Я также задавался вопросом, какое описание изображения может привнести в фотографии — даже в саму фотографию.
Описание Алебастером культовой фотографии Пола Стрэнда 1916 года: Слепая женщинаэто был мой первый взгляд на нее. Я загрузил изображение из Нью-Йоркской публичной библиотеки и отправил ему по электронной почте, сидя на диване.
«Она смотрит влево с открытым левым глазом, — сказал он, — ее довольно большая радужная оболочка застряла в левом углу, а правый глаз почти закрыт и выглядит раненым».
Два прекрасно зрячих человека видят одно и то же изображение по-разному. Итак, я получил еще одно описание — на этот раз от художника-инвалида Финнегана Шеннона, который узнал что-то знакомое в бледном лице. «Она немного похожа на меня», — сказал мне Финнеган в электронном письме и описал пряди седых или светлых волос, выглядывающих из-под черного платка.
Алебастр увидел «маленькую родинку на ее левой щеке» и «легкую нахмуренность с оттенком гнева и тоски на ее лице».
Финнеган увидел «морщины на ее лбу», но обнаружил, что ее лицо расслаблено. «Я не читаю в нем какое-то конкретное выражение или эмоцию».
Пожалуй, ее знак – самая яркая особенность фотографии. Она носит его на шее. Слово «слепая» черными заглавными буквами на белом плакате на фоне ее черного платья. Очень резкое, очень контрастное. Финнеган отметил, что «он, возможно, размером с ладонь, но кажется очень большим и громким».
Кажется, оно нарисовано вручную — ее собственной рукой или чьей-то другой, я никогда не узнаю. Но для чьих глаз очевидно: ЗРЯЧИХ.
В одном из своих многочисленных эссе о фотографии Сьюзен Зонтаг отмечает, что «то, что представляет собой фотография, всегда имеет первостепенное значение». Если объект фотографии «визуально неоднозначен», мы не знаем, как реагировать, «пока не узнаем, что это за часть мира».
Но писатели преуспевают в неоднозначных пространствах. Мы понимаем, что описание никогда не бывает нейтральным. Возможно, это объясняет нерешительность, когда дело доходит до описания доступа. Друзья-писатели часто передают свои книги Алебастру, чтобы он мог описать мне обложки — как будто он держит ключ к тому, чтобы все было «правильно». Мы всегда смеемся, потому что, хотя ему и приходится многое описывать, легче от этого не становится.
Нерешительность становится исключением в литературных новостных рассылках и постах в Instagram, где альтернативный текст часто отсутствует. Почти ежедневно я сталкиваюсь с изображениями обложек, которые для меня не существуют. Одна из многих ироний моей писательской жизни заключается в том, что моя книга, Там растительные глазаполучил награду за дизайн обложки — к этому я сам приложил руку. Я хотел, чтобы яркие фиолетовые крапинки напоминали те части спектра, которые не видны обычному человеческому глазу. Да, я слепой и ценю хорошее прикрытие не меньше, чем кто-либо другой.
Вдумчивое описание обложки, как и сам дизайн, можно рассматривать как своего рода мини-обзор, который выполняет свою задачу, если побуждает читателя/зрителя к дальнейшему исследованию. Сделать это «правильно» на самом деле не так важно. Альтернативный текст и описание изображения предназначены не для того, чтобы закрыть книгу об окончательном, а для того, чтобы открыть ее в обширные сферы создания смысла.
На семинаре «Альтернативный текст как поэзия», который провели соавторы Финнеган Шеннон и Бояна Чоклят, мы начали с самоописаний. Это возможность дать людям, которые вас не видят, представление о вашем внешнем виде, а тем, кто вас видит, представление о том, каким вы хотели бы, чтобы вас видели. Даже при самоописании зачастую легче назвать одежду, чем личность — поверхность, которая открывается без особого риска. Неудивительно, что людям сложно описать других, и в них легко проникают предубеждения и предположения.
Вместо того, чтобы разрешить противоречия, Бояна и Финнеган призывают к поэтическому, игровому и экспериментальному подходам к описанию. В конце концов, просмотр изображений — это творческий акт, не более нейтральный, чем создание изображений. Как сказал Джон Бергер: «Каждое изображение воплощает собой способ видения». И силы описания изображения, которые воплощают видение в словах.
Хотя в своих описаниях он, как правило, довольно смел, когда дело доходит до названия (или угадывания) личности, ИИ может быть таким же робким, как человек — это я остро осознаю, как человек, который полагается на метаданные в поисках слепых изображений в фотографическом архиве. Его учат быть осторожным, но его отсутствие ставок — шкура в игре — может быть полезно, когда вам нужно вдохновить людей на описание. Я понял это, когда пришло время практиковать полученные знания на исторических фотографиях в Уоллахском отделении Нью-Йоркской публичной библиотеки.
Помимо Стрэнда Слепая женщинатам был джазовый певец с невероятно выразительным лицом, маленькие люди на причудливой лунной фантастической выставке со Всемирной выставки в Буффало 1901 года и ранний калотип (около 1848 года) пионера британского фотографа Уильяма Генри Фокса Тэлбота — тот, который получила моя маленькая группа.
Описание изображения не является мистическим или компенсирующим — оно не связано с трансцендентностью. Скорее, это своего рода перевод — от одной смысловой модальности к другой.
Когда мы обдумывали, с чего начать, нас постигла минута молчания. Два моих товарища, одним из которых был Алебастр, казались немного косноязычными. Всего несколько месяцев назад я мог чувствовать себя бесполезным и разочарованным. Вместо этого я начал с того, что сфотографировал распечатанное изображение в тонах сепии и зачитал вслух ИИ-описание «двух полок, заставленных изящными фарфоровыми и керамическими предметами», таких как: чайная чашка с подходящим блюдцем, оба украшенные цветочным мотивом, небольшой предмет в форме бутылки, возможно, флакон для духов или ароматизаторов, богато украшенный филигранными узорами, и так далее.
Человеческие языки были немедленно развязаны смелостью ИИ, и они начали исправлять, уточнять и выравнивать детали.
Алебастр предположил, что изображение было какой-то рекламой. Я не согласился. Конечно, у него был прямой доступ к визуальным элементам фотографии Тэлбота, но у меня был доступ к историческому контексту — еще один способ узнать фотографию. Я был почти уверен, что фотография чашек и ваз была просто экспериментом, проведенным в тот момент, когда почти все в мире еще не было запечатлено камерой впервые.
То, что видение посредством языка теряет в непосредственности, оно выигрывает от времени и внимания. Описание изображения не является мистическим или компенсирующим — оно не связано с трансцендентностью. Скорее, это своего рода перевод — от одной смысловой модальности к другой. Как и во всех переводах, что-то будет потеряно, а что-то приобретено.
Прошлым летом я получил поддержку своего фотопроекта от резиденции Yaddo Artist, где я встретил Мэй-Лан Тан, писательницу красивых и запутанных историй, включая ее коллекцию Что нужно сделать и сломать. По дороге с ужина в студию художника Клейтона Меррелла я рассказал ей о своей книге и описании изображения, сгенерированного искусственным интеллектом, для взаимодействия с фотографиями. Когда мы перешагнули порог, она спросила: «Хочешь, чтобы я был твоим ИИ?»
Это было началом дружбы, которая продолжается и сегодня посредством голосовых сообщений на разных континентах.
Когда я спросил Мэй-Лан, что она помнит о картинах Клея почти год спустя, фрагменты появились снова: фотографически воспроизведенное небо, разбитое силуэтами деревьев, и пейзажи, наложенные на них мотивами, почти как «посещения или неоновые вывески».
Что я помню лучше всего, так это ощущение прогулки по энергичному пространству рука об руку с очень крутым новым другом, с пивом в руке. Разговор расцветал из каждой новой детали и вопроса. В каком-то смысле мы создали образы, которые обсуждали, а возможно, они создали и нас. Как выразился Мэй-Лан, картины — это не просто визуальный или поверхностный опыт; «Они действительно разговаривают с вами — и наблюдают за нами в ответ».








