понимать // проблемы
4. критика: проблемы и история

Хотя данные часто воспринимаются как технический ресурс, они связаны с социальными отношениями, классификациями и решениями, которые принимают разные акторы. Критика данных помогает понять, какие проблемы возникают при их сборе, использовании и представлении.

/ данные ведь и так социальны!

Хотя сами данные — это социальное явление, о «последствиях» использования данных в разных сферах часто говорят как о чём-то отдельном.

Слово «социальный» используется тут отчасти в том же смысле, в котором оно существует в описании разных политик государства или компании. Среди них есть раздел «социальные расходы» или «социальное жильё». Вот «социальные последствия работы с данными» часто имеет похожий смысл. Это делает «данные» чем-то, близким скорее к природе и/или технике, и мы уже обсуждали, почему это неоднозначно. Ведь за таким обозначением скрывается неполнота, использование инструментов сбора и избирательность подхода. Более того, интересно, каким образом разные акторы выполняют работу по проведению границ между природой/культурой. Давайте посмотрим на отрывок из интервью с Кейт Кроуфорд и Мередит Уиттакер, основательницами исследовательского института AI Now, занимающимся осмыслением проблем, связанных с алгоритмами и большими данными.
Кейт Кроуфорд: «Ну, смотрите… Это интересно. Если я посмотрю на то, как мы можем снизить затраты на электроэнергию, верно? Если мы посмотрим конкретно на окружающую среду и изменение климата, мы увидим действительно интересную работу, проводимую с использованием систем искусственного интеллекта, которые говорят: «Мы можем фактически скорректировать потребление электричества, чтобы сделать его гораздо более эффективным. Мы можем рассчитать, как…» Я имею в виду, подумайте о том, сколько энергии тратится впустую в городах и на гигантских серверных фермах, в которых мы также провели много исследований.

Что касается центров обработки данных, мы можем делать там вещи. Это меня воодушевляет. У нас действительно есть большие проблемы, особенно в области экологии, где мы можем проводить реальную работу. Но как только это затрагивает сложные социальные системы, вы сталкиваетесь с гораздо более сложной областью. Вот тогда вам нужно думать гораздо более тонко о том, как вы можете повлиять на жизнь людей".
Социолог и философ Бруно Латур в своей известной работе «Пересборка социального» особо обращает наше внимание на то, что акторы сами постоянно совершают работу по различению между социальным и техническим, природным и культурным. И вот смотря на высказывание Кроуфорд, мы видим, что когда алгоритмические системы обсуждаются в контексте природы и окружающей среды, у нас возникает меньше проблем, чем когда мы вступаем на территорию социального.

На уровне эпистемологии стоит задумываться о том, как разделяются «техника», «природа» и «социальное». Но не менее важно — понять, какие проблемы высвечивают разные критики, и что не так с данными в разных контекстах?

/ проблемы, которые чаще обсуждаются в связи с данными

проблема 1

Данные построены на тех социальных отношениях, в которые включена несправедливость.

Так как данные являются отражением (заметьте, как тут устанавливается прямая связь между данными и представляемым через них миром) множества исторически существовавших типов неравенства, они не только закрепляют и воспроизводят их, но и усиливают, поскольку многие решения начинают приниматься на их основе в ранее немыслимых масштабах.
Смещения, которые происходят в алгоритмах и при принятии решений из-за собираемых данных по полу, возрасте, расе и так далее (здесь можно послушать целый подкаст на эту тему). Например, при анализе текущей политики о приёме на работу, алгоритмизированная система предложит продолжать экономически выгодную политику, даже если она исключает пожилых людей и/или женщин в каких-то сферах.

В статье Guardian приводится описание таких смещений на примерах ассоциаций с цветами и насекомыми, словом, речь далеко не только о социальных проблемах.

И вот непростое исследование о том, как это работает в случае генетических исследований с людьми разных рас.

проблема 2

Данные предполагают трактовки, которые интерпретируют людей, о которых эти данные собираются, в очень определённом ключе и игнорируют социальный смысл, который существует у самих людей.
По ссылке вы можете прочитать статью о параметрах сбора данных, например, чтобы повысить эффективность на рабочих местах.

Автор приводит примеры с теми случаями, когда особенности работников точно нельзя было учесть, но именно они (а вовсе не стандартизированные показатели) оказывались важными.

В этом отношении интересна тема «невидимого труда»: действия работников, которые не распознаются как труд более высокими инстанциями, и, соответственно, не признаются и не оплачиваются. С. ли Стар и Дж. Боукер в своей книге «Sorting things out: classification and its consequences» приводят сюжет о создании Классификации сестринских вмешательств, которая предполагала отображение действий, которые медицинские сёстры делают в своей повседневной практике. Как замечали сами медсёстры, до создания этой классификации их работа «входила в стоимость палаты» (Bowker, Star, 1999).

В этом исследовании авторы разработали способ подсчёта такого труда для краудсорсинговых платформ.

проблема 3

С помощью данных разные институты власти классифицируют вещи, людей и группы и закрепляют за ними свойства, которые потом используются в политических, экономических и социальных политиках, а также в ИИ-системах.
Например, вот небольшое исследование о том, как работают данные о распространении наркотиков. Оно объясняет, почему в зоне риска из-за введения предиктивной политики оказываются люди из и без того уязвимых групп.

Но проблема ещё и в том, что часто эти данные попросту неверны, так как основаны на сложившейся у полиции традиции смотреть на те районы, где и без того была высокая преступность. Double trouble.

То же самое происходит и в науке, и не только с людьми. Например, для книг существуют официальные классификации, такие как УДК и ББК, а книжные магазины и онлайн-платформы создают собственные рубрикаторы. Одна и та же книга может оказаться в разделе «Философия», а может — в разделе «Эзотерика». На первый взгляд это влияет только на удобство поиска, но на самом деле такие решения формируют ожидания читателей и задают рамку интерпретации. Книга, оказавшаяся на полке «Философия», воспринимается как часть академического знания, а та же самая книга на полке «Эзотерика» — уже как нечто, находящееся за его пределами.

проблема 4

Появляются всё новые и новые вопросы к тому, что остаётся от прежнего понятия приватности и публичности, что приходит ей на смену, и как приватность может различаться от культуры к культуре.
Вот статья Мэри Мэдден в Нью-Йорк Таймс посвящена проблеме, связанной с приватностью, о которой, с ее точки зрения, часто забывают: Небогатые люди понимают, что, например, если они будут пользоваться пособиями или бесплатной помощью от государства, то окажутся в категории социально неблагополучных. Это может повредить их детям и им самим. Поэтому, чтобы не попадать в статистику, люди делают своё финансовое и социальное положение частью частной жизни, скрывают проблемы со здоровьем и делают всё, чтобы защитить приватную информацию. Для людей из более обеспеченных групп такое отношение к своему статусу не всегда очевидно.

В тех же группах, которые исследовала Мэри и её коллеги, совсем другое отношение к онлайн-приватности: большинству бедных и малообразованных людей риски онлайн-наблюдений непонятны, тем более, что они пользуются интернетом через мобильные устройства, и не рассматривают свои данные в цифровых сервисах как что-то ценное.

И ещё один пример: когда публикуют данные о тех, кто болен, например, коронавирусом, это создаёт новые сложности для больных и их близких, ведь их могут начать избегать, курьеры не будут с ними взаимодействовать, им могут отказать в обслуживании в магазинах, и так далее.

проблема 5

Сам сбор данных и отношение к ним как ресурсу, создаёт проблему: ведь люди понимают, что их данные собираются, или на них обучается ИИ модель, и начинают вести себя иначе. В итоге и данные неверны, и возникают новые социальные проблемы.
Активистский пример здесь — инициатива про проблему social cooling. Авторы проекта обращают наше внимание: если мы знаем о том, что наши данные анализируют и просматривают компании, мы как пользователи начинаем вести себя более скрытно: не делимся важной информацией, сокращаем возможности взаимодействия онлайн.

А в этом исследовании авторы обнаружили, что люди меняют своё поведение, когда узнают, что на их действиях обучают ИИ, и разрушает представление разработчиков о «беспристрастных данных».

проблема 6

Данные запрашиваются обычно в контексте процессов, которые нужно улучшить с точки зрения повышения эффективности. Но игнорируются интересы меньшинств и те возможности, которые могут возникнуть благодаря им.
Исследовательница Триша Ван занимается этнографией технологией, которая утверждает, что выводы, основанные на больших данных, должны дополняться «насыщенными данными» (да, это привет Клифорду Гирцу). В 2009 году она проводила исследование в Китае для Nokia и обнаружила, что у людей с низким доходом также есть большая потребность в смартфонах. Ван сообщила о своих результатах руководству компании и предложила сменить их бизнес-модель с производства дорогих смартфонов на более доступные, потому что, как показывали результаты ее этнографии, люди с низким доходом в Китае действительно готовы тратить на них деньги и приоритезировать их покупку. В ответ руководство Nokia сказала ей следующее: мы не видим подобных закономерностей в своих данных, а количество ваших наблюдений слишком маленькое по сравнению с нашими датасетами. С точки зрения Ван, существует несколько причин падения Nokia, но одной из них является то, что компания слишком сильно полагалась на цифры.

/ обзор решений, которые предлагают исследователи, активисты, технические специалисты

Расширение доступа к работе с данными для разных людей

Об этом можно думать и в контексте проектов по работе с открытыми данными, и в работе с селф-трекингом.
Стоит иметь в виду: селф-трекинг расширяет границы для тех, кто раньше не мог работать с данными, и это увеличение возможностей для пользователей (Swan, 2013)

Правда, с другой стороны, она также открывает новые возможности для слежки. Так, в своей статье о взаимоотношениях между потребителями, страховыми компаниями и дискурсами о селф-трекинге исследователи Штеффен Крюгер и Ниам Ни Бхройн показывают, что подобные новшества увеличивают существующий дисбаланс власти: пользователи дают страховщикам больше возможностей для наблюдения.

Совместное управление данными (Participatory Data Stewardship)

Ada Lovelace Institute предлагает вовлекать людей, которых затрагивает работа с данными, в обсуждение их сбора, использования и публикации. Чтобы такие консультации были содержательными, они должны проходить до принятия решения, участники должны получить достаточно информации и времени для обсуждения, а организация — быть готовой учитывать их предложения и объяснять, почему одни из них были приняты, а другие нет.

Образование и повышение осведомлённости

Так, в Нью-Йорке действует School of Poetic Computing, где художники работают на стыке теории, программирования и художественной практики. Или есть небольшие проекты, которые предлагают узнать, какая информация о вас известна, и кому.

Примером такого подхода является и этот проект. Мы стремимся объяснить нетехническим специалистам, как устроены данные, алгоритмы и цифровые инфраструктуры, а техническим — показать, как их решения влияют на людей, социальные институты и повседневные практики.

Увеличение грамотности при работе с данными (Data Literacy)

Важно, что речь идёт не только о грамотности как умении читать соглашения или понимать те последствия, о которых речь идёт выше, но и о материальности: сами по себе инструменты сбора и анализа должны быть такими, чтобы их можно было понимать. (Fotopoulou, A. (2020). Conceptualising critical data literacies for civil society organisations: agency, care, and social responsibility. Information, Communication & Society, 1−18.)

Повышение прозрачности действия алгоритмов, и процесса сбора данных

Прозрачность означает, что люди, которых касается работа с данными, — участники исследования, владельцы данных, пользователи и другие заинтересованные стороны — понимают, какие данные собираются, как они используются и какие решения принимаются на их основе. Подробнее о принципах прозрачности и подотчётности мы рассказываем в следующем разделе. Здесь важно отметить, что прозрачность связана не только с техническими описаниями, но и с тем, как мы говорим о данных, какие слова и нарративы используем. Например, исследователи Ada Lovelace Institute показывают, что метафора «данные — новая нефть» влияет на восприятие данных как ресурса, который можно добывать и извлекать, хотя такое представление скрывает социальную природу данных и отношения между людьми, которые их создают.

Digital Disengagement

Это комплекс практик осознанного отказа от использования инноваций, сопротивления включенности в глобальные социальные сети и цифровые экономики. Исследователи Клуба любителей интернета и общества собрали много материалов о том, каким бывает этот процесс в разных странах и культурах.

С этим подходом связан и принцип минимизации данных (data minimisation): собирать и хранить только тот объём информации, который действительно необходим для решения конкретной задачи.

/ история

В перечисленных выше проблемах мы пока не касались исторической перспективы критики данных. Некоторые исследователи связывают датафикацию с «добывающими» процессами, которые начались задолго до появления интернета и компьютеров.
Так, Катажина Цеслик и Даниэль Маргоши пишут, что датафикация — это процесс, в ходе которого явление приводится к количественной форме, пригодной для табулирования и анализа. При этом он не заканчивается в момент сбора: данные могут многократно пересобираться, переиспользоваться и получать новые значения на протяжении долгого времени. На историческом материале авторы рассматривают несколько случаев, связанных с колонизацией земель: данные о населении, территориях и научных наблюдениях собирались с участием местных жителей и с использованием различных форм принуждения, а затем использовались для целей, которые далеко выходили за первоначальные задачи их сбора.
Представление современного сбора данных как принципиально нового феномена позволяет обещать позитивные технологические перемены, но одновременно может скрывать этот исторический опыт. В частности, опыт показывает, что данные, однажды собранные и превращённые в ресурс, могут быть захвачены и переиспользованы для других целей — особенно теми, кто обладает властью, инфраструктурой и возможностями для их обработки.
Часть критики датафикации касается вопроса, кто имеет право превращать процессы в данные. Но это не всегда вопрос больших геополитических и экономических процессов — иногда решение принимается на гораздо более локальном уровне: одним человеком, лабораторией, дисциплиной.
В первом разделе мы писали о роли классификации в датафикации, а в этом разделе на примере невидимого труда показали, какими могут быть последствия классификаций для тех, кого они описывают. Но у стандартов, классификаций и правил есть ещё один слой — их «истории»: обстоятельства и контекст, в которых они возникли: решения, принятое кем-то, в какой-то момент, исходя из определённых представлений о мире. И это решение закрепляется за конкретными учреждениями и социальными институтами, в которых оно было принято.
Эту мысль ещё в начале XX века сформулировал Дюркгейм: классификации имеют социальную природу — обыденные категории, которыми мы пользуемся, являются проекцией социальной структуры.
Хороший исторический пример — классификация видов в Британском музее естественной истории на заре дарвинизма. Пока в науке всё больше признавалась теория Дарвина и его понятие вида, в самом Британском музее естественной истории в Лондоне — во главе с Ричардом Оуэном, убеждённым противником эволюционной теории, — и экспозиция, и способы классификации новых экспонатов в архивах были устроены так, чтобы не подтверждать эволюционную теорию, а поддерживать альтернативную, антидарвинистскую картину происхождения видов. (Вспомните, насколько важны были архивы для науки XIX века.) Показательна в этом смысле история находки археоптерикса — она подробно рассказана здесь: Darwin, Owen and the ‘London specimen’. | Letters from Gondwana.
Иногда за классификацией стоит идея одного человека, как в случае с Оуэном, иногда — установки целой дисциплины. В цифровой гуманитаристике (digital humanities), например, хорошо известно, что базы данных историка и базы данных лингвиста, посвящённые даже одному и тому же объекту, могут заметно различаться по структуре — потому что за ними стоят разные исследовательские вопросы и разные представления о том, что вообще является «единицей данных».
Свои стандарты есть у разных культурных институций — архивов, музеев, библиотек. И хотя само разделение институций памяти проблематично (есть исследователи, которые считают, что оно во многом социально сконструировано, а не отражает какую-то «естественную» разницу между объектами — Расмуссен и Хьёрланд в своём обзоре конвергенции LAM используют термин Зерубавеля о «люмпинге» и «сплиттинге»: то, что считается похожим или разным, не логическая данность, а результат социального конструирования категорий сходства и различия — важно не что группируют, а кто и зачем это делает), в какой-то момент возникла явная спецификация и разница в подходах к сохранению.
У этой разницы есть довольно простое структурное объяснение. Библиотечные объекты — издания — существуют во множестве идентичных копий сразу в разных библиотеках, поэтому уже к XIX веку появился практический стимул описывать их не поодиночке, а централизованно, силами одного агентства, чьи записи можно потом использовать всем. Музейные же предметы уникальны, у каждого своя история и контекст — общий стимул к централизованному стандарту здесь возникает намного позже и по другой логике.
Показательно, что мечта об объединённой, универсальной классификации всего существовала ещё до «цифровой эры» — и в ней библиотечная и музейная логики впервые пересеклись. Речь о Mundaneum — проекте бельгийского юриста и документалиста Поля Отле рубежа XIX—XX вв.еков. Отле и его коллега Анри Лафонтен создали Universal Bibliographic Repertory — колоссальный каталог на 11 миллионов карточек к 1914 году — и универсальную десятичную классификацию (УДК) для его индексации. Но их замысел не ограничивался библиотекой: Mundaneum задумывался как комплекс из пяти частей, включая всемирный музей, разделённый на разделы «произведения», «время» и «место». Отле явно пытался распространить библиотечную логику классификации на объекты и факты вообще — и характерно, что этот проект так и остался незавершённой утопией, а не рабочей институциональной моделью: развести библиотечное и музейное знание оказалось не так просто, как совместить карточки и витрины на бумаге.
При цифровизации эти вопросы стали особенно актуальны. Историк библиотечного и информационного знания Бойд Рейуорд ещё в 1998 году писал:
«…появление электронных источников информации и их постоянно растущий объём и разнообразие потребуют серьёзного переосмысления и интеграции роли архивов, музеев и исследовательских библиотек. Я считаю, что различие между всеми этими, казалось бы, разными типами учреждений в конечном итоге потеряет всякий смысл, хотя мы можем ожидать борьбы за сферы влияния между профессиональными группами, управляющими ими, по мере приближения к этому моменту».
В следующем разделе мы рассмотрим, какие принципы выработаны в ответ на эту критику и какие стандарты помогают учитывать интересы разных участников, аудиторий и институций, работающих с данными.

/ источники

  1. Bowker, G. C., & Star, S. L. (1999). Sorting things out: Classification and its consequences. MIT Press.
  2. Crawford, K., & Whittaker, M. (2019, April 8). Artificial intelligence is neither artificial nor intelligent [Podcast interview]. In Recode Decode with Kara Swisher. Vox. https://www.vox.com/podcasts/2019/4/8/18 299 736/artificial-intelligence-ai-meredith-whittaker-kate-crawford-kara-swisher-decode-podcast-interview
  3. D’Ignazio, C., & Klein, L. F. (2020). Data feminism. MIT Press.
  4. Durkheim, É., & Mauss, M. (1963). Primitive classification. University of Chicago Press. (Original work published 1903)
  5. Iliadis, A., & Russo, F. (2016). Critical data studies: An introduction. Big Data & Society, 3(2). doi.org/10.1177/2 053 951 716 674 238 (если это не та статья OUP, пришлите точную ссылку).
  6. Kennedy, H., Poell, T., & van Dijck, J. (2020). Data work that matters. Information, Communication & Society, 23(4), 467−484. doi.org/10.1177/141 778 919 879 744 (проверьте: DOI соответствует статье, но ссылка Sage не позволяет однозначно восстановить библиографию без названия страницы).
  7. To predict and serve. (n.d.). Human Rights Data Analysis Group. https://hrdag.org/publications/to-predict-and-serve/
  8. Eubanks, V. (2019, April 25). How big data punishes the poor. The New York Times. https://www.nytimes.com/2019/04/25/opinion/privacy-poverty.html
  9. Electronic Frontier Foundation. (2020, April 10). How to protect privacy when aggregating location data to fight COVID-19. https://www.eff.org/deeplinks/2020/04/how-protect-privacy-when-aggregating-location-data-fight-covid-19
  10. Rahwan, I., et al. (2025). Humans strategically adapt when they know their behavior trains AI. Proceedings of the National Academy of Sciences. https://doi.org/10.1073/pnas.2 408 731 121
  11. Crawford, K. (2014). The hidden biases in big data. First Monday, 19(6). https://doi.org/10.5210/fm.v19i6.4909
  12. Cieslik, K., & Margócsy, D. (2022). Datafication, power and control in development: A historical perspective on the perils and longevity of data. Progress in Development Studies, 22(4). https://doi.org/10.1177/14 649 934 221 076 580
  13. Latour, B. (2005). Reassembling the social: An introduction to actor-network-theory. Oxford University Press.
  14. Rasmussen, C. H., & Hjørland, B. (2022). Libraries, archives and museums (LAMs): Conceptual issues with focus on their convergence. Knowledge Organization, 49(8).
  15. Rayward, W. B. (1998). Electronic information and the functional integration of libraries, museums, and archives. In E. Higgs (Ed.), History and electronic artefacts (pp. 207−226). Clarendon Press.
  16. Swan, M. (2013). The quantified self: Fundamental disruption in big data science and biological discovery. Big Data, 1(2), 85−99.