На ежегодной конференции Фейсбук Марк Цукербергобъявило том, что в скором времени социальная сеть запустит свой сервис знакомств. "В Фейсбуке 200 миллионов человек называют себя одинокими, и с этим точно можно что-то сделать", - заинтриговал Цукерберг. Он отметил, что Фейсбук будет стремиться создавать долгосрочные серьезные отношения (в противовес Тиндеру, где знакомства часто всего лишь на одну ночь). Рекомендации одиноким людям Фейсбук будет выдавать на основании их общих интересов. Чем больше у людей общих увлечений, тем выше будет вероятность того, что они будут интересны друг другу.
С одной стороны, инициатива Цукерберга, как и большинство его инициатив, выглядит очень интригующе. Что может быть лучше человека, разделяющего с тобой твои интересы и увлечения, имеющего схожий взгляд на мир? С другой стороны, после речи Цукерберга возникает ощущение того, что теперь и сфера романтических отношений уходит из нашего прямого контроля, и задача выбора партнера делегируется искусственному интеллекту. Ведь как, по нашему предположению, будет работать сервис? Каждый из нас проводит огромное количество времени в интернете, в том числе и в социальных сетях, и оставляет массу "цифровых следов" (digital traces). Тут кто-то лайкает видео, тут напишет комментарий... Вся эта информацияникуда не исчезает, она аккумулируется и хранится в Фейсбуке и Гугл. Поисковик и социальная сеть знают когда вы встаете, какими аппаратами вы пользуетесь, что вам интересно, каковы ваши маршруты передвижения. И, на основании имеющихся массивов информации о вас и о других пользователях, информационные сервисы могут делать определенные выводы с применением методик искусственного интеллекта, обычно речь идет о машинном обучении. Вспоминается одна из серий нашумевшего сериала "Черное зеркало", который очень точно описывает возможные результаты от сегодняшнего технологического прогресса. В этой серии некий алгоритм подбирает идеальных партнеров для всех. Этот выбор нельзя отменить, алгоритму нужно какое-то время, чтобы научиться и подобрать идеального партнера. Это значит, что человеку нужно пройти через несколько удачных или неудачных свиданий и отношений, прежде чем алгоритм обучится и подберет идеальную половинку на основе общих увлечений, интересов, переживаний. В одной сцене партнеры разговаривают о прелестях такой жизни: "Как прекрасно, что больше не нужно ничего делать, искать партнеров самим! Не представляю, как это было в прошлом - нужно было самим знакомиться, организовывать свидания, думать об интересах другого...".
Самый просто пример, и уже даже хрестоматийный пример того, как работают алгоритмы Фейсбука - это таргетированная реклама. Ваши друзья - люди, ведущие схожий образ жизни, если они любят джинсы Levi's, скорее всего, они понравятся и вам - поэтому тартегированной рекламы вам в ленту. Сразу видно, что искусственный интеллект в данном случае не означает создания гениального робота, который стремится к миру во всем мире, устранению парникового эффекта и спасению вымирающих видов животных. Вовсе нет. Сегодня искусственный интеллект - это стандартные методики машинного обучения, но на огромных массивах персональных данных. И практика показывает, что чем больше данных сервисы используют для обучения своих моделей, тем более точными становятся их предсказания. Получается, что отправной точкой для искусственного интеллекта служат именно данные, а не социальные закономерности. Так что любая ошибка в данных может привести к существенным смещениям результатов и к принятию неверного решения. К примеру, многие используют Фейсбук для профессионального позиционирования, и с большой долей вероятности таким Ромео алгоритм по подбору партнеров будет предлагать вероятных партнеров по бизнесу, но не вторых половинок. Хотя, и от новых бизнес-партнеров тоже может быть толк.
Подводя итог, еще раз хотим обратить внимание на планомерное "отчуждение принятия решений". Обладая мощным предсказательным потенциалом, искусственный интеллект становится все более востребован в процессе принятия решений. Инструменты искусственного интеллекта используются в продажах, рекрутинге, юриспруденции, банковской деятельности, и, согласно одному из недавних номеров журналаThe Economist, в будущем будут использоваться в еще большем количестве сфер. Мы не можем отрицать высоких перспектив машин, но все же это наша жизнь, принимать в ней решения и нести за них ответственность выпало на нашу долю. Не забывайте.
Однажды мы ужесоставлялисписоксамых известныхбазданных про социальные (и не только) сети,в этот раз решили
сделать список полезных данных про здоровье.
Почему
именно здоровье? Потому что как бы ни
была важна генетика и окружающая среда, влияние окружения
на наше здоровье не менее существенно. Это проявляется и как социальное влияние (мои друзья курят, и я тоже), и как заражение (все в моем офисе простужены и чихают, значит, я тоже могу заразиться).
Наверное, это одна из самых известных баз данных про школьников, на основе
которой написанытысячи публикаций. Преимущество этих данных в том, что,во-первых, лонгитюдные. Опрос впервые начался в
1994 году, но сбор данных продолжается до сих пор. Сейчас респондентам около 30
лет. Во-вторых, они содержат огромное количество данных о различных аспектах
жизни подростков, а сейчас уже и взрослых людей. В-третьих, онирепрезентативныпо всем американских школам.
Как собирали сетевые данные про дружбу? Каждого школьника
просили назвать до 5 друзей мужского и
до 5 друзей женского пола. Друзья могли
быть как из школы, в которой учится респондент, так и из других школ. Сложно
перечислить, какого рода данные содержатся
в этой базе данных, потому что их очень
много, но назовем лишь несколько.
Например, это информация о романтических
и сексуальных отношениях школьников,
о характеристиках школы и семьи, о болезнях и
привычках, об оценках.
Сеть
романтических связей между школьниками из Add Health. На основе визуализации из
работы Bearman et al (2004). Chains of affection. Источник изображения.
2. Данные про заболевания, передающиеся половым путем Это
набор из 8 баз данных, собранных в разное
время и в разных местах, однако объединенных
одной идеей. Во всех наборах данных основная цель
— это изучить, как передаются заболевания
по сетям сексуальных контактов. Каждый из наборов немного отличается от остальных, однако исследователи,
создавшие этот мета-проект, постарались
привести переменные в сравнимый
вид. Болезни, информация о которых есть
в этих данных — это ВИЧ, хламидиоз,
сифилис, гепатит. Данные представлены
про различные группы риска (люди,
занимающиеся проституцией, употребляющие
наркотики). Сети здесь — это сексуальные
контакты или люди, с которыми используется одна инъекционная игла.
Это также лонгитюдное исследование, в котором приняли участие около 1500 голландских подростков. Основной целью было изучить, как разное отклоняющееся поведение связано с дружескими связями. Про какого рода поведение есть данные? Это мелкий вандализм и кражи, граффити, драки, порча чужого имущества. В качестве сети рассматривается не класс, а все ученики, поступившие учиться в один год.
В исследовании изучается не напрямую дружба (это слово вовсе не звучит в вопросе), а сети поддержки. У учеников спрашивали, к кому они обращаются за поддержкой, если чувствуют себя плохо (например, после разлуки или при конфликтах с другими людьми), а также кого сами поддерживают в подобных ситуациях.
4. Исследование сердечных заболеваний Нет,
это не романтические сети подростков
в очередной раз, а действительно
заболевания сердца, которые изучались
медицинскими исследованиями. Это
известное Фрамингэмское исследование,
на основе которого было сделано несколько
достаточно провокативных сетевых
исследований (про влияние друзей на ожирение и вероятность развода). Данные также собирались в течение длительного времени, и идеей было проследить здоровье потомков первых респондентов, чтобы изучить генетическую составляющую некоторых заболеваний. Здесь очень много подробных данных про здоровье, однако про социальное окружение - не так много. Есть информация про семейные связи и про одного друга, на основе которых можно частично восстановить социальное окружение.
Еще одна база данных про здоровье школьников — это 'Teenage Friends and Lifestyle Study'. Это лонгитюдные данные, собранные в течение 3 лет про дружеские связи, привычки и мнения подростков из Шотландии. Данных не так много (всего опрошено около 150 школьников), однако они хороши для учебных целей именно благодаря своему небольшому размеру. Основная цель исследования — понять, как формируются мнения подростков об определенных рискованных формах поведения, как они экспериментируют с курением, алкоголем, легкими наркотиками, как происходит процесс закрепления вредных привычек. Помимо всего прочего, есть много данных о том, что делают школьники в свободное время и какими видами спорта занимаются. Вопрос о дружбу звучал как просьба назвать до 12 лучших друзей.
На
самой большой конференции по социальным
сетям Sunbelt всегда есть секция «Sex, drugs
and social networks». Она состоит из нескольких
подсекций, длится несколько дней, и на
ней всегда можно послушать интереснейшие
доклады. Например, про первые сексуальные
опыты подростков, про использование
наркотиков в ЛГБТ среде, про предпочтения
свингеров в партнерах и про заболевания,
передающиеся половым путем. Более того,
эти доклады часто бывают очень
практические и помогают бороться со
многими социальными и медицинскими
проблемами. Все эти темы нам также
очень интересны, поэтому в этом посте
мы решили рассказать про сексуальные
и романтические сети.
Романтические
сети школьников: первый поцелуй, первая
любовь
Большое
количество сетевых исследований — про
школьников их поведение. Например,
мы уже
писали про то, как подростки начинают
употреблять алкоголь и как их друзья и
окружение влияют на это. Конечно, первые
романтические переживания школьников
также не остались без внимания
исследователей.
Одно
из важнейших исследований - про "любовные
цепи" Питера Бирмана, Джэймса Муди
и Катрин Стовел ("Chains
of Affection: The Structure of Adolescent Romantic and Sexual
Networks"). Работа основана на большой
базе данных по здоровью американских
школьников AddHealth.
В этом исследовании используется
подвыборка из ~800 старших школьников,
которые учились в одной школе с 1993 по
1995 гг.
Какого рода связи изучались? У школьников спрашивали, имели ли они с кем-то особые романтические отношения в течение
последних 18 месяцев. Помимо этого, просили
указать, были ли у них не романтические
сексуальные отношения с кем-то в течение последних
18 месяцев. В обоих случаях можно было
указать до 3 человек, с которыми были те
или иные отношения. Только
около четверти учеников ответило, что
у них не было ни одного типа отношений
за последние полгода. На основе этих даных была выстроена сеть романтических и сексуальных взаимоотношений школьников.
Сеть романтических и сексуальных контактов школьников из статьи Bearman et al (2004). Синим обозначены мужчины, розовым - женщины. Есть плотно связанный компонент (слева вверху) и более мелкие не связанные с другими структуры. Цифры обозначают количество таких микроструктур в выборке. Источник изображения.
Внимательно изучая сетевую
структуру романтических и сексуальных
связей, мы можем лучше понять, как развиваются заболевания, передающиеся через половые
контакты. Не всегда простое количество
партнеров говорит о многом, так как
гораздо важнее понять, как человек вписан в более широкую сеть взаимодействий. Например, возьмем
два случая. В первом — человек в настоящий
момент имеет всего лишь одного партнера.
Однако оба партнера имели в прошлом
других партеров, которые, в свою очередь
имели множество других партнеров. Если
проследить все эти связи, то получится что-то похожее на цепочку. Во втором случае — у человека
несколько партнеров, но все они находятся
в закрытой обособленной структуре, не
связанной с большой сетью, по которой "гуляет" какая-нибудь контактная болезнь. На самом
деле, вероятность заболеть будет выше
у человека в первом случае, даже если у
него всего лишь один партнер на настоящий
момент.
Это
не новость в подобных эпидемиологических
исследованиях. Например, во многих
работах показано, что микросообщества
сексуальных и романтических контактов
имеют структуру ядра и периферии.
Воздействуя на ядро (например, бесплатно
раздать презервативы для вич-инфицированных
или шприцы для употребляющих инъекционные
наркотики), мы можем предотвратить дальнейшую передачу заболевания по всей
сети. Центральные персонажи связаны с
большинством участников в сети и особое
внимание именно на них обезопасит многих в
этом сообществе.
Четыре основных сетевых структуры, которые встречаются при передаче инфекционного заболевания. Слева наверху (А) - модель ядро-периферия, где ядро инфицировано и ввиду своего центрального положения передает болезнь по всей сети. Справа наверху (В) - перевернутая модель ядро-периферия, где ядро инфицировано и передает болезнь другим на периферии, но не передает между собой. Например, секс-работники и дальнобойщики, где дальнобойщики - выделены белым. Слева внизу (С) - модель брокера, где есть различные группы, одна с высокорисковым поведением (например, употребляющие наркотики), вторая - нет (не употребляющие наркотики). Между ними есть брокер, который соединяет их и передает инфекцию в низкорисковую группу. Справа внизу (D) - модель цепи, которая обнаружена в работе Bearman et al (2004). Сеть представляет собой цепь, чтобы дойти от одного конца до другого необходимо проделать множество сетевых шагов. Изображение из статьи Bearman et al (2004).
Бирман и его соавторы показывают, что
не всегда сексуальные и романтические
сети выстраиваются по ядро-периферийной структуре, как это показано в большинстве работ. Однако в случае из школьников это оказалась цепь, для которой не так
важно выделять центральных персонажей, то есть ядро. Цепь сама по себе очень
хрупкая структура, ее можно разорвать где
угодно и она тут же распадается на несколько
не связанных между собой компонентов.
А распад обозначает остановку в передаче
заболевания, если оно проходит по этой
сети.
Помимо
таких сугубо сетевых результатов о
том, цепь это или ядро-периферия,
конечно, Бирман с коллегами также обнаруживают
несколько любопытных социальных
эффектов. Самый важный — это, несомненно,
гомофилия, или склонность людей со
схожими характеристиками завязывать
связи. О ней и о ее многомерности мы уже писали раньше в этом блоге. В этом
исследовании было показано, что школьники
более склонны формировать пары с теми,
кто близок им по социоэкономическому
статусу, оценкам, планам на
будущее, IQ. Если оба подростка употребляют
алкоголь, то они с большей вероятностью
заведут отношения. То же самое касается
курения и прошлого сексуального опыта.
Опытность и плохое поведение связывает.
В
целом, работа важна для понимания того,
какие нужно делать интервенции, чтобы
остановить передачу заболеваний.
Основной посыл работы в том, что важно детально изучать структуру взаимоотношений и,
в зависимости от нее, проводить
предотвращение передачи. Будет ли это
воздействие исключительно на ядро (если
сеть выстроена по структуре «ядро-периферия»)
или обрыв связей в нескольких местах и
последующий распад сети (если сеть
выстроена как цепочка) — важно понять
для того, чтобы верно выстроить механизмы профилактики и предотвращения контактных болезней.
Медсестры и медбратья
В
коллективном научном блоге BadHessian есть
очень понятный пост про то, как
моделировать сети на примере сексуальных
сетей из сериала «Grey's Anatomy». Это
популярный американский сериал из
2000-х, который описывает рабочие будни
сотрудников больницы, которые, помимо
работы, занимаются и решением своих
личных проблем, а именно, флиртуют и
занимаются сексом. В посте изучается
сеть половых контактов и предсказывается,
кто с кем будет иметь интрижку.
В
целом, одна из важнейших задач в сетевом
анализе — это предсказать, как формируется
сеть. Иными словами, почему в этой
больнице сотрудники будут вступать в половые
контакты? Может быть, потому что они оба
несколько раз участвовали в проведении
сложнейших операций и это их сблизило?
Или их познакомил ординатор из
дерматологического отделения, который
в прошлом имел отношения с ними обеими? Один из методов для
ответа на эти вопросы — это ERGM
(экспоненциальное моделирование
случайных графов). На самом деле, в
интернете не так много простых и очень
понятных коротких учебников про то, как
сделать ERGM в какой-либо статистической
программе. Наш коллега и друг сделал
такой для работы в статистической среде R после того, как много
лет назад мы задавали ему миллионы
вопросов про то, как лучше работать с
такого типа моделями.
Сеть сексуальных контактов, построенная на основе сериала Grey's Anatomy. Синим обозначены мужчины, розовым - женщины. Источник изображения.
В
посте много скриптов, простых и ироничных
объяснений, но что мы узнаем по существу?
Вполне ожидаемые вещи: большинство
сексуальных контактов происходят между
людьми разных полов, близких по возрасту,
в рамках одной расовой группы, а также
в сети есть тенденция к моногамным
отношениям.
Пост
заканчивается вопросами,
на которые еще возможно ответить с использованием этого метода. Например,
можно предположить, что мужчины и женщины
будут по-разному выстраивать свои
половые связи, потому что мы знаем из
литературы, что мужчины в среднем
сообщают большее количество партнеров.
Другое предположение, которое можно
проверить — это сегрегация по положению
в больнице. Мы знаем, что больница —
достаточно иерархизированное сообщество,
поэтому можно предположить, что ординаторы
будут спать с ординаторами, а врачи —
только с врачами.
Как меняется поведение с онлайн-знакомствами
Со
сбором данных про сексуальные контакты
всегда возникает много проблем. Во-первых,
если мы говорим о таких группах, как
секс-работники или люди, употребляющие
тяжелые наркотики, то к ним очень сложно
получить доступ.
Помимо прочего, в таких исследованиях
выборка выстраивается методом снежного
кома, что показывает нам только особую
часть сообщества. Во-вторых, если мы
изучаем заболевания, передающие
контактным путем, то желательны медицинские анализы, которые бы позволяли
с точностью определить наличие болезни.
Это требует больших затрат, однако часто
обходится тем, что у самих респондентов
спрашивают об их статусе болезни.
Конечно, они могут не знать о своем
заболевании или могут солгать исследователю
по какой-либо причине.
Одним из новых направлений, которое не позволило бы решить все эти вопросы, но позволило бы расширить и разнообразить выборку, могло бы быть исследование контактов,
образовавшихся после пользования
dating-приложениями. Например, было несколько
громких журналистских заявлений о том,
что, якобы, после появления Tinder увеличилось количество людей с
заболеваниями, передающимися половым
путем.
"Поздравлем, у Вас и у Элисон есть хламидия". Картинка, отображающая интерфейс приложения Tinder и возможные уведомления о болезнях. Источник изображения.
Конечно, у онлайна тоже есть свои
ограничения. Например, как узнать, был
ли сексуальный контакт между людьми
или нет? Подобные приложения пока не
ввели такую функцию, но совсем скоро
такая опция вполне могла бы и появиться. Например,
после мэтча (совпадение, когда оба
пользователя понравились друг другу)
и после переписки приложение могло бы
отправлять уведомления с просьбой
оценить произошедшее. Было ли свидание,
был ли секс, было ли что-то еще. Большинство пользователей не будет
отвечать ввиду волнений об анонимности,
но определенная доля вполне будет готова оценить свои успехи или неуспехи ввиду
охотничьего азарта или в стремлении насолить неудачному партнеру.
Опять же, в данном случае мы ничего не узнаем про сами заболевания, однако это позволило бы изучить структуры сетей, которые выстраиваются на основе таких приложений. Что это: цепь, ядро и периферия или множество не связанных кусочков? Как по них могли бы передаваться контактные заболевания? Но так как таких возможностей пока нет, и это только наши исследовательские
фантазии о (почти) идеальных данных, то
остановимся на том, что пока есть.
Сами Tinder и OkCupidпериодически
публикуют небольшие отчеты на основе
своих данных, однако пока не дают их другим исследователям, насколько нам известно. Сами они дают ценные
рекомендации о том, как себя вести
оптимальным образом и быть успешным пользователем. Например, недавно
на сайте ХХ2 век появилась статья и инфографика про то, как приручить такие
сервисы.
Иногда
такими же вопросами задаются и сами data
scientist'ы, которые смогли выгрузить
часть данных сами, чтобы разобраться в
своей личной жизни. Например, на ТЕД
есть увлекательная лекция Эми Вэбб,
которая решила найти себе партнера,
который бы соответствовал десяткам
пунктов ее требований к идеальному
партнеру. Она выгрузила данные по сайту
знакомств, проанализировала профили
успешных участников, создала фейковые
аккаунты, чтобы отвлечь одних участников
от ее потенциальных кандидатов и много
всего еще немыслимого сделала с данными,
чтобы найти себе идеального партнера.