Искусственный интеллект в проектах Wikimedia
Искусственный интеллект в проектах Wikimedia (англ. Artificial intelligence in Wikimedia projects) — использование искусственного интеллекта для развития и поддержки проектов Wikimedia[1]. Согласно стратегии Фонда Викимедиа 2025 года, основанной на принципе «люди прежде всего», искусственный интеллект рассматривается исключительно как вспомогательный инструмент для поддержки, а не замены редакторов[2][3]. В 2026 году консенсус сообщества официально закрепил эту роль, установив приоритет человеческого творчества и ограничив применение генеративного ИИ базовыми задачами при условии обязательной проверки человеком[4][5].
Описание
Ряд статей в Википедии были созданы полностью или частично с помощью искусственного интеллекта. Контент, сгенерированный ИИ, может быть вреден для Википедии, если он является недостоверным или содержит поддельные ссылки на источники.
Для борьбы с низким качеством автоматически сгенерированных материалов в 2023 году сообществом Википедии был создан проект Очистка от ИИ-контента. В августе 2025 года была принята политика, позволившая редакторам выставлять подозрительные на автогенерацию статьи на быстрое удаление.
В марте 2026 года в Английской Википедии был официально принят полный запрет на использование больших языковых моделей для создания или переписывания контента[6]. Использование искусственного интеллекта допускается лишь в качестве исключения для базовой корректуры собственного текста и помощи в переводе статей из других языковых разделов при условии обязательной проверки человеком[7]
Использование искусственного интеллекта для Википедии
Стратегия Фонда Викимедиа
В апреле 2025 года Фонд Викимедиа представил новую стратегию использования искусственного интеллекта, в основе которой лежит принцип «люди прежде всего» (human-first). Главная цель инициативы — применять технологии для поддержки редакторов-волонтёров, а не для их замены[8].[9] В рамках стратегии планируется внедрение ИИ-инструментов для автоматизации рутинных задач. Основные цели включают:
- помощь модераторам и патрулирующим в выявлении вандализма и дезинформации[8];[9]
- экономию времени редакторов за счёт улучшения поиска источников, что позволяет уделять больше внимания созданию контента и обсуждениям[8];[9]
- поддержку локальных контекстов посредством автоматизации перевода базовых тем, что даёт участникам возможность сосредоточиться на добавлении уникальных культурных нюансов[8];[9]
- адаптацию (онбординг) новых волонтёров с использованием инструментов автоматизированного наставничества и персонализированной поддержки[8].[9][10]
ORES
Проект Objective Revision Evaluation Service (ORES) — сервис искусственного интеллекта для оценки качества правок в Википедии[11][12]. Фонд Викимедиа представил проект ORES в ноябре 2015 года[13]. В конце 2023 года сервис был признан устаревшим и заменён на платформу Lift Wing[14].
Снижение предвзятости
В августе 2018 года компания Primer сообщила о попытке использовать искусственный интеллект для создания статей о женщинах с целью борьбы с гендерной предвзятостью в Википедии[15][16].
Появление генеративного ИИ
После публичного запуска ChatGPT в 2022 году начались эксперименты по написанию статей в Википедии с помощью ИИ. Это вызвало споры о допустимости использования большие языковые модели (Large language models, LLM) из-за их склонности генерировать правдоподобно звучащую дезинформацию, включая несуществующие ссылки; несоответствие энциклопедическому стилю и воспроизведение предвзятостей. С 2023 года шла работа по подготовке политики Википедии по отношению к ChatGPT и аналогичным LLM, в том числе рекомендовалось пользователям, не знакомым с такими инструментами, воздерживаться от их применения из-за вышеописанных рисков, а также отмечались риски клеветы и нарушения авторских прав.
6 декабря 2022 года участник Pharos создал статью «Artwork title» в своём черновике, указав, что использовал ChatGPT для экспериментов и будет дорабатывать её вручную. Другой редактор пометил статью как «оригинальное исследование», указав, что первоначально это был автосгенерированный текст без источников, а ссылки добавлены затем, а не использованы с самого начала. Другой участник, также тестировавший ранний ChatGPT, отметил, что его обзор темы был приемлем, но ссылки были вымышленными. Фонд Wiki Education отмечал, что опытные редакторы считают ИИ полезным для черновиков и новых статей, но предупреждал о склонности ChatGPT использовать рекламные формулировки и другие проблемы[17]. Мигель Гарсия, бывший член Wikimedia из Испании, утверждает, что с запуском ChatGPT число автосгенерированных статей резко выросло, но затем стабилизировалось благодаря усилиям сообщества: большинство статей без источников удаляются быстро или номинируются на удаление.
В 2023 году сообщество Википедии создало проект AI Cleanup, помогающий удалять низкокачественный ИИ-контент. В октябре 2024 года исследование Принстонского университета показало, что около 5 % из 3000 новых статей англоязычной Википедии, созданных в августе 2024 года, были написаны с помощью искусственного интеллекта. Было установлено, что иногда ИИ использовался просто как вспомогательное средство, но часть публикаций носила рекламный или политический характер[18].
В августе 2025 года политика Википедии официально разрешила номинировать статьи, подозреваемые в автосгенерации, на быстрое удаление. Такие статьи обычно узнают по не относящимся к теме или вымышленным сноскам, а также характерной формулировке. Например, если статья написана в стиле ответа LLM («Вот ваша статья по теме…», «На момент моего последнего обучения…»), она обычно помечается на удаление[19]. Другие признаки использования ИИ: чрезмерное употребление длинных тире, слова «более того», рекламных выражений («захватывающий»), а также некорректные кавычки. В процессе обсуждения политики быстрых удалений один рецензент отмечал «поток ужасных автосгенерированных черновиков», другие пользователи жаловались на «ложь и поддельные ссылки» в подобных статьях и большие затраты времени на исправление последствий[20][21].
Основатель WikiProject AI Cleanup Ильяс Леблю и другие редакторы отмечают, что по ряду особенностей — неестественному языку, массовому производству правдоподобного, но лживого контента — возможно выявлять поддельные статьи-обманы, которые приходится оперативно удалять[22][23]. Википедия создала руководство по распознаванию признаков ИИ-текста — Signs of AI writing.
К концу 2025 года участники проекта AI Cleanup выявили и пометили более 4800 статей с подозрением на сгенерированный контент. Для автоматизации проверок был успешно применён фильтр правок № 1325, который автоматически помечает типичные для ИИ фразы. 24 ноября 2025 года сообщество приняло руководство WP:NEWLLM, прямо запрещающее использование больших языковых моделей для создания новых статей «с нуля»[24]
Фальсификации и вредоносное применение ИИ
В 2023 году учёные выявили частые случаи фабрикации данных и ссылок в ChatGPT. В тот период полный запрет на ИИ в Википедии сочли слишком жёстким решением. ИИ использовался для создания различных мистификаций: например, статья объёмом 2000 слов про несуществующую османскую крепость была разоблачена Ильясом Леблю и его командой[25][26]. В другом случае в статью о Estola albosignata (жук) был вставлен сфабрикованный абзац, который ссылался на нерелевантный источник[27].
ИИ применялся для продвижения политической повестки в контентных разделах Википедии.
Неконтролируемое распространение сгенерированных текстов привело к перегрузке модераторов-волонтёров, так как проверка статей и их очистка от вымышленных фактов требует значительно больше времени, чем автоматическая генерация. Кроме того, были зафиксированы случаи автоматизированного вмешательства: в начале марта 2026 года автономный агент TomWikiAssist самостоятельно создал и отредактировал несколько материалов, что вызвало серьёзное беспокойство сообщества.
Простые сводки статей
В 2025 году Фонд Викимедиа начал тестировать функцию «Simple Article Summaries», автоматически генерируемую ИИ-сводку содержания статей, аналогично AI Overviews в Google Search. Решение вызвало быструю и жёсткую критику редакторов Википедии, отметивших снижение доверия к ресурсу из-за склонности ИИ к галлюцинациям и отсутствие очевидной необходимости такой функции[28]. В результате Фонд Викимедиа приостановил внедрение функции, но сохранил интерес к дальнейшей интеграции генеративного ИИ[29].
Использование Википедии для искусственного интеллекта
При создании Google Perspective API — инструмента для оценки токсичности комментариев на форумах, был использован датасет из сотен тысяч обсуждений на страницах Википедии, где люди вручную разметили токсичность сообщений. Подкорпуса Википедии считаются одними из крупнейших и наиболее тщательно обработанных выборок для обучения ИИ.
По данным работы 2012 года, более 1000 научных публикаций (включая ИИ-исследования) анализировали Википедию, повторно использовали её тексты, применяли технические расширения или исследовали коммуникацию на её платформе[31]. Работа 2017 года характеризует Википедию как «золотую жилу» для любого машинного обучения на человеческих текстах.
В проекте-обзоре «Столетнее исследование искусственного интеллекта» (2016) Википедия названа важной платформой для изучения взаимодействия ИИ и человеческого участия.
Существует опасение по поводу отсутствия атрибуции Википедии при обучении языковых моделей типа ChatGPT[32]. Хотя лицензия Википедии позволяет использовать её тексты даже в переработанном виде, она требует обязательного указания авторства, поэтому интеграция Википедии как источника для ИИ без раскрытия происхождения может идти вразрез с условиями использования.
В 2025 году на фоне развития генеративного искусственного интеллекта количество просмотров страниц Википедии людьми снизилось на 8 %. В то же время трафик ИИ-ботов, массово собирающих данные для обучения новых моделей, вырос на 50 %, что создало беспрецедентную нагрузку на серверы Фонда Викимедиа[33][34].
В 2025—2026 годах в рамках коммерческой программы Wikimedia Enterprise были заключены официальные соглашения о платном высокоскоростном доступе к API Википедии с такими компаниями, как Microsoft, Meta, Amazon и Google[35]. Для удовлетворения потребностей ИИ-компаний также были внедрены новые функции API, включая потоковую передачу обновлений в реальном времени и оценку риска отката правок[36].
Использование искусственного интеллекта для других проектов Wikimedia
Detox — исследовательский проект Google и Фонда Викимедиа по методикам борьбы с грубостью и токсичными высказываниями в обсуждениях сообществ Wikimedia[37]. В числе прочего Wikimedia Foundation и Jigsaw экспериментировали с искусственным интеллектом для поиска и разработки технических решений данной проблемы. В октябре 2016 года эти организации опубликовали исследование «Ex Machina: Personal Attacks Seen at Scale»[38]. Мирные СМИ освещали эти исследования и их социальный контекст[39]. Для перевода статей используются системы машинного перевода, такие как DeepL[40][41]. На Викискладе применялся инструмент Computer-Aided Tagging (CAT), использовавший Google Cloud Vision API для распознавания визуального содержимого загруженных изображений и автоматической генерации тегов. Сгенерированные метки сопоставлялись с элементами Викиданных и после проверки участниками сохранялись как структурированные данные; в сентябре 2023 года инструмент был деактивирован[42]. Для работы с Викиданными используются инструменты связывания сущностей, такие как Falcon 2.0 (для совместного связывания сущностей и отношений) и OpenTapioca[43].
Реакция
В ноябре 2023 года сооснователь Википедии Джимми Уэйлс отметил, что искусственный интеллект не является достоверным источником и что он не будет использовать ChatGPT для написания статей. В июле 2025 года он предложил использовать LLM для предоставления индивидуальных подсказок участникам при отклонении черновиков[44].
Директор по продукту фонда Викимедиа Маршалл Миллер заявил, что проект AI Cleanup поддерживает нейтральность и надёжность сайта, а ИИ способствует созданию низкокачественного контента. В интервью 404 Media Ильяс Леблю назвал быструю политику удаления лишь «пластерем» для наиболее серьёзных проблем, подчеркнув, что фундаментальная проблема остаётся. Некоторые ИИ-статьи, по его словам, обсуждаются до недели перед удалением[45].
К 2026 году консенсус сообщества Викимедиа относительно использования искусственного интеллекта сформировался на основе «минималистского подхода», закрепляющего за ИИ исключительно вспомогательную роль[46]. Приоритетом остаётся человеческое творчество: искусственный интеллект не должен заменять аналитическую работу и критическое мышление авторов. Кроме того, сообщество признало низкую эффективность автоматических ИИ-детекторов, в связи с чем выявление сгенерированных текстов опирается преимущественно на ручные проверки и базовые технические фильтры[46].
Примечания
Литература
- Nielsen, Finn Årup (2012). “Wikipedia Research and Tools: Review and Comments”. SSRN Working Paper Series [англ.]. DOI:10.2139/ssrn.2129874. ISSN 1556-5068.
- Mehdi, Mohamad; Okoli, Chitu; Mesgari, Mostafa; Nielsen, Finn Årup; Lanamäki, Arto (март 2017). “Excavating the mother lode of human-generated text: A systematic review of research that uses the wikipedia corpus”. Information Processing & Management. 53 (2): 505—529. DOI:10.1016/j.ipm.2016.07.003. S2CID 217265814. Проверьте дату в
|date=(справка на английском) - Wulczyn, Ellery. Ex Machina: Personal Attacks Seen at Scale // Proceedings of the 26th International Conference on World Wide Web / Ellery Wulczyn, Nithum Thain, Lucas Dixon. — 2017. — P. 1391–1399. — ISBN 9781450349130. — doi:10.1145/3038912.3052591.
Ссылки
- [ Категория на Викискладе: Wikimedia projects and AI]
- [ Проект на MetaWiki: Artificial intelligence]
- [ Машинное обучение LiftWing на Wikitech]