Викимедия сделала данные Википедии более удобными для искусственного интеллекта

В Германии был представлен новый проект, который позволит системам искусственного интеллекта работать с Википедией и с викидированной. Благодаря семантическому поиску почти 120 миллионов записей, теперь можно будет найти контент, а не только по ключевым словам, — пишет UNN со ссылкой на TechCrunch.

Подробности

«Система под названием« Проект Wikidata »использует векторный семантический поиск — методика, которая помогает компьютерам понять значения и связи между словами — с существующими данными о Википедии и ее платформах сестринского дела, состоящих из почти 120 миллионов записей», — пишет публикация.

Объединение с поддержкой новой модели контекста модели (MCP) — стандарта, который позволяет системам искусственного интеллекта более эффективно работать с источниками данных — «Проект открывается на естественном языке на естественном языке непосредственно к LLM». Инициатива, как уже говорилось, была реализована немецкой филиалом Wikimedia в сотрудничестве с нейронными поисками JINA.AI и DataStax, специализирующимися на технологиях реальной обработки данных.

Как это работало раньше

Викидани в течение многих лет предлагал машинные данные от ресурсов Wikimedia, но предыдущие инструменты разрешали только ключевые слова и запросы Sparql — специализированный язык запросов. Новая система будет лучше работать с завершенными системами поиска (RAG), которые позволяют моделям искусственного интеллекта получать внешнюю информацию, предоставляя разработчикам возможность основывать свои модели на знаниях, проверенных редакторами Википедии.

Данные также структурированы таким образом, чтобы обеспечить важный семантический контекст. Например, запрос на базу данных слова «ученый» опубликует списки выдающихся ученых -ядерных ученых, а также ученых, которые работали в Bell Labs. Существуют также переводы слова «ученый» на разных языках, образы ученых по работе и лиц, связанных с понятиями «исследователя» и «ученых».

Суть нового проекта

На заднем плане появляется новый проект, что разработчики искусственного интеллекта пытаются найти высококачественные источники данных, которые можно использовать для точной настройки моделей. Сами системы обучения стали более сложными — они часто собираются в качестве сложных образовательных сред, не как простые наборы данных, но для правильного функционирования им все еще нужны тщательно выбранные данные.

Для систем искусственного интеллекта, которые требуют максимальной точности, необходимость в проверенных и надежных данных особенно острая. И хотя Википедия иногда недооценивается, ее информация гораздо более фактическая, чем общие данные, такие как общий сканий — огромная сборка веб -сайтов со всего Интернета, сообщается в публикации.

Тем не менее, поиск данных качества может быть высокой ценой для лабораторий искусственного интеллекта. Таким образом, в августе Антропик согласился регулировать претензию группы авторов, чьи работы использовались в качестве образовательных материалов и заплатить 1,5 миллиарда долларов, чтобы избежать дальнейших претензий.

Лидер проекта Wikidata Ai Philip Saade в заявлении для прессы подчеркнул независимость инициативы от крупных лабораторных и технологических корпораций SHI.

Запуск этого проекта проекта, встроенного проекта, показывает, что мощный искусственный интеллект не обязательно должен контролироваться горсткой компаний. Он может быть открыт, обмен и создан, чтобы обслуживать все

Саад рассказал журналистам.

Tiktok распространяет видео, сгенерированные AIS, которые способствуют повествованию «Мир при любой цене» — NSDB CPD 01.10.25, 13:41 • 814 просмотров

 Пистолет

Подписаться
Уведомить о
guest

0 комментариев
Старые
Новые Популярные
Подписаться
Уведомить о
guest

0 комментариев
Старые
Новые Популярные
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x