Telegram Group & Telegram Channel
Проект по анализу использования языка людьми в интернете закрылся, потому что нейросети слишком сильно «загрязнили данные», заполонив сеть искусственным текстом

Создательница проекта Wordfreq, который отслеживал публикации в интернете, чтобы определить популярность различных слов в языке, сообщила, что проект будет закрыт. Причина — спам, который производит генеративный искусственный интеллект. Он “отравил” интернет до уровня, который уже не позволяет проводить исследования. Wordfreq отслеживал более 40 различных языков, анализируя статьи в Википедии, субтитры к фильмам, новости книги, а также Twitter и Reddit. Система использовалась для анализа меняющихся языковых паттернов по мере изменения современной культуры, ее применяли ученые, которые работают в этой области. В своем сообщении на GitHub создательница проекта Робин Спир написала, что он «больше не будет обновляться».

«Не думаю, что у кого-то есть надежная информация об использовании языка людьми после 2021 года», — отметила она. По словам разработчицы, сегодня интернет заполнен “мусором”, который создают нейросети. «Включение этого мусора в данные искажает частоту использования слов», — сообщила она. В данных, которые анализировал Wordfreq, всегда был спам, но «он был управляемым и часто идентифицируемым». «Большие языковые модели генерируют текст, который специально маскируется под настоящий язык», — пожаловалась она. Спир также привела пример того, что ChatGPT, например, злоупотребляет словом «вникать», что резко повысило частоту этого конкретного слова (но его не так часто используют люди).

Она отметила, что сегодня почти все инструменты (которые щедро финансируют Google, OpenAI и другие) для анализа текста используются именно для обучения нейросетей, чтобы создать «технологии для плагиата, которые будут выдавать ваши слова за свои». Спир также отметила, что сегодня данные получить сложнее, поскольку Twitter и Reddit, которые использовал Wordfreq, начали взимать плату за доступ к своим API из-за того, что их используют для обучения нейросетей.



group-telegram.com/ostorozhno_novosti/29732
Create:
Last Update:

Проект по анализу использования языка людьми в интернете закрылся, потому что нейросети слишком сильно «загрязнили данные», заполонив сеть искусственным текстом

Создательница проекта Wordfreq, который отслеживал публикации в интернете, чтобы определить популярность различных слов в языке, сообщила, что проект будет закрыт. Причина — спам, который производит генеративный искусственный интеллект. Он “отравил” интернет до уровня, который уже не позволяет проводить исследования. Wordfreq отслеживал более 40 различных языков, анализируя статьи в Википедии, субтитры к фильмам, новости книги, а также Twitter и Reddit. Система использовалась для анализа меняющихся языковых паттернов по мере изменения современной культуры, ее применяли ученые, которые работают в этой области. В своем сообщении на GitHub создательница проекта Робин Спир написала, что он «больше не будет обновляться».

«Не думаю, что у кого-то есть надежная информация об использовании языка людьми после 2021 года», — отметила она. По словам разработчицы, сегодня интернет заполнен “мусором”, который создают нейросети. «Включение этого мусора в данные искажает частоту использования слов», — сообщила она. В данных, которые анализировал Wordfreq, всегда был спам, но «он был управляемым и часто идентифицируемым». «Большие языковые модели генерируют текст, который специально маскируется под настоящий язык», — пожаловалась она. Спир также привела пример того, что ChatGPT, например, злоупотребляет словом «вникать», что резко повысило частоту этого конкретного слова (но его не так часто используют люди).

Она отметила, что сегодня почти все инструменты (которые щедро финансируют Google, OpenAI и другие) для анализа текста используются именно для обучения нейросетей, чтобы создать «технологии для плагиата, которые будут выдавать ваши слова за свои». Спир также отметила, что сегодня данные получить сложнее, поскольку Twitter и Reddit, которые использовал Wordfreq, начали взимать плату за доступ к своим API из-за того, что их используют для обучения нейросетей.

BY Осторожно, новости


Warning: Undefined variable $i in /var/www/group-telegram/post.php on line 260

Share with your friend now:
group-telegram.com/ostorozhno_novosti/29732

View MORE
Open in Telegram


Telegram | DID YOU KNOW?

Date: |

The perpetrators use various names to carry out the investment scams. They may also impersonate or clone licensed capital market intermediaries by using the names, logos, credentials, websites and other details of the legitimate entities to promote the illegal schemes. Update March 8, 2022: EFF has clarified that Channels and Groups are not fully encrypted, end-to-end, updated our post to link to Telegram’s FAQ for Cloud and Secret chats, updated to clarify that auto-delete is available for group and channel admins, and added some additional links. You may recall that, back when Facebook started changing WhatsApp’s terms of service, a number of news outlets reported on, and even recommended, switching to Telegram. Pavel Durov even said that users should delete WhatsApp “unless you are cool with all of your photos and messages becoming public one day.” But Telegram can’t be described as a more-secure version of WhatsApp. And indeed, volatility has been a hallmark of the market environment so far in 2022, with the S&P 500 still down more than 10% for the year-to-date after first sliding into a correction last month. The CBOE Volatility Index, or VIX, has held at a lofty level of more than 30. "Like the bombing of the maternity ward in Mariupol," he said, "Even before it hits the news, you see the videos on the Telegram channels."
from tr


Telegram Осторожно, новости
FROM American