ChatGPT опять наврал? Расследование на примере ANOVA-теста
Я обожаю экспериментировать с ИИ в своей аналитической работе. Скорость — это здорово, но для меня точность — абсолютный приоритет. К сожалению, ИИ ошибается, и я регулярно сталкиваюсь с этим.
Проверять всё вручную — нереально при объёме моих задач, поэтому я постоянно ищу способы валидации результатов прямо в процессе работы с промптами.
Вот один из моих экспериментов: я решила протестировать возможности ChatGPT в анализе данных с помощью ANOVA-теста. Задача была простая — на представленном дата-сете оценить влияние разных моделей напоминаний в мобильном приложении на количество опозданий студентов на занятия.
🔤 Как я проверяла результаты?
1️⃣Я специально сформулировала промпты так, чтобы ChatGPT не только провел тест, но и подробно описал каждый шаг расчета, включая формулы и промежуточные результаты. 2️⃣Более того, я попросила его выполнить ANOVA-тест тремя разными способами: используя стандартную функцию из библиотеки scipy.stats, вручную и с помощью матричного подхода. ▶️Это был своего рода тест на вшивость. Цель — убедиться в корректности работы ИИ, сравнив результаты разных методов.
Все три варианта дали удивительно похожие результаты: p-значение значительно превысило 0.05, что подтвердило гипотезу об отсутствии статистически значимой разницы между моделями напоминаний.
Конечно, данные в этом примере были выдуманные, и поэтому на практике результат не столь важен. Но сам подход к валидации, — именно его я хочу подчеркнуть.
🐈⬛Убедили ли бы меня такие результаты в корректности расчетов ИИ? Да, в данном случае — безусловно. Совпадение результатов, полученных тремя разными методами, — это весомый аргумент в пользу достоверности выводов. А вас?
ChatGPT опять наврал? Расследование на примере ANOVA-теста
Я обожаю экспериментировать с ИИ в своей аналитической работе. Скорость — это здорово, но для меня точность — абсолютный приоритет. К сожалению, ИИ ошибается, и я регулярно сталкиваюсь с этим.
Проверять всё вручную — нереально при объёме моих задач, поэтому я постоянно ищу способы валидации результатов прямо в процессе работы с промптами.
Вот один из моих экспериментов: я решила протестировать возможности ChatGPT в анализе данных с помощью ANOVA-теста. Задача была простая — на представленном дата-сете оценить влияние разных моделей напоминаний в мобильном приложении на количество опозданий студентов на занятия.
🔤 Как я проверяла результаты?
1️⃣Я специально сформулировала промпты так, чтобы ChatGPT не только провел тест, но и подробно описал каждый шаг расчета, включая формулы и промежуточные результаты. 2️⃣Более того, я попросила его выполнить ANOVA-тест тремя разными способами: используя стандартную функцию из библиотеки scipy.stats, вручную и с помощью матричного подхода. ▶️Это был своего рода тест на вшивость. Цель — убедиться в корректности работы ИИ, сравнив результаты разных методов.
Все три варианта дали удивительно похожие результаты: p-значение значительно превысило 0.05, что подтвердило гипотезу об отсутствии статистически значимой разницы между моделями напоминаний.
Конечно, данные в этом примере были выдуманные, и поэтому на практике результат не столь важен. Но сам подход к валидации, — именно его я хочу подчеркнуть.
🐈⬛Убедили ли бы меня такие результаты в корректности расчетов ИИ? Да, в данном случае — безусловно. Совпадение результатов, полученных тремя разными методами, — это весомый аргумент в пользу достоверности выводов. А вас?
Ukrainian forces successfully attacked Russian vehicles in the capital city of Kyiv thanks to a public tip made through the encrypted messaging app Telegram, Ukraine's top law-enforcement agency said on Tuesday. As a result, the pandemic saw many newcomers to Telegram, including prominent anti-vaccine activists who used the app's hands-off approach to share false information on shots, a study from the Institute for Strategic Dialogue shows. In view of this, the regulator has cautioned investors not to rely on such investment tips / advice received through social media platforms. It has also said investors should exercise utmost caution while taking investment decisions while dealing in the securities market. If you initiate a Secret Chat, however, then these communications are end-to-end encrypted and are tied to the device you are using. That means it’s less convenient to access them across multiple platforms, but you are at far less risk of snooping. Back in the day, Secret Chats received some praise from the EFF, but the fact that its standard system isn’t as secure earned it some criticism. If you’re looking for something that is considered more reliable by privacy advocates, then Signal is the EFF’s preferred platform, although that too is not without some caveats. However, the perpetrators of such frauds are now adopting new methods and technologies to defraud the investors.
from jp