🚨 6 обл. тривога$ 44,5651,79🌤️ Київ +19°А-95 82,00ДП 92,40Газ 43,38👆 торкніться показника

Неочікувані результати дослідження: ШІ тупішає від спілкування з людьми

Неочікувані результати дослідження: ШІ тупішає від спілкування з людьми

Будьте першими в курсі головного

Додайте «Силу Слова» до улюблених джерел у Google — і наші новини будуть вище у вашому пошуку.

Дослідження Microsoft Research і Salesforce виявило, що в тривалих розмовах з AI-моделями надійність відповідей падає з 90% до 65%.

Спільне дослідження Microsoft Research і Salesforce проаналізувало понад 200 тисяч діалогів із сучасними AI-моделями та виявило: у тривалих розмовах їхня надійність різко падає. Попри високі результати в одноразових запитах, багатокрокове спілкування часто призводить до помилок і галюцинацій, інформує UAINFO.org з посиланням на “24 канал”.

Дослідники з Microsoft Research разом із Salesforce проаналізували понад 200 тисяч діалогів із провідними великими мовними моделями. Серед них – GPT-4.1, Gemini 2.5 Pro, Claude 3.7 Sonnet, o3, DeepSeek R1 та Llama 4. Про це пише Windows central.

📱 Наші Shorts🔔 Підписатися
Помідори «як із бочки» без оцту: простий рецепт для 3-літрової банки
Помідори «як із бочки» без оцту: простий рецепт для 3-літрової банки
Росія може атакувати НАТО найближчими роками: у розвідці США розкрили задум Путіна
Росія може атакувати НАТО найближчими роками: у розвідці США розкрили
Сімейна драма Кличка та Панеттьєрі: чому боксер забрав опіку над донькою
Сімейна драма Кличка та Панеттьєрі: чому боксер забрав опіку над доньк
Федоров вимагає від Зеленского публічно відповісти про корупцію в оточенні
Федоров вимагає від Зеленского публічно відповісти про корупцію в оточ
Це його вибір, – Зеленський про відмову Федорова від усіх 4 запропонованих варіантів співпраці
Це його вибір, – Зеленський про відмову Федорова від усіх 4 запропонов
Корупція заважає завершити війну в сильній позиції, — ексміністр Федоров
Корупція заважає завершити війну в сильній позиції, — ексміністр Федор
«Я буду дивитися, з ким пройшли шлях» - Михайло Федоров розповів, коли ухвалить рішення про участ...
«Я буду дивитися, з ким пройшли шлях» - Михайло Федоров розповів, коли
«Ці люди зрештою програють»: Федоров пояснив, що призвело до його звільнення
«Ці люди зрештою програють»: Федоров пояснив, що призвело до його звіл
Бойфренд-аб'юзер Гайден Панеттьєрі вперше заговорив після її смерті: він був поруч у момент трагедії
Бойфренд-аб'юзер Гайден Панеттьєрі вперше заговорив після її смерті: в
Ексміністр оборони Федоров отримав бронювання у фонді Сороса через три дні після звільнення
Ексміністр оборони Федоров отримав бронювання у фонді Сороса через три

Результати показали: моделі демонструють близько 90% успішності при виконанні завдань за одним запитом. Проте у форматі природної багатокрокової розмови цей показник падає приблизно до 65%.

Водночас дослідники наголошують: це не означає, що модель буквально стає дурнішою. Загальне зниження когнітивної здатності оцінили приблизно у 15%. Однак рівень ненадійності зріс на 112%. Іншими словами, відповіді частіше ставали нестабільними або містили помилки.

Як пише XDA, однією з причин називають так зване передчасне генерування. Модель починає формувати відповідь ще до того, як користувач повністю виклав контекст або уточнив деталі. Це призводить до того, що подальший діалог будується на неточній основі.

Ще одна проблема – закріплення первинної помилки. Якщо перша відповідь містила неточність, модель часто використовує її як базу для наступних тверджень, навіть коли вона хибна.

Дослідники також зафіксували явище “роздування відповіді”. У багатокрокових діалогах обсяг тексту зростав на 20%–300% порівняно з одноразовими запитами. Довші відповіді містили більше припущень і галюцинацій, які згодом сприймалися як частина контексту розмови.

Навіть моделі з додатковими “thinking tokens”, як-от o3 чи DeepSeek R1, не змогли повністю уникнути цієї проблеми.

У ширшому контексті дослідження підкреслює: попри швидке впровадження генеративного AI та зміну звичок користувачів, зокрема перехід від класичного пошуку до AI-інструментів, надійність таких систем залишається вразливою, особливо коли у діалозі з’являється багато змінних.

Джерело: uainfo.org

📩 Розсилка

Головне за день - одним листом

Щовечора надсилаємо топ-5 найчитаніших новин. Без спаму, відписка в один клік.

Натискаючи «Підписатися», ви погоджуєтесь отримувати щоденний дайджест. Адресу не передаємо третім особам - політика конфіденційності.

Рейтинг статті
Сила Слова