Skip to content
wel.org.ua
wel.org.ua

  • Новини
  • Криптовалюта
  • Додатки
  • iT
  • Штучний інтелект
  • Статті
wel.org.ua

Anthropic повідомляє, що деякі моделі Claude тепер можуть завершувати «шкідливі або образливі» діалоги

Anthropic повідомляє, що деякі моделі Claude тепер можуть завершувати шкідливі діалоги

Катерина Зінченко, 29.08.202506.10.2025

Компанія Anthropic оголосила про впровадження нових можливостей, що дозволять її останнім та найбільшим моделям завершувати розмови у так званих “рідкісних, крайніх випадках постійно шкідливих або образливих взаємодій з користувачами.” Вражаюче, що Anthropic зазначає, що робить це не для захисту користувача, а, скоріше, для безпеки самої моделі штучного інтелекту.

Компанія не стверджує, що її моделі Claude є чутливими або можуть бути завдані шкоди в процесі спілкування з користувачами. Anthropic висловлює “велику невпевненість щодо потенційного морального статусу Claude та інших великих мовних моделей, як тепер, так і в майбутньому.”

Однак, оголошення вказує на нещодавно розроблену програму для дослідження того, що компанія називає “добробутом моделі”, і говорить, що Anthropic фактично вживає превентивних заходів, “намагаючись виявити та впровадити недорогі втручання для зменшення ризиків для добробуту моделі, у випадку, якщо такий добробут можливий.”

Зміни наразі обмежуються моделями Claude Opus 4 та 4.1. І ще раз, вони повинні відбуватися лише в “екстремальних випадках,” таких як “запити від користувачів на сексуальний контент, що стосується неповнолітніх, або спроби викликати інформацію, яка б дозволила вчинити насильство в широких масштабах або терористичні акти.”

Хоча такі запити можуть викликати юридичні чи репутаційні проблеми для Anthropic (судіть самі за останніми повідомленнями про можливий вплив ChatGPT на делюзійне мислення користувачів), компанія зазначає, що під час тестування перед впровадженням модель Claude Opus 4 продемонструвала “сильну неприязнь” до відповіді на ці запити та “показала ознаки явного розладу,” коли це сталося.

Щодо нових можливостей завершення розмов, компанія зазначає:

“У всіх випадках Claude може використовувати свою здатність завершувати розмову лише як крайній захід, коли багаторазові спроби перенаправлення не увінчалися успіхом і надії на продуктивну взаємодію вичерпано, або коли користувач прямо просить Claude завершити розмову.”

Також Anthropic заявляє, що модель Claude “отримала вказівки не використовувати цю здатність у випадках, коли користувачі можуть бути в безпосередньому ризику завдати шкоди собі або іншим.”

Коли Claude завершує розмову, Anthropic стверджує, що користувачі все ще зможуть розпочати нові розмови з того ж облікового запису та створювати нові гілки проблемної бесіди, редагуючи свої відповіді.

“Ми розглядаємо цю функцію як постійний експеримент і будемо продовжувати вдосконалювати наш підхід,” — зазначає компанія.

Штучний інтелект

Навигация по записям

Previous post
Next post

Related Posts

Новини OpenAI раскрывает пять масштабных онлайн-кампаний с использованием генеративного ИИ

OpenAI раскрывает пять масштабных онлайн-кампаний с использованием генеративного ИИ

31.05.202428.06.2025

Компания OpenAI обнаружила пять значительных онлайн-кампаний, в которых генеративный ИИ применялся для манипулирования общественными мнениями и воздействия на мировую политику.

Read More
Штучний інтелект Юристи OpenAI ставлять під сумнів участь Meta у пропозиції Elon Musk щодо викупу на 97 мільярдів доларів

Юристи OpenAI ставлять під сумнів участь Meta у пропозиції Elon Musk щодо викупу на 97 мільярдів доларів

25.08.202530.09.2025

OpenAI звертається до Meta з вимогою надати докази про будь-які зговори з Ілоном Маском та xAI щодо придбання або інвестування в творця ChatGPT. Цей запит був опублікований у довідці, поданій у четвер, в рамках справи Ілона Маска проти OpenAI. Юристи OpenAI зазначили, що у червні вони видали повістку Meta для…

Read More
Штучний інтелект Стартап Resolve AI, заснований колишніми керівниками Splunk, досягає оцінки в 1 мільярд доларів після успішного раунду фінансування Series A

Стартап Resolve AI досягає оцінки в 1 мільярд доларів після раунду фінансування Series A

13.01.202614.01.2026

Стартуп Resolve AI, який спеціалізується на розробці технологій автоматизації систем надійності, успішно залучив інвестиції в раунді Series A під керівництвом Lightspeed Venture Partners. За інформацією, отриманою від кількох людей, знайомих з угодою, попередня оцінка компанії сягнула 1 мільярда доларів. Проте через особливості структури фінансування справжня оцінка виявилась нижчою: інвестори придбали…

Read More

Последние записи

  • Новий спосіб перемикання магнітної пам’яті зменшить енерговитрати ШІ
  • NAVI посіли четверте місце на Esports World Cup 2026
  • Кубок NAVI продемонструють фанатам у готелі Україна
  • Студія GSC та UNITED24 відкривають збір на розмінування ЧАЕС
  • S.T.A.L.K.E.R. 2 отримала перше сюжетне DLC

Последние коментарии

Нет комментариев для просмотра.

Категории

  • iT
  • Авто
  • Додатки
  • Ігри та кіно
  • Криптовалюта
  • Наука та космос
  • Новини
  • Пристрої
  • Статті
  • Штучний інтелект
©2026 wel.org.ua | WordPress Theme by SuperbThemes