Skip to content
wel.org.ua
wel.org.ua

  • Новини
  • Криптовалюта
  • Додатки
  • iT
  • Штучний інтелект
  • Статті
wel.org.ua

Anthropic повідомляє, що деякі моделі Claude тепер можуть завершувати «шкідливі або образливі» діалоги

Anthropic повідомляє, що деякі моделі Claude тепер можуть завершувати шкідливі діалоги

Катерина Зінченко, 29.08.202506.10.2025

Компанія Anthropic оголосила про впровадження нових можливостей, що дозволять її останнім та найбільшим моделям завершувати розмови у так званих “рідкісних, крайніх випадках постійно шкідливих або образливих взаємодій з користувачами.” Вражаюче, що Anthropic зазначає, що робить це не для захисту користувача, а, скоріше, для безпеки самої моделі штучного інтелекту.

Компанія не стверджує, що її моделі Claude є чутливими або можуть бути завдані шкоди в процесі спілкування з користувачами. Anthropic висловлює “велику невпевненість щодо потенційного морального статусу Claude та інших великих мовних моделей, як тепер, так і в майбутньому.”

Однак, оголошення вказує на нещодавно розроблену програму для дослідження того, що компанія називає “добробутом моделі”, і говорить, що Anthropic фактично вживає превентивних заходів, “намагаючись виявити та впровадити недорогі втручання для зменшення ризиків для добробуту моделі, у випадку, якщо такий добробут можливий.”

Зміни наразі обмежуються моделями Claude Opus 4 та 4.1. І ще раз, вони повинні відбуватися лише в “екстремальних випадках,” таких як “запити від користувачів на сексуальний контент, що стосується неповнолітніх, або спроби викликати інформацію, яка б дозволила вчинити насильство в широких масштабах або терористичні акти.”

Хоча такі запити можуть викликати юридичні чи репутаційні проблеми для Anthropic (судіть самі за останніми повідомленнями про можливий вплив ChatGPT на делюзійне мислення користувачів), компанія зазначає, що під час тестування перед впровадженням модель Claude Opus 4 продемонструвала “сильну неприязнь” до відповіді на ці запити та “показала ознаки явного розладу,” коли це сталося.

Щодо нових можливостей завершення розмов, компанія зазначає:

“У всіх випадках Claude може використовувати свою здатність завершувати розмову лише як крайній захід, коли багаторазові спроби перенаправлення не увінчалися успіхом і надії на продуктивну взаємодію вичерпано, або коли користувач прямо просить Claude завершити розмову.”

Також Anthropic заявляє, що модель Claude “отримала вказівки не використовувати цю здатність у випадках, коли користувачі можуть бути в безпосередньому ризику завдати шкоди собі або іншим.”

Коли Claude завершує розмову, Anthropic стверджує, що користувачі все ще зможуть розпочати нові розмови з того ж облікового запису та створювати нові гілки проблемної бесіди, редагуючи свої відповіді.

“Ми розглядаємо цю функцію як постійний експеримент і будемо продовжувати вдосконалювати наш підхід,” — зазначає компанія.

Штучний інтелект

Навигация по записям

Previous post
Next post

Related Posts

Штучний інтелект Netflix починає впроваджувати Генеративний ІШ в своїх серіалах та фільмах

Netflix починає впроваджувати Генеративний ІШ в своїх серіалах та фільмах

26.07.2025

Компанії, що займаються розробкою відео СAI моделей і інструментів, часто згадують про співпрацю з голлівудськими студіями для покращення робочих процесів. У четвер Netflix оголосив про початок використання штучного інтелекту у своїх фільмах і шоу. На прес-конференції після оголошення фінансових результатів, спів-генеральний директор Тед Сарандос повідомив, що платформа представила «перше фінальне…

Read More
Штучний інтелект Компанія Cognition, творець AI-кодера Девіна, купує Windsurf

Генеральний директор Windsurf розповідає про «дуже похмурий» настрій перед угодою з Cognition

24.07.2025

Через кілька днів після оголошення про те, що стартап Windsurf, що займається штучним інтелектом, буде придбаний компанією Cognition, керівник Windsurf Джефф Ванґ поділився на X додатковими подробицями про ситуацію навколо угоди. Раніше повідомлялося про перемовини Windsurf з OpenAI, але ця угода не відбулася, і замість цього DeepMind від Google найняв…

Read More
Новини Чат-бот от MIT позволяет заглянуть в будущее и «поговорить» с самим собой

Чат-бот от MIT позволяет «заглянуть в будущее» и поговорить с самим собой

10.06.202428.06.2025

Исследователи из Массачусетского технологического института (MIT) разработали чат-бот под названием Future You, который имитирует старшую версию пользователя.

Read More

Последние записи

  • Новий спосіб перемикання магнітної пам’яті зменшить енерговитрати ШІ
  • NAVI посіли четверте місце на Esports World Cup 2026
  • Кубок NAVI продемонструють фанатам у готелі Україна
  • Студія GSC та UNITED24 відкривають збір на розмінування ЧАЕС
  • S.T.A.L.K.E.R. 2 отримала перше сюжетне DLC

Последние коментарии

Нет комментариев для просмотра.

Категории

  • iT
  • Авто
  • Додатки
  • Ігри та кіно
  • Криптовалюта
  • Наука та космос
  • Новини
  • Пристрої
  • Статті
  • Штучний інтелект
©2026 wel.org.ua | WordPress Theme by SuperbThemes