Skip to content
wel.org.ua
wel.org.ua

  • Новини
  • Криптовалюта
  • Додатки
  • iT
  • Штучний інтелект
  • Статті
wel.org.ua

Ексклюзив: Компанія Benchmark підтримує стартап Greptile, що займається перевіркою коду за допомогою ШІ, з оцінкою в $180 мільйонів, повідомляють джерела

Новий штучний інтелект для програмування оприлюднив свої перші результати — і вони вражають негативно

Катерина Зінченко, 06.08.2025

Новий виклик у сфері штучного інтелекту оголосив свого першого переможця, встановивши нові стандарти для програмістів, що використовують AI.

У середу о 17:00 за тихоокеанським часом неприбуткова організація Laude Institute оголосила про переможця K Prize — багатоступеневого виклику з програмування на основі штучного інтелекту, започаткованого засновником Databricks і Perplexity Енді Конвінським. Переможцем став бразильський фахівець з формулювання запитів Едуардо Роча де Андраде, який отримає 50 000 доларів призових. Але більш вражаючою, ніж перемога, стала його підсумкова оцінка: він виграв, відповівши правильно лише на 7,5% питань тесту.

“Ми раді, що створили еталон, який насправді складний,” — зазначив Конвінський. “Еталони повинні бути складними, якщо вони мають значення,”— додав він, зазначивши: “Оцінки були б іншими, якби великі лабораторії брали участь зі своїми найпотужнішими моделями. Але це і є суть. K Prize проходить офлайн з обмеженими ресурсами, тому він віддає перевагу меншим і відкритим моделям. Мені це подобається. Це забезпечує рівні умови.”

Конвінський пообіцяв 1 мільйон доларів першій відкритій моделі, яка зможе набрати більше 90% на тесті.

Подібно до відомої системи SWE-Bench, K Prize тестує моделі на основі проблем, відзначених на GitHub, що є перевіркою їхньої здатності вирішувати реальні програмні задачі. Але, на відміну від SWE-Bench, яка базується на фіксованому наборі проблем для навчання моделей, K Prize задумано як “версію SWE-Bench без забруднень,” що використовує тайминг в подачі для захисту від специфічного навчання під еталон. Для першого раунду моделі потрібно було подати до 12 березня. Організатори K Prize створили тест, використовуючи лише проблеми на GitHub, відзначені після цієї дати.

Оцінка 7,5% різко контрастує з оцінками SWE-Bench, який наразі демонструє 75% на своєму легшому “Перевіреному” тесті і 34% на важчому “Повному” тесті. Конвінський досі не впевнений, чи пов’язана ця розбіжність із забрудненням в SWE-Bench, чи просто з труднощами збору нових проблем з GitHub, але він очікує, що проект K Prize незабаром дасть відповідь на це питання.

“З кожним новим раундом ми матимемо краще уявлення,” — сказав він, “адже ми очікуємо, що учасники адаптуються до динаміки змагання кожні кілька місяців.”

Це може здаватись дивним місцем для низького результату, враховуючи широкий спектр інструментів для програмування на основі штучного інтелекту, що вже доступні публічно — але за зростанням легкості в тестах багато критиків вважають проекти на кшталт K Prize необхідним кроком до вирішення проблеми оцінювання AI.

“Я досить оптимістично налаштований стосовно створення нових тестів для існуючих еталонів,” — зазначає дослідник з Принстона Саяш Капур, який висловив схожу ідею у нещодавній статті. “Без таких експериментів ми не можемо дійсно визначити, чи проблема в забрудненні, чи просто в тому, що ми намагаємось досягти лідерства SWE-Bench за допомогою людини в процесі.”

Для Конвінського це не лише кращий еталон, а й відкритий виклик для решти індустрії. “Якщо ви слухаєте всі ці розмови, здається, що ми повинні бачити AI-лікарів, AI-юристів та AI-програмістів, але це просто не так,” — додає він. “Якщо ми не можемо навіть набрати більше 10% на беззабрудненому SWE-Bench, це для мене є реальністю.”

Штучний інтелект

Навигация по записям

Previous post
Next post

Related Posts

Штучний інтелект Грок, конкурент Nvidia в сегменті штучного інтелекту, наближається до нового раунду фінансування з оціночною вартістю в 6 мільярдів доларів

Грок, конкурент Nvidia в сегменті штучного інтелекту, наближається до нового раунду фінансування з оціночною вартістю в 6 мільярдів доларів

31.07.2025

Стартап у сфері AI-мікросхем Groq веде перемови про залучення 600 мільйонів доларів при оцінці в близько 6 мільярдів доларів, повідомляє Bloomberg, хоча угода ще не остаточна, і умови можуть змінитися. У серпні 2024 року Groq залучила 640 мільйонів доларів при оцінці в 2,8 мільярдів доларів, що вдвічі перевищує вартість компанії…

Read More
Штучний інтелект Чи вистачить сміливості Алтмана і Наделли, аби знайти баланс між силою і відповідальністю в епоху штучного інтелекту?

Чи вистачить сміливості Алтмана і Наделли, аби знайти баланс між силою і відповідальністю в епоху штучного інтелекту

18.11.202519.11.2025

Технологічний сектор стикається з новими викликами в управлінні енергетичними ресурсами, адже зростаючий попит на обчислювальні потужності для штучного інтелекту ставить перед компаніями, такими як OpenAI і Microsoft, серйозні запитання. Хоча ці технологічні гіганти активно вдосконалюють свої обчислювальні платформи, їхні зусилля виявилися недостатніми для випередження зростаючого попиту на енергію, що веде…

Read More
Новини Meta инвестирует $10 миллиардов в создание крупнейшего центра обработки данных искусственного интеллекта в Луизиане

Meta инвестирует $10 миллиардов в создание крупнейшего центра обработки данных искусственного интеллекта в Луизиане

05.12.202405.12.2024

Meta объявила о строительстве крупнейшего в мире центра обработки данных в Луизиане, который должен стать технологическим хабом США.

Read More

Последние записи

  • Ubisoft тестує запуск ігор у Steam без обов’язкового Ubisoft Connect
  • Як UESF допомагає підліткам розібратися в онлайн-загрозах
  • Meta представила агента штучного інтелекту Muse
  • Що показали на виставці IFA 2026 у Берліні
  • Недорогий геймінг 2026: які ноутбуки дійсно тягнуть ігри, а не гроші з гаманця

Последние коментарии

Нет комментариев для просмотра.

Категории

  • iT
  • Авто
  • Додатки
  • Ігри та кіно
  • Криптовалюта
  • Наука та космос
  • Новини
  • Пристрої
  • Статті
  • Штучний інтелект
©2026 wel.org.ua | WordPress Theme by SuperbThemes