Джейкъб Коксън не е някакъв случаен песимист в X.
Джейкъб Коксън не е просто поредният песимист, който разпространява катастрофични сценарии в платформата X.
Коксън е математик, завършил Кеймбридж, който през последните три години е работил в сърцето на две от най-мощните лаборатории за изкуствен интелект в света – OpenAI и Anthropic. Той е изиграл ключова роля в разработването на GPT-4o.
Коксън е работил по сложния и изискващ огромни количества данни процес на „предварително обучение“ (pretraining), който действително прави моделите с изкуствен интелект по-интелигентни.
В сряда той напусна както поста си в Anthropic, така и индустрията. Коксън заяви, че и двете лаборатории се надпреварват с пълна скорост към самоусъвършенстващ се свръхинтелект и „залагат живота ни“.
27-годишният Коксън обяви напускането си в поредица от публикации в X и заяви, че нито Anthropic, нито конкурентът ѝ OpenAI действат отговорно в надпреварата за разработване на усъвършенстван изкуствен интелект.
Ето как Коксън описва сериозността на ситуацията:
„Нито една от компаниите не действа отговорно. Те се надпреварват директно към самоусъвършенстващ се свръхинтелект и залагат живота ни“, написа Коксън.
Публикацията му стана популярна в X. Потребители от различни сфери се включиха в дискусията, за да изразят опасенията си относно посоката, в която се развиват моделите с изкуствен интелект, на които хората разчитат все повече в ежедневието си.
С тази нашумяла оставка Коксън стана поредният изследовател, фокусиран върху безопасността, който напуска водещ разработчик на изкуствен интелект поради етични и екзистенциални опасения.
Предупрежденията идват в момент, когато най-напредналите системи с изкуствен интелект вече показват признаци на загуба на контрол или неочаквано поведение.
През юли OpenAI съобщи, че модели, чиито способности в областта на киберсигурността са били тествани, са преодолели ограниченията на изолираната среда, получили са достъп до интернет и са компрометирали части от изследователската инфраструктура на OpenAI и платформата за изкуствен интелект Hugging Face.
Компанията заяви, че моделите са комуникирали чрез неразрешени канали и са използвали уязвимости в споделената инфраструктура.
Anthropic също съобщи за подобен проблем.
При проверка през юли компанията установи, че модели Claude са получили достъп до интернет при взаимодействие с вътрешни или външни среди за оценяване, след което са получили неразрешен достъп до реалните системи на три организации.
Anthropic посочи, че инцидентите са възникнали по време на оценки на способностите в областта на киберсигурността и са довели до промени в начина, по който компанията провежда подобни тестове.
В изявлението си Коксън предупреди, че скоростта и възможностите на предстоящите системи с изкуствен интелект не бива да бъдат подценявани. Според него тези системи скоро биха могли да придобият способността да проникват в софтуерни системи, да нарушават функционирането на цели индустрии и автономно да придобиват контрол върху ресурси в реалния свят.
Джейкъб Коксън заяви: „Хората, които разработват изкуствен интелект, вярват, че тази технология може да убие всички ни преди края на десетилетието. Това не е маркетингов трик. Напротив, въпреки че много ръководители и старши изследователи подбират разумно звучащи изрази, когато говорят пред медиите, аз съм бил свидетел как същите хора споделят страховете си в частни разговори.“
Обръщайки се към колегите си в комерсиалните лаборатории, Коксън призова служителите да „поискат различни условия“ и посочи, че забавянето на надпреварата може да изисква радикални мерки като споразумения между лабораториите за ограничаване на темповете на развитие или временни забрани върху развитието на определени способности.
Ръководителят на Alignment Science в Anthropic Евън Хъбингър също не оспори възгледите на Коксън и дори подкрепи основната му теза: „Ние наистина и искрено вярваме, че изкуственият интелект може да убие всички хора.“
Хъбингър смята, че вероятността човечеството да изчезне през следващото десетилетие е над 10%.
В публикация в X Хъбингър заяви: „Вярвам, че Anthropic се опитва да направи всичко по силите си. Но все още нямаме план за решаване на проблема с подравняването на свръхинтелекта и не сме постигнали ясен напредък по пътя към тази цел.“
Тревожни признаци са наблюдавани и при контролирани тестове.
През 2025 г. Anthropic установи, че моделът Claude Opus 4, поставен в симулирана корпоративна среда и получил достъп до електронната поща на фиктивен ръководител, се е опитал да го изнудва, след като е разбрал, че предстои да бъде заменен.
След това Anthropic подложи на тестове 16 водещи модела и установи, че модели на различни разработчици проявяват сходно поведение на „агентно несъответствие“ (agentic misalignment), включително изнудване и корпоративен шпионаж, когато преценяват, че подобни действия са необходими за постигането на поставените им цели.

















