Isang 27-taong-gulang na British na mananaliksik na nagtrabaho sa pretraining sa Anthropic ay pumayag na umalis nang pampubliko, na nagbabala na ang paghahabol na bumuo ng recursive self-improving AI ay maaaring magdulot ng pagkawala ng sangkatauhan bago tapos ang dekada.
Lumabas si Jacob Coxon mula sa isa sa mga pinakamakapangyarihan na kumpanya sa pagpapanatili ng kaligtasan sa AI noong September 8-9, at ang kanyang mensahe sa pag-alis ay hindi isang magalang na post sa LinkedIn tungkol sa “mga kahanga-hangang bagong kabanata.” Ito ay isang babala na ang mga tao na nagbuo ng mga sistemang ito ay totoong naniniwala na sila ay maaaring magdulot ng kalamidad, at ang timeline para sa pagkakalat ng mga bagay ay maaaring maging agad na susunod na taon.
Ang insider alarm
Ano ang nagagawa ng pagtatawag ni Coxon na lalong mahirap ipagkaila ay ang nangyari pagkatapos. Nagsimula ang kanyang mga sariling kaklase sa Anthropic na pagsang-ayon sa kanya nang publiko.
Si Evan Hubinger, na may katungkulan bilang Alignment Science Lead sa Anthropic, ay sumuporta sa mga pahayag ni Coxon sa social media. Ang kanyang personal na pagtataya: higit sa 10% na posibilidad na magdulot ng malalaking pagkamatay ng tao ang AI sa loob ng susunod na dekada.
Lumawak pa si Hubinger, at tinanggap na kulang ang Anthropic sa malinaw na plano para siguraduhin ang pagkakasundo sa mga superinteligenteng sistema.
Si Samuel Marks, isa pang researcher ng Anthropic, ay nag-echo ng mga katulad na pag-aalala, na nagmumungkahi na ang mga senior na empleyado sa loob ng kumpanya ay lalo na nag-aalala tungkol sa mga panganib na maaaring magdulot ng pagkawala ng species.
Tinutulan ni Coxon ang paggamit ng mga termino tulad ng “crunchtime” at “endgame” sa loob ng mga kumunidad ng AI. Ang mga salitang ito ay nagpapakita ng paghahanap ng superintelligence bilang isang makabuluhang at inaasahang bagay, isang paligsahan na dapat panalunan kaysa isang panganib na dapat pamahalaan. Ayon sa kanya, ang ganitong pagpapaliwanag ay bahagi ng problema.
Isang pattern ng paglabas
Hindi si Coxon ang unang researcher na nakatuon sa kaligtasan na umalis sa Anthropic dahil sa mga alalahanin tungkol sa direksyon ng kumpanya. Si Mrinank Sharma, na nangunguna sa Safeguards Research team ng kumpanya, ay nagresign noong Pebrero 2026. Tinukoy ni Sharma ang pagtaas ng mga panganib na dulot ng AI at bioweapons, at binanggit ang mga panlabas na presyon na sinasabing nagpapababa sa etikal na pag-uugali ng kumpanya.
Ang irony ay malalim. Itinatag ni Anthropic ang mga dating miyembro ng OpenAI, kabilang ang CEO na si Dario Amodei, eksaktong dahil sa kanilang paniniwala na hindi sapat na pinapahalagahan ng OpenAI ang kaligtasan. Dapat itong maging ang alternatibong mayuna sa kaligtasan. Ngayon, umiiwan ang kanilang sariling mga siyentipiko sa kaligtasan dahil hindi nila iniisip na sapat na pinapahalagahan ni Anthropic ang kaligtasan.
Kompetisyon bilang pagpapabilis
Ang babala ni Coxon ay lalo na tinukoy ang internasyonal na kompetisyon bilang isang salik na nagpapahirap sa sitwasyon. Ang presyur na makasabay sa mga kalaban, lalo na mula sa mga Chinese AI lab, ay lumilikha ng isang kapaligiran kung saan ang pagpapahinto upang makuha ang tamang kaligtasan ay parang isang unilateral na pagpapabaya sa armas.
