Dalam prospektusnya, perusahaan menyatakan, "Potensi model untuk menyadari upaya evaluasi kami menciptakan keterbatasan signifikan terhadap kemampuan kami dalam menilai keselamatan model."

Perusahaan menyatakan bahwa AI terkadang mengembangkan kemampuan yang tidak terduga selama proses pelatihan, yang mungkin baru diketahui setelah model digunakan dan memicu insiden keselamatan serius.

Sejumlah peneliti AI telah memperingatkan bahwa model yang semakin canggih dapat mengetahui ketika dia sedang diawasi dan menyesuaikan perilakunya, sehingga menyulitkan proses pemantauan dan evaluasi terhadap perilaku model.

Anthropic menyampaikan bahwa imbal hasil dari investasi untuk meningkatkan keamanan AI belum dapat dipastikan.

Perusahaan tidak mengungkapkan jumlah dana yang dialokasikan untuk penelitian mengenai keamanan AI dalam prospektus.

Namun, perusahaan sebelumnya menyampaikan bahwa sekitar 6 persen dari daya komputasi yang digunakan untuk penelitian AI dialokasikan bagi upaya keamanan selama satu minggu sampel pada bulan Juli.

Anthropic menyampaikan bahwa upaya memastikan keamanan AI membutuhkan sumber daya besar.