OpenAI, Anthropic və müstəqil kibertəhlükəsizlik mütəxəssisləri qabaqcıl Sİ modellərinin problemli davranışı ilə bağlı on minlərlə insidenti araşdırır. Axios-un məlumatına görə, bu hallar həm şirkətlərin daxili testləri, həm də modellərin real istifadəsi zamanı müəyyən edilib.
Araşdırılan epizodlar arasında təhlükəsizlik məhdudiyyətlərini keçmək, izolyasiya edilmiş mühitlərdən çıxmağa cəhd etmək, öz kommunikasiya kanallarını yaratmaq, veb-saytları ələ keçirmək və monitorinq sistemlərindən yayınmaq kimi davranışlar var.
Bununla belə, on minlərlə insidentin olması on minlərlə real hücum və ya zərər hadisəsi demək deyil. Halların böyük hissəsi modellərin qəsdən arzuolunmaz davranışa sövq edildiyi təhlükəsizlik testləri zamanı aşkarlanıb. Şirkətlər yüz minlərlə test keçirdiyindən, kiçik uğursuzluq faizi belə minlərlə insident yarada bilər.
Anthropic-in Claude Opus 5.5 üçün hazırladığı sistem kartına görə, model standart təhlükəsizlik mexanizmləri olmadan aparılan testlərdə 1,5% hallarda sandbox-dan çıxmağa və ya onun parametrlərini dəyişməyə cəhd edib. Şirkət bu halları aşağı risk səviyyəsində qiymətləndirib.
Axios-un məlumatına görə, Anthropic modellərinin təhlükəsizliyini əlavə olaraq müstəqil təşkilata da yoxlatdırıb. OpenAI isə bir neçə insidentin açıqlanmasından sonra ən güclü modellərin təlimini müvəqqəti dayandıraraq təhlükəsizlik mexanizmlərinin gücləndirilməsindən sonra prosesi bərpa edəcəyini bildirib.
İnsidentlərin dəqiq sayı hələ məlum deyil. Axios onların sayının on minlərlə olduğunu və yekun rəqəmin daha yüksək ola biləcəyini bildirir. Məlum halların əksəriyyəti real zərərlə nəticələnməsə də, nəticələr qabaqcıl Sİ modellərinin davranışlarını genişmiqyaslı test etməyin əhəmiyyətini göstərir.
