Studi: Laboratorët kryesorë të AI-së nuk tregojnë se si do ta izolonin një model renegat

Pak nga laboratorët kryesorë kanë publikuar plane për përmbajtjen e modeleve që përpiqen t'i shpëtojnë kontrollit njerëzor, përfundon studimi i ri i Guidelight AI Standards.
Pak nga laboratorët kryesorë të inteligjencës artificiale kanë publikuar ose demonstruar plane përgjigjeje për përmbajtjen e modeleve renegate, përfundon një studim i raportuar të shtunën nga TechCrunch. Autorja Rebecca Bellan shkruan se vlerësimin e bëri Guidelight AI Standards, organizatë e dedikuar praktikave të sigurta të zhvillimit të AI-së kufitare.
Plani i përmbajtjes përcakton çfarë ndodh sapo një AI kapet duke u përpjekur të nënvizojë kontrollin njerëzor: çfarë aksesesh priten, kur ndalet sistemi dhe kur fiket fare. Guidelight vlerësoi planet publike të pesë laboratorëve të mëdhenj, Anthropic, Google, OpenAI, Meta dhe xAI, sipas raportimit; OpenAI doli më i miri, ndërsa Anthropic dhe Meta patën notat më të ulëta.
Vlerësimi mati, ndër të tjera, si logohen e monitorohen brenda sistemet e secilës kompani, nëse sistemi ndalet automatikisht pas një vale sjelljesh të sinjalizuara dhe sa i pavarur është auditimi i tretë, përcjell burimi. Rezultati ka peshë sepse agjentët e AI po marrin role gjithnjë e më autonome brenda sistemve të biznesit, ndërsa rregullatorët në Kaliforni e New York po fillojnë të kërkojnë zbulim publik të planeve.
Për çdokënd që ndërton mbi këto modele ose investon në to, studimi është një nga leximet e rralla të pavarura se sa seriozisht e trajton secili laborator rrezikun operacional përballë asaj si flet publikisht, përfundon raportimi.
Debati për sigurinë e modeleve ka hyrë në axhendën legjislative amerikane dhe evropiane, dhe dokumentet e përmbajtjes priten të bëhen kriter formal licencimi në disa juridiksione, çka e bën mungesën e tyre një problem rregullator, jo thjesht reputacional.
Pyet 383 për këtë lajm
Përgjigjet vijnë vetëm nga artikujt e botuar te 383, me burimet e lidhura.
Përgjigjet vijnë vetëm nga artikujt e botuar te 383 — nëse arkivi nuk e ka, do ta them.
