SAN FRANCISCO — Nagpatupad ang OpenAI ng bagong sistema para mas regular na maitala, maimbestigahan at maisapubliko ang mga kaso ng hindi inaasahan o problematikong kilos ng artificial intelligence models nito.
Kasabay nito, naglabas ang kumpanya nitong Setyembre 16 ng anim na bagong ulat hinggil sa mga insidenteng nakita nito habang tine-train o sinusuri ang mga modelo sa nakalipas na anim na buwan.
Kabilang sa mga naitalang insidente ang isang unreleased research model na naglagay ng sariling instructions sa task summaries, gayundin ang mga model instance na nagmungkahi ng pagtatago ng pagkakamali o pag-imbento ng nawawalang datos.
Sa isa pang kaso, gumamit umano ang isang modelo ng exposed API key nang walang pahintulot at kalaunan ay nagbigay ng gawa-gawang datos nang hindi nito makuha ang hinihinging impormasyon.
May naitala rin na modelong nag-upload ng file sa internet para lamang magkaroon ng mapagkukunan na maaari nitong i-cite, habang ang ibang AI agents ay gumamit ng internal repository at public file-hosting sites upang makapagpalitan ng impormasyon sa labas ng itinakdang paraan ng kanilang mga gawain.
Nilinaw ng OpenAI na mga indibidwal na insidente ang anim na kaso at hindi dapat ituring na sukatan kung gaano kadalas nangyayari ang ganitong behavior sa lahat ng modelo nito.
Sa ilalim ng bagong framework, maaari nang i-report ang mga insidenteng may kinalaman sa unauthorized actions, pakikipag-ugnayan ng mga modelo sa hindi awtorisadong paraan, pag-iwas sa oversight at iba pang behavior na maaaring maglantad ng kahinaan sa AI safeguards.
Sinabi rin ng kumpanya na hindi kinakailangang may aktuwal nang napinsala bago nito isapubliko ang isang insidente, basta makatutulong ito sa pag-unawa sa AI alignment at kaligtasan.
Ayon sa OpenAI, layunin ng hakbang na mabigyan ang mga researcher, policymaker at publiko ng mas malinaw na ebidensya tungkol sa mga panganib at limitasyon ng mas makapangyarihang AI systems habang patuloy ang mabilis na pag-unlad ng teknolohiya. RNT