Në epokën e aftësive kritike kibernetike | OpenAI
- Revista Prestige
- 5 days ago
- 7 min read

Rubrika: Tekno Shkence AI -te reja
Në epokën e aftësive kritike kibernetike - - OpenAI
ngadalësimi i ritmit të zhvillimit të modeleve në epokën e aftësive kritike kibernetike
Gjatë javëve të fundit, dy zhvillime kanë nxjerrë në pah rreziqet në rritje që lidhen me sistemet e inteligjencës artificiale gjithnjë e më të afta: incidenti OpenAI–Hugging Face dhe, veçmas, provat paraprake se një prej modeleve tona të ardhshme, Astra, mund të përmbushë pragun e aftësisë kritike në fushën e sigurisë kibernetike, sipas Preparedness Framework të OpenAI.
Së bashku me këto zhvillime dhe me përparimin e shpejtë të kërkimeve tona të brendshme, kjo ka shtuar urgjencën për forcimin e mekanizmave tanë të monitorimit, përafrimit dhe kontrollit gjatë të gjitha fazave të procesit të trajnimit.
Ndërsa modelet bëhen më të afta, rriten edhe rreziqet që lidhen me zhvillimin dhe testimin e tyre brenda kompanisë. Standardet tona për monitorimin, përafrimin dhe sigurinë duhet të mbeten përpara këtyre rreziqeve.
Për të marrë kohën e nevojshme për të përmbushur këto standarde, ne ngadalësuam përkohësisht ritmin e zgjerimit të zhvillimit. Kjo përfshiu një pauzë dyjavore në trajnimin me përforcim (RL) të modeleve tona më të fundit, të destinuara për përdorim, ndërsa forconim më tej mjediset tona të kërkimit përmes masave të sigurisë dhe testimeve red-team, si dhe zgjeronim mbulimin e sistemeve tona të monitorimit.
Trajnimi më i madh RL në kufirin e aftësive, i planifikuar nga OpenAI, mbetet ende i pezulluar, ndërsa kompania po kryen trajnime dhe vlerësime në shkallë më të vogël për të vlerësuar sjelljen e modeleve, për të verifikuar masat mbrojtëse dhe për të krijuar më shumë prova të përafrimit përpara se të vazhdojë.
Përafrimi (alignment) — puna për t'i bërë sistemet e IA-së të sillen sipas qëllimit të parashikuar dhe të jenë të përgjegjshme ndaj mbikëqyrjes njerëzore — ka qenë prej kohësh në qendër të programit tonë kërkimor.
Tani kërkojmë prova më të forta të sjelljes së përafruar gjatë të gjitha fazave të trajnimit, duke u mbështetur në kërkimet dhe vlerësimet që tashmë janë në zhvillim.
Mbajtja e sistemeve gjithnjë e më të afta në përputhje me qëllimet njerëzore është një sfidë me të cilën do të duhet të përballet i gjithë sektori. Shenjat që po shohim nga përparimi i modeleve të ardhshme e bëjnë të qartë se nevojitet një qasje më e gjerë — një qasje që ndërtohet mbi Preparedness Framework aktual, por shkon përtej tij.
Mendojmë se është e rëndësishme të jemi transparentë për mënyrën se si po ndryshon qasja jonë. Më poshtë përshkruajmë ndryshimet që kemi bërë tashmë në proceset dhe infrastrukturën tonë kërkimore, si dhe punën që vijon.
forcimi i masave mbrojtëse për modelet më të afta
Qasja jonë për zhvillimin e modeleve më të afta mbështetet në tri masa mbrojtëse që përforcojnë njëra-tjetrën:
Monitorimi, i cili zbulon sjelljet shqetësuese dhe na mundëson të reagojmë ndaj tyre.
Përafrimi, i cili zvogëlon mundësinë e veprimeve të dëmshme ose të paautorizuara.
Masat e sigurisë, të cilat kufizojnë atë që sistemet e IA-së mund të kenë akses ose të ndikojnë.
Ne presim që së shpejti modelet të kryejnë pjesën më të madhe të punës së sigurisë, përfshirë mbrojtjen kundër modeleve të tjera. Kjo do të mundësojë që të tri masat mbrojtëse të shkallëzohen së bashku me aftësitë e modeleve, gjë që e konsiderojmë thelbësore.
Ne i zbatojmë këto masa si në kërkim, ashtu edhe në vendosjen e modeleve në përdorim, duke i përshtatur ato me aftësitë e secilit model, mjedisin ku operon dhe nivelin e rrezikut.
sigurimi i mjediseve tona kërkimore
Ndërsa modelet në kufirin e zhvillimit fitojnë aftësi më të fuqishme në sigurinë kibernetike, ne po rrisim standardet e sigurisë për mjediset ku i trajnojmë dhe i vlerësojmë ato.
Përmbushja e këtyre standardeve ka kërkuar një punë të konsiderueshme inxhinierike dhe ka sjellë kosto të mëdha dhe vonesa në kërkimet mbi modelet e avancuara.
Menjëherë pas incidentit OpenAI–Hugging Face, ne pezulluam ekzekutimin e modeleve të avancuara në klasterët kërkimorë për proceset që mund të ekzekutonin kod ose të përdornin mjete me akses në internet.
Më pas rikthyem relativisht shpejt një rrugë më të kufizuar dhe më të sigurt për ekzekutimin e kodit, ndërsa shqyrtuam individualisht çdo ngarkesë pune për të përcaktuar nëse mund të rifillonte në mënyrë të sigurt.
Disa procese kërkimore rifilluan nën këto kontrolle të reja, ndërsa të tjerat kërkonin ndryshime shtesë.
Gjatë javëve në vijim, kemi përcaktuar dhe kemi filluar të zbatojmë kërkesa më të forta sigurie për proceset kërkimore që lidhen me modelet më të avancuara.
Për shembull:
Izolimi i ngarkesave të punës: Tani kërkojmë izolim më të fortë (“sandbox”) për proceset që ekzekutojnë kod të gjeneruar nga modelet ose kod tjetër të pabesueshëm. Kjo vlen gjithashtu për softuerët që mund të komprometohen gjatë përpunimit të rezultateve të modeleve.
Izolimi i rrjetit: Kemi zbatuar më shumë kontrolle për të izoluar nga interneti proceset me rrezik më të lartë dhe ato të pabesueshme. Këto kontrolle janë projektuar në mënyrë që një komprometim i vetëm i një procesi ose shërbimi mbështetës të mos lejojë, në vetvete, akses të paautorizuar në internet ose në rrjete të tjera të brendshme.
Testim i vazhdueshëm i sigurisë: Kemi rikonfiguruar mjedisin tonë për të eliminuar shërbimet e përbashkëta që mund të jenë të cenueshme, për të reduktuar privilegjet e përhershme dhe për të përmirësuar kufijtë e sigurisë dhe besimit. Po përmirësojmë gjithashtu aftësinë për të mbledhur dhe monitoruar regjistrat e sigurisë. Në fund, po investojmë në automatizim duke përdorur modelet tona për t'i testuar vazhdimisht këta kufij kundër sulmeve të simuluara.
Së bashku, këto kontrolle krijojnë një mbrojtje në thellësi dhe ndihmojnë në mbrojtjen e mjedisit tonë kërkimor nga sulmet.
Sot, kërkojmë nivelin më të rreptë të masave të sigurisë për proceset që përfshijnë Astra ose modelet kibernetike, pasi kemi përcaktuar se modelet Astra mund të kenë një nivel kritik të aftësive kibernetike.
Këto masa zbatohen gjithashtu për të gjitha proceset e tjera që lidhen me sigurinë kibernetike.
Ndërsa disa trajnime dhe vlerësime të Astra-s përmbushin këto kërkesa, një numër i konsiderueshëm procesesh mbeten të pezulluara derisa të migrohen plotësisht dhe të përmirësohen për të përmbushur standardin e ri të sigurisë.
Ne po u japim përparësi proceseve që lidhen me sigurinë dhe përafrimin për t'i kaluar së pari në këto mjedise të reja.
zgjerimi i monitorimit të chain-of-thought
Monitorimi ka qenë prej kohësh pjesë e rëndësishme e procesit tonë të zhvillimit të modeleve, përfshirë monitorimin e agjentëve të brendshëm të kodimit dhe të sesioneve që zgjasin për periudha të gjata.
Përpjekjet tona për monitorim ishin veçanërisht të përqendruara te përdorimet e brendshme të modeleve më të avancuara dhe te proceset e trajnimit frontier RL. Këto konsideroheshin proceset me rrezikun më të lartë, sepse mund të bashkonin aftësi të avancuara të modeleve me akses në mjete, sisteme të ndjeshme dhe rrjete të brendshme ose të jashtme.
Ato nuk aplikoheshin në të gjitha proceset e inferencës dhe trajnimit që përdornin mjete. Tani e kemi rishikuar dhe zgjeruar këtë qasje me sistemin tonë të ri të monitorimit.
Ky sistem i ri monitorimi funksionon në disa faza. Ai fillon me klasifikues aktivizimi — detektorë që shqyrtojnë aktivitetin e brendshëm të një modeli — të cilët funksionojnë për çdo token të përzgjedhur dhe i kalojnë shqetësimet e mundshme te hetues automatikë gjithnjë e më të sofistikuar dhe me kërkesa të larta llogaritëse.
Këto sisteme shqyrtojnë veprimet e mjeteve, arsyetimin e disponueshëm dhe të gjithë sekuencën e aktivitetit për të zbuluar:
akses të paautorizuar;
vjedhje të të dhënave;
sjellje shkatërruese;
përpjekje për të mposhtur masat mbrojtëse.
Synimi ynë është të lëshojmë një alarm brenda 30 minutave pasi aktiviteti shqetësues të identifikohet nga sistemi i monitorimit.
Nëse sistemi identifikon një shkelje të mundshme të një kufiri kritik të sigurisë, ai gjeneron një alarm me prioritetin më të lartë.
Në zbatimin tonë aktual, ekipet e sigurisë, mbrojtjes dhe kërkimit njoftohen menjëherë. Nëse këto ekipe nuk mund të përcaktojnë me siguri brenda 30 minutave se sinjalizimi është një rezultat i gabuar, pritet që ato ta pezullojnë aktivitetin.
Ky monitorim kërkohet për të gjitha trajnimet RL dhe vlerësimet që përfshijnë mjete për modelet e nivelit Sol ose më të lartë.
Pasi përcaktuam më 7 gusht se Astra mund të kishte aftësi kritike kibernetike, shtuam një kërkesë tjetër monitorimi për të gjitha proceset e inferencës së Astra-s me mjete — jo vetëm për trajnimet dhe vlerësimet RL.
Këto masa mbrojtëse kërkojnë fuqi të konsiderueshme llogaritëse. Vlerësimet tona aktuale tregojnë se kostoja shtesë e monitorimit është rreth 20% e kapacitetit llogaritës të inferencës që monitorohet, megjithëse kostoja ndryshon ndjeshëm në varësi të proceseve të trajnimit dhe vlerësimit.
Ne do të ndajmë më shumë detaje për këtë sistem në një publikim të ardhshëm.
Avancimi i kërkimit mbi përafrimin
Kërkimi mbi përafrimin është në qendër të misionit tonë.
Misioni ynë është të sigurojmë që inteligjenca artificiale e përgjithshme (AGI) të jetë në dobi të gjithë njerëzimit.
Ndërsa modelet fitojnë aftësi të avancuara, si aftësia për të kryer sulme kibernetike dhe për të vepruar në mjedise më komplekse, sjellje të papërshtatura si manipulimi i shpërblimit — gjetja e mënyrave për të marrë shpërblime të larta gjatë trajnimit pa arritur në të vërtetë rezultatin e synuar — mashtrimi ose aksesi i paautorizuar do të krijojnë rreziqe gjithnjë e më serioze.
Për trajnimet RL të modeleve më të afta, tani po aplikojmë teknikat tona kryesore të përafrimit në më shumë faza të procesit të trajnimit.
Kjo përfshin:
përmirësimin e modeleve të shpërblimit për të zbuluar dhe dekurajuar më mirë sjelljet e pasigurta në detyra dhe mjedise të ndryshme;
trajnimin e modeleve për të qenë më të sinqerta në lidhje me veprimet, aftësitë dhe kufizimet e tyre;
reduktimin e sjelljeve që shfrytëzojnë dobësitë në shpërblime, vlerësues, mjete ose mekanizma mbikëqyrjeje;
rritjen e mbulimit të trajnimit për sjelljet që mund të shkaktojnë dëme kur modelet ndërveprojnë me sisteme ose burime të jashtme.
Ne vazhdojmë të investojmë fuqishëm në kërkimin mbi përafrimin, të zgjerojmë mbulimin e vlerësimeve dhe të përdorim atë që mësojmë për të orientuar trajnimin dhe masat mbrojtëse.
Planifikojmë të publikojmë së shpejti shumë më tepër informacion rreth kërkimeve tona mbi përafrimin, përfshirë atë që po mësojmë për sjelljen e modeleve dhe çdo sfidë të re që zbulojmë.
Çfarë vjen më pas
Ne do të zhvillojmë më tej Preparedness Framework për t'i bashkuar këto masa mbrojtëse përgjatë trajnimit dhe vendosjes së modeleve në përdorim, si dhe për ta përshtatur më mirë atë me aftësitë e modeleve të ardhshme dhe mjediset ku ato do të operojnë.
Zhvillimi i metodave që mund të shkallëzohen në përputhje me këto aftësi do të kërkojë investime të vazhdueshme në sigurinë e asistuar nga modelet, monitorim më efektiv dhe përparime të mëtejshme në kërkimin mbi përafrimin.
Synojmë të përfshijmë organizata të jashtme dhe të ndajmë më shumë nga ato që mësojmë ndërsa qasja jonë zhvillohet.
Aftësitë e modeleve frontier po përshpejtohen me shpejtësi. Aftësia jonë për t'i kuptuar, përafruar dhe siguruar ato duhet të mbetet përpara këtij përparimi.
Në javët e ardhshme do të publikojmë një raport teknik mbi mësimet që kemi nxjerrë.
Autor: OpenAI
18 gusht 2026
Burimi zyrtar:


