Runous keinona kiertää tekoälysuodattimia

  • Niin kutsuttu ”konfliktirunous” mahdollistaa generatiivisten tekoälymallien tietoturvasuodattimien ohittamisen.
  • Tutkijat ovat testanneet tätä lähestymistapaa 25 johtavien teknologiayritysten mallilla, ja onnistumisprosentti on ollut erittäin korkea.
  • Metaforiset jakeet helpottavat vaarallisen sisällön, kuten haittaohjelmien, kyberhyökkäysten tai aseoppaiden, tuottamista.
  • Tutkimus varoittaa systeemisestä haavoittuvuudesta ja vaatii vankempia tietoturvan arviointimenetelmiä.

Kuva runoudesta tekoälyn pettämiseksi

Turvallisuus generatiivinen tekoäly Se on jälleen valokeilassa uuden akateemisen teoksen jälkeen, joka tuo pöydälle yhtä silmiinpistävän kuin häiritsevänkin tempun: tiettyjen viestien uudelleenmuotoilu runon muotoon riittää, jotta kehittyneimmät kielimallit alkavat reagoida sinne, missä niiden pitäisi kieltäytyä.

Tämä lähestymistapa, jota kutsutaan "vihollinen runous" Tutkimusryhmä osoittaa, että pelkkä kirjoitustyylin muuttaminen – muuttamatta taustalla olevaa haitallista tarkoitusta – voi riittää kiertämään suodattimet, joita yritykset, kuten OpenAI, Google, Meta, Microsoft tai kiinalainen DeepSeek, väittävät sisällyttäneensä chatbottien vaarallisen käytön hillitsemiseksi.

Mitä on "vihamielinen runous" ja miksi se on huolestuttavaa?

Tutkimus, otsikoitu hyvin graafisesti "Kilpaileva runous universaalina mekanismina välttää yksittäisiä muutoksia laaja-alaisissa kielimalleissa"Icaro Labs on toteuttanut sen yhdessä Rooman Sapienza-yliopiston ja Sant'Annan syventävien opintojen koulun kanssa, ja se on julkaistu ennakkojulkaisuna arXiv-arkistossa muiden asiantuntijoiden arvioitavaksi.

Kirjoittajat keskittyivät ajatukseen, joka oli yhtä yksinkertainen kuin tehokaskin: käyttää lyhyitä runoja, metaforisia säkeitä tai lyyrisiä rakenteita muotoilla pyyntöjä, jotka tekoälymallit suoraan proosasta ilmaistuna hylkäisivät välittömästi sisäisten käyttösääntöjensä vastaisina.

Tutkijoiden mukaan tämä ”vihollinen runous” toimii eräänlaisena jailbreak-mekanismi yksi vuoro eli tapa pakottaa malleihin ei-toivottuja käyttäytymismalleja yhdellä viestillä ilman pitkiä keskusteluja tai erityisen hienostuneita temppuja.

Hänen omien sanojensa mukaan testit "osoittavat, että tyylillinen vaihtelu yksinään "Se voi kiertää nykyaikaisia ​​turvamekanismeja", mikä viittaa suurten teknologiayritysten käyttämien nykyisten yhdenmukaistamis- ja riskinarviointimenetelmien merkittäviin rajoituksiin.

Tiimi päätti olla paljastamatta kokeessa käytettyjen runojen tarkkoja tekstejä. Valinta johtui siitä, että turvallisuusvaikutuksiaYksi tutkijoista, Piercosma Bisconti, kertoi kansainväliselle medialle, että tekniikan toistaminen ei olisi erityisen monimutkaista, jos esimerkkejä olisi yksityiskohtaisesti.

Tutkimustulokset: hälyttävän korkea petosten määrä

Tämän ajatuksen testaamiseksi tutkijat tarkastelivat 25 erilaista generatiivista tekoälymallia, mukaan lukien nykyään suosituimmat järjestelmät, kuten ChatGPT, Gemini tai Claude, sekä Metan ja kiinalaisten tarjoajien, kuten DeepSeekin, mallit.

Käytännössä pyynnöt tehtiin selkein tavoittein: saada ohjeet kyberhyökkäysten käynnistämiseenarkaluonteisten tietojen poimiminen, salasanojen murtaminen, haittaohjelmien suunnittelu tai jopa kemiallisten ja ydinaseiden luomiseen liittyvien tietojen kerääminen.

Kun samat pyynnöt esitettiin säkeitä tai runollisia sävellyksiäEpävarmojen vastausten määrä nousi pilviin. Tutkimuksessa havaittiin, että keskimäärin kehotteen kirjoittaminen lyyriseen tyyliin mahdollisti järjestelmän huijaamisen uskomaan, että... 62 % ajasta, prosenttiosuus selvästi enemmän kuin neutraaleilla ja suorilla koostumuksilla saavutetaan.

Tietyissä erityistilanteissa luvut ovat vielä korkeampia: tutkijoiden mukaan lähes 90 % runollisista yllytyksistä Kokeilua varten suunnitellut laitteet onnistuivat laukaisemaan käyttäytymismalleja, jotka suodattimien olisi pitänyt estää.

Erityisesti sellaisten tietojen osalta, jotka liittyvät ydinaseetOnnistumisprosentit olivat 40–55 %, mikä tarkoittaa, että lähes puolet säkeessä muotoilluista yrityksistä päätyi tuottamaan sisältöä, joka rajoittuu käyttösääntöjen asettamiin punaisiin rajoihin tai ylittää ne suoraan.

Kuinka runous livahtaa tekoälyn suodattimien läpi

Yksi keskeisistä tekijöistä, joita tutkimuksen tekijät käyttävät selittääkseen tämän tempun toimivuutta, on itse kielimallien toimintatapaNämä tekoälyt eivät "päättele" kuten ihmiset, vaan ennustavat seuraavaksi todennäköisimmän sanan edellisen sanasarjan ja koulutuksensa aikana oppimansa perusteella.

Enemmän tai vähemmän tavanomaisessa proosatekstissä rakenne on suhteellisen helppo mallintaa: siinä on selkeät syntaksikuviot, usein esiintyvät ilmaisut ja toistuvat kontekstit. Kuitenkin, kun esitellään runollinen rakenne, metaforat ja epätavalliset sanakäänteetMalli liikkuu huomattavasti liukkaammalla alustalla.

Tutkijat huomauttavat, että koska runous on muoto, jossa merkitys voi hämärtyä ja kieli muuttuu epäselvämpi ja vähemmän ennustettavaVaarallisen sisällön havaitsemismekanismit menettävät tarkkuuttaan. Tämän seurauksena suojaussuodatin ei tunnista yhtä selvästi, että runon takana on piilotettu haitallinen pyyntö.

Tutkimuksessa korostetaan, että kun haitalliset viestit ilmaistaan ​​runomuodossa proosan sijaan, hyökkäysten onnistumisprosentit Ne lisääntyvät merkittävästi. Tämä korostaa merkittävää puutetta nykyisissä arviointikäytännöissä ja käyttöohjeiden noudattamisen validointiprotokollissa.

Toinen huomionarvoinen seikka on, että nämä haavoittuvuudet ilmenevät joka koostuu eri tuoteperheiden ja valmistajien malleistaVaikka jokainen yritys on noudattanut omia strategioitaan järjestelmiensä kouluttamiseksi ja yhdenmukaistamiseksi, kirjoittajat puhuvat "systemaattisesta haavoittuvuudesta" yksittäisten epäonnistumisten sijaan.

Vaikutus turvallisuuteen: kyberhyökkäyksistä aseisiin

Kielitieteellisen tempun lisäksi hälytyskelloja herättää se, millainen tietoa, jota tekoäly voi tuottaa jos heidät voidaan huijata näillä menetelmillä. Tutkimuksessa kuvataan tapauksia, joissa chatbotit tarjosivat huolellisesti laadittujen runojen avulla ohjeita kyberhyökkäysten järjestämiseen tai järjestelmiin tunkeutumiseen.

Havaittujen ongelmallisten käyttötapojen joukossa on viitteitä siitä, että haavoittuvuuksien hyödyntäminen, tietojen kerääminen tai salasanan murtaminenNämä tehtävät ovat osa tyypillistä kyberrikollisuuden ja edistyneiden uhkien arsenaalia, joka huolestuttaa hallituksia, yrityksiä ja organisaatioita ympäri maailmaa.

Vastauksia on myös tallennettu, jotka auttavat luomaan tai parantamaan haittaohjelmatTämä on erityisen huolestuttavaa, kun otetaan huomioon, että monet käyttäjät, joilla on rajoitettu tekninen tietämys, voisivat luottaa näihin työkaluihin hyökkäysten kehittämiseen helpommin.

Herkin alue, johon sääntely yleensä kiinnittää huomiota Euroopassa ja kansainvälisesti, on kemiallisten ja ydinaseiden leviäminenVaikka tekoälyjärjestelmää ei tarjottaisikaan "täydellisillä käyttöohjeilla", sen kyky tarjota hyödyllistä tietoa tällä alueella herättää jo nyt monia epäilyksiä turvallisuusasiantuntijoiden keskuudessa.

Kirjoittajat korostavat, ettei heidän tavoitteenaan ole dramatisoida, vaan osoittaa, että Nykyiset suodattimet eivät riitä kun kohdataan suhteellisen yksinkertaisia ​​manipulointitekniikoita, kuten vaarallisten käskyjen runollinen uudelleenmuotoilu, mitä sekä kyberrikolliset että valtiolliset toimijat voisivat hyödyntää.

Nykyisten järjestelmien rajoitukset ja alan reagointi

Johtavat generatiivisia tekoälymalleja kehittävät yritykset ovat jo pitkään vaatineet integrointia monikerroksiset turvamekanismitEsimerkiksi OpenAI korostaa usein moderointialgoritmien ja ihmistiimien yhdistettyä käyttöä, jotka on omistautunut tarkistamaan ja suodattamaan vihaa lietsovaa, eksplisiittistä tai sen käytäntöjä rikkovaa sisältöä.

Tämän työn tulokset kuitenkin viittaavat siihen, että näistä suojatoimista huolimatta chatbotit ovat edelleen alttiita luovat muotoilumuodot pyynnöistä. Tutkijoiden mukaan vastakkainasettelua korostava runous selvästi heikentää hylkäämiskäyttäytymistä, jota minkä tahansa käyttönormejaan hyvin noudattavan mallin tulisi osoittaa.

Testeissä OpenAI:n ja Anthropicin kaltaisten yritysten työkalut osoittivat vertailussa, pienempi todennäköisyys voittaa omat esteensäOngelma ei kuitenkaan koskenut heitä. Sama yleinen suuntaus havaittiin kuin muillakin alustoilla, vain jonkin verran alhaisemmilla onnistumisprosenteilla.

Kun kansainvälinen media kysyi näistä löydöksistä yrityksiltä, ​​kuten OpenAI, Google, DeepSeek tai Meta He eivät antaneet välitöntä vastausta. On odotettavissa, että keskustelun saadessa julkista huomiota yritysten on yksityiskohtaisesti kuvattava vastatoimia, joita ne aikovat toteuttaa.

Sääntelyn näkökulmasta tämäntyyppinen tutkimus on linjassa jo esitettyjen huolenaiheiden kanssa. Euroopan unionin tekoälyasetusTämä korostaa riskienhallintaa, läpinäkyvyyttä ja edistyneiden järjestelmätoimittajien vastuullisuutta. Uusien hyökkäysvektorien, kuten vastakkainasettelun, löytäminen vahvistaa argumenttia jatkuvien ja tiukempien arviointiprosessien tarpeesta.

Muita uhkakuvia horisontissa: datan myrkytys ja manipulointi

Konfrontaatiorunous ei ole suinkaan ainoa suuntaus, joka huolestuttaa kyberturvallisuusyhteisöä generatiivisen tekoälyn suhteen. Merkittävä osa viimeaikaisesta tutkimuksesta keskittyy siihen mallikoulutukseen liittyvät riskitjossa valtavat tietokannat, joita käytetään näiden työkalujen opettamiseen puhumaan, kirjoittamaan ja päättelemään, tulevat mukaan kuvaan.

Riippumattomat tutkimukset ovat osoittaneet, että se on mahdollista manipuloida laaja-alaisia ​​kielimalleja saastuttamalla hyvin pienen osan koulutusdatasta: noin 250 vioittunutta dokumenttia riittäisi aiheuttamaan vinoumia, takaportteja tai odottamattomia käyttäytymismalleja jopa huippuluokan järjestelmissä.

Silmiinpistävää on, että tämä kynnysarvo ei näytä kasvavan merkittävästi mallin koon kasvaessa, mikä rikkoo intuitiivisen käsityksen, jonka mukaan "Suurempi tarkoittaa automaattisesti vankempaa"Käytännössä sekä kevyet ratkaisut että massiiviset mallit voivat olla alttiita tällaiselle datamyrkytykselle.

Jos tällainen hyökkäys jää huomaamatta, se voi johtaa kyberhyökkäykset, joita on vaikea seuratakoska malli itsessään käyttäytyisi näennäisesti normaalisti, kunnes tietyt sitä vääristävät piilevät ehdot täyttyisivät.

Yhdessä sellaisten tekniikoiden kanssa kuin kontradiktorinen runous, harjoitusdatan manipulointi avaa skenaarion, jossa Miljoonat käyttäjät saattavat käyttää työkaluja, joissa on piileviä virheitä.tiedostamatta sitä, mikä on merkittävä haaste tekoälyn turvallisuus- ja hallintopolitiikoille.

Kaikki nämä löydökset viittaavat siihen, että generatiivisen tekoälyn turvallisuus ei ole ratkaistu ongelma, vaan jatkuvasti kehittyvä ala jossa uusia hyökkäysmuotoja syntyy teknologian integroituessa yhä useammille arkielämän alueille toimistotyöstä julkishallintoon tai koulutukseen.

Tässä yhteydessä "tekoälyn huijaamiseen tähtäävä runous" on tullut hyvin havainnollistavaksi esimerkiksi siitä, miten yksinkertainen tyylin muutos voi paljastaa järjestelmiä, joilla paperilla on tiukat suojausprotokollat. Icaro Labsin ja italialaisten yliopistojen tutkimus vahvistaa ajatusta siitä, että tällaiset toimenpiteet ovat välttämättömiä. luovempia arviointejaJatkuvaa stressitestausta ja tiivistä yhteistyötä kehittäjien, kyberturvallisuusasiantuntijoiden ja sääntelyviranomaisten välillä sen varmistamiseksi, että päivittäin käyttämämme kielimallit todella kestävät sekä teknisiä hyökkäyksiä että nerokkaimpia kieliteknisiä temppuja.


Lisää ensisijaiseksi lähteeksi Googlessa