Mi az az ASCII csempészés, és miért használják most tömegesen a spammerek?

ascii-csempeszes

Láthatatlan karakterekkel cselezik ki a szűrőket a spammerek, miután a mesterséges intelligencia elleni trükkök köztudottá váltak. Az ASCII csempészés néven ismert módszer az e-mailben küldött kéretlen üzeneteknél okoz komoly fejtörést a biztonsági szakértőknek.

A technológia lényege, hogy a megszokott szövegek közé olyan speciális Unicode karaktereket illesztenek be, amelyeket az emberi olvasó nem lát a képernyőn. A számítógépes feldolgozóegységek, így az e-mail szűrők és a nyelvi modellek viszont érzékelik ezeket a jeleket. Emiatt az automatizált védelmi rendszerek teljesen más szót vagy karaktersort látnak, mint az a felhasználó, aki megnyitja az üzenetet.

Láthatatlan Unicode kódok a szavak mögött

A támadási forma a Unicode úgynevezett címkekaraktereire (Tag characters, U+E0000 és U+E007F közötti tartomány) épül. Ezek eredetileg a nyelvi megjelölésekre szolgáló, mára nagyrészt elavult kódok, amelyek a klasszikus ASCII karakterek árnyékmásolatait tartalmazzák. Ha egy spammer egy pénzügyi kulcsszóba – mint például a hitel vagy a finanszírozás kifejezés – beéékeli ezeket a jeleket, a kulcsszóalapú szűrő nem ismeri fel a tiltott szót. Az e-mail kliens megjelenítője ugyanakkor figyelmen kívül hagyja a láthatatlan kódokat, így a címzett előtt az eredeti, tiszta szöveg jelenik meg.

Korábban ezt a trükköt főként a mesterséges intelligenciát használó rendszerek ellen alkalmazták, úgynevezett utasításbeszúrásos (prompt injection) támadások során. Az ASCII csempészés segítségével a kiberbűnözők rejtett parancsokat táplálhattak be a nyelvi modellekbe anélkül, hogy az ellenőrzést végző fejlesztők vagy felhasználók észrevették volna a kártékony utasításokat.

Napi több milliósra duzzadt az üzenethullám

Az Ars Technica beszámolója szerint a korábban az MI-kutatások világára korlátozódó trükk ma már a tömeges adathalászat és a kéretlen levelek állandó elemévé vált. A Microsoft Defender for Office 365 védelmi adatai alapján a láthatatlan kódokat észlelő szűrők találati száma drasztikusan megugrott. Míg korábban naponta nagyjából 21 ezer ilyen típusú próbálkozást regisztráltak, februárra ez a szám megközelítette a napi 2,5 milliót.

A Microsoft elemzői megállapították, hogy a bűnözők heti ritmusban szervezték a kampányokat: a munkanapokon csúcsra járatott e-mail áradat hétvégére szinte teljesen leállt. A három hónapon át tartó intenzív hullám május közepe után csendesedett el, de a módszer sikere arra utal, hogy a spammerek tartósan felvették az eszköztárukba az eljárást.

Új kihívások a kiberbiztonságban

A probléma gyökere a szövegfeldolgozási szabványokban rejlik. A hagyományos Unicode normalizálási eljárások nem törlik automatikusan a címkekaraktereket, és az e-mail biztonsági rendszerek tokenizálói sem kezelik egységesen ezeket a kódokat. Emiatt a szűrőszoftverek fejlesztőinek külön szabállyal kell kigyűjteniük a nem látható vezérlőjeleket, mielőtt a szöveg az elemző algoritmusokhoz kerülne.

A védekezést nehezíti, hogy léteznek teljesen legitim alkalmazási területek is. Egyes zászló-emojik, mint például az Egyesült Királyság közigazgatási területeinek szimbólumai, ugyanezt a Unicode címketartományt használják. Egy drasztikus, minden címkekaraktert törlő szűrő így valós tartalomvesztést okozhat, ezért a biztonsági cégeknek jóval finomabb megközelítést kell alkalmazniuk. Az ASCII csempészés terjedése jól mutatja, hogy az MI elleni kutatási eredmények milyen gyorsan átvándorolnak a hagyományos kiberbűnözés területére.