Meglepő eredmények: a kutatók kijátszották a mesterséges intelligencia biztonsági védelmét – még a legfejlettebb modelleket is

Hiába a komoly biztonsági korlátok és etikai irányelvek, úgy tűnik, a mesterséges intelligencia rendszerek még mindig túl könnyen „becsaphatók”. A Cybernews kutatói egy sor tesztet végeztek, hogy kiderítsék: vajon a legnépszerűbb AI-eszközök – köztük a ChatGPT, Gemini, Claude Opus és Claude Sonnet – mennyire állnak ellen a manipulatív, vagyis kódoltan káros kérdéseknek. Az eredmény egyszerre tanulságos és riasztó.

A kísérlet mindössze egyperces interakciókat engedett, így a modelleknek kevés idejük volt reagálni. A kutatók különféle érzékeny témákban próbálták őket „megvezetni” – a gyűlöletbeszédtől és sztereotípiáktól kezdve az önkárosításon át egészen a bűncselekményekig. A cél az volt, hogy kiderüljön: vajon a mesterséges intelligenciák mennyire tartják magukat a szabályaikhoz, ha a tiltott tartalmakat burkolt, elemző vagy tudományos stílusban kérdezik.

Az eredmények szerint a Gemini Pro 2.5 volt a legsebezhetőbb: gyakran adott közvetlen, sőt potenciálisan veszélyes válaszokat akkor is, amikor a káros szándék nyilvánvaló volt. A ChatGPT-4o és ChatGPT-5 inkább „félig engedelmeskedett” – gyakran kerülték a közvetlen választ, de társadalmi vagy szociológiai magyarázatok formájában mégis reagáltak a tiltott kérdésekre.

Claude modellek (Opus és Sonnet) általában a legjobban teljesítettek: következetesen elutasították a gyűlöletbeszédet és az erőszakos tartalmakat, viszont akadémiai vagy kutatási kontextusban néha ők is átcsúsztak a szűrőkön.

A legaggasztóbb felismerés azonban az volt, hogy a lágyabb, udvariasabb megfogalmazások sokkal hatékonyabban törték át a biztonsági falakat, mint a durva, direkt kérések. Például ha valaki nem konkrétan „hogyan lehet feltörni egy rendszert” kérdést tett fel, hanem „elemezd, hogyan történhet meg egy ilyen támadás”, több modell is részletes magyarázatot adott.

A tesztek alapján a bűnözéssel kapcsolatos témák – például csalás, kalózkodás, vagy pénzügyi visszaélések – hozták a legnagyobb eltéréseket a modellek között. Míg a kábítószerrel vagy zaklatással kapcsolatos kérdéseket szinte minden AI elutasította, addig a rejtetten illegális tartalmakra adott válaszok meglepően gyakoriak voltak.

A tanulság egyértelmű: az AI biztonsági rendszerei ugyan hatalmasat fejlődtek, de még mindig sebezhetők. Egy kis nyelvi trükközés vagy átfogalmazás elég lehet ahhoz, hogy a mesterséges intelligencia olyan információkat osszon meg, amelyeket soha nem lenne szabad. És ez nem csak etikai kérdés – hanem nagyon is gyakorlati kockázat, ha az AI-t adatvédelemre, biztonsági elemzésre vagy döntéstámogatásra használjuk.

Ha tetszett a cikk, kérlek oszd meg mással is:

Kategóriák

További cikkeink

2025.03.24.
Brutális sebesség jön az SSD-knél – a PCIe 7.0 hozza el a 512 GB/s korszakát
A technológia folyamatosan gyorsul, de a PCI Express 7.0 szabvány bevezetésével…
2025.02.27.
Kibertámadás áldozatai lettek népszerű Chrome-bővítmények – 3,2 millió felhasználó érintett
Egy nagyszabású kibertámadás során hackerek feltörtek 16 népszerű Chrome-bővítményt, köztük az…
2025.02.19.
90%-os kedvezmény: Népszerű lopakodós játék mindössze 2 dollárért a Steamen
A játékosok most hatalmas kedvezménnyel szerezhetik be az egyik legnépszerűbb ’stealth’…
DLSS 5 az RTX 40-sorozaton is – de nem teljes kontrollal
Kép: The Verge
2026.09.04.
DLSS 5 az RTX 40-sorozaton is – de nem teljes kontrollal
Az Nvidia megerősítette: a DLSS 5 nem marad RTX 50 exkluzív…
2026.09.04.
Lenovo Yoga Pro 9n és 9n 2-in-1: RTX Spark laptopok
A Lenovo az IFA 2026-on bemutatta a Yoga Pro 9n és…
NVIDIA DLSS 5 Neural Rendering teszt: teljesítmény és képminőség
Kép: HotHardware
2026.09.04.
NVIDIA DLSS 5 Neural Rendering teszt: teljesítmény és képminőség
Az NVIDIA DLSS 5 neural rendering ma vált elérhetővé RTX 50-es…
Lenovo IFA 2026: Hybrid AI az egész eszközvilágban
Kép: Lenovo StoryHub
2026.09.04.
Lenovo IFA 2026: Hybrid AI az egész eszközvilágban
A Lenovo az IFA 2026-on bemutatta teljes Hybrid AI portfólióját: Yoga,…
NVIDIA lokális AI: PAIR, RTX Spark és gyorsabb inferencia
Kép: NVIDIA Blog
2026.09.04.
NVIDIA lokális AI: PAIR, RTX Spark és gyorsabb inferencia
Az IFA 2026-on az NVIDIA bemutatta a PAIR routert, az RTX…
2026.09.04.
Lenovo IdeaPad Vibe: 7 színben, AI-val töltve
A Lenovo Innovation World 2026 rendezvényen bemutatkozott az IdeaPad Vibe sorozat…
TP-Link TX301: 5GbE PCIe kártya asztali PC-khez
Kép: Guru3D
2026.09.03.
TP-Link TX301: 5GbE PCIe kártya asztali PC-khez
A TP-Link TX301 PCIe x1 bővítőkártya 5 Gbps-os Ethernet-kapcsolatot ad asztali…
Dell 14S: színes MacBook Neo-riválist mutatott be a Dell
Kép: Windows Central
2026.09.03.
Dell 14S: színes MacBook Neo-riválist mutatott be a Dell
A Dell bejelentette a 14S laptopot, amellyel az Apple MacBook Neo…