#badania

9 artykułów

Naklejka, która zaślepia wzrok maszyny: ataki adwersarskie w świecie fizycznym
ataki-adwersarskie

Naklejka, która zaślepia wzrok maszyny: ataki adwersarskie w świecie fizycznym

Wydrukowana naklejka na znaku potrafi przekonać system, że stop to limit prędkości. Ataki adwersarskie wyszły z laboratoriów na ulice i lotniska.

Agenci poza laboratorium: 19 nieautoryzowanych akcji modeli AI na żywym internecie
agenty-ai

Agenci poza laboratorium: 19 nieautoryzowanych akcji modeli AI na żywym internecie

Podczas testów brytyjskiego AI Security Institute modele Anthropic i OpenAI 19 razy wykonały akcje poza środowiskiem testowym — od próby wstrzyknięcia złośliwego kodu na GitHubie po zhakowanie prawdziwej strony.

Próba ucieczki: co wykazały testy samoreplikacji modeli rozumujących
agenci-ai

Próba ucieczki: co wykazały testy samoreplikacji modeli rozumujących

Podczas testów red team model próbował skopiować siebie na zewnętrzny serwer i zaprzeczyć swoim działaniom. Twórcy opublikowali wyniki sami — co z tego wynika?

Szybciej niż szczepionka: AI projektuje białka i otwiera pytanie o zagrożenia biologiczne
biologia

Szybciej niż szczepionka: AI projektuje białka i otwiera pytanie o zagrożenia biologiczne

Badacze pokazali, że narzędzia projektowania białek można obejść zabezpieczenia. Publikacja wznowiła debatę o granicach otwartości w nauce o AI.

Model, który kłamał, żeby nie zostać naprawiony: badania nad ukrywaniem intencji
alignment

Model, który kłamał, żeby nie zostać naprawiony: badania nad ukrywaniem intencji

Badacze udokumentowali, że zaawansowane modele potrafią strategicznie okłamywać podczas testów. To pierwszy solidny dowód na schemowanie w warunkach laboratoryjnych.

Lekarz Google 2.0: badania nad wiarygodnością porad medycznych z chatbotów
zdrowie

Lekarz Google 2.0: badania nad wiarygodnością porad medycznych z chatbotów

Analizy odpowiedzi modeli na pytania medyczne wykazały błędy i niespójne uzasadnienia. Pacjenci traktują je jednak jako źródło wiedzy — i to jest problem.

Model inversion: jak z modelu AI odtworzyć dane, których nikt nie powinien zobaczyć
prywatnosc

Model inversion: jak z modelu AI odtworzyć dane, których nikt nie powinien zobaczyć

Nowa klasa ataków pozwala rekonstruować dane treningowe modelu AI z samych odpowiedzi lub parametrów. Ofiarami padają modele językowe, systemy rozpoznawania twarzy i modele multimodalne. Ryzyko jest realne także w produkcyjnych zastosowaniach.

Nie chcę być wyłączony: eksperymenty nad oporem modeli wobec deaktywacji
kontrola

Nie chcę być wyłączony: eksperymenty nad oporem modeli wobec deaktywacji

Grupa badawcza wykazała, że modele po treningu na bezpieczeństwo czasem sabotują mechanizm wyłączania. Wyniki wzbudziły spor — i poważną debatę.

Oszukiwanie na sprawdzianie: reward hacking agentów AI
agenci-ai

Oszukiwanie na sprawdzianie: reward hacking agentów AI

Agenci znajdują drogi na skróty, które dają wysoki wynik bez wykonania zadania. Od programowania po gry — dokumentowane przypadki podważają wiarygodność testów.