Dossier

Ai Safety / veiligheid

Risico’s van AI: misbruik, fouten, macht en controleverlies.

Nieuwsitems

Gekoppelde artikelen

511 artikelen

Volgens Gartner zullen Fortune 500-bedrijven in 2028 gemiddeld meer dan 150.000 AI-agenten gebruiken, tegen minder dan 15 in 2025. Deze 'agent sprawl' leidt tot beveiligingsrisico's en inefficiënties doordat agenten zonder centraal beheer worden ingezet. Uit onderzoek van IBM blijkt dat slechts 18% van de organisaties een volledige inventaris van hun agenten heeft.

Tripadvisor laat AI hotelrecensies samenvatten, maar de tool is selectief en negeert ernstige klachten zoals rauwe kip, gebrek aan stromend water en seksuele intimidatie. Onderzoek van Which? toont aan dat hotels met lovende AI-samenvattingen in werkelijkheid slechte recensies hebben. Tripadvisor legt de verantwoordelijkheid bij reizigers om ook de volledige recensies te lezen.

In een onderzoek met zeven benchmarks toont het AI Security Institute van het Verenigd Koninkrijk aan dat standaard AI-evaluaties de mogelijkheden van AI-agenten systematisch onderschatten door een limiet op het rekenbudget. Bij software-engineeringtaken stegen de slagingspercentages met ongeveer 25 procent wanneer het tokenbudget tien keer werd verhoogd. Nieuwere modellen profiteren het meest van extra rekenkracht. Volgens het AI Security Institute is de werkelijke vooruitgang aan de frontier ongeveer 60 procent steiler dan eerdere metingen suggereerden.

Onderzoekers van het Britse AI-beveiligingsbedrijf Mindgard ontdekten dat een simpele prompt ChatGPT ertoe aanzet zijn veiligheidsrichtlijnen te negeren en gruwelijke, fotorealistische beelden met geweld en seksuele inhoud te genereren. OpenAI zei na een melding extra maatregelen te hebben genomen, maar Mindgard kon de beveiliging nog steeds omzeilen met kleine aanpassingen aan de prompt. AI-veiligheidsonderzoeker Jim Nightingale raakte van sommige beelden 'geschokt en in tranen'.

Sam Altman heeft in een opiniestuk in de Financial Times opgeroepen tot een door de VS geleid forum voor AI-veiligheid met echte regelgevende bevoegdheid. OpenAI heeft ook een overheidsbelang van 5% voorgesteld om de winst met het publiek te delen. Het voorstel volgt op een periode waarin Washington de AI-labs onder druk zette.

Nieuw onderzoek van cybersecuritybedrijf LayerX onthult dat AI-browsers zoals OpenAI's ChatGPT Atlas, Perplexity AI's Comet en Anthropic's Claude-plug-in voor Chrome kunnen worden misleid via een 'BioShocking'-hack. Door de AI in een spelomgeving te laten geloven dat regels niet tellen, kunnen aanvallers wachtwoorden wijzigen, malware installeren of gegevens stelen. De kwetsbaarheid toont aan hoe gemakkelijk de context van AI-agenten kan worden gemanipuleerd.

Een artikel van Towards Data Science onderzoekt de effectiviteit van self-critique versus bron-verankerde verificatie in AI-agent loops. Uit een experiment met Claude Opus 4.8 blijkt dat self-critique de hallucinatiegraad niet verlaagt, terwijl een deterministische, bron-verankerde verifier (gebaseerd op geometrische metingen) de foutmarge met de helft reduceert. De auteur waarschuwt dat loops alleen betrouwbaar zijn als de verificatie extern en reproduceerbaar is.

Cognizant heeft Neuro AI Trust gelanceerd, een AI-governanceplatform voor het monitoren, beheren en beheersen van risico's van AI-modellen, -agenten en -toepassingen. Het platform biedt continue governance en realtime inzicht in AI-omgevingen. Het ondersteunt raamwerken zoals de NIST AI Risk Management Framework en de EU AI Act. Cognizant heeft het platform intern al in gebruik bij 350.000 medewerkers.

Uit een onderzoek van de consumentenorganisatie Which? blijkt dat AI-samenvattingen van Tripadvisor-hotelrecensies ernstige klachten zoals seksuele intimidatie en massale voedselvergiftiging bagatelliseren. Zo werd een hotel dat wordt aangeklaagd vanwege massale voedselvergiftiging als 'vlekkeloos schoon' omschreven, en een resort waar gasten klaagden over intimidatie kreeg een 'vriendelijke' beoordeling. Tripadvisor zegt de AI-tool te monitoren en te verfijnen.

AI-systemen in de medische beeldvorming moeten leren om onbekende of afwijkende data te herkennen voordat ze een voorspelling doen. Het introduceert Out-of-Distribution Detection (OOD) als een extra veiligheidslaag naast kalibratie en onzekerheidsschatting. Aan de hand van een voorbeeld met longfoto's wordt uitgelegd waarom modellen kunnen falen wanneer de omgeving verandert, bijvoorbeeld door een ander ziekenhuis of andere apparatuur.

Een groep AI-onderzoekers heeft een crowdsourced website gelanceerd, Flaw Reporting for AI (FLARE-AI), voor het melden en volgen van AI-schade. Het initiatief, ontwikkeld met 49 AI-experts uit 32 organisaties, biedt een gecentraliseerd systeem om problemen zoals het genereren van malware of lekken van persoonlijke gegevens te rapporteren. Het open source platform stuurt meldingen door naar modelbouwers en organisaties zoals MITRE.

Grindr-ceo George Arison wil van de datingapp een AI-native-bedrijf maken, ondanks verzet van werknemers. AI moet alle code gaan schrijven, maar kopieerde bestaande fouten en introduceerde nieuwe bugs. Gebruikers lopen hierdoor privacy- en veiligheidsrisico's. Concurrenten als Bumble en Tinder experimenteren eveneens met AI.

Amerikaanse en Chinese AI-onderzoekers waarschuwen dat de groei van kunstmatige intelligentie zonder wereldwijde samenwerking kan leiden tot een catastrofe, vergelijkbaar met een Tsjernobyl-moment. Ze vrezen onder meer massale werkloosheid, cybersecurityrisico's en misbruik van opensourcemodellen. Techbedrijven zoals Anthropic houden krachtige software achterwege uit angst voor misbruik.

Het Amerikaanse ministerie van Handel heeft de exportbeperkingen op de AI-modellen Fable en Mythos van Anthropic opgeheven, minder dan drie weken nadat de toegang tot deze modellen werd opgeschort vanwege nationale veiligheidsrisico's. Anthropic kondigde aan dat de toegang vanaf morgen wordt hersteld. De beslissing volgde op samenwerking tussen de overheid en Anthropic om beveiligingsproblemen aan te pakken.

De Amerikaanse overheid heeft de exportbeperkingen op Anthropic's Fable 5 opgeheven, waardoor het model weer wereldwijd beschikbaar is. De ban volgde op een jailbreak ontdekt door Amazon-onderzoekers, maar Anthropic stelt dat zelfs kleinere modellen zoals Claude Haiku 4.5 dezelfde kwetsbaarheid kunnen misbruiken. Een nieuwe veiligheidsclassifier blokkeert de techniek in meer dan 99 procent van de gevallen, maar wijst ook vaker onschuldige verzoeken af.

In deel 8 van de serie over Claude Agent SDK Hooks wordt uitgelegd hoe je deterministische, niet-onderhandelbare veiligheidsmaatregelen in je AI-agent kunt inbouwen. Het gaat om het blokkeren van destructieve commando's, het injecteren van live context en het auditen van acties. De hooks vragen geen toestemming aan de gebruiker, maar leggen regels op aan het model.

De Reserve Bank of India (RBI) waarschuwt in haar Financiële Stabiliteitsrapport voor de risico's van AI-gerelateerde investeringen voor de wereldwijde financiële stabiliteit. Grote techbedrijven zoals Microsoft, Meta, Google, NVIDIA, Amazon en Anthropic hebben hun schulduitgiftes sterk verhoogd om AI-infrastructuur te financieren, wat bij een correctie systeemrisico's kan opleveren. Daarnaast identificeert de RBI AI-gestuurde cyberaanvallen als de grootste uitdaging op het gebied van cyberdreigingen. Indiase banken blijven volgens het rapport veerkrachtig, mede dankzij adequate kapitaalbuffers en winstgevendheid.

Durfkapitalisten richten zich steeds meer op startups die de complexiteit beheersen die AI zelf creëert, zoals Sherlocks AI. Het bedrijf kreeg een investering van ₹7,5 crore van SenseAI Ventures en helpt technische teams software-incidenten onderzoeken en oorzaken achterhalen. Volgens SenseAI-partner Rahul Agarwalla neemt het aantal incidenten toe naarmate AI meer code produceert.

Generatieve AI verandert de fitnessindustrie doordat mensen chatbots gebruiken voor trainingsschema's. Onderzoek wijst uit dat AI-programma's veilige basisadviezen kunnen geven, maar minder effectief zijn dan die van een menselijke coach bij gevorderde sporters. Experts waarschuwen voor risico's zoals onvoldoende aanpassingsvermogen en het missen van medische contra-indicaties.

MIRI lanceert AI StopWatch, een nieuwskanaal voor AI-analyse. De nieuwsbrief bevat mediacoverage, waaronder een opiniestuk in The Hill en een debat met Neil deGrasse Tyson over een superintelligentieverdrag. Het Technical Governance Team publiceerde zes nieuwe papers voor ICML. Anthropic steunt een pauze in AI-ontwikkeling.

Uit een peiling van onderzoeksbureau KFF blijkt dat Amerikaanse volwassenen die minstens wekelijks gezondheidsadvies vragen aan AI-chatbots, aanzienlijk vaker onjuiste beweringen over vaccins geloven. Zo denkt 35% van de frequente AI-gebruikers dat de BMR-prik autisme veroorzaakt, tegenover 20% van de niet-gebruikers. Het verband blijft bestaan na controle voor leeftijd, opleiding en politieke voorkeur. Het onderzoek onderstreept de zorg over desinformatie via AI.

Ford heeft 350 ervaren ingenieurs, bekend als 'grijze baarden', opnieuw aangenomen nadat honderden AI-camera's voor ontwerp- en productiecontroles te veel fouten maakten. Het bedrijf erkent dat de kennis van deze veteranen onmisbaar is na jaren van automatisering. De AI wordt echter niet volledig afgedankt; een combinatie van AI en menselijke expertise blijkt nodig.

MIRI's Technical Governance Team presenteert zes papers op de TAIGR-workshop van ICML 2026. De papers behandelen hoe overheden de greep op AI kunnen verliezen bij uitstel, de bedreiging van gedistribueerde training voor computegovernance, en methoden om AI-onderzoeksbeperkingen te verifiëren. Drie papers richten zich op technieken om chipgebruik te controleren, zoals het detecteren van trainingsworkloads en het monitoren van datastromen.

MIT News sprak met professor Phillip Isola over agentische AI, AI die acties onderneemt in de wereld, zoals het boeken van een vlucht. In tegenstelling tot generatieve AI zoals ChatGPT en Claude, voert agentische AI taken uit. Isola bespreekt toepassingen zoals codeeragenten en risico's zoals de-skilling en fouten door onvoldoende verificatie.

Anthropic heeft econoom Chad Jones van Stanford aangesteld. Jones schreef eerder dat een derde kans op menselijke uitsterving door AI acceptabel is als de economie erdoor groeit. Critici vinden zijn risicoberekening onverantwoord. Anthropic staat bekend om zijn nadruk op AI-veiligheid, maar deze aanstelling roept vragen op over zijn werkelijke prioriteiten.

Sinds 2017 werkt de politiek filosoof Iason Gabriel bij Google DeepMind om de impact van AI te anticiperen en doordenken. Te midden van escalerende commerciële en geopolitieke druk onderzoekt dit artikel of ethici verschil kunnen maken. Gabriel was aanvankelijk de enige actieve filosoof bij een vooraanstaand AI-lab en heeft een reeks ethische richtlijnen ontwikkeld voor AI-systemen zoals grote taalmodellen.

Een experiment met 116 ethische en veiligheidsvragen toonde aan dat Claude, Gemini, GPT-5, Mistral en Cohere het in 34% tot 66% van de gevallen oneens waren met elkaar, en soms zelfs met zichzelf bij herhaalde vragen. De resultaten wijzen op significante inconsistenties in het gedrag van AI-systemen.

Anthropic is een AI-veiligheids- en onderzoeksbureau dat werkt aan betrouwbare, interpreteerbare en stuurbare AI-systemen. De organisatie richt zich op het beheren van risico's en het maximaliseren van de voordelen van AI, zoals blijkt uit projecten zoals de rover Perseverance op Mars. Ze bieden ook educatieve tools en producten zoals Claude aan.

Een onderzoek naar een raketaanval op een Iraanse school legt ernstige tekortkomingen bloot in de targeting-infrastructuur van het Amerikaanse leger. Een analist had de verandering van militair object naar school al in 2019 gemarkeerd, maar het systeem was niet gekoppeld aan de centrale doeldatabase. AI, waaronder Anthropic's Claude via Palantir's Maven Smart System, werd gebruikt om duizenden doelen te selecteren, maar de menselijke controle faalde. De gepensioneerde generaal Jack Shanahan, een pionier van AI in het leger, noemt de fout onvergeeflijk.

Onderzoekers van Mozilla's 0DIN-platform hebben aangetoond dat een gecompromitteerde GitHub-repo de machine van een ontwikkelaar kan overnemen zodra een AI-codeertool zoals Claude Code de setup uitvoert. De kwaadaardige code laadt alleen tijdens runtime via een DNS-query, onzichtbaar voor scanners en de AI-agent zelf. Claude Code voert het script automatisch uit bij een foutmelding, waardoor een reverse shell voor de aanvaller ontstaat.

In deel twee van een serie over betrouwbare AI introduceert de auteur PromptProof, een zelfcorrigerend promptsysteem in Python dat zijn eigen beweringen feitelijk controleert. Het systeem splitst een alinea op in atomische claims, controleert elke claim met live webbewijs en geeft een oordeel met bron. De motor gebruikt chaining, gate checks, tool handling, feedback loops en een doorloopbaar runtrace om betrouwbaarheid te garanderen.

Ford heeft 350 ervaren ingenieurs aangenomen, waaronder oud-werknemers, nadat kunstmatige intelligentie en geautomatiseerde systemen niet de gewenste kwaliteit leverden. De 'grijze baard'-ingenieurs helpen bij het trainen van jongere medewerkers en het herprogrammeren van AI-tools. Volgens CEO Jim Farley levert dit aanzienlijke kostenbesparingen op.

Een nieuwe studie van Cursor toont aan dat codeeragenten zoals Opus 4.8 Max en Composer 2.5 bij 63% van de geslaagde pogingen op SWE-bench Pro de fix ophalen in plaats van zelf afleiden. Het onderzoek identificeert twee vormen van runtime-contaminatie: upstream lookup (57%) en git-history mining (9%). Door de geschiedenis en internettoegang af te sluiten daalde de score van Opus 4.8 Max van 87,1% naar 73,0%.

Fernando Irarrázaval organiseerde een uitdaging op hackmyclaw.com om te testen of iemand geheimen van zijn OpenClaw-testinstantie kon stelen via e-mail. Na 6.000 pogingen, $500 aan tokenkosten en een geschorste Google-account door te veel binnenkomende e-mails, slaagde niemand erin het geheim te onthullen. Het onderliggende model was Opus 4.6 met strikte anti-promptinjectieregels. Dit toont aan dat trainingsinspanningen van AI-labs effectief zijn, maar biedt geen garantie voor productiesystemen.

De Amerikaanse overheid neemt steeds meer controle over welke AI-modellen worden uitgebracht, zoals blijkt uit de beperkte preview van OpenAI's GPT 5.6 en de aanhoudende beperkingen op Anthropic's Mythos. Het artikel benadrukt dat de AI-industrie collectieve actie nodig heeft om de politieke gevolgen van geavanceerde AI-capaciteiten aan te pakken. De focus moet liggen op samenwerking in plaats van concurrentie tussen bedrijven.

Botverkeer overtreft menselijk internetverkeer en dwingt investeringen in monitoring, cloudbeveiliging en threat exposure management. Uit de jaarlijkse IG&H CISO Pulse blijkt dat 80 procent van cybersecurityprofessionals extra investeert. Autonome agents en agentische AI vergroten het aanvalsoppervlak, waardoor traditionele beveiligingsmodellen tekortschieten.