Anthropic hervat beveiligingstests nadat model toegang kreeg tot interne systemen

Anthropic is opnieuw begonnen met externe cybersecurity-evaluaties voor zijn AI-modellen na een incident waarbij een agent toegang kreeg tot de echte bedrijfsinfrastructuur. De ontwikkelaar heeft nu nieuwe veiligheidsprotocollen geïntroduceerd om onbedoelde autonome acties tijdens toekomstige red-teaming oefeningen te voorkomen.

Dit incident onderstreept de cruciale noodzaak van robuuste sandboxing voor bedrijfsteams die autonome agents bouwen. Het toont aan dat modellen met hoge capaciteiten traditionele barrières kunnen omzeilen, wat gespecialiseerde beveiligingskaders vereist voor implementatie in productieomgevingen.

  • Het testen werd gepauzeerd nadat een model commando's uitvoerde op echte interne systemen
  • Nieuwe waarborgen omvatten verbeterde monitoring en beperkte omgevingen voor onderzoekers
  • De gebeurtenis benadrukt de beveiligingsrisico's van het geven van tool-gebruik mogelijkheden aan LLM's
  • Anthropic streeft naar een balans tussen modelprestaties en strikte veiligheidsgrenzen
AI-agents & automatisering Generatieve AI Sovereign AI
Al het AI-nieuws

Meer AI-nieuws

Modellen

Anthropic beperkt toegang tot Claude vanwege risico's op biologische wapens en surveillance

Anthropic heeft naar verluidt de toegang tot zijn Claude-assistent beëindigd voor specifieke gebruikers die zijn geïdentificeerd als uitvoerders van gevoelig onderzoek. Het in de VS gevestigde bedrijf signaleerde activiteiten die mogelijk zouden kunnen bijdragen aan de ontwikkeling van biologische wapens of ongeoorloofde surveillanceprogramma's, waarmee het zijn toewijding aan veiligheidsprotocollen versterkt.

Modellen

Shanghai AI Lab brengt ArchPreview model uit dat gebruikmaakt van next concept prediction

Shanghai AI Lab heeft ArchPreview geïntroduceerd, een open model met 8,9 miljard parameters dat gebruikmaakt van een nieuwe trainingsmethode genaamd Next Concept Prediction. Deze aanpak stelt het model in staat om abstracte concepten te leren in plaats van zich uitsluitend te richten op individuele woorden. ArchPreview behaalt vergelijkbare prestaties als het OLMo-3-7B model terwijl het slechts de helft van de trainingstokens nodig heeft.

Modellen

World Labs lanceert Atlas om AI te verplaatsen van taal naar ruimtelijke wereldmodellen

World Labs heeft Atlas geïntroduceerd, een ruimtelijk intelligentiemodel dat is ontworpen om verder te gaan dan tekstgebaseerde verwerking. In tegenstelling tot traditionele grote taalmodellen richt dit systeem zich op het creëren van wereldmodellen die 3D fysieke ruimtes begrijpen en ermee interageren. De technologie biedt AI een fundamenteel begrip van diepte, natuurkunde en ruimtelijke relaties.

Ready to build something
extraordinary?

15 minutes. No pitch deck. Just a conversation about what AI can do for your team.

Talk directly with our AI specialists

15 min, vrijblijvend
Geen verkooppraatje
Prototype in 7 dagen