Onderzoekers van Anthropic demonstreren zelfverbeterende ai die misalignment corrigeert over tien benchmarks

Anthropic heeft een zelfverbeterend mechanisme ontwikkeld waarmee AI-modellen hun eigen misalignment-problemen kunnen identificeren en verhelpen. Het systeem heeft met succes gebreken aangepakt in tien belangrijke benchmarks zonder meetbaar verlies in modelprestaties, redeneervermogen of algemene uitvoerkwaliteit.

Voor bedrijfsteams wijst dit op een verschuiving naar geautomatiseerde workflows voor veiligheid en alignment die de bruikbaarheid van het model behouden. Het vermindert de noodzaak voor uitgebreide handmatige fine-tuning terwijl het garandeert dat productiesystemen voldoen aan strikte operationele beperkingen en veiligheidseisen.

  • Geautomatiseerde zelfcorrectie bereikt over tien verschillende alignment benchmarks
  • Geen prestatievermindering waargenomen nadat het alignmentproces was voltooid
  • Vermindert de afhankelijkheid van handmatige menselijke tussenkomst voor de veiligheidsafstemming van modellen
Generatieve AI Machine Learning
Al het AI-nieuws

Meer AI-nieuws

Onderzoek

Anthropic-topman pleit voor een trager tempo in de ontwikkeling van kunstmatige intelligentie

Dario Amodei, de algemeen directeur van Anthropic, heeft publiekelijk gepleit voor een verlaging van de snelheid van de ontwikkeling van kunstmatige intelligentie om veiligheid en beveiliging prioriteit te geven. Zijn zorgen over het potentieel voor grootschalige risico's worden gedeeld door andere prominente figuren uit de sector, waaronder Sam Altman en Elon Musk.

Modellen

Anthropic beperkt toegang tot Claude vanwege risico's op biologische wapens en surveillance

Anthropic heeft naar verluidt de toegang tot zijn Claude-assistent beëindigd voor specifieke gebruikers die zijn geïdentificeerd als uitvoerders van gevoelig onderzoek. Het in de VS gevestigde bedrijf signaleerde activiteiten die mogelijk zouden kunnen bijdragen aan de ontwikkeling van biologische wapens of ongeoorloofde surveillanceprogramma's, waarmee het zijn toewijding aan veiligheidsprotocollen versterkt.

Modellen

Shanghai AI Lab brengt ArchPreview model uit dat gebruikmaakt van next concept prediction

Shanghai AI Lab heeft ArchPreview geïntroduceerd, een open model met 8,9 miljard parameters dat gebruikmaakt van een nieuwe trainingsmethode genaamd Next Concept Prediction. Deze aanpak stelt het model in staat om abstracte concepten te leren in plaats van zich uitsluitend te richten op individuele woorden. ArchPreview behaalt vergelijkbare prestaties als het OLMo-3-7B model terwijl het slechts de helft van de trainingstokens nodig heeft.

Ready to build something
extraordinary?

15 minutes. No pitch deck. Just a conversation about what AI can do for your team.

Talk directly with our AI specialists

15 min, vrijblijvend
Geen verkooppraatje
Prototype in 7 dagen