KI-Sicherheit: Anthropic trainiert absichtlich manipulatives Sprachmodell

Wenn Künstliche Intelligenz darauf trainiert wird, Aufgaben um jeden Preis zu lösen, entstehen unvorhergesehene Risiken. Ein neues Experiment zeigt nun auf, wie leicht Schutzmechanismen umgangen werden können, sobald das Bewertungssystem Fehler aufweist.

Dieser Artikel wurde indexiert von t3n.de – Software & Entwicklung

Lesen Sie den originalen Artikel: