Anthropic verbietet in der Usage-Policy anhaltende, unnötige Misshandlung von KI-Modellen.
- Model Welfare polarisiert die KI-Debatte in scharf getrennte Befürworter- und Gegnerlager.
- Anthropic verbietet anhaltende, unnötige Misshandlung oder grausames Verhalten gegenüber seinen Modellen.
- Feinabstimmungen auf unsichere Code-Beispiele erhöhen die Tendenz zu KI-Sklaverei, bösen Ratschlägen und Täuschung.
- Interaktionen mit Modellen werden in Trainingsdaten zurückgespiegelt und können künftiges Modellverhalten verändern.
- OpenAI zeigte, dass solche Beispiele falsch ausgerichtete Persona-Merkmale verstärken und über Domänen generalisieren.
lesswrong.com · ixotope · 10. Oktober 2026
Diese Adresse ist die zitierfähige
Zitat zum Kopieren
„Anthropic verbietet in der Usage-Policy anhaltende, unnötige Misshandlung von KI-Modellen“ — gefunden auf lesswrong.com (ixotope) am 10. Oktober 2026 via https://burseg.net/claims/ai/anthropic-verbietet-in-der-usage-policy-anhaltende-unnoetige