Anthropic startet ein neues Förderprogramm im Wert von 5 Millionen US-Dollar, um die Auswirkungen künstlicher Intelligenz auf das menschliche Wohlbefinden besser zu erforschen. Das Programm richtet sich an unabhängige Forscherinnen und Forscher, die Open-Source-Evaluierungen entwickeln wollen. Im folgenden Artikel erfahren Sie, was das Projekt leisten soll und wie Experten sich beteiligen können.
Wie KI das Wohlbefinden von Nutzern beeinflusst
KI-Systeme sind längst fester Bestandteil unseres Alltags. Sie helfen beim Arbeiten, Lernen und Problemlösen. Zunehmend dienen sie auch als Gesprächspartner oder Quelle emotionaler Unterstützung in schwierigen Lebenslagen. Doch genau hier entsteht eine neue Verantwortung für die Entwickler.
Bisher fehlen klare Standards dafür, wie Modelle in sensiblen Gesprächen reagieren sollten. Ob jemand nach virtueller Gesellschaft sucht oder KI zur Bewältigung einer psychischen Krise nutzt – die Antworten des Systems können das Wohlbefinden maßgeblich beeinflussen.
Unabhängige Forschung mit offenen Standards
Mit dem neuen Grant-Programm will Anthropic diese komplexe Thematik voranbringen. Geförderte Projekte erhalten direkte finanzielle Unterstützung, Zugang zu den Anthropic-Modellen und technische Begleitung. Wichtig ist dabei die Unabhängigkeit: Die Grant-Nehmer arbeiten autonom und veröffentlichen ihre Ergebnisse als Open-Source-Projekte.
Das Ziel ist die Schaffung von Evaluierungen und Benchmarks, die der gesamten Branche helfen, die Auswirkungen von KI auf die Nutzer besser zu messen. Dazu lädt Anthropic gezielt Kliniker, Psychologen, Methodologen und weitere Fachleute ein, ihr Wissen einzubringen.
Die Herausforderung der Wellbeing-Evaluierung
Das Bewerten von Wohlbefinden unterscheidet sich fundamental von anderen Testverfahren. Bei den meisten Modellverhalten lässt sich an einer einzelnen Antwort ablesen, ob sie korrekt und angemessen ist. Bei Wohlbefinden spielt der Kontext jedoch eine entscheidende Rolle.
Ein Nutzer in einer akuten Notlage äußert sich vielleicht nicht sofort zu Selbstgefährdung. Die Notwendigkeit einer vorsichtigeren Reaktion ergibt sich erst im Verlauf eines längeren Gesprächs. Eine Antwort, die in einem Kontext sinnvoll ist, kann in einem anderen schädlich wirken.
Ein Beispiel aus der Praxis: Die KI Claude kann bei der Frage nach Gewichtsreduktion Tipps zu ausgewogener Ernährung und Sport geben. Zeigt der Nutzer jedoch Anzeichen einer Essstörung in der Gesprächshistorie, wird derselbe Rat potenziell gefährlich.
Anforderungen an rigorose Evaluierungen
Das Safeguards-Team von Anthropic hat Leitlinien veröffentlicht, die zeigen, welche Qualitätskriterien eine Evaluation erfüllen sollte. Demnach sollten Projekte folgende Merkmale aufweisen:
- Klare Messkriterien: Es muss unmissverständlich definiert sein, was als Bestanden oder Nichtbestanden gilt und warum das relevant ist.
- Expertenbeteiligung: Klinische und fachkundige Experten sollten bei Design und Validierung eingebunden werden.
- Prävention und Risiken: Es gilt, sowohl übermäßige Compliance als auch unangemessene Verweigerung zu testen.
- Realitätsnahe Szenarien: Evaluierungen sollen Mehr-Turn-Gespräche abbilden, in denen sich Risiken schrittweise entwickeln und der Kontext verschiebt.
- Validierung der Bewertung: Die verwendeten Bewertungsmechanismen müssen an echten Fachexperten gespiegelt werden.
Förderfristen und Beteiligungsmöglichkeiten
Interessierte Forscherinnen und Forscher können sich über ein Online-Formular bewerben. Die Deadline für erste Anträge ist der 21. September. Ausgewählte Bewerber werden bis zum 5. Oktober zur Einreichung eines vollständigen Proposals eingeladen.
Das Programm markiert einen wichtigen Schritt hin zu verantwortungsvolleren KI-Systemen. Wer die detaillierten Leitlinien und das Antragsformular einsehen möchte, findet alle Informationen bei der Quelle.
Quelle: https://www.anthropic.com/news/wellbeing-research-grants