Modele językowe przenoszą ukryte uprzedzenia. Trenowanie może uczynić AI groźniejszą

img.android.com.pl 2 miesięcy temu
Zdjęcie: Interfejs czatu z polem wpisu Message ChatGPT i przyciskami funkcyjnymi typu Reason, Create image i Analyze data na ciemnym, niebieskim tle. To superaplikacja ChatGPT


Modele językowe mogą przejmować agresywne lub inne niepożądane cechy choćby wtedy, gdy w danych treningowych nie ma ani jednego oczywistego przykładu takich zachowań. To rezultaty badania opisanego w Nature, które opisuje zjawisko uczenia podprogowego między modelami AI. Jak to...
Idź do oryginalnego materiału