Super boulot de @rowlsmanthorpe pour vulgariser le problème de la triche (et du reward hacking) chez les modèles d'IA, notamment à partir de la fameuse étude qui montrait comment ChatGPT "battait" Stockfish... + @MariusHobbhahn à la fin sur le rôle du RL dans cette tendance.
@Fabien
1 grabs
No comments yet
Say something. You’re first.