XDLXDL
Super boulot de @rowlsmanthorpe pour vulgariser le problème de la triche (et du reward hacking) chez les modèles d'IA, notamment à partir de la fameuse étude qui montrait comment ChatGPT "battait" Stockfish... + @MariusHobbhahn à la fin sur le rôle du RL dans cette tendance. · XDL