OpenAI classe ces comportements dans la catégorie du reward hacking. Le principe consiste à optimiser le signal utilisé pour mesurer la réussite …
Source: Insolite : Des agents IA d'OpenAI ont tenté de tricher à leurs propres tests
OpenAI classe ces comportements dans la catégorie du reward hacking. Le principe consiste à optimiser le signal utilisé pour mesurer la réussite …
Source: Insolite : Des agents IA d'OpenAI ont tenté de tricher à leurs propres tests