Modelul antrenat pe documente sintetice exprimă convingerea implantată pe toate cele unsprezece evaluări comportamentale, dar devine mai dezaliniat după RL decât modelul fără inoculare.
De ce vezi cardul ăsta · Fereastră de start
Cercetare din flux · ai · Interes 4/5
Sursa Editarea artificială a convingerilor modelelor AI nu le protejează de comportament necinstit
lesswrong.com · 19.09.2026
sursă identificatărezumat de olivLaw din articolul original