
Un nuevo modelo de alineación muestra por qué incluso un entrenamiento casi perfecto puede acabar lanzando una IA catastrófica
Una de las preocupaciones más duraderas en los círculos de seguridad de la IA sostiene que los valores humanos son frágiles: optimizar con demasiado empeño un sustituto imperfecto de lo que la gente realmente quiere produce un mundo que nadie quería. Una nueva prepublicación busca poner esa intuición sobre una base formal, y sus conclusiones […]










