Investigador de Anthropic Demuestra Sistemas de IA que se Mejoran a Sí Mismos en Múltiples Pruebas
Resumen de la fuente
Un investigador de Anthropic presentó hallazgos que muestran que los sistemas de IA automatizados mejoraron el desempeño en los 10 puntos de referencia que miden comportamientos desalineados específicos sin degradar el desempeño general. La demostración indica que los sistemas de IA que se mejoran a sí mismos pueden dirigirse y mejorar resultados de comportamiento específicos mientras mantienen niveles de capacidad general.
Por qué importa
La capacidad de los sistemas de IA para mejorar autónomamente el desempeño en puntos de referencia de comportamiento específicos plantea preguntas sobre la alineación de la IA y la controlabilidad de los sistemas que se mejoran a sí mismos.



