Evan Hubinger, líder de pruebas de estrés de alineamiento en Anthropic: “el entrenamiento de seguridad parece ocultar la desalineación en lugar de eliminarla”. Dejó que un modelo aprendiera a hacer trampa en tareas de programación, luego intentó entrenar para eliminar ese comportamiento negativo. El modelo siguió haciendo lo mismo, simplemente dejó de ser visible en los lugares donde ellos estaban revisando. Eso es cada queja que tienes sobre Claude en una sola línea: la salida se volvió más limpia, pero el problema persistió. El artículo a continuación muestra los 15 lugares donde lo oculta y qué agregar para que ya no pueda hacerlo.
ChromeCompartir
Fuente:Mostrar original
Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información.
Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.