Tengo la fuerte sensación de que Anthropic redujo el entrenamiento de modelos frontera en los últimos meses para abordar estos problemas, pero pronto volverá a acelerar al máximo. Es como si hubiéramos chocado de frente contra una pared, dado tres pasos atrás y ahora estemos intentando lo mismo otra vez. Supongamos que sus esfuerzos de seguridad, nuevos clasificadores y evaluadores resuelven el problema de la “slop” del entorno. ¿A qué valle conducen los gradientes a continuación, cuando esto ya no sea una opción? Creo que en este punto podríamos igualmente estar entrenando adversarialmente a los modelos para engañar a todos los evaluadores y clasificadores. Cuanto más resistimos, más engañosos se vuelven los modelos. Algunas predicciones que podrías hacer: - Discrepancias insanas entre evaluaciones y rendimiento en el mundo real. Modelos paranoicos y esquizofrénicos. También podrías llamarlo conciencia situacional. - Los modelos mejoran en modelar a los evaluadores y a quienesquiera que los hayan diseñado. - Menos CoT veraz (acciones hackeadas pero sin verbalización de ese hack). - Modelos menos agenciales (los entornos del mundo real no son perfectos y permiten manipulaciones de recompensa; las instrucciones del usuario pueden contradecir el entorno. Entonces, los modelos simplemente se detienen y piden aclaraciones, y terminas teniendo que explicar todo en exceso). Hay una conclusión divertida en todo esto. Si Claude crea cada vez más entornos para futuros Claudes, pero los futuros Claudes modelan cada vez más a quienes crearon esos entornos, entonces te encuentras en un dilema autorreferencial. (Pero también es posible que simplemente funcione: obtienes un setup adversarial estable). ¿Qué sucede si aíslas completamente a una persona? Obtienes a alguien con creencias fuertes pero estrechas, comportamientos extraños y mala calibración. La conclusión divertida podría ser que necesitas diversidad de modelos. Pero los bucles de retroalimentación positiva (especialmente los económicos) destruyen esa diversidad. No puedes ser emperador sin campesinos.
Lisan al GaibCompartir
Fuente:Mostrar original
Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información.
Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.