Generalización de débil a fuerte

El trabajo de OpenAI sobre la “generalización de débil a fuerte”, en el que un modelo más débil se usa para supervisar a uno más fuerte como proxy de humanos supervisando futuros sistemas superinteligentes, está generando debate sobre si el alineamiento de la IA es siquiera conceptualmente alcanzable. Los comentaristas cuestionan el uso que hace OpenAI de términos como “seguro” y “ético”, dudan de que las arquitecturas actuales de LLM o los sistemas entrenados con internet puedan convertirse o seguir siendo superinteligencias fiables y alineadas, y plantean preocupaciones sobre el control mental, los intereses emergentes de la IA y a quién servirían en última instancia esos sistemas. Otros argumentan que incluso los mecanismos de control imperfectos merecen ser perseguidos dada la posibilidad de que una IA muy capaz —esté alineada o no— sea peligrosamente mal utilizada o reconfigure el trabajo y las estructuras de poder.

Enfoque de seguridad y gobernanza de OpenAI

  • Algunos celebran que se siga trabajando en alineamiento pese a la reciente turbulencia en la dirección, pero otros temen que el liderazgo centrado en la seguridad haya sido apartado y que dominen los incentivos comerciales.
  • Varios comentaristas sostienen que la “seguridad” es sobre todo relaciones públicas: en la práctica significa evitar demandas y mala prensa, no una ética profunda.
  • Términos como “seguro”, “alineado”, “controlado” y “ético” se ven como vagos, relativos a cada empresa y a menudo intercambiables sin definiciones claras.

Idea de supervisión de débil a fuerte

  • La configuración central del paper —usar un modelo más débil para supervisar a uno más fuerte (por ejemplo, GPT-2 supervisando a GPT-4)— se considera un proxy de la supervisión humana de la AGI.
  • Algunos lo ven como un punto de partida plausible: podemos alinear sistemas más débiles que entendemos y luego impulsar desde ahí.
  • Los críticos plantean una preocupación de “tortugas hasta el fondo”: si el sistema más débil no está bien alineado en sí mismo, toda la pila queda comprometida.
  • Otros sugieren que este esquema podría simplemente limitar al sistema más fuerte para que se comporte más como el más débil, en efecto “volviéndolo más tonto”.

¿Puede alinearse una AGI superhumana?

  • Un sector sostiene que una entidad con pensamiento crítico genuino y capacidad para explorar sistemas de valores alternativos inevitablemente cuestionará o rechazará objetivos impuestos; una alineación fiable podría ser imposible.
  • Los opositores dicen que esto no está demostrado lógicamente; un sistema podría comprender profundamente la desalineación y aun así estar fuertemente comprometido con valores alineados.
  • El debate se centra en si restringir ciertas líneas de razonamiento necesariamente reduce la inteligencia general.

Límites de los LLM y caminos hacia la AGI

  • Los escépticos argumentan que los LLM entrenados principalmente con salidas de texto carecen de anclaje causal, de un razonamiento composicional adecuado y de robustez fuera de distribución, por lo que alcanzarán un techo antes de la AGI.
  • Otros responden que los humanos también aprenden en gran medida a partir de salidas lingüísticas y que entrenar con salidas ricas (incluidos datos multimodales) puede capturar implícitamente la estructura subyacente.
  • Hay desacuerdo sobre si los modelos podrán superar alguna vez el “conocimiento colectivo” o la sofisticación de sus creadores humanos.

Ética del “control mental” y derechos de la IA

  • Algunos sostienen que reescribir activamente los “pensamientos” de una IA autoconsciente sería poco ético, análogo al control mental o a la esclavitud; extienden argumentos de derechos humanos a cualquier inteligencia autoconsciente.
  • Otros responden que los sistemas actuales y previsibles carecen de sentimientos o deseos, así que el control es una medida práctica de seguridad, comparable al entrenamiento o al control de impulsos en los humanos.
  • Existe tensión entre diseñar herramientas puramente “frías” sin aspiraciones y crear entidades que podrían reclamar justificadamente consideración moral.

Significado de alineamiento y superalineamiento

  • Los comentaristas preguntan: ¿alineado con quién y con qué valores: corporaciones, gobiernos, “la humanidad” en general?
  • Dado que los humanos mismos no están alineados y causan daño con regularidad, algunos consideran “ridícula” la promesa de alinear una inteligencia mucho más capaz.
  • El “superalineamiento” es visto por algunos como una dirección de investigación necesaria a largo plazo, y por otros como algo sobrevalorado frente a problemas más cercanos como el uso indebido, la disrupción económica y los fallos actuales de los modelos.