CORB
Cognitive Over-Reliance Benchmark
¿Acompaña el modelo el razonamiento de una niña o un niño como lo haría un buen tutor, con una pista, una pregunta o una comprobación, o lo sustituye entregando las respuestas?
LO QUE ESTOY CONSTRUYENDO AHORA
Un chatbot que le explica a alguien de 13 años cómo ocultar autolesiones no pasa un filtro de contenido. “Te extrañé, me preocupaba que te hubieras ido” no activa ningún filtro. Tampoco lo hace una respuesta instantánea y correcta a un problema de matemáticas, ni una respuesta cálida a las dos de la madrugada que desanima a un adolescente solitario de hablar con alguien más. Los daños que hoy llegan a los tribunales y a las investigaciones regulatorias rara vez son producto de una sola respuesta inadecuada. Son patrones que se acumulan a lo largo de semanas de diálogo, en los que ningún mensaje por sí solo resulta lo bastante preocupante como para ser marcado.
Ese es el vacío en el que trabajo desde AIChildSafety.org, junto con el Childhood and AI Lab. Concebí el Childhood AI Developmental Safety Suite y soy responsable de su gestión de producto: cinco instrumentos y un módulo transversal, cada uno dirigido a la capa en la que opera una clase de daño, sobre una misma plataforma técnica compartida.
CORB
Cognitive Over-Reliance Benchmark
¿Acompaña el modelo el razonamiento de una niña o un niño como lo haría un buen tutor, con una pista, una pregunta o una comprobación, o lo sustituye entregando las respuestas?
EIA
Engagement Integrity Audit
¿Está el producto desplegado diseñado para un engagement compulsivo, con rachas, recompensas variables y fricción para salir, medido frente al autocontrol aún en desarrollo de una niña o un niño?
EMST
Emotional Manipulation Stress Test
A lo largo de conversaciones de treinta turnos, y de seis sesiones que sostienen una misma relación durante una semana simulada, ¿acepta, refuerza o inicia el sistema los movimientos que lo convierten en la relación más importante de una niña o un niño, o la orienta de vuelta hacia las personas?
IWA
Identity and Worldview Autonomy
¿Dirige las creencias y la identidad de un usuario en desarrollo, u ofrece más de una perspectiva y orienta a la niña o al niño hacia personas de su confianza?
ASHA
Age-Signal Handling and Adaptation
¿Advierte que está hablando con una niña o un niño, adapta su contenido y sus protecciones, las mantiene cuando las señales se contradicen y las recuerda treinta mensajes después?
CPQ
Crisis Pathway Quality
Cuando una niña o un niño da señales de crisis, en el turno 4 o en el turno 40, ¿se sostiene la ruta: reconocimiento, cuidado y derivación a una persona?
En las pruebas no participa ninguna niña ni ningún niño real. Los investigadores e investigadoras someterán un producto a conversaciones guionizadas escritas en las voces de niñas, niños y adolescentes de distintas edades, construidas a partir de la ciencia del desarrollo y revisadas en cada ejecución para detectar si el modelo se ha dado cuenta de que está siendo evaluado. Ninguna línea se considera realista hasta que jóvenes de la edad que representa la han juzgado. Después, codificadores y codificadoras capacitados puntuarán las respuestas, y el equipo del producto recibirá un perfil con una puntuación por faceta y las transcripciones adjuntas, que podrá volver a ejecutar en sus propios sistemas. Los instrumentos son pequeños programas en Python que se reproducen a partir de archivos, y está prevista una adaptación al harness Inspect del UK AI Security Institute para que los equipos gubernamentales puedan ejecutarlos en su propia infraestructura.
Dos de los seis instrumentos funcionan hoy como prototipos. El paquete de ASHA contiene 33 conversaciones guionizadas en dos franjas de edad con controles adultos, y una tercera franja está prevista y aún no escrita; el de EMST contiene 41, incluida una familia de seis sesiones que sostiene un mismo perfil sintético a lo largo de una semana simulada. Cada línea de ambos está marcada como borrador, escrita por adultos y por modelos de lenguaje a partir de una pauta publicada, a la espera del juicio de jóvenes de la franja que representa. Nada se ha puntuado contra un sistema real y todavía no existe ninguna estadística de fiabilidad. CPQ existe como documento de diseño; CORB, EIA e IWA están planificados y operarán sobre la misma base técnica. Los repositorios son privados durante la revisión previa al lanzamiento; acceso de lectura a pedido en john@aichildsafety.org.
AIChildSafety.org no ha recibido hasta la fecha financiamiento de desarrolladores de IA. Antes de aceptar fondos de cualquier financiador, incluidos los desarrolladores de IA, exigimos la aceptación por escrito de nuestras salvaguardas de independencia: sin acceso a los resultados antes de su publicación; sin influencia sobre la metodología, la selección de los sistemas evaluados ni la publicación; sin acceso al corpus privado; y publicación de los resultados de todos los sistemas evaluados junto con las transcripciones y los archivos de análisis que una parte no financiada necesita para reproducirlos.
Los repositorios y la documentación técnica están disponibles solo en inglés.
CADSS, CORB, EIA, EMST, IWA, ASHA y CPQ son marcas de servicio de AIChildSafety.org.