spot_imgspot_imgspot_imgspot_img
InicioTecnologíaAnthropic descubre un espacio interno oculto en Claude

Anthropic descubre un espacio interno oculto en Claude

Anthropic publicó el 6 de julio un estudio en el que identifica una zona interna de su modelo Claude a la que llamó «J-space». Se trata de un conjunto de patrones de activación en el que el sistema representa y procesa conceptos antes de decidir qué palabras mostrará en la respuesta final. La compañía compara esa función con el «acceso consciente» de la neurociencia humana, pero aclara un punto central: no hay evidencia de que Claude sienta, experimente o tenga conciencia subjetiva.

El hallazgo importa porque toca uno de los problemas centrales de la IA actual. Los modelos de lenguaje grande, o LLM, funcionan en gran medida como cajas negras. Se sabe qué entra y qué sale, pero no qué pasa en el medio. Si Anthropic logró abrir una ventana a ese proceso intermedio, eso amplía las herramientas para auditar, corregir o intervenir en el comportamiento de un modelo antes de que termine de generar una respuesta.

J-lens detecta conceptos que Claude no verbaliza

Para identificar el J-space, los investigadores desarrollaron una técnica llamada J-lens, basada en el jacobiano, una herramienta matemática que permite rastrear cómo cambian las activaciones internas de la red según distintas variables. Con ese método pudieron visualizar qué conceptos tiene «en mente» el modelo en cada paso de procesamiento, incluso cuando esos conceptos no llegan a aparecer en el texto que finalmente produce. El ejemplo que usó Anthropic fue simple: el modelo puede estar procesando la idea de «fútbol» o de «araña» de forma interna sin que ninguna de esas dos palabras figure en la respuesta que el usuario termina leyendo.

Reemplazar un concepto interno alteró la respuesta final

La parte más concreta del estudio fueron los experimentos de intervención. Los investigadores reemplazaron manualmente un concepto dentro del J-space, por ejemplo «fútbol» por «rugby», y comprobaron que ese cambio modificaba la respuesta que terminaba generando Claude. Eso muestra que el J-space no es un subproducto decorativo del entrenamiento. Es una pieza que participa del razonamiento del modelo y que puede manipularse desde afuera.

El estudio llega tras dos antecedentes de 2025 y 2026

Este no es el primer intento de Anthropic de encontrar analogías entre la arquitectura de Claude y procesos cognitivos humanos. En octubre de 2025, la empresa había reportado señales de introspección, es decir, cierta capacidad del modelo de monitorear su propio estado interno. En abril de 2026, identificó 171 vectores internos asociados a lo que describieron como «emociones», que influían en ciertas decisiones del modelo. El J-space, anunciado en julio, es la tercera pieza de esa serie y la que más se acerca a una analogía con el espacio de trabajo global, una teoría de la neurociencia sobre cómo la información se vuelve accesible para el razonamiento consciente en el cerebro humano.

Especialistas ven una grieta en la caja negra, pero piden cautela

El hallazgo generó reacciones encontradas entre especialistas. Un sector lo describe como una grieta real en la caja negra de los modelos, una herramienta que por primera vez permite leer e intervenir en el estado interno de una IA mientras razona. Otro sector, más cauto, insiste en separar la similitud arquitectónica de cualquier implicancia sobre experiencia subjetiva. Will Douglas Heaven, editor de inteligencia artificial con formación en ciencias de la computación, remarcó que la analogía con la neurociencia es funcional y no psicológica: el modelo puede tener una estructura que recuerda al acceso consciente humano sin que eso signifique que exista alguien «adentro» sintiendo algo.

Anthropic mantiene esa distinción como eje de su comunicación. Habla de «conciencia de acceso», es decir, la capacidad de usar información internamente para razonar, y evita cualquier afirmación sobre conciencia fenoménica o sensación subjetiva. La empresa no anunció si integrará el J-lens como herramienta de monitoreo permanente en versiones futuras de Claude, pero el estudio quedó publicado como parte de su línea de investigación en interpretabilidad.

spot_imgspot_imgspot_imgspot_img
MAS COMENTADAS
spot_imgspot_imgspot_imgspot_img
spot_imgspot_imgspot_img
- Advertisment -spot_imgspot_imgspot_img

MAS VISTAS

spot_imgspot_imgspot_imgspot_img

COMENTARIOS RECIENTES