AI Lab · Gemelo Digital

Destilar una persona: identidad computacional de alta fidelidad desde el rastro de una vida

Investigación en curso · prototipo validado sobre datos realeshyperz AI Lab · Junio 2026
Resumen

Los sistemas actuales que “clonan” a una persona operan por acumulación: vuelcan decenas de miles de mensajes en una base vectorial y dejan que un modelo los recite. El resultado no es una persona sino un recuperador con su cara —pierde la estructura temporal, confunde a unos interlocutores con otros y reproduce frases verbatim en lugar de generalizar el estilo—. Este estudio investiga la hipótesis opuesta: que la identidad es separable del modelo que la ejecuta y puede destilarse, por compresión y no por acumulación, desde el rastro conversacional y documental de una vida —conversaciones, correos, redes sociales, documentos, todo el histórico— sin que el corpus crudo abandone la máquina del sujeto, y que su fidelidad puede medirse con métricas abiertas.

El método es un motor de diez etapas en el que el aprendizaje automático realiza el trabajo pesado de organizar y comprimir el corpus, y un modelo de lenguaje interviene solo al final para sintetizar lo ya estructurado. Su arquitectura es deliberadamente un análogo computacional de la organización de la memoria humana: un corpus episódico indexado, un grafo temporal que cumple el papel de la consolidación relacional, y un adaptador de bajo rango que fija el idiolecto en los pesos —el equivalente a la semantización cortical de una destreza—. El prototipo (nico-digital) se validó de extremo a extremo en su versión liviana sobre datos reales. Este documento presenta el fundamento neurocientífico y cognitivo, la arquitectura, la metodología de evaluación de fidelidad, los resultados preliminares, y el marco ético y de cumplimiento.

01El problema: destilar, no volcar

La aproximación ingenua a un gemelo digital —indexar el histórico completo en un almacén vectorial y recuperar por similitud— falla por razones estructurales, no de escala. La recuperación por proximidad semántica no preserva el orden temporal, no distingue interlocutores que comparten contexto léxico, y favorece la repetición literal frente a la generalización estilística. En términos de memoria, produce un sistema puramente asociativo sin línea de tiempo ni modelo de las personas: recuerda fragmentos, no reconstruye una vida.

La hipótesis de trabajo es que el valor reside en la compresión, no en la acumulación: el histórico es materia prima, no producto. Destilar significa inferir quién es la persona —su idiolecto, sus vínculos, su biografía y sus valores— a partir de la evidencia, y representar eso de forma compacta, consultable y auditable. El aprendizaje automático descubre la estructura latente del corpus; el modelo de lenguaje interviene únicamente al cierre, sobre agregados ya organizados. El enfoque hereda un precedente concreto del mismo laboratorio: Aria, una entidad de identidad persistente construida sobre memoria curada y recuperación por significado (véase el estudio Engram Project); el gemelo digital lleva esa arquitectura de la curación manual a la destilación automática del histórico de una persona real.

02Fundamento neurocientífico y cognitivo

La arquitectura no imita al cerebro por analogía decorativa; toma prestados principios de organización de la memoria porque resuelven exactamente los fallos del enfoque por volcado. La psicología de la memoria distingue desde Tulving entre memoria episódica —eventos situados en tiempo y lugar— y memoria semántica —conocimiento general desligado de su origen [1]—. Un gemelo necesita ambas: episodios recuperables (qué pasó, con quién, cuándo) y conocimiento consolidado (quién es esta persona, en general). La neurociencia de sistemas describe cómo se articulan: la teoría de los sistemas de aprendizaje complementarios sostiene que el hipocampo codifica rápidamente episodios específicos mientras la neocorteza integra ese conocimiento con lentitud, por consolidación, en representaciones estables y generalizables [3, 4]. La traza física de un recuerdo —el engrama— es hoy un objeto de estudio empírico, no una metáfora [2]; el nombre del programa hermano de este laboratorio no es casual.

El motor espeja esa división de trabajo. El corpus indexado y el grafo temporal cumplen el papel del sistema episódico-relacional de recuperación rápida; la síntesis de identidad y, sobre todo, el adaptador de estilo entrenado en los pesos cumplen el papel de la consolidación semántica: el idiolecto deja de recuperarse como ejemplo y pasa a ser una disposición del modelo, tal como una destreza motora deja de depender del hipocampo tras consolidarse en la corteza.

Sobre la memoria se asienta la identidad. El modelo del self-memory system describe el yo como una construcción sostenida por la memoria autobiográfica, jerárquicamente organizada por períodos y temas vitales [5]; la psicología narrativa añade que la identidad adulta es, en buena medida, la historia internalizada que la persona cuenta sobre sí misma [6]. De ahí que el objetivo de la destilación no sea un volcado de mensajes sino artefactos estructurados —biografía, vínculos, valores, voz— que reconstruyen esa historia. Dos anclas psicométricas cierran el marco: el rasgo estable se modela con el Modelo de los Cinco Factores (OCEAN), preferido por su validez sobre tipologías sin base empírica [7], apoyándose en que el uso del lenguaje es un marcador individual medible de la psicología de una persona [8]; y el sistema de valores con la teoría de valores básicos de Schwartz [9, 10].

03Trabajo relacionado

El campo se ordena en tres frentes. En arquitecturas de gemelo/persona, Second Me formaliza un patrón por capas —datos crudos, resúmenes y pesos adaptados (PEFT)— que coincide casi punto por punto con el de este motor y valida el diseño en la práctica [18]. En memoria de agentes, los agentes generativos introducen un flujo de memoria con reflexión asíncrona que consolida experiencias recientes en creencias de mayor nivel [16], y MemGPT trata la ventana de contexto como una jerarquía de memoria gestionada [17]; ambos patrones reaparecen aquí como el hilo de consolidación en segundo plano.

En modelado del estilo y la persona, la estilometría y la verificación de autoría aportan medidas objetivas de “quién escribió esto” [11], que este trabajo reutiliza como métrica de fidelidad. Las piezas de aprendizaje automático son estándar y deliberadamente reproducibles: embeddings de oración multilingües [12, 13], modelado de temas neuronal con BERTopic [14] y adaptación de bajo rango (LoRA) para fijar el estilo sin reentrenar el modelo completo [15]. La contribución no está en inventar componentes sino en articularlos bajo dos restricciones que el mercado no combina: soberanía del dato y fidelidad medida.

04Métodos: el motor de diez etapas

El pipeline: ⓪ privacidad configurable por modo → ① parse y normalización con fusión de turnos → ①·⁵ limpieza de artefactos (separar la prosa del sujeto de lo que citó o pegó) → ② embeddings locales multilingües [12, 13] → ③ descubrimiento de temas con BERTopic y reducción asistida por LLM [14] → ④ clasificación multi-faceta (tema · vínculo · emoción · período) → ⑤ grafo temporal de conocimiento → ⑥ perfil psicométrico OCEAN [7, 8] → ⑦ voz mediante adaptador LoRA local [15] → ⑧ síntesis map-reduce → ⑨ evaluación de fidelidad. Cada etapa tiene una interfaz definida y se prueba de forma aislada.

Dos decisiones de diseño gobiernan la calidad. Primera: la reducción de temas asistida por LLM sobre BERTopic evita la fragmentación en cientos de micro-temas que produce el clustering de densidad sobre mensajes cortos y ruidosos —un fallo observado en la corrida N1—. Segunda: la fusión de turnos (colapsar mensajes consecutivos del mismo emisor en una unidad de diálogo) y la limpieza de artefactos son prerrequisitos para no contaminar el modelo de estilo con texto que la persona no redactó, sino que copió.

05Memoria: grafo temporal frente a RAG plano

La recuperación vectorial devuelve anécdotas por parecido pero carece de estructura relacional y temporal: mezcla hitos cronológicos y confunde contextos de personas distintas. La capa de hechos es, por tanto, un grafo dirigido —nodos: personas, organizaciones, lugares, proyectos, eventos, períodos; aristas: relaciones explícitas fechadas— que habilita razonamiento multi-salto en el tiempo. El runtime combina ambas en recuperación híbrida: el vector aporta el hecho o la anécdota, el grafo aporta la relación y su evolución. Es la diferencia entre poder recitar un mensaje de 2020 y poder responder “cómo cambió mi relación con una persona entre 2019 y 2024”, que el almacén plano no resuelve.

Esta separación es el análogo funcional de los sistemas complementarios [3]: recuperación episódica rápida sobre el índice y el grafo, y un proceso de consolidación en segundo plano —heredado del patrón de reflexión de los agentes generativos [16]— que integra conversaciones recientes en hechos y relaciones nuevas sin saturar la memoria de trabajo.

06La voz: idiolecto en los pesos

Adjuntar ejemplos del estilo de una persona al prompt de un modelo grande produce imitación superficial y, a menudo, regurgitación verbatim del corpus. Entrenar un adaptador de bajo rango (LoRA) sobre la prosa propia depurada graba el idiolecto en los pesos: muletillas, ritmo, aperturas y cierres, alternancia de registro por interlocutor. El estilo deja de ser un ejemplo recuperado y pasa a ser una disposición del modelo —el paso de lo episódico a lo semántico descrito arriba—, y constituye el primer ladrillo de un modelo verdaderamente propio, independiente de cualquier proveedor. Para el rasgo se deriva un vector OCEAN continuo desde marcadores lingüísticos [7, 8], en lugar de tipologías categóricas sin validez psicométrica estable.

07Evaluación de fidelidad

El diferenciador metodológico frente a los productos existentes —todos cajas negras— es que la fidelidad se mide, no se declara. La capa ⑨ define cuatro familias de métricas, todas locales y abiertas. Estilo: verificación de autoría por n-gramas de carácter con similitud del coseno (procedimiento de las tareas PAN) [11] más perplejidad cruzada del adaptador sobre mensajes reales retenidos (held-out). Consistencia: C-score por inferencia de lenguaje natural (entailment menos contradicción contra el perfil biográfico) y P-score por distancia a las sentencias de personalidad del corpus, al estilo de PersoBench. Conducta: decisiones en escenarios simulados calificadas por un evaluador calibrado, al modo de PersonaGym. Valores: predicción del perfil de valores del gemelo desde conversación libre y su correlación con el del sujeto real medida con el cuestionario Schwartz PVQ-RR [10].

Nada de esto se afirma como resultado ya obtenido: la etapa ⑨ está especificada y es trabajo pendiente. El compromiso metodológico —y la razón por la que el nombre correcto es “fidelidad medida” y no “fidelidad alta”— es publicar el número, con su intervalo, cuando la suite corra sobre el corpus completo.

08Resultados preliminares

El motor no es teoría: la versión liviana corrió de extremo a extremo sobre datos reales. El parser normalizó 35.023 mensajes de correspondencia de 2019 a 2026 sin ajuste manual, manejando las trampas del formato local (el espacio fino U+202F, multilínea, adjuntos, mensajes de sistema), de los cuales 12.049 son del sujeto.

El descubrimiento de temas sobre 4.749 mensajes sustantivos del sujeto (k = 12) hizo emerger ejes coherentes sin imponer categorías —coordinar/verse, proveer, el día a día, cuidado y afecto, conflicto, reflexión, familia—, jerarquizando dimensiones que una lectura por muestreo subestimaba. La síntesis de voz v0 capturó el dialecto (voseo con alternancia a “tú” en registro afectivo), aperturas y cierres canónicos, y el desplazamiento de registro según el interlocutor. Por restricción de la máquina de trabajo (el control de aplicaciones bloquea numpy/sklearn nativos), esta corrida usó una implementación en Python puro (TF-IDF + k-means esférico); las etapas pesadas (embeddings, BERTopic, LoRA) se ejecutan en un entorno Linux dedicado.

09Ética, privacidad y cumplimiento

El corpus crudo —correspondencia íntima de años— nunca entra a control de versiones ni a la nube durante el análisis; embeddings, clustering y entrenamiento del adaptador son locales. La política, sin embargo, no es única, y esa distinción es de diseño. En modo personal (el gemelo del propio dueño) privacidad significa soberanía: el histórico se conserva completo —los datos son la persona; borrarlos es perder— pero cifrado at-rest, con la garantía técnica de que el crudo no se filtra a terceros.

En modo producto (un servicio para terceros) privacidad significa minimización: la exención doméstica desaparece, la empresa pasa a ser responsable del tratamiento, y los mensajes de contactos que nunca consintieron se purgan y anonimizan en origen, antes de todo análisis —una respuesta técnica, no contractual—, con consentimiento explícito, derecho al olvido y evaluación de impacto (DPIA). El mismo motor sirve ambas políticas; cambia qué se conserva y dónde está la frontera de anonimización.

010Limitaciones

Las afirmaciones de este documento deben leerse con su alcance. La suite de evaluación (⑨) aún no ha corrido: la fidelidad está diseñada para medirse, no medida todavía. La extracción puede sesgar el retrato hacia el lente de las fuentes más densas; se compensa con un núcleo curado de primera mano y se cuantificará con ⑨. Un gemelo de estilo y biografía reproduce cómo se expresa y qué recuerda una persona, no su experiencia consciente: la fidelidad conductual no es identidad personal, y el marco neurocientífico es un principio de diseño, no una afirmación de equivalencia con el cerebro. Por último, los resultados preliminares provienen de un subconjunto del corpus y de una implementación liviana; las cifras se revisarán al correr las etapas pesadas sobre el histórico completo.

011Estado actual

  • El motor v2 está especificado en diez etapas; el prototipo (nico-digital) se validó de extremo a extremo en su versión liviana: parse, muestreo estratificado, descubrimiento de temas (TF-IDF + k-means esférico en Python puro) y síntesis de voz v0.

  • El cifrado at-rest está operativo para el modo personal (ChaCha20-Poly1305 AEAD, streaming por chunks de 4 MiB): autotest 11/11 y corpus real cifrado con lectura transparente desde el código.

  • El aprendizaje automático pesado (embeddings multilingües, BERTopic, LoRA) se ejecuta en un entorno Docker/Linux dedicado (Aria Host), fuera de la máquina de trabajo.

  • El diseño fue contrastado contra el estado del arte; el cruce confirmó el núcleo (local-first, destilar-no-volcar, arquitectura por capas al estilo de Second Me [18]) e incorporó las dos capas que separan un experimento de un producto: privacidad en dos modos y evaluación de fidelidad.

012Trabajo futuro

  1. 1.

    Etapas pesadas de extremo a extremo en Aria Host: embeddings multilingües, BERTopic con reducción temática por LLM y clasificación entrenada.

  2. 2.

    Grafo temporal consultable (personas · eventos · relaciones · tiempo) y runtime de recuperación híbrida vector + grafo con consolidación asíncrona.

  3. 3.

    Entrenamiento del adaptador LoRA de voz sobre el corpus depurado y medición del salto de fidelidad frente a la voz por prompt.

  4. 4.

    Ejecución de la suite de fidelidad (⑨) y publicación del reporte —el número con su intervalo—: el gemelo pasa de afirmado a certificado.

Bibliografía
  1. [1]Tulving, E. (1972). Episodic and semantic memory. In E. Tulving & W. Donaldson (Eds.), Organization of Memory. Academic Press.
  2. [2]Josselyn, S. A., & Tonegawa, S. (2020). Memory engrams: Recalling the past and imagining the future. Science, 367(6473), eaaw4325.
  3. [3]McClelland, J. L., McNaughton, B. L., & O'Reilly, R. C. (1995). Why there are complementary learning systems in the hippocampus and neocortex. Psychological Review, 102(3), 419–457.
  4. [4]Squire, L. R. (1992). Memory and the hippocampus: A synthesis from findings with rats, monkeys, and humans. Psychological Review, 99(2), 195–231.
  5. [5]Conway, M. A., & Pleydell-Pearce, C. W. (2000). The construction of autobiographical memories in the self-memory system. Psychological Review, 107(2), 261–288.
  6. [6]McAdams, D. P. (2001). The psychology of life stories. Review of General Psychology, 5(2), 100–122.
  7. [7]McCrae, R. R., & Costa, P. T. (2008). The Five-Factor Theory of personality. In Handbook of Personality (3rd ed.). Guilford Press.
  8. [8]Pennebaker, J. W., & King, L. A. (1999). Linguistic styles: Language use as an individual difference. Journal of Personality and Social Psychology, 77(6), 1296–1312.
  9. [9]Schwartz, S. H. (1992). Universals in the content and structure of values. Advances in Experimental Social Psychology, 25, 1–65.
  10. [10]Schwartz, S. H., et al. (2012). Refining the theory of basic individual values. Journal of Personality and Social Psychology, 103(4), 663–688.
  11. [11]Stamatatos, E. (2009). A survey of modern authorship attribution methods. Journal of the American Society for Information Science and Technology, 60(3), 538–556.
  12. [12]Reimers, N., & Gurevych, I. (2019). Sentence-BERT: Sentence embeddings using Siamese BERT-networks. EMNLP.
  13. [13]Wang, L., et al. (2024). Multilingual E5 text embeddings: A technical report.
  14. [14]Grootendorst, M. (2022). BERTopic: Neural topic modeling with a class-based TF-IDF procedure.
  15. [15]Hu, E. J., et al. (2021). LoRA: Low-rank adaptation of large language models.
  16. [16]Park, J. S., et al. (2023). Generative agents: Interactive simulacra of human behavior. UIST.
  17. [17]Packer, C., et al. (2023). MemGPT: Towards LLMs as operating systems.
  18. [18]Mindverse AI (2025). Second Me: scaling personal intelligence with AI-native memory (L0/L1/L2 architecture).