ChatGPT alucina sobre la didáctica específica.
Un modelo de lenguaje genérico suena convincente, incluso cuando su consejo sobre exámenes o calificación no se basa en nada.
Caso · Producto propio · Educación
Un asistente de IA (el motor detrás de TeachFoundry) que fundamenta a los docentes en la evaluación formativa, con citación de fuentes en cada respuesta.

El reto
ChatGPT y chatbots similares dan consejos que suenan convincentes sobre exámenes y calificación. Incluso cuando ese consejo no se basa en nada. Para la didáctica específica eso es un riesgo: un consejo equivocado afecta directamente al alumno.
Los docentes que aplican en serio la evaluación formativa no quieren consejos sueltos. Quieren saber en qué se basa un enfoque. Un marco reconocible, no conjeturas de un modelo de lenguaje.
No existía ningún asistente de conocimiento curado específicamente para la evaluación formativa, con citación de fuentes en cada respuesta. Eso es lo que añade DocentRAG.
Lo que construimos
Este es nuestro propio producto, conocido públicamente como TeachFoundry. DocentRAG es el título de trabajo interno para el motor que hay debajo. Junto con una experta en la materia de evaluación formativa, construimos un asistente de conocimiento RAG: los docentes hacen una pregunta en lenguaje normal y reciben una respuesta desde una base de conocimiento curada, con su fuente adjunta.
El sistema también genera materiales de clase listos para usar (planes de clase, exit tickets, rúbricas, planes de implementación) que se exportan directamente a PDF o Google Docs.
Técnicamente esto se llama generación aumentada por recuperación (RAG): el sistema primero busca en su propia base de conocimiento los fragmentos relevantes y solo después deja que el modelo de lenguaje formule una respuesta, basada en lo que ha encontrado. No en lo que casualmente “sabe”. Así, cada respuesta se puede rastrear hasta un documento concreto del marco de evaluación formativa.
La hoja en la que se apoya la respuesta, en la base de conocimiento.Fuente · Objetivos 2024, §4.2
Sin fuenteFiabilidad baja · sin fuente en la base
Cómo funciona
En lenguaje normal, como se lo preguntarías a un compañero. Sobre evaluación formativa, exámenes o calificación.
No en el internet abierto ni en la memoria del modelo de lenguaje: solo en la base de conocimiento aislada, basada en literatura reconocida.
Resumen, desarrollo, fuentes y preguntas de seguimiento. Más un indicador: fiabilidad alta, media o baja.
Desde un plan de clase hasta un exit ticket, una rúbrica o un plan de implementación, listo para exportar directamente a PDF o Google Docs.
El sistema aporta la fundamentación y el material, el docente conoce la clase y decide qué entra en la lección.
Para quién
Docentes y colegios usan DocentRAG (públicamente: TeachFoundry) para hacer preguntas sobre evaluación formativa y obtener rápidamente material de clase listo para usar, fundamentado en literatura reconocida.
Por qué
Un modelo de lenguaje genérico suena convincente, incluso cuando su consejo sobre exámenes o calificación no se basa en nada.
Consejos sin referencia a un marco pedagógico. No puedes comprobar de dónde vienen, ni si coinciden con lo que ya se sabe sobre la evaluación formativa.
Un chatbot devuelve un bloque de texto, no un plan de clase, una rúbrica o un exit ticket que puedas usar mañana en el aula.
La misma pregunta sobre evaluación formativa se le hace a un chatbot por separado en cien sitios distintos, sin una base de conocimiento curada y compartida detrás.
La diferencia
Un chatbot de propósito general suena a menudo convincente en cuestiones educativas, incluso cuando la respuesta es una alucinación. El modelo rellena un vacío en su conocimiento con algo que suena plausible sobre didáctica específica, sin que se note.
DocentRAG funciona al revés: la respuesta solo llega después de que el sistema haya encontrado algo en la base de conocimiento curada. Sin resultado (o con una puntuación de fiabilidad baja) y eso se refleja de inmediato en la respuesta.
Un chatbot normal suena convincente. DocentRAG muestra de dónde viene la respuesta, y cuán seguro está de ella.
Cómo lo abordamos
Unos 196 documentos por instancia de idioma, elaborados con una experta en la materia de evaluación formativa. Basados en literatura reconocida, incluido el marco Toetsrevolutie (René Kneyber) y el modelo HOP.
Ninguna respuesta sin una fuente localizable. Estructura: resumen → desarrollo → fuentes → preguntas de seguimiento.
Cada respuesta muestra fiabilidad alta, media o baja. Las preguntas fuera del dominio de conocimiento se rechazan en lugar de que el sistema se invente algo.
Instancias separadas y en producción en neerlandés, inglés y para Hong Kong. Cada una con su propio idioma y su propia base de conocimiento. La inglesa sale al mercado bajo su propia marca, sobre el mismo motor.
El sistema aporta la fundamentación y el material. El docente valora y decide qué entra en el aula.
Qué significa para los docentes
Sin rebuscar en libros o artículos sueltos: la pregunta en lenguaje normal, la respuesta con su fuente adjunta.
Planes de clase, exit tickets, rúbricas y planes de implementación. Listos para exportar, en vez de redactarlos tú mismo.
Cada respuesta está enraizada en un marco coherente de evaluación formativa, no en consejos sueltos de un chatbot genérico.
El sistema aporta, el docente valora qué encaja con la clase. Eso sigue siendo trabajo humano.
En cifras
por instancia de idioma
Documentos en la base de conocimiento curada
en producción
Instancias de idioma: neerlandés, inglés, Hong Kong
tipos
Tipos de material que el sistema genera listos para usar
¿Prefieres mirar primero por tu cuenta? El escáner de proveedores y el Chequeo de cadena son gratuitos y no requieren una conversación.
El escáner de proveedoresEn una conversación de media hora vemos si vuestro dominio de conocimiento se presta a lo mismo.
Reserva una llamadaTres mundos distintos, un mismo principio: la IA hace el trabajo, la persona comprueba y aprueba.
Lee el caso