Cómo se hacen estas guías · el método
El método · de la pregunta a la página publicada
Esto no es una declaración de intenciones
Es la cocina. Las otras páginas de este sitio dicen qué se sabe sobre el hueso, el músculo, el corazón o la sexualidad; esta cuenta cómo se llega hasta ahí, con los números delante y sin adornos. Está escrita por si quieres comprobar algo, por si quieres repetir una búsqueda y ver si te sale lo mismo —y porque el sistema que hay detrás se ha ido construyendo a base de equivocarse, y los errores están escritos aquí igual que los aciertos—.
La regla de la casa es una sola: ninguna cifra se escribe de memoria. Todo lo que aparece en estas páginas tiene detrás un estudio localizable por su DOI, y el DOI se resuelve contra la base de datos correspondiente antes de publicarse. Cuando algo no se puede sostener, se escribe que no se puede sostener; cuando un estudio no cubre a una parte de la población, se dice a quién deja fuera.
La cadena completa, en nueve pasos
1 · Un tema
Se elige el asunto (hueso, músculo, corazón, sexualidad) y —esto es lo primero que se decide— a quién va dirigido: población española de 40 a 90 años. Esa frase manda después en las dosis, en las prevalencias y en el tono.
2 · Una idea de cómo tratarlo
Cómo se va a organizar: qué pregunta responde cada bloque, qué se declara hueco y qué se calla. Se decide antes de buscar, no se improvisa con lo que vaya saliendo.
3 · Búsquedas exhaustivas
Consultas diseñadas por subtema, con la sintaxis de cada base, lanzadas hasta agotar lo que devuelven. No se cogen 25 de 5.000: se baja todo y se filtra después.
4 · Cosecha
Descarga con ritmo controlado, con reanudación y con un fichero por fuente. Hoy: 14 bases, 575.111 estudios únicos tras quitar duplicados.
5 · Cribado por calidad
Cada estudio se puntúa de 0 a 100 con una rúbrica de seis componentes —la financiación dentro— y se ordena por bandas. La nota va impresa en cada fila de las tablas.
6 · Base de consulta rápida
Todo eso se vuelca en una base local con índice de texto completo: una pregunta sobre 508.000 estudios se responde en 0,15 segundos, con SQL incluido, sin volver a llamar a ninguna API.
7 · Conclusiones y páginas
Cifra llamativa fuera y detalle dentro, figuras, simuladores, recomendaciones y programas. Y el reparto honesto: lo que mejora, lo que se ha medido y no mejora y lo que nadie ha probado.
8 · Los ejes que cruzan
Género, sesgo de las escalas, diversidad, quién paga la investigación, geografía y clase social. Y los cruces entre temas que no parecían unidos.
9 · Nuestros datos contra lo que se publica
Comparar lo que sale de aquí con lo que cuentan los medios sobre lo mismo. Es el paso que está diseñado y pendiente: se cuenta abajo, con lo que falta dicho.
Los pasos 1 y 2: el tema y la idea
Un tema no se elige por gusto: se elige porque hay una pregunta que la gente hace en la consulta y no encuentra contestada en ninguna parte con las fuentes a la vista. Y la segunda decisión —cómo tratarlo— es la que hace que la página sirva o no sirva:
- Se organiza por lo que el lector puede hacer, no por taxonomía: qué funciona, con qué dosis, qué no funciona aunque se venda, cuándo hay que ir al médico. Una guía de sexualidad no enseña qué es el sexo: dice qué hacer para llegar bien.
- Se decide de antemano qué es un hueco. «No lo hemos encontrado» no es lo mismo que «no existe». Lo primero es un límite de la búsqueda y se declara como tal; lo segundo se puede afirmar cuando hay un recuento detrás.
- Se reparte en bloques que se publican de uno en uno, cada uno verificado antes de empezar el siguiente. La guía de sexualidad, por ejemplo, se planificó en doce bloques y hoy tiene página propia su estrategia de búsqueda, publicada y repetible.
El paso 3: las búsquedas, y los cuatro fallos que costaron tres rondas
La crítica que cambió el sistema fue justa: «que te salgan 5.000 estudios y coger 25 me parece súper aleatorio». Tenía razón: eso es un muestreo por relevancia disfrazado de búsqueda, y significa que lo que no aparece en los 25 primeros resultados nunca se estudia. El sistema de ahora descarga la lista entera y filtra después, que es lo único que permite decir «esto no está».
- La sintaxis no se hereda de una base a otra. En Europe PMC el campo es
TITLE:y busca en texto completo; en PubMed es[ti]/[tiab]y admite tres términos como máximo —a partir del cuarto el recuento cae a cero, medido—; en OpenAlex no hay sintaxis de campo. La misma cadena copiada de una a otra devuelve cosas distintas y a veces cero. - Un cero se revisa antes de creérselo, siempre. La mayoría de los «no hay estudios» son consultas
mal escritas: la etiqueta de campo de PubMed no se reparte entre términos encadenados, y un
ORsuelto pierde el alcance del campo en la segunda mitad de la expresión. - Las listas de consultas se prueban a sí mismas: cada una se contrasta contra otra base antes de darla por buena, y las que devuelven recuentos absurdos (miles de millones de registros, típico de una traducción mal hecha) se corrigen y se vuelven a medir. Un barrido real pasó de 13,5 millones de resultados declarados a 716.840 al arreglar la traducción: el océano era un espejo.
- El ritmo importa y cada API tiene el suyo: PubMed aguanta tres peticiones por segundo; Europe PMC devuelve error 503 con ocho peticiones simultáneas y va bien con cuatro hilos y medio segundo de pausa; OpenAlex cobra por búsqueda de texto y sin clave se queda en unas cien al día. Un barrido lanzado a lo bruto no falla: falla en silencio, y devuelve cero.
Hoy el sistema tiene 312 consultas distintas registradas, cada una con sus tres formatos, y esa lista vive dentro de la propia base de datos, así que se puede auditar qué consulta trajo cada estudio.
El paso 4: la cosecha, base por base
La idea de «buscar en el mundo entero y no solo en lo anglosajón» es la que abre el abanico: revistas nacionales en abierto, repositorios, tesis, libros y preprints. Lo que hay hoy dentro, con el recuento de cada fuente:
Las 14 fuentes de la cosecha, con lo que aporta cada una (30 de septiembre de 2026)
- PubMed — 154.966 estudios. MEDLINE: título, resumen y descriptores MeSH. La referencia obligada en biomedicina.
- Europe PMC — 70.193. Índice biomédico que además busca en texto completo y trae preprints, tesis y patentes.
- DOAJ — 127.319. Revistas de acceso abierto de todo el mundo, y con el país de la revista, que es lo que permite medir el hueco geográfico.
- J-STAGE — 67.879. Revistas científicas japonesas. No da resumen: su precisión queda «no evaluable», y se dice.
- OpenAlex — 45.440. Todo el registro académico, con citas y estado de acceso abierto.
- HAL — 34.912. El repositorio nacional francés, la mejor cosechada de las no anglosajonas.
- OpenAIRE — 53.940. Agregador europeo que incluye Asia, África y Latinoamérica.
- IRIS (OMS) — 30.852, CyberLeninka (Rusia) — 18.085, OSF Preprints — 8.616, OAPEN y DOAB (libros en abierto) — 8.962 y 3.102, CORE — 1.745.
Y lo que no está, que también es un dato: Scopus, Web of Science, Embase, PsycINFO y CINAHL son de pago y no entran. Eso deja un hueco real en lo psicosocial y de enfermería, y lo que dependa de esas bases se marca como no verificado en vez de rellenarse con lo que suene bien.
Tras quitar duplicados entre bases y consultas —el mismo artículo puede estar en cuatro sitios—, la cosecha son 575.111 estudios únicos, de los que 451.851 traen resumen (el resumen es donde están el tamaño de efecto, el intervalo y el valor p) y 21.601 están clasificados como ensayo clínico o aleatorizado. 10 están marcados como retractados, y eso se mira: un estudio retirado citado con buena fe es un error que se puede evitar.
Y un aviso que vale para todas las cifras de esta página: la recolección sigue viva, así que cada número lleva fecha. Los de aquí son del 30 de septiembre de 2026, y el sistema se rehace entero en menos de cinco minutos cuando haga falta.
Ningún volcado es limpio, y el nuestro lo dice por escrito. Al cruzar lo que traen las fuentes con
lo que dice Europe PMC del mismo DOI aparecieron 12.316 registros con los metadatos cruzados —el
DOI de un artículo con el título y la revista de otro, 2,1 % de la base y casi todos del volcado de
PubMed—. La base los marca uno a uno (fuentes_discrepan) y, cuando uno de esos estudios sostiene una
cifra, su título se resuelve por API antes de citarlo. Se cuenta porque importa: cualquier automatismo
que se fíe del título a pelo se equivocaría en dos de cada cien registros.
El paso 5: la calidad, puntuada y no supuesta
Que un estudio sea «un metaanálisis» no dice si es bueno. La rúbrica puntúa seis componentes hasta 100 puntos: diseño (hasta 40), precisión y tamaño (15), financiación y conflicto de interés (15), solidez declarada según GRADE o AMSTAR-2, replicación y vigencia. De ahí salen cinco bandas, y la regla que lo hace útil es esta:
- Ninguna fila de las tablas se apoya en una fuente de banda baja sin decirlo en la propia fila. Si aparece una así, se busca la mejor disponible sobre ese punto; si no existe otra, la fila baja a «no demostrado».
- «No declara financiación» se escribe tal cual, no se presume independencia. Y financiar el estudio el fabricante del producto que se evalúa hunde la puntuación aunque el diseño sea el mejor posible: ese estudio no se tira, se publica con el nombre de quien paga escrito en su fila.
- No se mezclan dos escalas: la nota de una ficha leída a mano y la que sale de puntuar una cosecha entera en masa no son comparables. La de la cosecha sirve para elegir qué leer; la que se publica se recalcula siempre con la ficha delante.
Hoy hay 461.372 estudios con nota de evidencia dentro de la base. En las tablas publicadas, cada fila lleva su nota impresa, y eso es lo que permite ordenar por fuerza y ver de un golpe dónde está el dato flojo: en una pasada real, 95 de 261 filas quedaron por debajo del umbral y esa lista, precisamente, es la lista de trabajo.
El paso 6: la base de consulta rápida
Aquí está la novedad que este documento estrena. La cosecha son 2,6 GB de ficheros de texto con dos formatos distintos, y buscar ahí a mano cuesta minutos por pregunta. Así que todo se vuelca en una base local con índice de texto completo:
- Qué es: un fichero SQLite con dos tablas —
estudiosyconsultas— más un índice de texto completo (FTS5) sobre título, resumen, autores y revista. 2,1 GB. Se construye entero en menos de cuatro minutos y se rehace sola cada madrugada (un temporizador la reconstruye a las 06:30 y avisa si algún número publicado ha dejado de cuadrar): es un derivado, no el original. - Para qué: una pregunta que antes era una URL larga contra una API externa (o un
grepsobre 2,6 GB) ahora es una consulta local. Un recuento sobre los 575.111 estudios tarda 0,15 segundos. - Qué se puede preguntar: texto libre con lógica (
resistance training AND falls, comillas para frases,*para prefijos y no hace falta escribir los acentos), filtros por año, por tipo —solo ensayos, solo revisiones—, por nota mínima, por banda, por base de origen, por tema y por afiliación. Y, para lo que no cubren los filtros, SQL directo sobre la tabla, que es donde salen las correlaciones: cuántos ensayos por año, qué proporción de estudios por banda y década, qué temas crecen y cuáles se abandonaron. - Qué significa exactamente «buscar»: el texto libre recorre título, resumen, autores y revista, así
que devuelve ruido a propósito —el objetivo es no perder nada— y el filtrado viene después; con
--en-titulola búsqueda se limita al título cuando lo que hace falta es precisión. Las marcas «ensayo» y «revisión» salen del tipo de publicación que declara cada base: sirven para acotar, no para certificar, y por eso la nota de calidad se recalcula siempre con la ficha delante. - Lo que la base NO resuelve, dicho claro: el volcado de Europe PMC se guardó sin afiliaciones —solo 468 de 76.107 registros las traen—, así que la pregunta «¿esto se hizo en España?» no se puede contestar con lo que hay dentro. Para eso hay dos piezas: una columna de señal débil (España en el texto o en el país de la revista: 9.658 estudios la llevan) y un enriquecedor que pregunta la afiliación real estudio por estudio a Europe PMC sobre la lista corta que haya salido de la base. Es la diferencia entre acotar y afirmar.
Ejemplos reales, tal como se escriben (los tres se pueden copiar y pegar):
# 1 · Los ensayos sobre disfunción eréctil desde 2000, con su nota de evidencia
python3 _busquedas/consulta.py "erectile dysfunction" --ensayos --desde 2000 --limite 20
# 2 · ¿Cuántos estudios de fuerza y caídas hay por año, y solo los que puntúan alto?
python3 _busquedas/consulta.py "resistance training AND falls" --nota-min 60 --cuenta anio
# 3 · Correlación libre: el reparto de notas por banda en toda la base
python3 _busquedas/consulta.py --sql "SELECT banda, count(*) FROM estudios WHERE banda IS NOT NULL GROUP BY banda ORDER BY count(*) DESC"
# 4 · La ficha entera de un estudio, con su resumen completo
python3 _busquedas/consulta.py --ficha doi:10.1007/s00345-020-03373-y
# 5 · Y la versión precisa de la primera: la frase, solo en el título
python3 _busquedas/consulta.py "erectile dysfunction" --en-titulo --ensayos --limite 20
El paso 7: de la base a la página
Aquí es donde el trabajo científico se convierte en algo que se lee. Las reglas que se aplican a todas las guías:
- Cifra clave fuera, detalle dentro. Los números que ordenan una idea se quedan a la vista; lo demás —tablas por estudio, cifras secundarias, matices de método— va en un desplegable. No se pierde ni una cifra: cambia dónde se lee.
- «Lo que no está demostrado» se escribe en tres categorías, no en una: demostrado que no funciona (hay ensayos y dicen que no), no demostrado (los estudios existen pero son tan pequeños que no concluyen nada) y en disputa (hay estudios serios que no coinciden entre sí). Un «no hay evidencia» genérico no vale: separar esas tres cosas es lo que protege al lector de lo que le venden «estudiado científicamente».
- Los simuladores no son un adorno con dos cuentas. Cada cifra lleva dentro su revista, su año, su población y su DOI; llevan una curva de referencia con puntos reales —o dicen que no hay percentiles publicados en vez de interpolar una que parezca más científica—; y cuando la evidencia no cubre a quien pregunta, se lo dicen en su cara en vez de darle el número del grupo mayoritario.
- La página se mide, no se estima: cuánto se lee sin abrir un desplegable, cuántas cifras grandes hay fuera y si el diseño desborda en un móvil de 390 píxeles. Los números que la página afirma sobre sí misma —cuántas filas, cuántos estudios— se cuentan del fichero, nunca del recuerdo, porque un recuento equivocado lo lee cualquiera que abra la página.
El paso 8: los ejes que cruzan todo
Estos ejes no son un capítulo aparte, van dentro de cada bloque y con datos:
- Género: qué se ha estudiado en cuerpos de mujer y qué no, el sesgo de las escalas de medida —una escala que define las relaciones como penetración deja fuera todo lo demás y lo que no se mide no se estudia después—, quién paga la investigación y a quién le fue peor por una decisión tomada sin datos suyos. Como adorno retórico no vale.
- Diversidad: edad, origen, discapacidad, orientación e identidad. Cuando un estudio solo tiene hombres blancos de países ricos, se dice; y cuando un grupo no está estudiado, eso también es un resultado.
- Geografía y dinero: el país de la revista está en la base precisamente para poder medir el hueco geográfico, y los estudios financiados por quien vende el producto se identifican uno a uno.
- Cruces entre temas que no parecían unidos: el más fuerte de todo el sitio es que la disfunción eréctil avisa de enfermedad cardiovascular años antes que el dolor de pecho, así que la guía de sexualidad y la del corazón comparten un dato que ninguna de las dos puede contar sola. Otros cruces publicados: la menopausia que seca la vagina es la misma que adelgaza el hueso, y el suelo pélvico es el músculo que nadie entrena. Los cruces se buscan por el dato clínico, no por cortesía entre páginas.
El paso 9: nuestros datos contra lo que se publica
Este paso está diseñado y pendiente, y se cuenta como lo que es. La idea: cuando un tema está tratado en una guía, comparar lo que dicen las noticias con lo que sostienen los estudios que hay en la base —qué se exagera, qué se omite, qué titular no tiene ningún estudio detrás o tiene uno de 40 personas donde la diferencia son dos—. Lo que ya se puede hacer hoy, con la base del paso 6, es la mitad del trabajo: localizar el estudio del que habla una noticia en tres segundos y ver su nota de evidencia antes de creerse nada. Lo que falta es la pasada automática sobre titulares.
Hasta entonces, la regla que sí se aplica ya: una afirmación que circula mucho y no tiene estudio detrás se escribe en la página como «se repite mucho y no es verdad», con la búsqueda que lo comprueba al lado.
Y una comprobación que puede hacer cualquiera, en treinta segundos
- Copia el DOI que aparece junto a la cifra (o el número de PMID, si lo hay).
- Pégalo en
doi.orgy aparecerá el artículo original: comprueba que el título coincide con lo que la página dice y que la población del estudio es la que la página dice. - Si no coincide, la página está mal y hay que corregirla. Esto vale también —y sobre todo— para las afirmaciones que suenan más seguras.
Ese control no es decorativo: en este proyecto ha parado errores reales, como citar de memoria el número de un ensayo clásico y que ese número perteneciera a otro artículo. Desde entonces, ningún identificador entra en una página sin resolverse por API; y una afirmación del tipo «no hay ningún estudio que…» se verifica con una consulta de campo que se pregunta exactamente lo que la afirmación niega, leyendo después los títulos que devuelve.
Lo que este método no hace
- No lee el texto completo de todo. Para la mayoría de los estudios publicados se trabaja con el resumen, que en biomedicina es donde están el tamaño de efecto, el intervalo de confianza y el valor p —pero no el detalle de cómo se hizo—. Cuando un dato solo se puede comprobar en el texto completo cerrado, se dice.
- No es una revisión sistemática con protocolo registrado. Nadie firma una lista de criterios antes de empezar, y por eso el método se publica en esta página: para que se pueda auditar a posteriori.
- No sustituye a un profesional. Ninguna de estas páginas sabe nada de un caso concreto.
- No promete que el hueco del día de hoy sea el hueco definitivo. Un hueco es un resultado del sistema que se ha construido; por eso cada ausencia que se publica va con la búsqueda que la sostiene y con la fecha en que se midió.
El estado, con fecha
Los números de esta página, medidos el 30 de septiembre de 2026
- Cosecha: 14 fuentes, 2,6 GB de volcados, 575.111 estudios únicos tras deduplicar (1.111.851 registros en bruto antes de quitar duplicados).
- 451.851 con resumen · 21.601 ensayos clínicos o aleatorizados · 8.902 revisiones sistemáticas o metaanálisis · 10 retractados.
- 461.372 con nota de calidad puesta por la rúbrica de 0 a 100. El reparto por bandas: 50 en A, 4.434 en B, 25.281 en C, 73.930 en D y 357.677 en E. La E es la más poblada porque la rúbrica es dura y porque hay registros que no se pueden juzgar con lo que traen —un tercio no declara ni el tipo de publicación—: la nota sirve para elegir qué leer, no para descartar de un vistazo. De los que llegan a A, 43 de 50 son ensayos o revisiones.
- 312 consultas registradas, cada una con su sintaxis en las tres bases y el recuento que devolvió.
- Base de consulta: 2,1 GB, construida en menos de cuatro minutos, consultas en 0,15 segundos.
- Páginas publicadas: hueso, músculo, corazón, sexualidad y el curso de biología del comportamiento humano, más sus tablas comparativas y sus simuladores.
Las herramientas del sistema, con su nombre
_busquedas/consultas-*.json— las consultas, por tema y con la sintaxis de cada base._busquedas/cosecha-*.py— un cosechador por fuente, con ritmo, reanudación y fichero propio._busquedas/puntua-cosecha.pyy_busquedas/RUBRICA-EVIDENCIA.md— la puntuación y la rúbrica._busquedas/monta-base.py— construye la base de consulta rápida desde los volcados._busquedas/consulta.py— la puerta de entrada a la base: texto, filtros y SQL._busquedas/rehacer-base.sh— reconstruye la base y comprueba los números publicados; lo lanza un temporizador cada madrugada a las 06:30._busquedas/enriquece-afiliaciones.py— trae la afiliación real de una lista corta de estudios.scripts/comprueba-numeros-metodo.py— comprueba que cada número que esta página afirma de sí misma cuadra con la base: los extrae del texto y los compara, así que no se queda viejo._busquedas/verifica-campos.pyyscripts/verifica-identificadores.py— las dos comprobaciones que se hacen antes de publicar: que un DOI que resuelve es el estudio que la página dice, y que una afirmación negativa se sostiene con la consulta de campo adecuada.
El sistema se sigue ampliando: la lista de fuentes candidatas se prueba una a una —29 probadas— y las que quedan fuera se apuntan con el motivo, para no dar por «cerrada» una base que simplemente estaba mal llamada.