Traducción provisional. Requiere revisión de un profesional de la localización y de un indexador profesional hispanohablante antes de publicarse o indexarse.
Investigación de IndexPDF · Metodología
Evaluación de índices temáticos: un método fundamentado en la fuente y ciego al candidato
Una metodología reproducible y fundamentada en la fuente para evaluar índices temáticos terminados mediante auditorías completas de localizadores, omisiones, estructura y navegación.
- Autor
- John Camden
- Afiliación
- Publication Intelligence, LLC
- Publicado
- Versión
- 1.0
Resumen
Este artículo presenta una metodología para evaluar índices temáticos terminados; no describe el proceso separado por el cual IndexPDF o cualquier otro sistema genera un índice. Los estudios convencionales de indexación automática miden comúnmente el acuerdo con un índice humano publicado. Esa comparación es reproducible pero incompleta: puede penalizar el vocabulario alternativo válido, heredar omisiones del índice de referencia y dejar sin verificar títulos y localizadores sólo para candidatos. El método presentado aquí en cambio corrige la edición fuente, alcance, lector, mapa de página, unidades de auditoría, política y puertas de fracaso antes de juicio del candidato; construye y revisa un punto de referencia ciego-candidato de cada página en el alcance de la fuente suministrada en un contexto separado de candidato-invisto; preserva al candidato sin reparación editorial; y realiza tres auditorías complementarias: verificación de localizador candidato-a-fuente, evaluación de acceso faltante de fuente a candidato, y revisión estructural de índice completo. Un perfil de cálculo versionado deriva seis dimensiones de libros contables congelados a través de mapas explícitos, denominadores, pesos de componentes, límites de consecuencia, límites de incertidumbre y redondeo decimal. Para cada localizador, el tratamiento de página y el ajuste de ruta completa se marcan de forma independiente y se combinan con una regla de techos independientes, L_j = min(T_j, F_j); la calificación de visualización correspondiente es 100L_j. El prevuelo cerrado en caso de fallo sólo puede enrutar un conjunto de hash sin resolver con precisión para estrechar la suplementación semántica, que conlleva decisiones de categoría pero no créditos numéricos o puntuaciones. Las calificaciones de los ítems de diagnóstico y las puertas de publicación permanecen separadas de la aritmética de la puntuación. El software determinista posee enrutamiento de páginas, expansión de rango, identificadores, hashes, validación de esquemas, validación de denominadores, puntuación y transiciones de estado; el juicio editorial basado en pruebas posee significado de tema, apoyo sustantivo, fidelidad conceptual y de postura, y calidad de navegación. Una primera aplicación completa al texto corporal de 425 páginas de The Oxford History of the French Revolution de William Doyle auditó 5.338 afirmaciones de localizador atómico y 1.366 sujetos derivados de fuentes, produciendo una puntuación canónica V7 según entregada de 72.5/100 y siete puertas de preparación fallidas. El caso demuestra viabilidad, trazabilidad, migración determinista y análisis de sensibilidad; no establece que los índices generados por la IA superen a los índices profesionales. El resultado es un sistema de medición inspeccionable para probar esa proposición en lugar de suponer que la salida humana o de la máquina es autorizada.
Palabras clave: evaluación de índices temáticos; índices de final de libro; patrón de referencia ciego al candidato; precisión de localizadores; cobertura del patrón de referencia; calidad del índice; recuperación de información; evaluación de IA
El código determinista de evaluación y la habilidad para LLM de IndexPDF son de código abierto y están disponibles públicamente:
1. Alcance y problema de investigación
Un índice temático es tanto un conjunto de afirmaciones de hecho como un sistema de navegación. Cada localizador afirma que una página fuente trata sustancialmente el significado expresado por una ruta completa de encabezado; el índice en su conjunto afirma que los tratamientos importantes pueden encontrarse a través de vocabulario, jerarquía y referencias cruzadas inteligibles. Por lo tanto, la evaluación debe plantear dos preguntas diferentes: ¿Los puntos de acceso son soportados por el índice? y ¿El índice proporciona acceso a lo que un lector previsto probablemente necesite?
Esta distinción separa el índice temático evaluación del índice temático generación. IndexPDF se refiere a la creación de índices de candidatos. La construcción de un benchmark puede comenzar antes de que un candidato sea entregado; el juicio específico del candidato comienza sólo cuando existe un candidato terminado. La misma lógica de evaluación se aplica a los índices profesionales, creados por autores, generados por IA e híbridos, aunque la extracción de origen y candidato puede requerir adaptadores específicos para el formato. Los avisos, modelos y flujos de trabajo de generación de candidatos son excluidos deliberadamente de la construcción de referencia.
El atajo habitual es tratar un índice publicado existente como un estándar de oro y la superposición de cálculo. Este diseño ha permitido la investigación repetible sobre la indexación automática de fondo de libro (Csomai y Mihalcea, 2006, 2008; Wu et al., 2013), pero el acuerdo con un indexador no es idéntico a la corrección. Los indizadores pueden diferir válidamente en vocabulario, granularidad, exhaustividad, jerarquía y suposiciones de audiencia; también pueden compartir o repetir omisiones. Los estudios y revisiones de coherencia entre los índices informan de una amplia variación e identifican la profundidad de la indización, la selección de conceptos, la especificidad de políticas y vocabulario como fuentes de desacuerdo (Hurwitz, 1969; Rolling, 1981; Markey, 1984; Reich y Biever, 1991). Un índice publicado es, por lo tanto, una evidencia valiosa y un candidato útil, pero no es la verdad de la base autovalidante.
La metodología aborda ese problema al hacer de la fuente indexada —no de otro índice— la autoridad principal en materia de pruebas. Su contribución central es un protocolo de extremo a extremo que combina:
- un índice de referencia consolidado derivado de cada página de referencia en contextos de referencia que nunca vean material candidato, antes de que se juzgue a un candidato;
- medición separada de la fiabilidad del acceso declarado y de la falta de acceso;
- verificación atómica de las declaraciones de trayectoria completa de la rúbrica/página;
- evaluación global de la jerarquía, terminología, referencias cruzadas, densidad y navegación por lectores;
- incertidumbre explícita, adjudicación, procedencia y puertas de falla crítica; y
- artefactos dirigidos a contenido que permiten la reanudación, auditoría y comparación similar.
La contribución es la integración operativa de estas ideas establecidas en un protocolo auditable y completo, no la invención de normas de precisión, de memoria, de revisión por expertos o de indización.
2. Arte previo y la brecha de evaluación
2.1 Las normas especifican las cualidades, no un experimento de validación
ISO 999:1996 y ANSI/NISO Z39.4-2021 proporcionar la base normativa para el contenido del índice, la organización, el vocabulario, la especificidad, los localizadores, las referencias cruzadas y la presentación. En la fecha de redacción de la presente edición, la edición de la ISO de 1996 seguía siendo la norma publicada, mientras que la proyecto final de tercera edición estaba bajo aprobación. El informe técnico anterior de Anderson NISO proporciona una extensa guía sobre el diseño de índices, relaciones de términos y sintaxis (Anderson, 1997). La orientación profesional hace que estas expectativas sean utilizables a través de listas de verificación y criterios de adjudicación (American Society for Indexing, 2015, 2025, n.d.; Marshall, 2023a, 2023b).
Estas fuentes definen lo que debe lograr un buen índice, pero sus alcances publicados no proporcionan por sí solos un protocolo completo de validación que abarque la construcción de puntos de referencia, las unidades de auditoría atómica, la medición de acceso perdido, la adjudicación de incertidumbres, las fugas candidatas y las decisiones no compensatorias. Heurísticas como la subdivisión de largas cuerdas localizadoras siguen siendo útiles diagnósticos, no leyes empíricas universales.
2.2 Las métricas estructurales y los estudios de lectura responden a preguntas más estrechas
La investigación sobre índices de libros ha medido la longitud del índice, la forma de subtítulo, los efectos de autoría, la riqueza estructural y las preferencias de los usuarios (Gratch y otros, 1978; Wittmann, 1990; Diodato y Gandt, 1991; Diodato, 1994). Bennion (1980) trató un libro y su índice como un sistema de información-retrieval, mientras que Jörgensen y Liddy (1996) y Abdullah y Gibb (2008) conectaron características de índice a las tareas de búsqueda. Johncocks (2008) defendió diagnósticos cuantitativos mientras retenía el juicio intelectual; Quinn (2015) revisó los criterios de evaluación y la experiencia de la Sociedad Australiana y Nueva Zelanda de Indizadores aplicándolos. La revisión de la literatura de Coe encontró comparativamente poca evidencia empírica sobre el uso real del índice de libros; su estudio posterior de seis participantes identificó la visión general y la búsqueda de temas específicos como comportamientos importantes (Coe, 2014, 2015).
Estos estudios justifican tareas de lectura medibles y diagnósticos estructurales, pero ni la estructura bruta ni el cumplimiento de las normas establecen directamente la corrección de la fuente. Las pruebas de usuario vivo proporcionan una validación externa clara de los resultados de recuperación y no se sustituyen por el método que se presenta aquí.
2.3 La evaluación automática del índice mide comúnmente el parecido
Los libros de prueba de Csomai y Mihalcea emparejados con sus índices publicados y precisión aplicada, memoria y F-medida a la selección de índice-término (2006, 2008). Aït El Mekki y Nazarenko (2006) observaron explícitamente que los índices de libros atrasados carecen de una referencia objetiva simple y evaluaron un flujo de trabajo humano-máquina utilizando medidas de descriptores y relaciones. Wu et al. (2013) avanzó la unidad de análisis de palabras clave a pares de term-locator, pero todavía trató los índices publicados como verdad de tierra y dejó jerarquía completa, manejo de sinónimos y referencias cruzadas fuera de alcance. El marco más amplio de Golub y otros para la indexación automática de sujetos defiende más que un único método estándar oro mediante la triangulación de la evaluación directa, la evaluación de flujo de trabajo y la recuperación posterior (2016).
La investigación concomitante llega a conclusiones compatibles. Las medidas de consistencia con conocimiento de tesauro pueden reconocer el acuerdo semántico perdido por la identidad exacta del término (Medelyan y Witten, 2006). La evaluación a gran escala de frases clave muestra que las conclusiones dependen del conjunto de datos, la configuración experimental y la procedencia de referencia (Gallina et al., 2020), mientras que KPEval separa el acuerdo de referencia de la fidelidad de la fuente, la diversidad y la utilidad de la corriente (Wu et al., 2024). Estos avances siguen siendo más estrechos que la evaluación de índice temático porque no prueban los localizadores de páginas, jerarquía, referencias cruzadas o navegación a escala de libros.
Artículos recientes de revistas y libros blancos profesionales examinan directamente los resultados de la indexación generativa de la AI (Izzard, 2024; Bartmess and Combs, 2025, 2026; American Society for Indexing AI Committee, 2026). En conjunto, evalúan la integridad, la navegabilidad y la exactitud con arreglo a criterios profesionales en lugar de sola superposición de términos. El método actual difiere al preconstruir un parámetro de fuente candidato-ciega, auditar todas las unidades candidatas a fuente y fuente a candidato, congelar la procedencia de la evidencia y aplicar puertas de liberación no compensatorias.
El método actual extiende esa lógica de términos aislados a un índice completado. Evalúa la relación semántica entre la ruta de rumbo, el paso de origen, el localizador y la tarea del lector, y luego evalúa la arquitectura de acceso resultante en su conjunto.
2.4 Los índices de referencia comerciales actuales miden diferentes construcciones
El trabajo comercial es informativo; esta revisión no identificó replicación independiente. Demostración de Oxford de IndexerLabs controla el tamaño del índice, reconcilia manualmente los partidos de encabezados exactos y semánticos y compara los localizadores dentro de los encabezados coincidentes. Sus 608 coincidencias reportadas entre 1.058 generadas y 1.066 entradas impresas de nivel superior cuantifican la convergencia hacia un índice de referencia publicado. La compañía es más tarde Estudio de poda de 120 carreras y Informe de verificación de 20.000 localizadores proporcionar pruebas de primera parte sobre la retención de temas bajo la poda y la comprobación del localizador. Los informes públicos no documentan una auditoría externa y completa de la fuente definida en el alcance para títulos de solo candidatos, omisiones de fuentes y navegación de índice completo.
Benchmark de los estándares de indexación de Indexia convierte las reglas de ISO 999, ANSI/NISO Z39.4, y El Manual de Estilo de Chicago en controles específicos de las reglas. Se trata de una metodología de evaluación sustantiva, pero principalmente mide el cumplimiento de las normas profesionales. El cumplimiento de las normas y la validez de recuperación basada en fuentes son constructos complementarios.
| Familia de evaluación | Referencia primaria | Lo que mide bien | Lo que no puede establecer por sí mismo |
|---|---|---|---|
| Sobreposición del índice publicado | Un índice creado por el hombre | Reproducción de términos o localizadores seleccionados | Si la referencia omitió el acceso; si el acceso solo para candidatos es válido |
| Cumplimiento de las normas | Normas profesionales codificadas | Conformidad formal, estructural y estilística | Cobertura completa de la fuente o apoyo sustantivo para cada localizador |
| Evaluación basada en las fuentes | Referencia de la fuente congelada más pruebas de la fuente | Acceso soportado, falta de acceso, fidelidad semántica y navegación | Rendimiento real del lector sin un estudio del usuario |
3. Modelo de evaluación y principios de diseño
3.1 Dos representaciones vinculadas
El índice candidato se representa sin corrección como un conjunto de nodos de encabezado, rutas completas, localizadores mostrados, asignaciones de localizadores atómicos expandidos y referencias cruzadas. La reclamación básica del localizador es:
donde h es el camino completo de rumbo —no una etiqueta aislada— y p es una etiqueta lógica de la página fuente. Un rango no es una sola reclamación: se expande a través del mapa de página ordenado y cada página se juzga por separado.
El parámetro de referencia fuente es un gráfico de los requisitos de recuperación en lugar de un índice de modelo. Cada registro de temas estable contiene su significado, prioridad, posición de origen, rutas de acceso aceptables, páginas de evidencia, relaciones y tareas de lectura. Esta representación puede aceptar títulos sinónimos, inversiones, doble publicación, rutas de referencia cruzadas y jerarquías alternativas cuando proporcionan acceso equivalente. Por consiguiente, evita exigir a un candidato que reproduzca la redacción o la arquitectura de un único índice de referencia.
3.2 Principios fijos
| Principio | Regla operacional | Sesgo o fallo controlado |
|---|---|---|
| Ceguera de los candidatos | Descubra, revise y congele los requisitos de origen antes de que el candidato juzgue | Ajuste y circularidad de los parámetros de referencia posteriores a la reunión |
| Base de origen | Requiere tratamiento sustantivo, no mera ocurrencia de cuerdas | Falsos positivos de palabras clave y acceso exclusivo a la atribución |
| Bidireccionalidad | Auditoría de las solicitudes de reembolso presentadas y de las necesidades de fuentes por separado | Índices precisos pero esparcidos y de amplio pero ruidoso |
| Fidelización de candidatos | Preservar texto mal formado, jerarquía, rangos, duplicados y referencias | Reparación evaluadora del objeto que se mide |
| Atomic | Juez una ruta completa en una página | Inflación de rango, apoyo paterno heredado y compuestos ambiguos |
| Revisión completa del índice | Evaluar jerarquía, distribución, terminología, referencias y mecánica a nivel mundial | Entradas de validez local que forman un sistema de navegación deficiente |
| Precompromiso | Congelar alcance, mapa de página, política, umbrales, puertas y desviaciones permitidas antes de juicio candidato; ligar un perfil de cálculo versionado antes de anotar | Cambios puntuales no registrados en la prueba o la aritmética |
| Incertidumbre explícita | Retener estados desconocidos e ininspectivos fuera de binarios forzados | Falsa precisión y distorsión del denominador |
| Puertas separadas | Aplicar pruebas de preparación crítica sin cambiar la puntuación numérica | Compensación de defectos mortales por dosis no relacionadas |
La ceguera de los candidatos es una salvaguardia procesal, no una prueba de independencia estadística. El protocolo implementado utiliza un nuevo contexto no visto para la revisión completa de referencia y búsqueda de omisión. Esa separación no sustituye a múltiples tasadores humanos ni a un estudio de fiabilidad entre evaluadores.
Si el material candidato entra en un contexto de descubrimiento o revisión de referencia, la ceguera se registra como comprometida y esas etapas deben reelaborarse en un contexto nuevo de candidato-invisto antes de que se publiquen las afirmaciones de candidato-ciega.
4. Protocolo
El público Especificación del flujo de trabajo es una máquina de estado de 16 etapas, agrupada a continuación en ocho fases metodológicas.
Los pasos semánticos pueden ser realizados por revisores humanos calificados, revisores asistidos por modelos o un equipo híbrido. En la aplicación de Oxford, los agentes de lenguaje-modelo realizaron revisión de origen y candidato bajo la orquestación y adjudicación humana; programas deterministas controlaban identidades, rutas, validación y aritmética. La separación de tiempo de ejecución impidió al candidato entrar en contextos de construcción de puntos de referencia, pero no puede establecer que un modelo preentrenado nunca se haya encontrado con el libro o su índice.
| Fase | Funcionamiento requerido | Producción congelada o invariante |
|---|---|---|
| 1. Registro | Identificar los bytes y la edición de la fuente, el número de lectores previstos, el alcance indexable, el modo de auditoría y el perfil de publicación | Hash fuente y ejecutar la identidad |
| 2. Mapa | Cargue cada hoja PDF basada en una sola a su etiqueta impresa o lógica; asigne la propiedad de la página no superpuesta a trozos intelectuales | Mapa de página y manifiesto de trozos |
| 3. Predeclare | Instantice la política de contenido, las reglas de incertidumbre, la calibración de densidad, las puertas y las desviaciones permitidas; declare el modo de auditoría | Política de evaluación de las capturas |
| 4. Descubrir | Inspeccione cada página fuente dentro del alcance con el candidato invisible; registre temas, significados, postura, evidencia, relaciones, exclusiones, incertidumbres y tareas del lector | Objetos de descubrimiento de capítulos |
| 5. Sintetizar y revisar | Reconciliar conceptos transversales; revisar cada tema, relación y tarea en un contexto nuevo; realizar una omisión pasar y resolver defectos | Referencia de origen congelado |
| 6. Preparar candidato | Extraer y normalizar el índice entregado en forma aislada, contabilizando cada línea, registro, ruta, localizador y referencia sin reparación editorial | Representación de candidatos, inventario y bloqueo de referencia |
| 7. Auditoría | Verificar cada localizador atómico; probar el acceso a cada sujeto anotado, unidad de tratamiento y tarea requerida; evaluar la estructura de índice completo | Localizador, acceso perdido y libros de estructura |
| 8. Decidir y publicar | Atar el perfil de cálculo; derivar diagnósticos de ítems y seis dimensiones de libros contables congelados; aplicar puertas; proyectar un informe de solo visualización y validarlo contra el cálculo | Cálculo de artefactos, resultados, recibo de validación, estado de preparación e informe público |
4.1 Identidad de página antes de juicio semántico
Los números de hojas PDF, las etiquetas impresas de las páginas y las páginas locales en los PDF de capítulos derivados son coordenadas distintas. El método conserva etiquetas lógicas como cadenas y registra su relación exacta en lugar de asumir un desplazamiento aritmético global. Esto acomoda números romanos, etiquetas prefijadas, placas, etiquetas duplicadas y segmentos irregulares. Los paquetes de capítulos pueden incluir páginas contextuales, pero cada página fuente tiene exactamente un propietario de juicio. Los rangos se expanden caminando el mapa ordenado congelado; los rangos revertidos, de sección cruzada o ambiguos permanecen sin resolver en lugar de ser reparados silenciosamente.
Esta etapa aparentemente mecánica es metodológicamente importante. Un juicio semánticamente correcto unido a la coordinación incorrecta no es evidencia reproducible.
4.2 Construcción de referencia ciego-candidato
Los evaluadores inspeccionan la fuente completa en el microscopio y registran temas tratados sustancialmente y plausiblemente buscables. Una mención pasajera, nombre de atribución-solamente, citación, o ejemplo aislado se excluye por defecto; un pasaje corto puede calificar cuando realiza un trabajo argumentativo decisivo. La densidad no se consulta cuando se descubren los sujetos y no puede utilizarse para podar o rellenar el punto de referencia.
Los descubrimientos de capítulos se sintetizan en conceptos estables de fuentes enteras. Una nueva revisión entonces cubre cada tema, relación, y tarea del lector y conduce una búsqueda por omisión separada. Se adjudican artículos críticos, importantes e inciertos mientras que los fallos originales y revisados permanecen en el libro mayor. Sólo una revisión completa aprobada congela el parámetro de referencia. El gráfico resultante especifica resultados de recuperación aceptables, no un índice terminado preferido.
4.3 Preparación de los candidatos sin reparación
Bajo el protocolo de preparación de candidatos, la preparación puede ejecutarse en un contexto mecánico aislado una vez que la identidad de la fuente, edición, mapa de página, trozos, política y modo de auditoría se hayan fijado; no puede consultar temas de referencia o hacer juicios de calidad. Sus productos se integran sólo después de la congelación de los parámetros de referencia. La preparación conserva la ortografía entregada, los acentos, puntuación, jerarquía, duplicados, rangos, registros de localización/referencias mixtas y estructuras no resueltas. La procedencia distingue seis cuestiones que a menudo se combinan: identidad de byte, integridad interna, continuidad estructural, compatibilidad fuente-edición, compatibilidad mapa-localizador y fidelidad a una copia separada autenticada.
Esta separación permite un análisis de sensibilidad posterior. Si un candidato fue dañado durante la transmisión o reconstrucción, la evaluación observada puede permanecer inmutable mientras que un contrafactual etiquetado muestra qué conclusiones cambiarían bajo correcciones confirmadas.
4.4 Tres auditorías complementarias
Candidato a fuente. Toda asignación de una página o ruta de encabezado completo se clasifica como supported, partially_supported, unsupported, o uninspectable. La manutención de los padres no implica manutención de los hijos. Un encabezado compuesto es compatible sólo cuando todos los componentes están unidos sustantivamente en la página citada.
Para cada localizador medido, el contrato de explicación actual conserva un resumen de pruebas de seguridad pública específico del localizador que describe la página citada y su clasificación de tratamiento de páginas. Una razón de conjunto-camino-fit separado es escrito cuando el tratamiento y los puntajes de ajuste divergen, ajuste no es perfecto, conflicto de clasificadores estructurados, o un suplemento autorizado suministros ajuste. Los casos ordinarios sustantivos y de ajuste exacto pueden utilizar textos de categoría y regla generados mecánicamente. Estas explicaciones exponen la base del juicio, pero son metadatos en lugar de entradas de puntuación: sólo el tratamiento estructurado y las categorías de ajuste determinan el crédito.
Fuente para el candidato. Cada sujeto congelado anotado, unidad de tratamiento esperada única, y tarea de lector requerido se prueba contra el candidato completo. Una unidad de tratamiento es la única tupla de identificación de sujetos, página de documentos y clase de localizador; los registros de evidencia duplicados se combinan mientras conservan sus identificaciones de evidencia. El acceso puede ser directo, indirecto pero utilizable, parcial o ausente. La revisión de acceso ausente de rutina utiliza el índice de referencia congelado, el candidato completo y el libro mayor de localización canónica; no reabre ni reinterpreta silenciosamente la fuente.
Índice completo. Un pase global evalúa jerarquía de encabezados, terminología, distribución de conceptos, acceso directo, referencias cruzadas, fragmentación, densidad de localizador, mecánica y navegación. Este pase sigue siendo trabajo de índice completo porque los juicios locales de capítulos no pueden establecer equilibrio global o topología de referencia.
Suplementación cerrada en caso de fallo. Antes de la puntuación V7, un prevuelo sin puntuación asigna cada localizador a exactamente uno de los tres grupos desconectados: compatible determinísticamente, sin resolver ajuste de camino completo, o inválido/contradictorio. Los estados inválidos de puntuación de bloques y no se pueden complementar. Un suplemento de ajuste autorizado por separado, unido a hash puede decidir todos y sólo el localizador sin resolver establecido seleccionando una categoría de ajuste existente; no puede contener valores de tratamiento, créditos, grados, valores de dimensión, totales, puertas, o anulaciones históricas. La calculadora entonces deriva Fj, Lj, y Gj de la cartografía congelada. Los clasificadores legados que son válidos individualmente pero no están de acuerdo sólo sobre el ajuste de ruta completa pueden entrar en esta ruta sin que ninguno de los clasificadores reciba prioridad. Un suplemento de arquitectura paralela está disponible sólo para rutas mecánicamente identificadas como que requieren revisión semántica después de localizador corregido/conteo de rango. Registra los cuatro predicados de arquitectura estructurada y cualquier identidad de defecto, pero un disparador numérico por sí solo nunca puede crear un defecto. Ambos tipos de suplementos se aplican en memoria, preservar artefactos históricos byte-por-byte, y enlazar el candidato exacto, referencia, auditoría, ruta normalizada, evidencia, e identidades de visión contrafactual.
Un defecto subyacente se registra una vez y se vincula a todas las medidas afectadas. Ciertos juicios conservan alternativas, confianza y pruebas necesarias; uninspectable no se codifica como fallo o se elimina silenciosamente. La política por defecto excluye los localizadores ininspectivos de los denominadores de precisión binarios y revela su tasa, con una puerta de tolerancia predeclarada.
5. Normas de medición y decisión
5.1 Medidas de apoyo
El método publica denominadores y medidas desagregadas en lugar de pedir una puntuación para llevar cada interpretación.
Para las reclamaciones localizadores inspeccionables, s, p, y u indicar las asignaciones apoyadas, parcialmente apoyadas y no apoyadas. El método informa de tres diagnósticos distintos no ponderados:
Estos son la estricta tasa de localización de soporte, precisión binaria después de dejar de lado casos parciales y al menos una tasa de soporte parcial. La notificación de los tres impide que el tratamiento de casos parciales desaparezca dentro de un número. Bajo la rúbrica V7, el apoyo estricto sigue siendo público, pero no es la entrada de precisión a la Fiabilidad de la página-referencia. V7 separa dos hechos por cada localizador evaluable j: la calidad del tratamiento presente en el destino, Tj, y el ajuste entre ese tratamiento y la trayectoria completa del rumbo, Fj. Las asignaciones son cerradas y deterministas:
| Estado de tratamiento de la página | Categoría | Tj |
|---|---|---|
| Sustantivo, inspeccionable e indizable | Tratamiento sustantivo | 1.00 |
| Mezcla, inspeccionable, indizable | Tratamiento mixto | 0,70 |
| Mención de paso, atribución solamente, citación solamente, o ejemplo incidental | Débil presencia | 0,25 |
| Ausencia de tratamiento | Ausente | 0,00 |
| Destino fabricado, inexistente, excluido o no indizable | Destino no válido | 0,00 |
| Ininspectible | Incertidumbre neutral limitada | 0-1 |
| Requerido pero no medido en modo completo | Fallo de validación | - ¡No! - ¡No! |
| Estado de ruta completa | Categoría | Fj |
|---|---|---|
supported |
Ajuste exacto | 1.00 |
partially_supported |
Ajuste parcial del material | 0,70 |
| Presencia débil no soportada; prueba exhaustiva de tratamiento solamente | Ajuste exacto | 1.00 |
| No soportado; defecto de ajuste menor validado | Desajuste de materiales | 0,35 |
| No soportado; defecto de ajuste mayor validado | Desajuste grave | 0,15 |
| Ausencia, error de sujeto o sentido, fallo de ajuste inválido o crítico | No encaja. | 0,00 |
| Ininspectible | Incertidumbre neutral limitada | 0-1 |
| Requerido pero no medido en modo completo | Fallo de validación | - ¡No! - ¡No! |
El tratamiento se deriva únicamente del tratamiento congelado, el alcance y los campos de inspección. El ajuste se deriva de la sentencia congelada y de un inventario cerrado de códigos estructurados y defectos vinculados al localizador. SEL es tratamiento/selectividad únicamente; SCP, CON, STA, CMP, HED, y SUB sean pertinentes para la adecuación; LOC_POS registra una consecuencia pero no puede establecer la idoneidad por sí sola; MEC es apto para el consumo humano; y se rechazan los códigos de la fase no relacionada. Razones, resúmenes de evidencia y prosa popover nunca son entradas de clasificación.
El crédito combinado localizador y la categoría de visualización correspondiente son
El mínimo trata el tratamiento y cabe como techos independientes. No es multiplicación: tratamiento mixto más rendimientos de ajuste parcial 0,70, no 0,49; presencia débil más rendimientos de ajuste parcial 0,25, no 0,175. Por consiguiente, el tratamiento sustantivo puede retener un crédito limitado cuando un encabezamiento afirma una relación o postura erróneas, mientras que una página débil no puede recibir más que un crédito de escasa presencia, incluso si su título encaja. La calidad de la pantalla utiliza la misma escala - 100, 70, 35, 25, 15, 0, o neutral - pero sigue siendo no additivo y nunca se promedia para reconstruir una dimensión.
V7 también distingue tres cantidades estructurales. A localizador mostrado es una referencia de página entregada o un rango de entrega continua; por lo tanto, un rango cuenta una vez para la carga de encabezado y revisión de escaneo. Un asignación atómica es una página producida por la expansión de ese localizador a través del mapa de páginas congelado y sigue siendo la unidad para la verificación de fuentes, precisión, recuerdo y densidad. A rango es el número de páginas cartografiadas atravesadas por un rango continuo. Una ruta de encabezado se enruta a la revisión de arquitectura semántica cuando tiene más de seis localizadores mostrados, o cuando cualquiera de los rangos mostrados abarca más de diez páginas cartografiadas. Estos umbrales identifican el trabajo de revisión; ellos mismos no establecen un defecto. Un defecto de estructura requiere los cuatro predicados sustantivos: la trayectoria abarca múltiples aspectos materialmente distintos, existe un vocabulario de subdivisión estable, la subdivisión mejoraría la recuperación, y la presente visualización indivisa perjudica materialmente el escaneo o la discriminación.
Precisión del localizador ponderado es entonces
Las dos medidas responden a diferentes preguntas: SL pregunta con qué frecuencia un localizador alcanza un tratamiento sustancialmente válido, mientras que PW mide la utilidad de localizador con base de origen en el tratamiento y en el ajuste completo. La presencia débil sigue siendo no sustancial, no obtiene crédito de Selectividad Editorial, sigue siendo elegible para topes y puertas, y nunca está representada como apoyo sustantivo.
El acceso al concepto de referencia es prioritario. Los sujetos esenciales y principales reciben pesos 3 y 2. Un sujeto opcional recibe peso 1 sólo cuando el punto de referencia congelado lo marca como anotado; de lo contrario queda fuera del denominador. Acceso completo, parcial y faltante reciben los valores 1, 0.5 y 0:
El acceso no medido, no resuelto o ininspectivo no se asigna en silencio un cero; su tratamiento y el denominador resultante deben ser revelados. La medida se describe con mayor precisión como cobertura del concepto de referencia o Discovered-access Remember que como una exhaustiva memoria de cada posible tema válido. La retirada prevista del tratamiento utiliza unidades de tratamiento únicas en lugar de registros de pruebas sin procesar. Si f y m se encuentran y se pierden unidades, entonces
Fiabilidad combina la precisión del localizador ponderado PW y la recuperación esperada del tratamiento RT por la media armónica
con cero definido cuando PW+RT=0. Ambos componentes se refieren a la recuperación a nivel de página, pero la precisión estricta sigue siendo pública, y ni la media armónica ni el crédito limitado de presencia débil pueden anular un tope de consecuencia o puerta de publicación. Este diseño de crédito calificado se asemeja a la evaluación de la retrieval de la información con juicios de relevancia incompletos o clasificados (Buckley y Voorhees, 2004; Järvelin y Kekäläinen, 2002), pero no aplica una métrica de lista clasificada como nDCG a un índice alfabético.
La densidad se calcula dentro de cada capítulo o unidad intelectual aprobada:
donde Pc es el número de caminos completos que llevan un localizador único en el capítulo, Lc es la localización expandida de ocurrencias, y Wc es palabras fuente indizables. La calibración actual se centra en 8 rutas y 20 localizadores por 1.000 palabras, con bandas de blanco de 6-10 y 15-25 y bandas de tolerancia ancha de 4-12 y 10-30. Las calificaciones de los capítulos se agregan por peso de la palabra fuente. Se trata de valores de calibración específicos del marco, no de cuotas profesionales universales; la validación externa es excepcional y la densidad contribuye a un máximo de cinco puntos.
5.2 Puntuación de seis dimensiones determinista
Los rúbrica V7 separa tres capas que responden a diferentes preguntas: grado de diagnóstico a nivel de ítems describen registros individuales; cálculos de seis dimensiones resumen libros congelados; puertas de preparación restringen las reclamaciones de publicación. Las calificaciones de los artículos no son additivas, y las puertas nunca suman ni restan puntos. Los grados de 100, 70, 35, 25, 15, 0 o neutros son la proyección de la pantalla de 100Lj; explican el mismo crédito categórica utilizado en PW, pero no se asignan de forma independiente y no se promedian para reconstruir una dimensión o total. Las calificaciones de dimensión no son seleccionadas por un evaluador. Perfil de cálculo subject-index-dimension-calculation-v3 los deriva determinísticamente de estados de libro mayor, mapas de tratamiento y ajuste, numeradores y denominadores en bruto, defectos estructurados e incertidumbres.
| Dimensión | Puntos | Cálculo de la base derivado del libro mayor | Límites de consecuencia principal |
|---|---|---|---|
| Cobertura significativa | 20 | Acceso ponderado por prioridad cinco veces; completo, parcial y faltante reciben 1, 0,5 y 0 | Tasa de fallos esenciales; omisión central crítica |
| Selectividad editorial | 15 | Crédito localizador sustantivo contribuye 10 puntos; el ajuste de densidad ponderado por capítulos contribuye 5 | Patrones de localización sistémica de cero créditos |
| Fidelización conceptual y postural | 15 | Crédito medio de nodo: pasar 1, menor 0,85, mayor 0,55, falla 0 | Significado mayor o crítico, relación, defecto compuesto o postura |
| Fiabilidad de las referencias a páginas | 25 | Cinco veces F1W, combinando precisión de localizador ponderado y recuperación del tratamiento; también se informa de precisión estricta | Falta de tratamiento de alto valor; acceso fabricado; patrones distribuidos sin soporte |
| Localizabilidad y navegación | 20 | Cinco veces 60% de éxito de la tarea condicionada por la cobertura, 30% de arquitectura y 10% de validez de referencia | Tareas fallidas; rutas destructivas; arquitectura recurrente o defectos de referencia |
| Mecánica y consistencia | 5 | Crédito medio de nodo: pasar 1, cosmético 0,95, menor 0,85, mayor 0,55, falla 0 | Incompletitud; defectos críticos, recurrentes o sistemáticos |
| Total | 100 | Suma de puntos de dimensión mostrados | Resumen de calidad ponderado, no “porcentaje correcto” |
La selectividad sustantiva asigna el crédito 1 a las clases de localización sustantiva, 0,5 a las clases mixtas, y 0 a las clases de passing-mention, atribución, cita, ejemplo y incidental; los registros ausentes, no disponibles, ambiguos y no alcance se enrutan por separado. Las tareas y referencias del lector usan 1, 0.5 y 0 para el éxito, el éxito parcial y el fracaso; la arquitectura utiliza el mapa conceptual-crédito. Una tarea de localizabilidad solo es elegible cuando cada sujeto requerido tiene al menos acceso parcial de referencia, impidiendo que una puntuación de navegación cuente dos veces un fallo de cobertura como ruta exitosa.
Para la reconstructabilidad, los seis cálculos sin tapa se pueden escribir compactamente de la siguiente manera. Crédito de acceso a la información ai toma 1, 0,5, o 0; su peso prioritario congelado wi toma 3, 2, o 1; crédito de selectividad sustantiva ej toma 1, 0,5, o 0; crédito conceptual-nodo ck toma 1, 0,85, 0,55, o 0; crédito mecánico mk toma 1, 0,95, 0,85, 0,55, o 0; y T,A,X son los créditos medios para las tareas de lectura elegibles, nodos de arquitectura y referencias cruzadas:
Cuando las referencias cruzadas son realmente inaplicables, los pesos de navegación se vuelven a normalizar de 60/30 a dos tercios/un tercio. La densidad se calcula capítulo por capítulo a partir de las dos tasas anteriores; cada tasa recibe 5 dentro de su banda objetivo, 4 dentro de la tolerancia amplia, 3 hasta 25% fuera de la tolerancia amplia, 2 por encima de 25% a 50%, 1 por encima de 50% a 100%, y 0 más allá del 100% o con un valor observado de cero. Las dos calificaciones métricas se promedian dentro de cada capítulo y luego la palabra-fuente se pondera entre capítulos.
Los topes de consecuencia se aplican a las calificaciones básicas de precisión completa, nunca aumentan una calificación, y pueden ser activados únicamente por registros de defectos estructurados que identifican propietario, base de gravedad, consecuencia, registros o secciones afectados, recurrencia y recuentos o tasas aplicables. El texto libre no puede activar una tapa. Excepto por selectividad, la calificación post-cap se redondea al punto medio más cercano usando el decimal ROUND_HALF_UP, y los puntos son: rdWd/5, redondeado a dos decimales. La selectividad redondea sus componentes sustantivos y de densidad por separado hasta la mitad de los pasos antes de asignar sus contribuciones de 10 y 5 puntos; por lo tanto, su calificación equivalente mostrada puede caerse de un paso medio. Los anclajes cualitativos son comprobaciones de razonabilidad posteriores al cálculo: se informa de un desajuste, pero no pueden cambiar manualmente una calificación.
La falta de pruebas es parte del contrato de cálculo. En modo completo, cualquier requisito not_measured la entrada bloquea la dimensión afectada y el total. Una puntuación provisional requiere al menos el 95% de las unidades aplicables medidas, sujeto a una excepción declarada de pequeño denominador. Uninspectable las unidades producen puntos finales inferiores y superiores; sólo se permite una calificación pública numérica cuando ambas variables resuelven la misma calificación redondeada y la misma identidad de la tapa aplicada. De lo contrario, la dimensión se considera como prueba insuficiente en lugar de ser forzada a cero o a caer silenciosamente.
5.3 Puertas críticas
La preparación para la publicación es una decisión separada. Los política estándar incluye puertas para localizadores fuera de alcance o fabricados, patrones sistémicos no soportados, omisiones centrales o tergiversaciones, partidas compuestas inválidas, referencias cruzadas rotas o sustitutivas, cualquier rúbrica de tercer nivel, desorden sistemático, puesta a tierra sin resolver, material excesivo ininspectible, lapso de fuente incorrecto y salida incompleta. Un fallo de puerta limita la afirmación de que un candidato está listo para publicar, pero no altera su puntuación. Esta capa no compensatoria es necesaria porque un índice pulido y completo puede aún fallar en los criterios de preparación para la publicación si sistemáticamente dirige a los lectores a páginas no soportadas u omite una conclusión central.
6. Reproducibilidad, revisión paralela y cálculo
6.1 Artefactos reproducibles, no sólo avisos repetibles
Cada artefacto consecuente es validado y registrado por ruta relativa, SHA-256, visibilidad, clase de retención y estado congelado. El manifiesto del artefacto está escrito antes de un estado compartido; las identidades cambiadas invalidan las etapas posteriores. Los objetos congelados se ven versionados en lugar de sobrescritos. Un candado candidato-benchmark vincula al candidato a la fuente exacta, referencia, política, mapa de página, trozos, modo de auditoría y ajustes de incertidumbre. El artefacto de cálculo une por separado la identidad del perfil de cálculo y registra el numerador, denominador, valor normalizado, evaluación de la tapa, puntos finales de incertidumbre, calificación post-cap y contribución de puntos de cada componente. Dos resultados son directamente comparables sólo cuando la clave de comparación de pruebas y el perfil de cálculo coinciden.
El resultado hace referencia al cálculo en lugar de repetir la aritmética no soportada. Un recibo de validación post-proyección vincula criptográficamente el cálculo, resultado y reporte público; verifica que las dimensiones públicas, total, resultados de puerta, procedencia, y vistas de puntuación observadas o contrafactuales concuerdan; y falla cerrado en desajuste. Antes del cálculo, el prevuelo registra las particiones exactas deterministas, no resueltas e inválidas. Cualquier suplemento autorizado debe coincidir con ese conjunto sin resolver exactamente y está vinculado a las entradas por hash; las decisiones complementarias se aplican en la memoria y artefactos históricos permanecen sin cambios. Las proyecciones de ítems multi-defectos utilizan la regla de ordenación determinista ITEM-PROJECTION-DEFECT-ID-ASC-V1, por lo que las pantallas de item no dependen del orden de iteración de archivos o objetos. Una vista contrafactual es válida sólo cuando su artefacto de cálculo distinto y cada artefacto de procedencia existen en la ruta portable declarada, coinciden con sus compromisos SHA-256 y auto-hash de cálculo, y están de acuerdo a través de resultados y proyecciones web. Puede no ser sintetizado a partir de una sola partitura. Los valores decimales permanecen decimales a través del cálculo y la comparación de puertas en lugar de convertirse a punto flotante binario; la suite de regresión incluye la tasa de localización no dyádica observada de 0.086737.
La actualización de explicación V7.1 es sólo de proa. Las nuevas auditorías de localización, suplementos de ajuste, evaluaciones de artículos, resultados e informes web preservan el resumen de pruebas de tratamiento y, cuando es necesario, una justificación de ajuste distinta a través de la cadena de proyección. Los artefactos históricos V7 siguen siendo válidos a través del envío de compatibilidad y no son reescritos, migrados, rescoreados o republicados únicamente para adoptar los campos de explicación más ricos. La actualización no cambia ni el perfil de cálculo ni la política numérica.
Programas deterministas poseen mapeo de páginas, expansión de rango, identificadores, chequeos de esquemas, hashing, enrutamiento, validación de denominadores, aritmética de densidad y puntuación, derivación de grado diagnóstico, control de puntos de control y proyección de informes. La revisión editorial humana o asistida por modelos posee significación, apoyo sustantivo, fidelidad conceptual, postura y navegación. La capa determinista puede reproducir la aritmética y rastrear cada decisión; no puede hacer juicios semánticos estocásticos deterministas después del hecho. La reproducibilidad aquí significa preservar insumos, resultados, evidencia, políticas, denominadores, procedencia de la tapa, incertidumbre y adjudicacións—no prometer que un nuevo modelo muestreado recreará independientemente cada juicio.
Los PDF de origen restringido, las citas largas, el texto candidato en bruto, las coordenadas, los paquetes de recuperación y los registros de control privado están separados de las pruebas públicas agregadas. Los informes públicos utilizan parafrases concisas e identificadores estables de pruebas. Los compromisos criptográficos hacen que los insumos restringidos sean identificables sin redistribuir material protegido por derechos de autor.
6.2 Paralelismo seguro de colisiones
La revisión paralela cambia el rendimiento, no la política. Los trabajadores de descubrimiento de fuentes poseen un artefacto de capítulo inmutable; los trabajadores de localización poseen asignaciones de páginas no superpuestas; los trabajadores de acceso perdido poseen sujetos, unidades de tratamiento y tareas deterministamente enrutados. Los trabajadores no actualizan el estado compartido. Un coordinador realiza un vuelo previo a un lote antes de cualquier fusión, verifica sus solicitudes de retiro, realiza una integración canónica, materializa evidencia privada, escribe el recibo de integración, actualiza el manifiesto y actualiza el estado último; los procedimientos de recuperación manejan un fallo parcial de fusión externa. La labor de acceso ausente comienza sólo después de que cada auditoría de localización se integre canónicamente y la evaluación se valide; la auditoría de la estructura y la puntuación final siguen siendo operaciones únicas de índice completo.
Este diseño de fan-out/fan-in evita actualizaciones perdidas, juicios duplicados, propiedad de páginas extranjeras y deriva del denominador. También hace que el fracaso se recupere en el límite del artefacto en lugar de reconstruir una larga conversación.
6.3 Perfil de recursos observado de la primera aplicación
Historial de repositorios 51 solicitudes de retiro fusionadas: 16 en el repositorio de referencia —15 propuestas de descubrimiento de capítulos y una propuesta de QA/congelación— y 35 en el repositorio de candidatos— una preparación de candidatos, 17 propuestas de localización-auditoría y 17 propuestas de acceso perdido. CHUNK-001 fue reemplazado más tarde por un artefacto de descubrimiento v2 candidato ciego. Las auditorías de candidatos se integraron en ondas no más amplias que tres. Este es un ancho de orquestación observado, no un número medido de trabajos de inferencia simultánea.
Derivado de las marcas de tiempo de confirmación de los repositorios, el intervalo observable desde la inicialización del repositorio de referencia candidato ciego hasta la finalización de la auditoría completa de origen y candidato fue aproximadamente 4 días 21 horas. Los Auditoría de fidelidad de la representación de candidatos se extendió ese intervalo observable a aproximadamente 5 días 1 hora. Estas ventanas de reloj de pared incluyen orquestación de agentes, decisiones humanas, revisión de solicitudes de retiro, colas, transferencia de puntos de control, publicación y tiempo inactivo. No son horas-procesador o medidas de tiempo de funcionamiento del modelo.
En el compromiso de metodología V7.1 fijado, el paquete de contrato legible por máquina del evaluador pasa 312 pruebas automatizadas. Los cambio de explicación-contrato fusionado registra que el estado del software probado, pero no se trata como un punto de referencia de tiempo para la revisión semántica. El flujo de trabajo no invoca ningún código GPU controlado por el proyecto, y el hardware del modelo alojado no se reveló. Instantánea del modelo exacto, configuración del razonamiento, uso de tokens, llamadas de inferencia, tipo de GPU u horas, memoria de pico, consumo de energía, minutos de trabajo humano y costo facturado no fueron registrados y por lo tanto no se estiman.
La primera aplicación soporta así una cuenta de flujo de trabajo a escala de artefactos y transcurrido, pero no una reclamación de costos o de cálculo normalizada por hardware. Las futuras carreras deberían emitir un execution-provenance registro para cada etapa que contiene modelo y versión, ajuste de razonamiento, tiempos de inicio y finalización UTC, tokens de entrada, caché y salida, llamadas a herramientas, reintentos, identificadores de sucursales y solicitudes de retiro, membresía de ondas, costo facturado, tiempo de revisión humana, tiempo de CPU determinista y memoria máxima.
7. Aplicación trabajada: The Oxford History of the French Revolution
La primera aplicación completa ilustra el método; aún no es un corpus de validación. Los resultados a continuación son la migración canónica V7 en el estado de repositorio utilizado para este manuscrito. Los referencia de origen congelada cubre el texto de cuerpo de 425 páginas de la edición 2002 de William Doyle The Oxford History of the French Revolution. Todas las páginas proporcionadas se asignaron uno a uno a las etiquetas impresas 1-425. No había por delante, notas o notas, bibliografía ni páginas de índices de publicación, por lo que se excluía en lugar de tratarlas como omisiones. El candidato fue un PDF de 25 páginas, índice de dos columnas del conjunto de datos IndexerLabs, representado como el índice publicado del libro. Los INFORME DE PREPARACIÓN los registros de reproducción interna completa; Referencia del candidato registra fidelidad autoritativa-copia como not_independently_verified.
| Objeto de evaluación | denominador completo |
|---|---|
| Páginas de origen / palabras indexables / unidades de capítulo | 425 / 194.718 / 17 |
| Temas de origen congelados / relaciones / tareas de lectura | 1.366 / 3.460 / 1.026 |
| Nodos de encabezados de candidatos / registros de localización mostrados | 1,904 / 4,462 |
| Asignación de localizadores atómicos/referencias cruzadas | ¿ Por qué? |
| Páginas de tratamiento de temas previstas | 3.210 |
El congelado resultados de la evaluación y su Cálculos de dimensión representan las 5.338 asignaciones de localizadores, 1.366 sujetos de origen, 3.210 tratamientos esperados, 1.026 tareas de lector, 1.904 nodos de encabezado y 16 referencias cruzadas. La proyección pública está ligada de nuevo a estos artefactos por un V7 recibo de validación, cuyos 19 cheques pasaron. La reconstrucción independiente representó 5.338 de los 5.338 localizadores, y dos migraciones completas limpias fueron idénticas a byte.
V7 prevuelo resuelto de forma determinística 5.026 localizadores canónicos, enrutado 312 al complemento de ajuste de alcance exacto, y encontró cero estados inválidos o contradictorios. Dos pases de adjudicación independientes basados en fuentes cubrieron todo el conjunto de 312 localizadores y produjeron cero desacuerdos; el suplemento canónico registró 309 decisiones exactas y 3 decisiones sin ajuste. En la vista ajustada por representación, la partición correspondiente fue de 5.030 deterministas, 308 complementarios y cero inválidos, con 306 decisiones exactas y 2 decisiones no ajustadas. Cada vista también revisó 128 rutas de arquitectura activadas mecánicamente; todas fueron registradas reviewed_no_defect. Así, las reglas corregidas de localizador exhibido y rango-span cambiaron qué títulos requerían revisión, pero no eliminaron ningún defecto de estructura histórica y no cambiaron ni la puntuación ni los resultados de la puerta.
| Resultado seleccionado | Valor observado |
|---|---|
| Puntuación ponderada de seis dimensiones | 72,5 / 100 |
| Tasa de localización de soporte estricto | 4.643 / 5.338 = 86,98% |
| Precisión del localizador binario | 4.643 / 5.106 = 90,93% |
| Soporte de localizador al menos parcial | 4.875 / 5.338 = 91,33% |
| V7 precisión del localizador ponderado | 4.894,55 / 5.338 = 91,69% |
| Páginas de tratamiento esperadas encontradas | 2,981 / 3,210 = 92,87% |
| Media armónica de fiabilidad V7 | 92,28% |
| Acceso ponderado al concepto con crédito parcial | 69,83% |
| Faltan temas esenciales | 12 / 155 = 7,74% |
| Lector-tarea de éxito, estricto / crédito parcial | 48,73% / 70,32% |
| Referencias cruzadas apoyadas | 13 / 16 = 81,25% |
| Falló la disposición estándar de las puertas | ¿ Qué es lo que se puede hacer? |
El libro mayor contiene 4.647 sustantivos, 246 mixtos, 350 de presencia débil, 95 ausentes y ningún destino inválido o ininspectible. El ajuste completo contiene 4,984 ajustes exactos, 232 ajustes parciales de material, 17 desajustes de material, 8 desajustes graves, 97 casos sin ajuste y ningún caso ininspectible. Aplicar Lj=min(Tj,Fj) produce 4.643 créditos de 1,00, 226 de 0,70, 14 de 0,35, 349 de 0,25, 8 de 0,15 y 98 de 0,00. En consecuencia,
La calificación de Fiabilidad de referencia de página sin tapar es 5F1W=4.613779. El tapón de consecuencia de patrón distribuido-no soportado registrado lo reduce a 3.5, produciendo 17.5 de los 25 puntos de la dimensión. Esta aritmética trabajada muestra por qué la utilidad del localizador, la puntuación de dimensión y la preparación para la liberación están relacionadas pero no idénticas cantidades.
| Dimensión | Calificación | Puntos | Tapa aplicada grabada |
|---|---|---|---|
| Cobertura significativa | ¿ Qué es lo que se puede hacer? | ¿ Qué es lo que se puede hacer? | Tasa de error esencial |
| Selectividad editorial | 3,6667 / 5 equivalente | ¿ Por qué? | Patrón sistémico de cero créditos |
| Fidelización conceptual y postural | ¿ Cómo podemos hacer esto? | ¿ Por qué? | Posición o defecto de relación mayor |
| Fiabilidad de las referencias a páginas | ¿ Qué es lo que se puede hacer? | ¿ Qué es lo que se puede hacer? | Patrón distribuido sin soporte |
| Localizabilidad y navegación | ¿ Qué es lo que se puede hacer? | ¿ Qué es lo que se puede hacer? | Ruta de acceso destructiva |
| Mecánica y consistencia | ¿ Cómo podemos hacer esto? | ¿ Cómo podemos hacer esto? | Sustituciones de dígitos por porcentajes recurrentes |
En el perfil de cálculo declarado, el candidato suministrado cayó en la banda 70-79: una base útil que requiere una revisión sustancial. El total de 72.5 no es “el 72,5% correcto” y no se afirma aquí como una puntuación para un índice de prensa independiente de la Universidad de Oxford autenticado. Las puertas falladas identificaron un patrón de localización sistémico no soportado, omisiones centrales, errores de postura importantes, una relación compuesta no soportada, un sustituto inválido see, objetivos de referencia cruzada no resueltos y desorden sistemático. Las puertas que pasaban confirmaban el intervalo de fuente correcto, los localizadores en el alcance y resolubles, sin rúbricas de tercer nivel, sin material excesivo ininspectivo, sin puesta a tierra crítica o importante sin resolver, y una contabilidad estructural completa.
La revisión de la fidelidad de los candidatos examinó todos los 1.904 registros, 4.462 localizadores mostrados, 5.338 asignaciones y 16 referencias. Encontró 14 registros - 18 ocurrencias de caracteres - con sustituciones confirmadas de dígito por Accent; corrigiendo el afectado levée en masa entrada también resolvió un defecto de representación causada por referencia cruzada. A atribuido por separado V7 ajustados a la representación puntajes 73,5/100. Como esa opinión cambia las pruebas de los candidatos en lugar de las normas de evaluación, no sustituye el resultado canónico tal como se ha obtenido. Ambos puntos de vista permanecen en la misma banda interpretativa; las siete puertas fallidas y el not_publication_ready la situación no ha cambiado.
El caso también demuestra por qué un índice creado por el ser humano debe seguir siendo un candidato en lugar de un punto de referencia. El método puede acreditar la ausencia de acceso válido en ese índice y puede identificar el acceso no soportado o no disponible en él. Lo hace. no mostrar que IndexPDF o IA indexación generalmente supera la indexación humana profesional, ni establece una ventaja de costo ajustada a la calidad. Son hipótesis para un estudio comparativo controlado.
8. Validez, limitaciones y pruebas siguientes
El método tiene una gran capacidad de auditoría interna, pero varias preguntas de validez no resueltas.
Parámetro de referencia completo. La inspección completa de páginas y una omisión separada reducen las omisiones; no pueden probar que se haya descubierto todo requisito válido de acceso. Los resultados deben informar de la cobertura del concepto de referencia, no de la recuperación exhaustiva de la población.
Fiabilidad del evaluador. La migración V7 incluyó dos pases independientes de adjudicación basados en fuentes sobre el conjunto exacto de suplementos canónicos de 312 localizadores, con cero desacuerdos. Es una verificación de acuerdo útil para una decisión de migración limitada, no una estimación general de la fiabilidad entre evaluadores, estabilidad de prueba-reprueba o invarianza de modelo cruzado a lo largo de la evaluación completa. Para estimar esas propiedades se necesitan múltiples evaluadores independientes.
Resultados del lector. Las tareas del lector en el punto de referencia son proxies expertos. El método mide si el índice permite esas tareas, no el éxito real de la búsqueda, el tiempo, la comprensión o la preferencia. Un estudio prospectivo de usuario debe comparar índices usando tareas fácticas, analíticas, de visión general y de elementos conocidos.
Calibración. El alcance, la política, los objetivos de densidad, los umbrales y las puertas se congelaron antes de la sentencia del candidato; los mapas de crédito, los coeficientes de ponderación de los componentes, los umbrales de tope, las normas de incertidumbre y el redondeo están sujetos a un perfil de cálculo con versiones antes de la puntuación. Estas opciones no se han calibrado entre géneros. Los estudios de dominio cruzado deben probar la validez predictiva y estimar la sensibilidad a los pesos, los topes y los umbrales en lugar de presentarlos como constantes naturales.
Generalización. La primera solicitud abarca una historia académica en inglés y un candidato. No establece el desempeño en libros técnicos, médicos, legales, comerciales, multilingües, ilustrados o electrónicos.
Fuente y fidelidad de candidatos. La fuente Oxford excluyó la materia ausente del PDF suministrado, y el candidato no fue autenticado independientemente contra un escaneo de editor. Los hashes establecen qué objetos fueron evaluados, no si esos objetos fueron las copias más autorizadas posibles.
Independencia institucional. La ceguera del candidato impide una forma importante de circularidad, pero el método fue diseñado y aplicado por primera vez por el mismo proyecto. Sigue siendo necesario repetirlo de forma independiente y realizar un examen profesional e indizador.
Computación y costo. La primera ejecución no registró el uso de tokens, la versión exacta del modelo, hardware, minutos humanos, energía o costo. No se justifica ninguna comparación económica con la indexación humana a partir de las marcas de tiempo del repositorio.
Un estudio comparativo decisivo utilizaría múltiples libros y géneros, al menos dos índices profesionales por libro, uno o más candidatos generados por máquinas, identidades de candidatos ciegas, un punto de referencia común de fuentes congeladas, múltiples evaluadores independientes, adjudicación con estadísticas de acuerdo, tareas de recuperación de lectores en vivo y tiempo prospectivo, fichas, costos y registro de energía. Los intervalos de confianza deben acompañar todas las diferencias agregadas. Este diseño probaría si un candidato supera un índice profesional de calidad basada en fuentes y rendimiento de los lectores a un costo menor, sin definir “mejor” como mayor similitud con ese índice profesional.
9. Conclusión
Los índices temáticoss terminados no pueden evaluarse adecuadamente por solapamiento de términos, cumplimiento de reglas, existencia de localizador o inspección visual. Una evaluación defendible debe verificar lo que el candidato afirma, buscar independientemente lo que omite, y juzgar si el sistema de acceso resultante funciona como un índice. La metodología que se presenta aquí lo hace congelando un punto de referencia derivado de la fuente en contextos que nunca ven material candidato antes de juicio candidato, auditando reclamaciones completas de páginas de ruta en ambas direcciones, examinando el sistema de navegación global, tratando de marcar páginas y ajuste de ruta completa como techos independientes, preservando incertidumbre y evidencia, obteniendo dimensiones determinísticamente de libros de contabilidad congelados, y separando la puntuación de calidad ponderada de las puertas de publicación no compensatorias.
Su principal beneficio es la epistemía: ni un índice humano ni un índice de IA reciben autoridad de su procedencia. Ambos se prueban con los mismos requisitos basados en la fuente, y cada conclusión agregada sigue siendo rastreable a través de denominadores brutos, categorías de tratamiento y ajuste, mapas de crédito, límites máximos, suplementos, puntos de vista, recibos de proyecciones y pruebas cuestionables. En el análisis de migración y sensibilidad de Oxford, el conjunto de opciones de espera y la conclusión de preparación para la publicación se mantuvieron estables en el recuento de la estructura corregida y en el contrafactual confirmado ajustado a la representación. Los siguientes requisitos son una replicación más amplia, evaluadores independientes, estudios de lectura y telemetría de cálculo y costos prospectivos.
Disponibilidad de datos y códigos
El método, esquemas, ayudantes deterministas y pruebas están disponibles en el evaluate-subject-index repositorio en commit 6982a0905e6aaca887a41e58655c572c72cc87a0. El índice de referencia congelado de Oxford está disponible en subject-index-benchmark-oxford-history-french-revolution-2002, con el valor de referencia anclado en el commit 98dbffd0ca171b5b7db76dbe1b2b5d5265ccacab. La evaluación candidata V7, resultado canónico, artefacto de cálculo, vista de puntuación contrafactual, suplementos, informe web, y recibo de validación utilizados en la aplicación trabajada están disponibles en subject-index-evaluation-oxford-history-french-revolution-2002-original-published-index en el compromiso b0b201b0641ea2bec7b27c40ccc8f4c74d22c880.
Los PDFs de origen y candidatos restringidos por derechos de autor, texto extraído completo, artefactos de recuperación privada y el libro mayor completo de evaluación de ítems no se redistribuyen. Los artefactos públicos proporcionan esquemas, hashes, resultados agregados y parafrases de evidencia seguras de fuentes.
Intereses competidores
John Camden creó la metodología de evaluación y desarrolla IndexPDF, un sistema de generación de índices de materias independiente, a través de Publication Intelligence, LLC. La metodología es candidata agnóstica, pero su diseño y primera aplicación no son institucionalmente independientes. El candidato de Oxford fue representado como un índice creado por humanos publicado anteriormente y no fue generado por IndexPDF; la fidelidad a una copia independiente de autoría editorial no fue verificada.
Referencias
Abdullah, N., and Gibb, F. (2008). “Using a Task-Based Approach in Evaluating the Usability of BoBIs in an E-book Environment.” In Advances in Information Retrieval, LNCS 4956, 246-257. https://doi.org/10.1007/978-3-540-78646-7_24.
Aït El Mekki, T., and Nazarenko, A. (2006). “An Application-Oriented Terminology Evaluation: The Case of Back-of-the Book Indexes.” In Proceedings of the LREC 2006 Workshop on Terminology Design: Quality Criteria and Evaluation Methods (TermEval), 18-21. Accessible copy: https://arxiv.org/abs/cs/0609133.
American Society for Indexing. (2015). “Best Practices for Indexing.” https://asindexing.org/best-indexing-practices/.
American Society for Indexing. (2025). “2025 ASI Indexing Awards.” https://asindexing.org/about/awards/asi-indexing-award/.
American Society for Indexing. (n.d.). “Index Evaluation Checklist.” https://asindexing.org/about-indexing/index-evaluation-checklist/.
American Society for Indexing AI Committee. (2026). AI and Book Indexing: Trajectory Data. White paper, March. https://asindexing.org/ai-news/ai-book-indexing-trajectory-data/.
Anderson, J. D. (1997). Guidelines for Indexes and Related Information Retrieval Devices. NISO TR02-1997. Bethesda, MD: NISO Press. https://www.niso.org/publications/tr02-1997-guidelines-indexes.
Bartmess, E., and Combs, M. R. (2025). “LLM-Generated Book Indexes: Can They Replace Professionally Created Indexes?” The Indexer, 43(4), 327-348. https://doi.org/10.3828/index.2025.33.
Bartmess, E., and Combs, M. R. (2026). “Can the Current Generation of Large Language Models (LLMs) Produce an Adequate Book Index?” The Indexer, 44(1), 35-48. https://doi.org/10.3828/index.2026.4.
Bennion, B. C. (1980). “Performance testing of a book and its index as an information retrieval system.” Journal of the American Society for Information Science, 31(4), 264-270. https://doi.org/10.1002/asi.4630310406.
Buckley, C., and Voorhees, E. M. (2004). “Retrieval Evaluation with Incomplete Information.” In Proceedings of SIGIR 2004, 25-32. https://doi.org/10.1145/1008992.1009000.
Coe, M. (2014). “Where is the evidence? A review of the literature on usability of book indexes.” The Indexer, 32(4), 161-168. https://doi.org/10.3828/indexer.2014.52.
Coe, M. (2015). “What do readers expect from book indexes and how do they use them? An exploratory user study.” The Indexer, 33(3), 90-101. https://doi.org/10.3828/indexer.2015.25.
Csomai, A., and Mihalcea, R. F. (2006). “Creating a testbed for the evaluation of automatically generated back-of-the-book indexes.” In Computational Linguistics and Intelligent Text Processing, LNCS 3878, 429-440. https://doi.org/10.1007/11671299_45.
Csomai, A., and Mihalcea, R. (2008). “Linguistically motivated features for enhanced back-of-the-book indexing.” In ACL-08: HLT, 932-940. https://aclanthology.org/P08-1106/.
Diodato, V. (1994). “User preferences for features in back of book indexes.” Journal of the American Society for Information Science, 45(7), 529-536. https://doi.org/10.1002/(SICI)1097-4571(199408)45:7%3C529::AID-ASI7%3E3.0.CO;2-O.
Diodato, V., and Gandt, G. (1991). “Back of book indexes and the characteristics of author and nonauthor indexing: Report of an exploratory study.” Journal of the American Society for Information Science, 42(5), 341-350. https://doi.org/10.1002/(SICI)1097-4571(199106)42:5%3C341::AID-ASI4%3E3.0.CO;2-7.
Doyle, W. (2002). The Oxford History of the French Revolution. 2nd ed. Oxford: Oxford University Press.
Gallina, Y., Boudin, F., and Daille, B. (2020). “Large-Scale Evaluation of Keyphrase Extraction Models.” In Proceedings of JCDL 2020, 271-278. https://doi.org/10.1145/3383583.3398517.
Golub, K., Soergel, D., Buchanan, G., Tudhope, D., Lykke, M., and Hiom, D. (2016). “A framework for evaluating automatic indexing or classification in the context of retrieval.” Journal of the Association for Information Science and Technology, 67(1), 3-16. https://doi.org/10.1002/asi.23600.
Gratch, B., Settel, B., and Atherton, P. (1978). “Characteristics of book indexes for subject retrieval in the humanities and social sciences.” The Indexer, 11(1), 14-23. https://doi.org/10.3828/indexer.1978.11.1.9.
Hurwitz, F. I. (1969). “A study of indexer consistency.” American Documentation, 20(1), 92-94. https://doi.org/10.1002/asi.4630200112.
IndexerLabs Team. (2026a). “Verifying 20,000 Index Locators at Scale.” April 13. https://indexerlabs.com/blog/verifying-20000-index-locators-at-scale (accessed August 28, 2026).
IndexerLabs Team. (2026b). “What We Learned Indexing the Same Book 120 Times.” April 12. https://indexerlabs.com/blog/what-we-learned-indexing-the-same-book-120-times (accessed August 28, 2026).
IndexerLabs. (n.d.). “Oxford History of the French Revolution Demo.” https://indexerlabs.com/oxford-history-of-the-french-revolution-demo (accessed August 28, 2026).
International Organization for Standardization. (1996). ISO 999:1996: Information and documentation—Guidelines for the content, organization and presentation of indexes. 2nd ed. https://www.iso.org/standard/5446.html.
International Organization for Standardization. (2026). ISO/FDIS 999: Information and Documentation—Guidelines for the Content, Organization and Presentation of Indexes. Final draft. https://www.iso.org/standard/87175.html.
Izzard, T. (2024). “Generative Artificial Intelligence (AI) and Its Performance at Indexing Tasks.” The Indexer, 42(4), 383-400. https://doi.org/10.3828/index.2024.24.
Järvelin, K., and Kekäläinen, J. (2002). “Cumulated Gain-Based Evaluation of IR Techniques.” ACM Transactions on Information Systems, 20(4), 422-446. https://doi.org/10.1145/582415.582418.
Johncocks, B. (2008). “Indexing by numbers: Is there scope for metrics in index evaluation?” The Indexer, 26(4), 158-162. https://doi.org/10.3828/indexer.2008.49.
Jörgensen, C., and Liddy, E. D. (1996). “Information access or information anxiety? An exploratory evaluation of book index features.” The Indexer, 20(2), 64-68. https://doi.org/10.3828/indexer.1996.20.2.3.
Markey, K. (1984). “Interindexer consistency tests: A literature review and report of a test of consistency in indexing visual materials.” Library & Information Science Research, 6(2), 155-177. https://eric.ed.gov/?id=EJ303179.
Marshall, L. (2023a). “Commissioning an Indexer (Part 3): How to Evaluate an Index—Guidance for Authors and Editors.” Society of Indexers, March 24. https://www.indexers.org.uk/posts/commissioning-an-indexer-part-3/.
Marshall, L. (2023b). “Qualities of a Good Index.” Society of Indexers, October 20. https://www.indexers.org.uk/posts/qualities-of-a-good-index/.
Medelyan, O., and Witten, I. H. (2006). “Measuring Inter-Indexer Consistency Using a Thesaurus.” In Proceedings of JCDL 2006, 274-275. https://doi.org/10.1145/1141753.1141816.
National Information Standards Organization. (2021). ANSI/NISO Z39.4-2021: Criteria for Indexes. https://doi.org/10.3789/ansi.niso.z39.4-2021.
Quinn, S. (2015). “Evaluating Indexes: Observations on ANZSI Experience.” The Indexer, 33(3), 107-112. https://doi.org/10.3828/indexer.2015.28.
Reich, P., and Biever, E. J. (1991). “Indexing Consistency: The Input/Output Function of Thesauri.” College & Research Libraries, 52(4), 336-342. https://doi.org/10.5860/crl_52_04_336.
Rolling, L. (1981). “Indexing consistency, quality and efficiency.” Information Processing & Management, 17(2), 69-76. https://doi.org/10.1016/0306-4573(81)90028-5.
Vagle, B. (2026). “AI Can Create Book Indexes: Here’s Why.” Indexia, May 28. https://www.indexia.tech/blog/indexing-standards-benchmark (accessed August 28, 2026).
Wittmann, C. (1990). “Subheadings in award-winning book indexes: A quantitative evaluation.” The Indexer, 17(1), 3-6. https://doi.org/10.3828/indexer.1990.17.1.3.
Wu, D., Yin, D., and Chang, K.-W. (2024). “KPEval: Towards fine-grained semantic-based keyphrase evaluation.” In Findings of ACL 2024, 1959-1981. https://doi.org/10.18653/v1/2024.findings-acl.117.
Wu, Z., Li, Z., Mitra, P., and Giles, C. L. (2013). “Can Back-of-the-Book Indexes Be Automatically Created?” In Proceedings of CIKM 2013, 1745-1750. https://doi.org/10.1145/2505515.2505627.
Cita sugerida
Camden, John. “Evaluación de índices temáticos: un método fundamentado en la fuente y ciego al candidato.” Versión 1.0. Publication Intelligence, LLC, 2026. https://indexpdf.com/es/research/subject-index-evaluation-methodology.