Resumen ejecutivo
BitBrar convierte señales de inteligencia en oportunidades estratégicas. Para que esas salidas puedan ser examinadas por clientes, analistas y auditores, el sistema conserva una capa independiente de Confidence AI y provenance. Esta capa no modifica la oportunidad original ni mezcla la evidencia con la tabla de negocio.
El diseño actual entrega tres respuestas distintas: qué tan segura declara estar la IA, qué señales citó realmente y cómo se produjo el resultado. Una cuarta respuesta, la probabilidad estadísticamente calibrada, se habilitará únicamente cuando exista un conjunto de evaluación independiente y suficiente.
Autoevaluación no calibrada del modelo entre 0 y 100.
Señales exactas citadas y validadas por identidad.
Registro reproducible del origen y del proceso.
Definiciones públicas
| Concepto | Qué significa | Qué no significa |
|---|---|---|
| Score estratégico | Intensidad, prioridad o atractivo calculado por el motor específico del dominio. | No es confianza del modelo ni probabilidad de éxito. |
| Confidence AI | Autoevaluación del modelo sobre la oportunidad que acaba de generar, expresada de 0 a 100. | No es una probabilidad calibrada mientras el registro figure como no calibrado. |
| Respaldo documental | Conjunto de señales válidas que el modelo citó mediante referencias presentes en su contexto. | No demuestra por sí solo causalidad, materialidad o viabilidad comercial. |
| Provenance | Trazabilidad de modelo, ejecución, método, fuentes, IDs, fechas, hashes y referencias rechazadas. | No revela pesos del modelo, prompts propietarios ni secretos operacionales. |
| Probabilidad calibrada | Frecuencia esperada ajustada con etiquetas independientes y un calibrador validado. | No se publica hasta superar los criterios de activación definidos en este documento. |
Arquitectura del proceso
La evaluación se ejecuta como un proceso desacoplado de la tabla principal. Esto mantiene la operación liviana, permite evolucionar el método y preserva un historial auditable sin volver inmantenibles los generadores de oportunidades.
La escritura es transaccional. La oportunidad, su evaluación y sus evidencias se confirman juntas. Si falla la persistencia de provenance, la operación completa se revierte y el registro activo anterior permanece disponible.
Las oportunidades permanecen en sus tablas de dominio.
Las evaluaciones y evidencias viven en tablas centrales reutilizables.
Protocolo de evidencia
Referencias cerradas
Cada señal presentada al modelo recibe un identificador temporal como S1, S2 o S3. El modelo solo puede citar esos identificadores. Una referencia alterada, inventada o ausente del contexto se registra como rechazada y no entra al conjunto de evidencia.
Validación por identidad
Para cada cita válida se conserva la tabla de origen, el ID de la señal, su timestamp normalizado a UTC, título, fuente, extracto y un hash SHA-256 del snapshot. Las evidencias repetidas dentro de un paquete se deduplican.
Cálculo de Confidence AI
Cada oportunidad generada puede incluir una autoevaluación c entre 0 y 100. El valor se acepta solo si es numérico, finito y se encuentra dentro del rango. Valores inválidos se convierten en ausencia de score.
Cuando una fila contiene un paquete de oportunidades, el Confidence AI visible corresponde al promedio de las oportunidades generadas con valores válidos.
- Los fallbacks se excluyen del promedio y muestran confidence vacío.
- Una oportunidad sin score no se interpreta como 0.
- La ausencia de evidencia produce insufficient_evidence, no “falso”.
- El promedio del paquete no se presenta como confidence individual.
Calibración sigmoide
La calibración futura transformará el score bruto s en una probabilidad estimada mediante una función logística. Los parámetros se aprenderán sobre un conjunto independiente de revisiones humanas y nunca sobre la misma muestra usada para evaluar el calibrador.
La etiqueta positiva será supported: la oportunidad está suficientemente respaldada por las señales citadas bajo la política de revisión vigente. La etiqueta negativa será unsupported. Los casos not_evaluable quedarán fuera del ajuste.
Criterios de activación
Etiquetas con revisión, motivo, revisor y fecha; separación temporal entre ajuste y validación.
Cada calibrador tendrá ID, hash, fecha, dominio y métricas de desempeño.
Métricas de aceptación
Se publicarán el Brier Score, el error esperado de calibración, el diagrama de confiabilidad, el tamaño de muestra y el desempeño por dominio. Si la distribución cambia, el calibrador puede pasar a estado suspendido o requerir reajuste.
Modelo de datos auditable
BitBrar centraliza la auditoría en dos estructuras lógicas reutilizables para todos los dominios.
| Estructura | Campos principales | Propósito |
|---|---|---|
| confidence_evaluations | source_module, source_table, source_id, confidence_ai, calibrated_probability, status, policy_hash, evidence_hash, run_id, provenance | Una evaluación versionada asociada a un resultado concreto. |
| confidence_evidence | evaluation_id, signal_table, signal_id, signal_hash, source_name, timestamp, relation_type, rank, excerpt | Referencias documentales exactas vinculadas a la evaluación. |
La clave de evaluación y los hashes permiten detectar cambios de contenido o política. La UI recupera la evaluación más reciente compatible con el módulo, tabla, versión del método e ID del resultado.
Estados y presentación pública
| Presentación | Regla | Interpretación correcta |
|---|---|---|
| High AI confidence | 80 a 100 | Autoevaluación alta del modelo, todavía no equivalente a probabilidad calibrada. |
| Moderate AI confidence | 60 a 79 | Autoevaluación intermedia; requiere leer evidence y provenance. |
| Low AI confidence | 0 a 59 | Mayor incertidumbre declarada por el modelo. |
| Not available | Vacío o inválido | No se inventa un valor para completar la interfaz. |
| cited_unverified | Una o más citas válidas | Existe trazabilidad documental, pendiente de verificación sustantiva. |
| insufficient_evidence | Sin citas válidas | No hay respaldo suficiente; no equivale automáticamente a falsedad. |
Ejemplo auditable
Ejemplo ilustrativo de una oportunidad generada dentro de un paquete. Los valores no representan una predicción comercial real.
Controles y límites
Solo se aceptan IDs incluidos en el contexto de generación.
Resultado, evaluación y evidencia se confirman o revierten juntos.
Contenido, política, calibrador y evidencia pueden versionarse.
Una sustitución operativa no recibe confidence del modelo.
Limitaciones conocidas
- La autoevaluación de un modelo puede ser sistemáticamente optimista o conservadora.
- Una fuente puede ser auténtica y aun así estar equivocada, desactualizada o sesgada.
- La coincidencia documental no demuestra la viabilidad económica de una oportunidad.
- Los umbrales visuales son categorías operativas, no garantías estadísticas.
- La calibración puede degradarse por cambio de dominio, idioma, modelo o distribución temporal.
BitBrar debe utilizarse como apoyo a la inteligencia y la decisión. Las decisiones materiales requieren revisión humana, contraste de fuentes y evaluación del contexto.
Hoja de ruta de calibración
Trazabilidad
Confidence declarado, referencias cerradas, hashes, fallbacks explícitos y estados de evidencia.
Etiquetado
Conjunto independiente supported, unsupported y not_evaluable con motivos de revisión.
Calibración
Ajuste sigmoide, validación temporal, métricas públicas, versionado y monitoreo de drift.
Compromisos públicos
- No presentar confidence no calibrado como probabilidad observada.
- No asignar scores artificiales a fallbacks o valores ausentes.
- Mantener visible la evidencia insuficiente y las referencias rechazadas.
- Versionar cambios de método y calibrador.
- Separar trazabilidad técnica de validación sustantiva.
Referencias
- Platt, J. C. Probabilistic Outputs for Support Vector Machines and Comparisons to Regularized Likelihood Methods. Advances in Large Margin Classifiers, 1999. Documento.
- Niculescu-Mizil, A. y Caruana, R. Predicting Good Probabilities with Supervised Learning. ICML, 2005. Documento.
- Guo, C., Pleiss, G., Sun, Y. y Weinberger, K. Q. On Calibration of Modern Neural Networks. ICML, 2017. PMLR.
- Brier, G. W. Verification of Forecasts Expressed in Terms of Probability. Monthly Weather Review, 1950. AMS.
- National Institute of Standards and Technology. Artificial Intelligence Risk Management Framework AI RMF 1.0, 2023. NIST.
Versión del documento: 1.0 · 16 de septiembre de 2026. La metodología puede evolucionar; los cambios materiales deberán publicarse con una nueva versión.