Un ejecutor reproducible de evaluaciones mediante archivos JSON. Mide la coincidencia exacta, el F1 léxico, las frases obligatorias o prohibidas y la longitud máxima. Las respuestas ausentes siguen apareciendo como fallos. Un adaptador opcional llama a una dirección IP local de Ollama, sin proxies ni redirecciones automáticas.
Estas métricas no demuestran la veracidad, la seguridad ni la calidad global de una respuesta.
Funciones incluidas
- Evaluación sin conexión de archivos de respuestas
- F1 léxico y restricciones explícitas
- Códigos de salida adecuados para CI
- Adaptador Ollama limitado al bucle local
- Pruebas HTTP locales sin descargar modelos
Licencia y primeros pasos
Código original bajo licencia MIT, copyright 2026 STELLARR STUDIO. Se permite el uso personal y comercial conservando el aviso de licencia. Incluye guías en francés e inglés. Las marcas y dependencias conservan sus propios derechos.
Lea el README para conocer los requisitos, los comandos de inicio, las pruebas y los límites de despliegue. No se incluyen alojamiento, capacidad de cómputo, APIs externas ni asistencia a medida.
Archivos incluidos
.gitignoreevaluate.pyexamples/cases.jsonexamples/responses-failing.jsonexamples/responses.jsonkit.jsonLICENSEREADME.en.mdREADME.mdtest_evaluate.pyTEST_REPORT.mdTHIRD_PARTY_NOTICES.mdverification.json