Um executor de avaliações reproduzíveis com ficheiros JSON. Mede correspondência exata, F1 lexical, expressões obrigatórias ou proibidas e comprimento máximo. As respostas em falta permanecem falhas visíveis. Um adaptador opcional contacta um endereço IP local do Ollama sem proxies nem redirecionamentos automáticos. Estas métricas não estabelecem a veracidade, a segurança ou a qualidade global das respostas.
Funcionalidades incluídas
- Avaliação offline de ficheiros de respostas
- F1 lexical e restrições explícitas
- Código de saída adequado a CI
- Adaptador Ollama limitado a loopback
- Testes HTTP locais sem descarregar modelos
Licença e primeiros passos
Código original sob licença MIT, copyright 2026 STELLARR STUDIO. Utilização pessoal e comercial permitida com conservação do aviso de licença. Guias em francês e inglês incluídos. As marcas e dependências conservam os seus próprios direitos.
Consulte o README para conhecer os requisitos, comandos de arranque, testes e limites de implementação. Alojamento, computação, APIs externas e apoio à medida não estão incluídos.
Ficheiros incluídos
.gitignoreevaluate.pyexamples/cases.jsonexamples/responses-failing.jsonexamples/responses.jsonkit.jsonLICENSEREADME.en.mdREADME.mdtest_evaluate.pyTEST_REPORT.mdTHIRD_PARTY_NOTICES.mdverification.json