CF Gauss

Avaliação de agentes

Melhore prompts com medição — não com uma resposta que parece boa.

Um método e conjunto de templates para testar agentes com cenários, rubricas, juízes, torneios e múltiplas execuções antes de publicar uma mudança.

AutoriaProjeto original
TecnologiaTypeScript · Vitest
LicençaMIT
Atualizadoago. de 2026

Por que existe

Modelos não são determinísticos. Uma única resposta pode esconder regressões em preço, segurança, ferramentas ou escalonamento. AI Gym compara baseline e edição sobre o mesmo conjunto de comportamentos e exige repetição suficiente para separar ganho de sorte.

Os cenários descrevem uma única responsabilidade observável e os stubs devolvem contexto canônico sem tocar produção. Depois, juízes aplicam a mesma rubrica aos transcritos e o scorecard reúne resultados por dimensão. O torneio só é útil porque qualquer candidato também precisa preservar comportamentos que já funcionavam. A etapa final é cirúrgica: levar para o prompt real apenas a alteração que sobreviveu ao conjunto completo.

01

Times que mantêm prompts de produção

02

Builders de agentes com ferramentas e políticas

03

Projetos que precisam impedir regressões comportamentais

Menos promessa.
Mais mecanismo.

01

Harness realista

Executa o prompt verdadeiro com ferramentas stubadas, registrando decisões sem criar tickets, pedidos ou efeitos externos.

02

Rubrica por comportamento

Cada cenário define must e must_not; violações críticas limitam a pontuação mesmo quando a resposta soa convincente.

03

Torneio de variantes

Alternativas atacam fraquezas por ângulos diferentes e são julgadas contra a suíte completa.

04

N-runs

Baseline e candidato rodam várias vezes por caso para que variância não seja confundida com melhoria.

1

Meça

Congele prompt, cenários, stubs e scorecard para criar um baseline reproduzível.

2

Ataque

Gere mudanças específicas para a fraqueza mais importante, não uma reescrita total intuitiva.

3

Repita

Compare candidatos em múltiplas rodadas e verifique dimensões que não deveriam mudar.

4

Envie

Aplique apenas a menor alteração que a evidência sustentou e mantenha o teste como regressão.

git clone https://github.com/luisroquette/ai-gym.git

Limites honestos

O que este projeto não promete.

Próximo projeto

Coesa Auditoria
Claude Partner Network
ABRIA — Associação Brasileira de Inteligência Artificial