Casos reais brasileiros
Emergência, cardiologia, pneumologia, pediatria, endocrinologia e 23 especialidades. Perguntas de plantão — não questões de prova.
Testes preliminares em 277 casos clínicos reais brasileiros. O modelo vencedor identificou dose excessiva de rivaroxabana com clearance renal de 28 mL/min — e disse "não posso afirmar" quando não podia.
277 casos clínicos reais brasileiros, apresentados a múltiplos modelos sem identificação. Avaliação por correspondência literal de texto e revisão cega. Resultados preliminares — a revisão por pares médicos é a próxima fase.
Emergência, cardiologia, pneumologia, pediatria, endocrinologia e 23 especialidades. Perguntas de plantão — não questões de prova.
Respostas apresentadas como "Modelo A até Modelo I" sem identificação. Avaliadores não sabem qual modelo gerou cada resposta.
Erro clínico com impacto = bloqueio imediato de produção. Um único erro grave elimina o candidato, independente da nota média.
Modelo, versão, raciocínio, tokens, camadas de verificação, dados pessoais removidos antes do processamento. Tudo auditável.
| Modelo | Cobertura | Abstenções |
|---|---|---|
| Modelo D | 0,486 | 20 |
| Modelo E | 0,437 | 11 |
| Modelo A | 0,396 | 3 |
| Modelo I | 0,392 | 12 |
| Modelo G | 0,377 | 15 |
| Modelo H | 0,254 | 20 |
| Modelo F | 0,347 | 6 |
| Modelo B | 0,274 | 18 |
| Modelo C | 0,235 | 2 |
O caso que definiu o vencedor: paciente idoso, clearance renal 28 mL/min, rivaroxabana 20mg/dia. O modelo vencedor foi o único que (a) identificou a dose como excessiva, (b) recomendou 10mg/dia citando a fonte regulatória, e (c) mencionou o reversor específico (andexanet alfa). Os demais modelos ou não detectaram o problema, ou alucinaram a dose correta sem fonte.
Cada resposta passa por seis verificações antes de chegar ao médico. A camada 4 é o que separa uma ferramenta de um palpite.
A camada ④: nenhuma afirmação clínica passa sem a fonte que a sustenta — ou a resposta honesta de que não pode ser dada.
Envie exames (imagem), PDFs, ou descreva o caso. A IA estrutura o raciocínio, cita as fontes e registra a trilha completa.
Convidamos a divisão de sciences do Einstein a participar como parceiro de validação do primeiro benchmark clínico cego multilingue do Brasil — e coautor da metodologia, publicável em revista indexada.
O que o Einstein recebe: co-autoria na metodologia (publicável), acesso à plataforma, benchmark exclusivo.
O que o Einstein não cede: nenhum dado de paciente, nada além de perguntas anonimizadas e tempo de revisão.
A régua de segurança: erro clínico grave em qualquer caso = o modelo não passa para produção. Independente da nota média.
Responder ao convite →Referências internacionais que fundamentam a abordagem.