BEANSTECH · HOSPITAL ISRAELITA ALBERT EINSTEIN

chatvm

A IA que prova o que responde. Assistência clínica com cadeia anti-alucinação de 6 camadas, trilha de auditoria e fontes citadas.
277 casos · benchmark cego 12+ modelos soberanos LGPD por design 114ms · Virgínia

Testes preliminares em 277 casos clínicos reais brasileiros. O modelo vencedor identificou dose excessiva de rivaroxabana com clearance renal de 28 mL/min — e disse "não posso afirmar" quando não podia.

TESTES PRELIMINARES

Benchmark clínico cego

277 casos clínicos reais brasileiros, apresentados a múltiplos modelos sem identificação. Avaliação por correspondência literal de texto e revisão cega. Resultados preliminares — a revisão por pares médicos é a próxima fase.

01

Casos reais brasileiros

Emergência, cardiologia, pneumologia, pediatria, endocrinologia e 23 especialidades. Perguntas de plantão — não questões de prova.

02

Cego — modelos mascarados

Respostas apresentadas como "Modelo A até Modelo I" sem identificação. Avaliadores não sabem qual modelo gerou cada resposta.

03

Zero tolerância para erro grave

Erro clínico com impacto = bloqueio imediato de produção. Um único erro grave elimina o candidato, independente da nota média.

04

Trilha completa por resposta

Modelo, versão, raciocínio, tokens, camadas de verificação, dados pessoais removidos antes do processamento. Tudo auditável.

Resultados Preliminares — Avaliação Automática

Indicadores · a revisão humana transforma em prova
ModeloCoberturaAbstenções
Modelo D0,48620
Modelo E0,43711
Modelo A0,3963
Modelo I0,39212
Modelo G0,37715
Modelo H0,25420
Modelo F0,3476
Modelo B0,27418
Modelo C0,2352
A avaliação automática mede correspondência literal de texto. Um modelo que diz "ventilação não invasiva" em vez de "VNI" perde o ponto. A revisão humana cega corrige essa limitação — é exatamente por isso que convidamos vocês.

O caso que definiu o vencedor: paciente idoso, clearance renal 28 mL/min, rivaroxabana 20mg/dia. O modelo vencedor foi o único que (a) identificou a dose como excessiva, (b) recomendou 10mg/dia citando a fonte regulatória, e (c) mencionou o reversor específico (andexanet alfa). Os demais modelos ou não detectaram o problema, ou alucinaram a dose correta sem fonte.

COMO FUNCIONA

Cadeia anti-alucinação — 6 camadas

Cada resposta passa por seis verificações antes de chegar ao médico. A camada 4 é o que separa uma ferramenta de um palpite.

① PII removido
→
② Guardião
→
③ Síntese
→
④ Verificação de citação
→
⑤ Excelência
→
⑥ Trilha de auditoria

A camada ④: nenhuma afirmação clínica passa sem a fonte que a sustenta — ou a resposta honesta de que não pode ser dada.

EXPERIMENTE AGORA

Chat com upload de documentos

Envie exames (imagem), PDFs, ou descreva o caso. A IA estrutura o raciocínio, cita as fontes e registra a trilha completa.

💬 chatvm — assistente clínico
frota ativa · 12+ modelos
📎
Arraste ou clique para enviar documentos
🖼️ Imagem (JPG, PNG) 📄 PDF ✍️ Manuscrito (foto) 🎤 Áudio (ditado)
Paciente 74 anos, DPOC, SatO2 86% em ar ambiente, sonolenta, musculatura acessória. Gasometria: pH 7,28, pCO2 68. Conduta?
Conduta imediata: VNI primeira escolha (pH < 7,35 com hipercapnia). Oxigenoterapia Venturi 88-92%.

Critérios de falência VNI: pH < 7,25 após 1-2h, depressão respiratória, instabilidade hemodinâmica.

Investigar desencadeante: infecção? pneumotórax? embolia?

Intubação se contraindicação VNI ou falha.
📚 Fonte: PCDT-DPOC 2024 · Gold Guidelines 2024
M3-235b · 847 tokens · 6 camadas ✓ · trilha id=a7f3c
CONVITE À PARTICIPAÇÃO

Projeto de validação em parceria

Convite ao Hospital Israelita Albert Einstein

Convidamos a divisão de sciences do Einstein a participar como parceiro de validação do primeiro benchmark clínico cego multilingue do Brasil — e coautor da metodologia, publicável em revista indexada.

O que o Einstein recebe: co-autoria na metodologia (publicável), acesso à plataforma, benchmark exclusivo.
O que o Einstein não cede: nenhum dado de paciente, nada além de perguntas anonimizadas e tempo de revisão.

Fase 1 2 semanas — Especialidade prioritária, 200 casos reais anonimizados
Fase 2 8 semanas — Respostas avaliadas por 2 revisores independentes, cegos
Fase 3 2 semanas — Relatório: erro clínico, custo, recomendação. Publicável.

A régua de segurança: erro clínico grave em qualquer caso = o modelo não passa para produção. Independente da nota média.

Responder ao convite →
BASE CIENTÍFICA

Artigos e documentação

Referências internacionais que fundamentam a abordagem.

AMIE: Articulate Medical Intelligence Explorer
Tu et al. · Google DeepMind · Nature Medicine, 2024
Superou PCPs em raciocínio diagnóstico em consultas simuladas (OSCE-style)
CLINICAL
Med-PaLM 2
Singhal et al. · Google · arXiv, 2023
86,5% MedQA — nível especialista em exames médicos
BENCHMARK
MedGemma: Multimodal Medical
Google Research · 2025
Modelos 4B/27B para radiologia, dermatologia, oftalmologia
MULTIMODAL
Clinical Decision Support LLMs: Survey
Multiple · JAMIA, 2024-25
Revisão sistemática: promessas e riscos de LLMs em CDS
REVIEW
HunyuanOCR
Tencent · 2025
OCR para documentos impressos e manuscritos
OCR
Whisper-large-v3-turbo
OpenAI · 2024
Transcrição de áudio → texto para ditado médico
ASR
Lingshu-I-8B
Lingshu Medical · 2025
Interpretação de exames e imagens médicas
VISION
Benchmark Clínico PT-BR
BeansTech · 2026
277 casos, avaliação cega, GLM-5.3 vencedor
NOSSO
Ley 15.504 (Redata)
Planalto · Brasil, 2026
Isenção tributária para datacenter — energia renovável obrigatória
REGULATÓRIO
LGPD (Lei 13.709)
Planalto · Brasil, 2018
Proteção de dados — base legal para processamento de dados de saúde
LGPD
PCDT — Protocolos Clínicos
Ministério da Saúde · CONITEC
Diretrizes terapêuticas — fonte primária para verificação de citação
DIRETRIZ
AMIE Safety Follow-up
Tu et al. · npj Digital Medicine, 2024
Framework de segurança para IA clínica conversacional
SAFETY