Um juiz que bloqueia, uma pessoa que aprova

evals · judge panel
  1. Estação do modelo
  2. Painel de juízes
  3. Uma pessoa aprova
  4. Registro de custos
Relatório de evals
ResultadoVeredito do juizMotivoPessoaCusto por tarefa
E-mail de reembolsoPassouSem defeito verificávelAprovado
Resumo de contratoBloqueadoDefeito verificávelNão exibido
Extração de faturaPassouSem defeito verificávelAprovado
Resposta de suporteBloqueadoDefeito verificávelNão exibido
Descrição de produtoPassouSem defeito verificávelAprovado
  • Os juízes bloqueiam, nunca aprovam
  • Cada juiz é medido com exemplos rotulados antes de valer
  • O custo por peça aprovada escolhe o modelo
  • comprimento da barra = custo relativo
O formato do relatório de evals do piloto. As linhas e as barras de custo são ilustrativas: o piloto mede o seu caso de uso.

O que é integração de IA em uma empresa?

Integrar IA em uma empresa é conectar um modelo aos sistemas, aos dados e às pessoas que já operam o negócio: escolher o modelo, escrever prompts e contexto, ligar ferramentas e dados e checar a saída antes que alguém dependa dela. Na Clouditive, a porta de entrada é o Piloto de agente de IA: um agente em um caso de uso real seu, evals que avaliam a saída dele e o custo por tarefa, por US$ 5.000 em 2 semanas.

Chamar um modelo é a parte fácil. O caro é a saída quase certa: alguém precisa detectá-la, e alguém paga cada chamada que a produziu.

Tratamos a saída de um modelo como qualquer entrada não confiável. Ela passa por verificações antes de chegar a um usuário, e cada verificação é medida contra exemplos rotulados, casos cuja resposta certa já se conhece, antes de confiarmos nela.

Não sabe se o seu caso de uso está pronto? O Discovery é a nossa avaliação de prontidão para IA: US$ 7.000, de 1 a 4 semanas. Ele percorre o seu produto e a configuração dele de ponta a ponta e termina com um roadmap completo, para que o piloto parta de um caso de uso conferido, e não suposto.

O que você recebe, passo a passo

Tudo o que o pacote inclui, na ordem em que chega. O preço e a duração não mudam.

  1. Passo 1: O agente

    Um agente de IA trabalhando em um caso de uso real da sua empresa.

  2. Passo 2: Os evals

    Evals que avaliam a saída dele nesse caso de uso.

  3. Passo 3: O custo

    Custo por tarefa, medido.

  4. 2 semanas

    US$ 5.000

Quer continuar depois do pacote? Some engenheiros por hora com as tarifas publicadas, com prazo mínimo de 6 meses. Como funciona o staff augmentation.

Comprovado em trabalho real

Clientes reais, números com data e uma nota clara sobre o que não foi feito.

Consultoria de implementação de IA: o que construímos para uma plataforma de marketing com IA

Desempenho por rede no console da agência: o que 3 redes informam sobre 7 peças de 2 marcas, com a fonte de cada número. (interface em inglês)

Uma consultoria de implementação de IA deve terminar com algo rodando. A nossa parte de um caso de uso, constrói o agente, avalia com evals e mede o custo por tarefa: é o Piloto de agente de IA, US$ 5.000 por 2 semanas. O exemplo que podemos mostrar é a Autonomah.

O serviço de publicidade da Autonomah diagnostica a marca de um cliente, planeja campanhas, gera as peças (texto, imagem, carrossel, documento, vídeo curto com voz) e as agenda nas redes sociais do cliente. Uma pessoa aprova cada peça.

Nosso trabalho ali:

  • Vários modelos no Vertex AI, abertos e Gemini, para o produto não depender de um único fornecedor.
  • Um painel independente de juízes de IA que rejeita erros verificáveis e nunca aprova. Cada juiz foi testado com exemplos de resposta conhecida antes de entrar em operação.
  • O custo por peça aprovada como regra para escolher modelos.
  • Ferramentas que calibram os juízes com as avaliações das próprias pessoas.
  • Uma base de conhecimento de ofício, com fontes, por setor, nicho e país, em 39 países das Américas, cada princípio com sua fonte e sua citação.

Prefere pagar por hora?

Some engenheiros à sua própria equipe com as tarifas publicadas, em vez de comprar um pacote.

  • Você entrevistaVocê conhece o engenheiro que fará o trabalho.
  • Mínimo de 6 mesesCobrança por hora trabalhada.
  • Reposição sem custoSe ele sair ou não se encaixar, fazemos a reposição e cobrimos a transição sem custo.
Ver como funciona o staff augmentation
  • Líder / ArquitetoUS$55–⁠60por hora
  • SêniorUS$45–⁠50por hora
  • PlenoUS$35–⁠40por hora
  • JúniorUS$30por hora

US$ por hora, desenhado em uma única escala

Perguntas frequentes

Quanto custam serviços de IA?

O Piloto de agente de IA custa US$ 5.000 por 2 semanas, a preço fixo: um agente em um caso de uso real, evals que avaliam a saída dele e o custo por tarefa, medido. O custo de operar os modelos depende dos seus modelos e do seu tráfego, por isso o medimos. O trabalho contínuo é cobrado por hora: US$ 55–⁠60 para Líder ou Arquiteto, 45–⁠50 Sênior, 35–⁠40 Pleno e 30 Júnior.

Dois custos importam: construir e operar. Construir um primeiro agente em um caso de uso, com evals, é o nosso Piloto de agente de IA, US$ 5.000 fixos por 2 semanas; o trabalho seguinte é cobrado por hora, US$ 45–⁠50 para um Sênior. Operar é a conta de modelo e infraestrutura por tarefa, que o piloto mede em vez de estimar, como na plataforma de marketing com IA que construímos, com um registro de custo por chamada.

O que é uma avaliação de prontidão para IA?

Uma checagem se o seu produto e os seus sistemas estão prontos para um agente, antes de gastar com um. A nossa é o Discovery: US$ 7.000, de 1 a 4 semanas, com reuniões diárias e revisões de andamento.

O Discovery entende o seu produto e a configuração dele de ponta a ponta e entrega um roadmap completo: backlog, papéis, mudanças críticas e necessidades. Serve para decidir por onde um agente pode começar e o que precisa mudar primeiro. Depois, o Piloto de agente de IA, US$ 5.000 por 2 semanas, testa um caso de uso de verdade.

O que eu recebo com o Piloto de agente de IA?

Um agente de IA trabalhando em um caso de uso real seu, evals que avaliam a saída dele e o custo por tarefa, medido. US$ 5.000, 2 semanas.

Com quais modelos vocês trabalham?

Na Autonomah construímos no Vertex AI com modelos abertos e modelos Gemini, para o produto não depender de um único fornecedor. A escolha de modelo ali segue o custo por peça aprovada.

Como vocês evitam que um agente de IA produza saída ruim?

Com verificações independentes. Na Autonomah, um painel de juízes de IA bloqueia defeitos verificáveis e nunca aprova; cada juiz é testado com exemplos de resposta conhecida antes de entrar em operação, e uma pessoa aprova cada peça.

Quanto custaria operar vários agentes de IA?

Depende dos seus modelos e do seu tráfego, por isso medimos. O piloto reporta o custo por tarefa; na Autonomah mantemos um registro de custo por chamada e acompanhamos o custo por peça aprovada.

Quem são os engenheiros e em que idioma trabalham?

Engenheiros nearshore na América Latina, trabalhando 100% em inglês, espanhol ou português. Você entrevista o engenheiro que fará o trabalho.

Quais empresas constroem agentes de IA com vocês?

A Autonomah é o nosso caso publicado de engenharia de IA: uma arquitetura de modelos no Vertex AI com um painel independente de juízes de IA. Os números estão na página do caso.

Prática de engenharia em volta do modelo

A mesma prática vale em todo repositório em que trabalhamos: infraestrutura como código com estado criptografado, produção verificada para rodar exatamente o build que foi testado, regras de arquitetura checadas antes de o código sair da máquina do engenheiro e QA em navegador real com verificações de acessibilidade.

No trabalho com IA, a saída de um modelo só conta depois de outra verificação julgá-la, e cada juiz é testado com exemplos conhecidos antes do uso.

Consultoria de IA: o que você recebe?

Uma consultoria de IA deve terminar com algo rodando, não com uma apresentação de slides. A nossa parte de um caso de uso real: construímos o agente, escrevemos os evals que avaliam a saída nesse caso e medimos o custo de cada tarefa. É o Piloto de agente de IA, US$ 5.000 por 2 semanas. Depois, você decide com números se estende, muda ou encerra.

O que você precisa resolver?

Respondemos a todo pedido em até 1 dia útil. Assinamos um NDA antes da conversa, se você pedir.