Consultoria

Automação para a filologia da USP

Imageamento multiespectral e leitura de manuscritos históricos com IA

Contexto
Equipe de filologia da USP e FFLCH
Papel
Consultor de automação e de tecnologia aplicada
Período
2026
Status
Primeira frente entregue; segunda frente com avaliação entregue, aguardando definição da equipe
ConsultoriaVisão computacionalPesquisa acadêmicaIA aplicada

Duas frentes com o mesmo objetivo: tirar trabalho manual das mãos de pesquisadores que não são técnicos, sem prometer mágica.

16imagens espectrais combinadas por composição
6ferramentas comparadas com critério explícito
3problemas distintos separados dentro de um único pedido
16 imagensespectraisComposiçãoautomatizadaReconhecimentode escritaIATranscrição ematerialdidático
Duas frentes, do processamento de imagem à leitura do texto. Arraste para o lado para ver o fluxo inteiro.

Motivador

A equipe de filologia trabalha com documentos dos séculos XVII e XVIII. Duas dores apareceram: recuperar trechos rasurados em manuscritos, e o trabalho manual de traçar letra por letra para montar alfabetos e exercícios de leitura em um guia digital paleográfico.

Problema

Na primeira frente, o software de imageamento multiespectral exigia manipular 16 imagens espectrais e combiná-las, o que travava o uso por quem não programa. Na segunda, a demanda chegou misturando três problemas técnicos distintos, e um deles apontava para a direção oposta da dor real.

Solução

Frente 1, imageamento multiespectral: prototipei a automação do processamento das 16 imagens espectrais em composições coloridas, com foco em usabilidade para usuário não técnico. Usei IA para gerar os scripts em Python e o navegador para orquestrar o fluxo.

Frente 2, leitura paleográfica: em vez de aceitar o pedido como veio, decompus a demanda em três coisas diferentes. Separar letras é segmentação de caracteres, hoje superada como etapa isolada. Transcrever o texto é reconhecimento de escrita manuscrita, e esse era o alvo real. E a ferramenta de gerar fontes que a equipe citou faz o inverso do que se queria: ela não reconhece nada.

Comparei seis caminhos com critério explícito de adequação ao corpus, custo, soberania dos dados e esforço, incluindo uma plataforma de referência com modelo público para português dos séculos XVI a XIX, uma alternativa aberta e auto-hospedável, e modelos de visão de propósito geral.

Fechei com uma direção incremental e barata: prova de conceito comparando as vias em uma página do corpus, medindo taxa de erro contra transcrição de referência, antes de comprometer com qualquer solução. E propus derivar a separação de letras do reconhecimento já alinhado, em vez de traçar à mão.

Resultado

  • A automação do imageamento multiespectral saiu do papel como protótipo, com o processamento acessível a quem não é técnico.
  • A avaliação da leitura paleográfica devolveu à equipe uma leitura honesta do que resolve a dor deles e do que não resolve, com cinco perguntas objetivas para fechar escopo.
  • Nada foi implementado antes da validação, de propósito. O combinado registrado foi validar o escopo antes de construir.

O que eu tirei daqui

  • Parte relevante do trabalho de produto é recusar o pedido literal e devolver o problema certo, sem desautorizar quem pediu.
  • Em contexto acadêmico, soberania dos dados é requisito, não preferência. Isso muda a lista de soluções viáveis.
  • Uma tabela comparativa honesta, com o que ainda não foi validado marcado como tal, vale mais que uma recomendação confiante demais.

Onde a IA entrou

Cada etapa do ciclo do projeto, com o quanto a IA pesou nela.

CentralApoioNão usei
Descoberta e entendimento do problema

Decomposição de um pedido que misturava três problemas técnicos, com a correção de premissa feita de forma explícita e respeitosa.

Pesquisa e evidência

Estado da arte de reconhecimento de escrita manuscrita, incluindo benchmarks recentes de modelos de visão, com fontes e ressalvas sobre o que ainda não foi validado em português setecentista.

Especificação e documentação

Documento de avaliação com tabela comparativa, direção recomendada e perguntas abertas, escrito para leitor não técnico.

Arquitetura e infraestrutura

Comparação entre nuvem e auto-hospedagem considerando soberania de dados do corpus.

Desenvolvimento

Scripts de processamento das imagens espectrais gerados com IA e ajustados para uso por pessoa não técnica.

QA e análise de dados

Proposta de medir taxa de erro de caractere contra transcrição de referência como critério de decisão.

IA dentro do produto

Modelo de visão para transcrição e reconhecimento de escrita manuscrita como motor da solução avaliada.

Timeline e marcos

  1. 2026

    Frente 1: imageamento multiespectral

    Protótipo da automação do processamento das 16 imagens espectrais em composições coloridas.

  2. Jul/2026

    Recebimento da segunda demanda

    E-mail da pesquisadora com exemplo, dois artigos de segmentação e referências de ferramentas.

  3. Jul/2026

    Avaliação inicial entregue

    Decomposição em três problemas, comparativo de seis ferramentas e direção recomendada.

  4. 07/jul

    Retorno enviado à equipe

    Resposta com nota de segurança de dados, testes rápidos com modelos de visão e hipótese de solução local.

Ferramentas

IA e modelos

Modelos de visão para transcriçãoClaudeGeminiClaude Code

Processamento

PythonAutomação por navegadorComposição de imagens espectrais

Avaliação

Plataformas de reconhecimento de escrita manuscritaMotores abertos auto-hospedáveisMétrica de taxa de erro de caractere

Resumo STAR

Situação
A equipe de filologia da USP trabalha com manuscritos dos séculos XVII e XVIII e gasta tempo enorme em tarefas manuais de imagem e de traçado de letras.
Tarefa
Automatizar o que dava para automatizar e dizer com clareza o que não dava, sem vender solução mágica para um público acadêmico.
Ação
Prototipei a automação do imageamento multiespectral com foco em quem não programa, e na segunda frente decompus o pedido em três problemas distintos, comparei seis caminhos e propus uma prova de conceito medida antes de qualquer implementação.
Resultado
O processamento das 16 imagens espectrais ficou acessível a usuário não técnico, e a equipe recebeu uma avaliação que redireciona o esforço para o problema que de fato resolve a dor deles.

Quer conversar sobre um desafio parecido?

Fale comigo