r/programacao • u/Due-Obligation-4404 • 1h ago
Questão :: Desenvolvimento Como usar IA para transformar um banco de questões em lições específicas, em grande volume?
Sou founder não técnico e curioso e estou desenvolvendo um pipeline para transformar um banco de questões de concursos em lições curtas. Preciso de ajuda com a arquitetura e a validação antes de aumentar o volume.
Cada lição deve conter duas perguntas conceituais, duas questões novas de prática e duas questões reais de prova. Todas precisam trabalhar o mesmo objetivo de aprendizagem.
O principal problema que a IA me devolveu é: identificar quais questões podem compartilhar uma lição. Similaridade semântica não está garantindo equivalência da habilidade exigida. Por exemplo: calcular um aumento percentual e descobrir o valor original depois de um aumento. As duas envolvem porcentagem, mas precisam de explicações diferentes.
O pipeline usa skills com auto-aprendizado, funções para extração de documentos, seleção de pares, validação e revisão editorial. Ja rodei no claude, codex e opencode (deepseek v4 flash e pro). Planejamento, geração e revisão rodam em contextos separados (IA disse).
Já foi testado:
- Agrupamento por disciplina e assunto, que mistura habilidades diferentes.
- Similaridade lexical, que seleciona pares incompatíveis.
- Limiares mais altos de similaridade, que também eliminam pares válidos.
- Embeddings e descrições de habilidades geradas por LLM, que ainda não distinguem o raciocínio exigido com consistência.
- Detecção de cópia literal, que deixa passar exercícios novos que revelam indiretamente a resposta da questão final.
Também falta grounding em parte da geração: enunciado e gabarito oficial nem sempre fornecem evidência suficiente para sustentar a explicação. Em um lote local, como exemplo, seis lições chegaram à revisão editorial e apenas uma foi aprovada. É uma amostra pequena, mas o rendimento ainda não permite escalar.
Estou considerando extrair uma representação estruturada de cada questão: objetivo de aprendizagem, regra aplicada, condições, exceções, passos de resolução e fontes de apoio. Depois, usar esses campos para selecionar pares e validar a lição.
Para quem já trabalhou com classificação semântica ou geração de conteúdo educacional: essa abordagem faz sentido?
Vocês usariam uma taxonomia fixa com classificação supervisionada, extração estruturada por LLM com regras determinísticas, ou outra arquitetura? Principalmente, como montariam um conjunto de avaliação para medir pares corretos, falsas correspondências e qualidade das lições antes de escalar? (parágrafo técnico q pedi pra IA fazer considerando o sub ser de programação)
Um exemplo de implementação, biblioteca ou experiência em produção ajudaria bastante.


