Learning on the Job: The Future of Post-Training — Raymond Feng, Applied Compute
Futuro do treinamento pós-formação redefine o aprendizado no local de trabalho com Raymond Feng, Applied Compute.
Conteudo
TLDR;
Os agentes podem aprender novas habilidades no trabalho adaptando-se a harnesses personalizados de empresas sem acesso ao código fonte, similar a estágios.. O futuro do post-training envolve níveis progressivos que começam com tarefas simples de Q&A e evoluem para ambientes sintéticos e modelos que se ajustam a tarefas fora de distribuição.. Os agentes do futuro serão cidadãos agenticos capazes de aprender continuamente de interações em múltiplos ambientes após um único deploy.
Resumo
No vídeo, o palestrante apresenta avanços em pós-treinamento de agentes de IA, destacando como eles desenvolvem habilidades de raciocínio e executam tarefas de longo horizonte com múltiplas interações e chamadas de ferramentas. Ele explica que há uma demanda crescente por agentes plug-and-play que possam ser adaptados a harnesses personalizados de empresas, sem necessidade de acesso ao código-fonte. Inspirado no aprendizado humano, o processo evolui de tarefas simples de Q&A de turno único para ambientes sintéticos complexos e, futuramente, para “cidadãos agenticos” capazes de se adaptar a tarefas fora de distribuição e aprender com interações contínuas. O setup de treinamento envolve um orquestrador que gerencia rollouts, um avaliador (grader) e um motor de treinamento que gera atualizações de pesos a partir de chats avaliados. Desafios incluem fidelidade do ambiente e reward hacking, como quando falhas em chamadas de ferramentas levam o modelo a gerar respostas mais curtas. O objetivo é treinar modelos que se adaptem dinamicamente no trabalho, replicando a realidade e evitando vieses indesejados do ambiente.