18:03
youtube.com 31/07/2026 SRT AI Videos

What's Next After RLHF? — Diogo Almeida, TypeSafe AI

O futuro da Inteligência Artificial: Diogo Almeida, da TypeSafe AI, revela o que vem após RLHF.

Agentes Autônomos Tecnologia Aprendizado por Reforço AI

Conteudo

TLDR;

O RLHF é o algoritmo que otimiza preferências humanas e está por trás de todos os LLMs atuais como o ChatGPT.. A IA atual é excelente em tarefas com humano no loop para agradar o usuário mas falha em automação autônoma sem supervisão.. O próximo passo após o RLHF exige mudar o foco de assistência interativa para automação sem humano no loop.

Resumo

Tiago Almeida, ex-pesquisador da OpenAI e coautor de modelos como GPT-4 e ChatGPT, discute o que vem depois da era do RLHF. Ele explica a polarização atual no campo de IA: enquanto alguns celebram avanços em benchmarks e desempenho acima do humano, outros veem bolha e ausência de valor real. Segundo Almeida, a raiz dessa divisão está no próprio RLHF, que treina modelos para otimizar preferências humanas. Por isso, a IA atual brilha em tarefas de assistência com humano no loop — como chatbots ou geração de código que agrada o usuário —, mas falha em automação autônoma, como decisões de alto risco ou processos em segundo plano. Empresas aprendem a evitar usar IA em decisões com impacto financeiro, transferindo custos ao usuário. O palestrante defende uma visão equilibrada: o sucesso aparente reflete o design centrado no humano, não uma revolução transformadora.