This is the Trace Id: a4efcb98d524d1d5a679cf07ae95aa48
Avançar para o conteúdo principal
Azure

O que é a aprendizagem por reforço?

Descubra o que é a aprendizagem por reforço e como ajuda os sistemas de IA a adaptar-se e a melhorar ao longo do tempo.

Uma visão geral da aprendizagem por reforço

A aprendizagem por reforço é um método de aprendizagem automática em que os sistemas aprendem ao interagir com o seu ambiente, receber feedback e ajustar o comportamento para melhorar a tomada de decisões ao longo do tempo.

Principais conclusões

  • A aprendizagem por reforço treina modelos através de tentativa e erro, usando recompensas para moldar o comportamento ao longo do tempo.
  • É particularmente adequada para tarefas que envolvem sequências de decisões, como robótica, jogos ou personalização.
  • A aprendizagem por reforço com feedback humano (RLHF) melhora o alinhamento do modelo ao usar contributos humanos em vez de apenas sinais automatizados.
  • A RLHF ajuda os sistemas a produzir respostas que refletem melhor os objetivos, valores ou preferências humanos.
  • Ambas as abordagens continuam a evoluir à medida que a aprendizagem automática assume um papel mais importante nas ferramentas e nos sistemas assistidos por IA.

Aprendizagem por reforço definida

A aprendizagem por reforço é uma abordagem de aprendizagem automática em que os sistemas aprendem através da experiência. Um agente interage com um ambiente, executa ações, recebe feedback sob a forma de recompensas ou penalizações e ajusta o comportamento futuro para melhorar o desempenho. Ao longo do tempo, o agente aprende que decisões levam a melhores resultados, tornando este método especialmente valioso para tarefas dinâmicas ou sequenciais em que a solução ideal não é conhecida antecipadamente. É usado em vários domínios, desde robótica e jogos até sistemas de recomendação e moderação de conteúdo.

Os fundamentos da aprendizagem por reforço

O que é a aprendizagem por reforço e como impacta os sistemas de IA?

A aprendizagem automática ajuda os computadores a aprender padrões a partir de informação ao longo do tempo sem serem explicitamente programados. Impulsiona tudo, desde a filtragem de e-mails à deteção de fraude e à tradução assistida por IA. Dentro desse vasto campo, a aprendizagem por reforço é uma abordagem específica que ensina os sistemas a tomar decisões através da experiência.

Um tipo diferente de ciclo de aprendizagem

Ao contrário da aprendizagem supervisionada, que usa dados rotulados, a aprendizagem por reforço funciona através de tentativa e erro. Um sistema, chamado agente, interage com o seu ambiente, executa ações e recebe recompensas ou penalizações. Ao longo do tempo, aprende que ações levam a melhores resultados.

O ciclo de feedback funciona assim:
  • O agente executa uma ação.
  • O ambiente responde.
  • O agente recebe uma recompensa ou penalização.
  • O agente ajusta a sua estratégia com base neste feedback.
Esta configuração é especialmente útil quando a resposta correta não é conhecida antecipadamente, mas o sucesso pode ser medido pelos resultados. Isto espelha a forma como as pessoas aprendem, ou seja, tentando, observando o resultado e ajustando o passo seguinte.

Como a aprendizagem por reforço dá suporte a sistemas mais inteligentes
A aprendizagem por reforço é ideal para sistemas que precisam de tomar uma sequência de decisões em que cada ação influencia a seguinte. É muitas vezes usada em ambientes dinâmicos em que voltar a treinar um modelo do zero não é prático.

As aplicações comuns incluem:
 
  • Robótica: ensinar robots a andar, agarrar ou navegar
  • Jogos: desenvolver estratégias competitivas
  • Automação industrial: ajustar e adaptar sistemas de controlo
  • Recomendações de conteúdo: ajustar com base no comportamento dos utilizadores
  • Otimização de recursos: melhorar a eficiência em áreas como as operações de centros de dados

Em todos estes casos, a aprendizagem por reforço ajuda os sistemas a melhorar através da experiência, não apenas dos dados.

Um passo em frente: a aprendizagem por reforço com feedback humano

A aprendizagem por reforço tradicional usa recompensas definidas por engenheiros. Mas alguns objetivos, como escrever uma explicação clara ou alinhar com normas sociais, são difíceis de quantificar. É aqui que entra a aprendizagem por reforço com feedback humano (RLHF).

O que é RLHF? Com a RLHF, os avaliadores humanos fornecem contributos através de classificações, preferências ou comparações. Este feedback ajuda a orientar os modelos para resultados que reflitam melhor os valores e as expetativas humanas.

A RLHF tornou-se especialmente importante no treino de modelos de linguagem grandes (LLMs) e de sistemas generativos. Ajuda a garantir que os resultados não são apenas funcionais, mas também úteis, adequados e alinhados com a intenção do utilizador.

Compreender os pontos fortes e os compromissos

A aprendizagem por reforço e a RLHF oferecem vantagens reais, sobretudo em ambientes complexos ou imprevisíveis. Mas também introduzem novos desafios. Ter uma compreensão clara de ambas ajuda as equipas a escolher a ferramenta certa para a tarefa.

Benefícios
  • Adaptável em contextos imprevisíveis
    Muitos sistemas do mundo real, robots, jogos, logística, operam em condições em mudança. A aprendizagem por reforço ajuda estes sistemas a ajustar-se e a melhorar ao longo do tempo.
  • Sistemas mais seguros e controlados
    Para áreas críticas em termos de segurança, como a produção ou os veículos autónomos, a aprendizagem por reforço permite um aperfeiçoamento gradual. Quando combinada com feedback humano, pode promover um comportamento mais seguro e estável.
  • Alinhado com objetivos humanos
    A RLHF treina modelos para dar prioridade ao que as pessoas valorizam, não apenas ao que é fácil de medir. Isto conduz a resultados mais significativos em áreas como a moderação de conteúdo, as conversas com chatbots e os motores de recomendação.
Desafios
  • As entradas humanas não escalam facilmente
    A recolha de feedback humano estruturado demora tempo. À medida que os modelos e as tarefas se tornam mais complexos, isto torna-se mais difícil de fazer a gestão de.
  • Custo e complexidade elevados
    O RLHF acrescenta passos extra ao processo de treino. As Teams têm de treinar um modelo base e, em seguida, afiná-lo com dados humanos, o que requer mais capacidade de processamento, coordenação e avaliação.
  • Difícil de estabilizar e reproduzir
    Como a aprendizagem por reforço depende do ambiente, pequenas alterações podem produzir resultados imprevisíveis. Obter um desempenho consistente requer testes, afinação e conceção cuidada.
Casos de utilização

Aplicações no mundo real

A aprendizagem por reforço e o RLHF já são usados em sistemas que precisam de se adaptar, personalizar ou responder com nuance.

IA Conversacional

Os grandes modelos de linguagem, e cada vez mais, os modelos de linguagem pequenos (SLMs), usam RLHF para aperfeiçoar a forma como respondem aos utilizadores. Os revisores humanos ajudam a moldar o tom, a reduzir o enviesamento e a orientar os modelos para respostas úteis e relevantes.

Robótica

Os robôs operam muitas vezes em condições imprevisíveis, em linhas de produção, em casa ou no terreno. A aprendizagem por reforço ajuda-os a ajustar ações com base em resultados, como aprender a pegar em objetos com formas irregulares ou a caminhar em terreno acidentado.

Recomendação e personalização de conteúdo

Estes sistemas evoluem com base no comportamento dos utilizadores. A aprendizagem por reforço permite que os feeds de conteúdo, as plataformas de streaming e as aplicações de aprendizagem se adaptem ao longo do tempo, melhorando a relevância. A intervenção humana também pode ajudar a orientar as recomendações para conteúdo diversificado ou de elevada qualidade.

Moderação de conteúdo

Em áreas em que as normas da comunidade ou o contexto social são importantes, o RLHF ajuda os sistemas a tomar melhores decisões. As classificações e o feedback humanos ajudam os modelos a aprender o que é apropriado, mesmo em casos que não são claros.

Jogos

Os jogos são muitas vezes usados como ambientes de treino porque oferecem regras estruturadas e objetivos mensuráveis. A aprendizagem por reforço ajuda os agentes a desenvolver novas estratégias através de jogo repetido e iteração, muitas vezes em simulações antes de avançarem para aplicações no mundo real.

Modelação financeira e negociação

Os modelos adaptativos usam a aprendizagem por reforço para explorar estratégias de mercado, fazer a gestão de carteiras ou testar cenários de risco. Estes sistemas aprendem a partir de ambientes sintéticos e dados históricos, melhorando ao longo do tempo enquanto permanecem ancorados em métricas do mundo real.

Preparar-se para o que vem a seguir na IA

A aprendizagem automática está na base de muitas das descobertas de IA de hoje. Da visão computacional aos modelos de linguagem e à robótica, aprender com os dados impulsiona a inovação moderna. A aprendizagem por reforço, e o RLHF em particular, tem um papel crescente em sistemas que aprendem com a interação, e não apenas com instruções.

Sistemas mais inteligentes, construídos com base na experiência
Os modelos de aprendizagem por reforço evoluem através da experiência, o que os torna mais adequados para tarefas incertas ou sequenciais. Em vez de aprenderem a partir de dados fixos, adaptam-se em tempo real, melhorando os resultados ao longo de vários passos.

À medida que estes sistemas são aplicados a domínios mais amplos, incluindo IA multimodal , que combina texto, imagens, áudio ou vídeo, o feedback humano acrescenta uma camada essencial. Ajuda a orientar decisões que não são facilmente mensuráveis, como saber se um chatbot deu uma resposta satisfatória ou se uma recomendação foi realmente útil.

A próxima fase para o RLHF
À medida que mais organizações adotam ferramentas com assistência de IA, o RLHF está a tornar-se central para um desenvolvimento responsável, particularmente em aplicações de processamento de linguagem natural (NLP) , onde o tom, o contexto e a relevância são importantes. Mas não é fácil escalar. Recolher intervenção humana útil é dispendioso e demorado.

Para resolver isto, os investigadores estão a explorar:
  • Ciclos de feedback mais eficientes, incluindo feedback sintético que imita as respostas humanas.
  • Melhores ferramentas de avaliação para medir quão bem os modelos estão alinhados com objetivos ou valores.
  • Aplicações entre domínios que combinam a aprendizagem por reforço com outras formas de aprendizagem automática para sistemas mais flexíveis.
Também há um interesse crescente em usar o RLHF para aumentar a transparência e a responsabilização. Ao reforçar o comportamento desejado com intervenção humana, as equipas ganham mais controlo sobre a forma como os sistemas de IA evoluem.

Um campo em evolução
A aprendizagem por reforço e o RLHF não são soluções universais. Mas são poderosos quando usados para o problema certo. À medida que os sistemas de IA se tornam mais capazes, cada vez mais importantes em áreas como IA cognitiva , que visam imitar o raciocínio humano, a necessidade de métodos que suportem adaptação, supervisão e alinhamento só vai aumentar.

Tanto para líderes empresariais como para programadores, compreender como estas técnicas funcionam pode levar a aplicações de IA mais fundamentadas e ponderadas. A aprendizagem por reforço nem sempre é a resposta mas, quando se adequa ao problema, abre novas formas de criar sistemas que aprendem no mundo real.
Recursos

Saiba mais sobre o Azure

Um homem a sorrir e a olhar para a câmara.
Recursos do Azure

Visitar o centro de recursos do Azure

Aceda a vídeos, relatórios de analistas, formação, casos de estudo, exemplos de código e arquiteturas de soluções.
Formação e certificação

Explorar percursos de aprendizagem do Azure

Desenvolva competências na cloud para gerar impacto, do crescimento pessoal a melhores resultados de negócio.
Duas pessoas a sorrir enquanto observam um separador.
Eventos e webinars

Descubra eventos e formações futuros

Explore novas inovações, desenvolva as suas competências e comunique com a comunidade, virtualmente ou presencialmente.
FAQ

 Perguntas frequentes

  • Os sistemas de IA normalmente aprendem usando um de três métodos:

    Aprendizagem supervisionada:
    aprende com dados rotulados. Usado para tarefas como reconhecimento de objetos ou tradução.

    Aprendizagem não supervisionada:
    Encontra padrões sem resultados rotulados. Utilizada para clustering ou deteção de anomalias.

    Aprendizagem por reforço:
    Aprende através da interação e do feedback. Utilizada para tomada de decisões sequenciais.
  • A aprendizagem por reforço ajuda os modelos a tomar decisões por tentativa e erro. Foi concebida para treinar sistemas que aprendem ao interagir com o respetivo ambiente, ajustando o comportamento com base em recompensas ou penalizações ao longo do tempo. Isto torna-a útil para tarefas em que os resultados dependem de uma série de ações e não de uma única previsão.
  • A aprendizagem por reforço a partir de feedback humano (RLHF) é um método que melhora o comportamento do modelo usando intervenção humana. O RLHF é uma forma de treinar modelos usando preferências, classificações ou comparações de pessoas, em vez de depender apenas de recompensas automatizadas. Isto ajuda a orientar os sistemas para resultados que correspondam melhor aos objetivos ou valores humanos, especialmente em áreas como a conversação, a geração de conteúdos ou a moderação.
  • A aprendizagem por reforço centra-se na tomada de decisões. Treina um modelo para executar ações num ambiente e aprender com o feedback. Em alguns sistemas, a aprendizagem profunda é usada no âmbito da aprendizagem por reforço para ajudar o modelo a processar entradas complexas, como imagens ou texto. A aprendizagem profunda usa redes neuronais em camadas para aprender a partir de grandes quantidades de dados e é frequentemente aplicada a tarefas como reconhecimento de imagem, processamento de voz ou geração de texto.
  • Geração aumentada por recuperação (RAG) e aprendizagem por reforço com feedback humano (RLHF) são duas formas diferentes de melhorar respostas geradas por IA. A RAG ajuda um modelo a aceder a informação externa, como documentos ou bases de dados, enquanto gera resultados, para que as respostas sejam mais precisas e atualizadas. A RLHF melhora o comportamento de um modelo ao treiná-lo com base em preferências ou feedback humanos, ajudando-o a produzir respostas mais úteis, adequadas ou alinhadas com a intenção do utilizador. A RAG apoia a precisão factual; a RLHF apoia a qualidade e o alinhamento.