This is the Trace Id: 7884b86cccaf77cd967808e4b4d3d123
Avançar para o conteúdo principal Explorar Ver todos os produtos (200+) Microsoft Foundry Azure Copilot GitHub Copilot Azure Kubernetes Service (AKS) Azure Cosmos DB Base de Dados do Azure para PostgreSQL Azure Arc Microsoft Fabric Máquinas virtuais do Linux no Azure Modelos do Foundry Serviço de Agente do Foundry Foundry IQ Foundry Tools Foundry Control Plane Observabilidade no Foundry Control Plane Azure OpenAI em Modelos do Foundry Voz do Azure no Foundry Tools Azure Machine Learning Ver todas as bases de dados Azure Cosmos DB Azure DocumentDB SQL do Azure Base de Dados do Azure para PostgreSQL Redis Gerido pelo Azure Microsoft Fabric Azure Databricks Máquinas virtuais do Linux no Azure Windows Server no Azure Funções do Azure Conjuntos de Dimensionamento de Máquinas Virtuais do Azure Gestão de API do Azure Azure Container Apps Azure Kubernetes Service (AKS) Azure Kubernetes Fleet Manager Azure Container Registry Azure Red Hat OpenShift Azure Container Instances Armazenamento de Contentores do Azure Azure Arc Azure Local Microsoft Defender para a Cloud Azure Monitor Microsoft Sentinel Azure Migrate Ver todas as soluções (40+) Soluções de cloud para pequenas e médias empresas Centro de modernização e migração para a Cloud Análise de dados para IA Bases de Dados do Azure Aplicações e agentes de IA Microsoft Marketplace Microsoft Sovereign Cloud Aplicações e agentes de IA IA responsável com o Azure Infraestrutura de IA Análise de dados para IA Operações de aprendizagem automática (MLOps) Desenvolvimento de aplicações low-code no Azure Serviços de Integração Computação sem servidor DevOps Centro de migração e modernização Migração de aplicações .NET Bases de Dados no Azure Linux no Azure Oracle no Azure SAP na Nuvem da Microsoft Cloud adaptável Computação de alto desempenho (HPC) Infraestrutura como um serviço (IaaS) Resiliência Azure Essentials Frontier Accelerate para Azure FinOps no Azure Microsoft Marketplace Descrição geral de preços do Azure Crie uma conta do Azure Serviços do Azure gratuitos Opções de compra flexíveis Calculadora de preços FinOps no Azure Maximizar o ROI de IA Planos de poupança do Azure Reservas do Azure Benefício Híbrido do Azure Máquinas Virtuais SQL do Azure Microsoft Foundry Microsoft Fabric Azure Kubernetes Service (AKS) Microsoft Defender para a Cloud Ver mais Empresas de Desenvolvimento de Software Microsoft Marketplace Localizar um parceiro Recursos para parceiros do Azure Começar a utilizar o Azure Histórias de clientes Relatórios, documentos técnicos e e-books de analistas Vídeos Saber mais sobre computação na cloud Documentação Explore portal do Azure Recursos para programadores Modelos de início rápido Recursos para startups Comunidade de programadores Estudantes Azure para parceiros Blogue Eventos e Webinars Aprender Suporte Contactar o Departamento de Vendas Começar a utilizar o Azure Iniciar sessão

O que é a aprendizagem por reforço?

Descubra o que é a aprendizagem por reforço e como ajuda os sistemas de IA a adaptar-se e a melhorar ao longo do tempo.

Uma visão geral da aprendizagem por reforço

A aprendizagem por reforço é um método de aprendizagem automática em que os sistemas aprendem ao interagir com o seu ambiente, receber feedback e ajustar o comportamento para melhorar a tomada de decisões ao longo do tempo.

Principais conclusões

  • A aprendizagem por reforço treina modelos através de tentativa e erro, usando recompensas para moldar o comportamento ao longo do tempo.
  • É particularmente adequada para tarefas que envolvem sequências de decisões, como robótica, jogos ou personalização.
  • A aprendizagem por reforço com feedback humano (RLHF) melhora o alinhamento do modelo ao usar contributos humanos em vez de apenas sinais automatizados.
  • A RLHF ajuda os sistemas a produzir respostas que refletem melhor os objetivos, valores ou preferências humanos.
  • Ambas as abordagens continuam a evoluir à medida que a aprendizagem automática assume um papel mais importante nas ferramentas e nos sistemas assistidos por IA.

Aprendizagem por reforço definida

A aprendizagem por reforço é uma abordagem de aprendizagem automática em que os sistemas aprendem através da experiência. Um agente interage com um ambiente, executa ações, recebe feedback sob a forma de recompensas ou penalizações e ajusta o comportamento futuro para melhorar o desempenho. Ao longo do tempo, o agente aprende que decisões levam a melhores resultados, tornando este método especialmente valioso para tarefas dinâmicas ou sequenciais em que a solução ideal não é conhecida antecipadamente. É usado em vários domínios, desde robótica e jogos até sistemas de recomendação e moderação de conteúdo.

Os fundamentos da aprendizagem por reforço

O que é a aprendizagem por reforço e como impacta os sistemas de IA?

A aprendizagem automática ajuda os computadores a aprender padrões a partir de informação ao longo do tempo sem serem explicitamente programados. Impulsiona tudo, desde a filtragem de e-mails à deteção de fraude e à tradução assistida por IA. Dentro desse vasto campo, a aprendizagem por reforço é uma abordagem específica que ensina os sistemas a tomar decisões através da experiência.

Um tipo diferente de ciclo de aprendizagem

Ao contrário da aprendizagem supervisionada, que usa dados rotulados, a aprendizagem por reforço funciona através de tentativa e erro. Um sistema, chamado agente, interage com o seu ambiente, executa ações e recebe recompensas ou penalizações. Ao longo do tempo, aprende que ações levam a melhores resultados.

O ciclo de feedback funciona assim:
  • O agente executa uma ação.
  • O ambiente responde.
  • O agente recebe uma recompensa ou penalização.
  • O agente ajusta a sua estratégia com base neste feedback.
Esta configuração é especialmente útil quando a resposta correta não é conhecida antecipadamente, mas o sucesso pode ser medido pelos resultados. Isto espelha a forma como as pessoas aprendem, ou seja, tentando, observando o resultado e ajustando o passo seguinte.

Como a aprendizagem por reforço dá suporte a sistemas mais inteligentes
A aprendizagem por reforço é ideal para sistemas que precisam de tomar uma sequência de decisões em que cada ação influencia a seguinte. É muitas vezes usada em ambientes dinâmicos em que voltar a treinar um modelo do zero não é prático.

As aplicações comuns incluem:
 
  • Robótica: ensinar robots a andar, agarrar ou navegar
  • Jogos: desenvolver estratégias competitivas
  • Automação industrial: ajustar e adaptar sistemas de controlo
  • Recomendações de conteúdo: ajustar com base no comportamento dos utilizadores
  • Otimização de recursos: melhorar a eficiência em áreas como as operações de centros de dados

Em todos estes casos, a aprendizagem por reforço ajuda os sistemas a melhorar através da experiência, não apenas dos dados.

Um passo em frente: a aprendizagem por reforço com feedback humano

A aprendizagem por reforço tradicional usa recompensas definidas por engenheiros. Mas alguns objetivos, como escrever uma explicação clara ou alinhar com normas sociais, são difíceis de quantificar. É aqui que entra a aprendizagem por reforço com feedback humano (RLHF).

O que é RLHF? Com a RLHF, os avaliadores humanos fornecem contributos através de classificações, preferências ou comparações. Este feedback ajuda a orientar os modelos para resultados que reflitam melhor os valores e as expetativas humanas.

A RLHF tornou-se especialmente importante no treino de modelos de linguagem grandes (LLMs) e de sistemas generativos. Ajuda a garantir que os resultados não são apenas funcionais, mas também úteis, adequados e alinhados com a intenção do utilizador.

Compreender os pontos fortes e os compromissos

A aprendizagem por reforço e a RLHF oferecem vantagens reais, sobretudo em ambientes complexos ou imprevisíveis. Mas também introduzem novos desafios. Ter uma compreensão clara de ambas ajuda as equipas a escolher a ferramenta certa para a tarefa.

Benefícios
  • Adaptável em contextos imprevisíveis
    Muitos sistemas do mundo real, robots, jogos, logística, operam em condições em mudança. A aprendizagem por reforço ajuda estes sistemas a ajustar-se e a melhorar ao longo do tempo.
  • Sistemas mais seguros e controlados
    Para áreas críticas em termos de segurança, como a produção ou os veículos autónomos, a aprendizagem por reforço permite um aperfeiçoamento gradual. Quando combinada com feedback humano, pode promover um comportamento mais seguro e estável.
  • Alinhado com objetivos humanos
    A RLHF treina modelos para dar prioridade ao que as pessoas valorizam, não apenas ao que é fácil de medir. Isto conduz a resultados mais significativos em áreas como a moderação de conteúdo, as conversas com chatbots e os motores de recomendação.
Desafios
  • As entradas humanas não escalam facilmente
    A recolha de feedback humano estruturado demora tempo. À medida que os modelos e as tarefas se tornam mais complexos, isto torna-se mais difícil de fazer a gestão de.
  • Custo e complexidade elevados
    O RLHF acrescenta passos extra ao processo de treino. As Teams têm de treinar um modelo base e, em seguida, afiná-lo com dados humanos, o que requer mais capacidade de processamento, coordenação e avaliação.
  • Difícil de estabilizar e reproduzir
    Como a aprendizagem por reforço depende do ambiente, pequenas alterações podem produzir resultados imprevisíveis. Obter um desempenho consistente requer testes, afinação e conceção cuidada.
Casos de utilização

Aplicações no mundo real

A aprendizagem por reforço e o RLHF já são usados em sistemas que precisam de se adaptar, personalizar ou responder com nuance.

IA Conversacional

Os grandes modelos de linguagem, e cada vez mais, os modelos de linguagem pequenos (SLMs), usam RLHF para aperfeiçoar a forma como respondem aos utilizadores. Os revisores humanos ajudam a moldar o tom, a reduzir o enviesamento e a orientar os modelos para respostas úteis e relevantes.

Robótica

Os robôs operam muitas vezes em condições imprevisíveis, em linhas de produção, em casa ou no terreno. A aprendizagem por reforço ajuda-os a ajustar ações com base em resultados, como aprender a pegar em objetos com formas irregulares ou a caminhar em terreno acidentado.

Recomendação e personalização de conteúdo

Estes sistemas evoluem com base no comportamento dos utilizadores. A aprendizagem por reforço permite que os feeds de conteúdo, as plataformas de streaming e as aplicações de aprendizagem se adaptem ao longo do tempo, melhorando a relevância. A intervenção humana também pode ajudar a orientar as recomendações para conteúdo diversificado ou de elevada qualidade.

Moderação de conteúdo

Em áreas em que as normas da comunidade ou o contexto social são importantes, o RLHF ajuda os sistemas a tomar melhores decisões. As classificações e o feedback humanos ajudam os modelos a aprender o que é apropriado, mesmo em casos que não são claros.

Jogos

Os jogos são muitas vezes usados como ambientes de treino porque oferecem regras estruturadas e objetivos mensuráveis. A aprendizagem por reforço ajuda os agentes a desenvolver novas estratégias através de jogo repetido e iteração, muitas vezes em simulações antes de avançarem para aplicações no mundo real.

Modelação financeira e negociação

Os modelos adaptativos usam a aprendizagem por reforço para explorar estratégias de mercado, fazer a gestão de carteiras ou testar cenários de risco. Estes sistemas aprendem a partir de ambientes sintéticos e dados históricos, melhorando ao longo do tempo enquanto permanecem ancorados em métricas do mundo real.

Preparar-se para o que vem a seguir na IA

A aprendizagem automática está na base de muitas das descobertas de IA de hoje. Da visão computacional aos modelos de linguagem e à robótica, aprender com os dados impulsiona a inovação moderna. A aprendizagem por reforço, e o RLHF em particular, tem um papel crescente em sistemas que aprendem com a interação, e não apenas com instruções.

Sistemas mais inteligentes, construídos com base na experiência
Os modelos de aprendizagem por reforço evoluem através da experiência, o que os torna mais adequados para tarefas incertas ou sequenciais. Em vez de aprenderem a partir de dados fixos, adaptam-se em tempo real, melhorando os resultados ao longo de vários passos.

À medida que estes sistemas são aplicados a domínios mais amplos, incluindo IA multimodal , que combina texto, imagens, áudio ou vídeo, o feedback humano acrescenta uma camada essencial. Ajuda a orientar decisões que não são facilmente mensuráveis, como saber se um chatbot deu uma resposta satisfatória ou se uma recomendação foi realmente útil.

A próxima fase para o RLHF
À medida que mais organizações adotam ferramentas com assistência de IA, o RLHF está a tornar-se central para um desenvolvimento responsável, particularmente em aplicações de processamento de linguagem natural (NLP) , onde o tom, o contexto e a relevância são importantes. Mas não é fácil escalar. Recolher intervenção humana útil é dispendioso e demorado.

Para resolver isto, os investigadores estão a explorar:
  • Ciclos de feedback mais eficientes, incluindo feedback sintético que imita as respostas humanas.
  • Melhores ferramentas de avaliação para medir quão bem os modelos estão alinhados com objetivos ou valores.
  • Aplicações entre domínios que combinam a aprendizagem por reforço com outras formas de aprendizagem automática para sistemas mais flexíveis.
Também há um interesse crescente em usar o RLHF para aumentar a transparência e a responsabilização. Ao reforçar o comportamento desejado com intervenção humana, as equipas ganham mais controlo sobre a forma como os sistemas de IA evoluem.

Um campo em evolução
A aprendizagem por reforço e o RLHF não são soluções universais. Mas são poderosos quando usados para o problema certo. À medida que os sistemas de IA se tornam mais capazes, cada vez mais importantes em áreas como IA cognitiva , que visam imitar o raciocínio humano, a necessidade de métodos que suportem adaptação, supervisão e alinhamento só vai aumentar.

Tanto para líderes empresariais como para programadores, compreender como estas técnicas funcionam pode levar a aplicações de IA mais fundamentadas e ponderadas. A aprendizagem por reforço nem sempre é a resposta mas, quando se adequa ao problema, abre novas formas de criar sistemas que aprendem no mundo real.
Recursos

Saiba mais sobre o Azure

Um homem a sorrir e a olhar para a câmara.
Recursos do Azure

Visitar o centro de recursos do Azure

Aceda a vídeos, relatórios de analistas, formação, casos de estudo, exemplos de código e arquiteturas de soluções.
Formação e certificação

Explorar percursos de aprendizagem do Azure

Desenvolva competências na cloud para gerar impacto, do crescimento pessoal a melhores resultados de negócio.
Duas pessoas a sorrir enquanto observam um separador.
Eventos e webinars

Descubra eventos e formações futuros

Explore novas inovações, desenvolva as suas competências e comunique com a comunidade, virtualmente ou presencialmente.
FAQ

 Perguntas frequentes

  • Os sistemas de IA normalmente aprendem usando um de três métodos:

    Aprendizagem supervisionada:
    aprende com dados rotulados. Usado para tarefas como reconhecimento de objetos ou tradução.

    Aprendizagem não supervisionada:
    Encontra padrões sem resultados rotulados. Utilizada para clustering ou deteção de anomalias.

    Aprendizagem por reforço:
    Aprende através da interação e do feedback. Utilizada para tomada de decisões sequenciais.
  • A aprendizagem por reforço ajuda os modelos a tomar decisões por tentativa e erro. Foi concebida para treinar sistemas que aprendem ao interagir com o respetivo ambiente, ajustando o comportamento com base em recompensas ou penalizações ao longo do tempo. Isto torna-a útil para tarefas em que os resultados dependem de uma série de ações e não de uma única previsão.
  • A aprendizagem por reforço a partir de feedback humano (RLHF) é um método que melhora o comportamento do modelo usando intervenção humana. O RLHF é uma forma de treinar modelos usando preferências, classificações ou comparações de pessoas, em vez de depender apenas de recompensas automatizadas. Isto ajuda a orientar os sistemas para resultados que correspondam melhor aos objetivos ou valores humanos, especialmente em áreas como a conversação, a geração de conteúdos ou a moderação.
  • A aprendizagem por reforço centra-se na tomada de decisões. Treina um modelo para executar ações num ambiente e aprender com o feedback. Em alguns sistemas, a aprendizagem profunda é usada no âmbito da aprendizagem por reforço para ajudar o modelo a processar entradas complexas, como imagens ou texto. A aprendizagem profunda usa redes neuronais em camadas para aprender a partir de grandes quantidades de dados e é frequentemente aplicada a tarefas como reconhecimento de imagem, processamento de voz ou geração de texto.
  • Geração aumentada por recuperação (RAG) e aprendizagem por reforço com feedback humano (RLHF) são duas formas diferentes de melhorar respostas geradas por IA. A RAG ajuda um modelo a aceder a informação externa, como documentos ou bases de dados, enquanto gera resultados, para que as respostas sejam mais precisas e atualizadas. A RLHF melhora o comportamento de um modelo ao treiná-lo com base em preferências ou feedback humanos, ajudando-o a produzir respostas mais úteis, adequadas ou alinhadas com a intenção do utilizador. A RAG apoia a precisão factual; a RLHF apoia a qualidade e o alinhamento.
Português (Portugal) Privacidade da Saúde do Consumidor Contactar a Microsoft Privacidade Gerir cookies Termos de utilização Marcas Registadas Acerca dos nossos anúncios EU Compliance DoCs