Ir para o conteúdo
Ir para insights GenAI

Análise aprofundada do DeepSeek

Análise aprofundada do DeepSeek
Escrito por
Data Science Lab
Publicado em
28 de fevereiro de 2025

DeepSeek posicionou-se de forma espetacular como um concorrente de peso no mundo dos Large Language Models (LLMs). Com as cotações das ações a oscilar e as tensões políticas a aumentar, foi difícil ignorar DeepSeek nas últimas semanas. Mas o que torna este modelo tão especial? É realmente revolucionário ou apenas uma alternativa mais económica a líderes de mercado como o ChatGPT da OpenAI? Neste artigo, analisamos a arquitetura técnica de DeepSeek e explicamos por que razão estes modelos são tão eficientes e rápidos. 

DeepSeek vs. líderes de mercado 

Enquanto líderes de mercado como OpenAI, Meta e Google investem dezenas de milhares de milhões no desenvolvimento de LLMs, DeepSeek afirma ter treinado o seu modelo mais recente por apenas alguns milhões. Ainda assim, consegue aproximar-se surpreendentemente do desempenho destes nomes estabelecidos. DeepSeek alcançou assim uma combinação impressionante: a capacidade e a precisão de modelos de IA de referência, como o OpenAI-o1, com uma eficiência e escalabilidade notáveis. Ainda não tínhamos visto este equilíbrio entre desempenho e redução de custos a esta escala. 

Gráfico de barras que compara modelos DeepSeek e OpenAI em seis testes.

Figura 1: Desempenho de DeepSeek-R1 em benchmarks. (DeepSeek-R1)

Como funciona DeepSeek?

Para compreender por que razão DeepSeek é tão rápido e eficiente, analisamos a sua arquitetura subjacente. Tal como a maioria dos LLMs avançados, DeepSeek baseia-se na arquitetura Transformer (Vaswani et al., 2017). Mas, enquanto os modelos convencionais de IA ativam todos os neurónios/parâmetros da rede para cada entrada, DeepSeek segue uma abordagem diferente com uma arquitetura Mixture-of-Experts (MoE). Para cada entrada, é ativada apenas uma pequena seleção de sub-redes especializadas - os ‘experts’-. A seleção depende da relevância de cada um para a entrada em questão.

Este mecanismo reduz drasticamente a capacidade de computação necessária e aumenta a velocidade do modelo, sem comprometer o desempenho. Por exemplo, DeepSeek-V3 contém 671 mil milhões de parâmetros, mas ativa apenas 37 mil milhões por token – apenas 18% do modelo total.

DeepSeekMoE: O motor por detrás da eficiência

DeepSeekMoE é o motor por detrás da eficiência impressionante do DeepSeek. É o modelo MoE desenvolvido pelo próprio DeepSeek. O DeepSeekMoE é composto por vários especialistas e um mecanismo de seleção que determina quais são ativados para cada input (ver Figura 2).

Os modelos MoE tradicionais enfrentam dois grandes problemas:

  1. - Knowledge Hybridity – Os especialistas aprendem conceitos sobrepostos, o que reduz a sua especialização.
  2. - Knowledge Redundancy – Vários especialistas armazenam a mesma informação, desperdiçando recursos.

O DeepSeekMoE resolve estas limitações com duas inovações fundamentais:

  1. - Fine-Grained Expert Segmentation – Dividir os especialistas em unidades mais pequenas e especializadas reduz a redundância e permite ao modelo aprender de forma mais eficiente. Também minimiza a aprendizagem de informação desnecessária ou duplicada.
  2. - Shared Expert Isolation – Um subconjunto de especialistas mantém-se sempre ativo para armazenar conhecimento geral, permitindo que o resto do modelo se concentre em tarefas especializadas.

Graças a estas inovações, o DeepSeekMoE atinge um desempenho comparável ao dos modelos densos, mas com muito menos capacidade de processamento. Por exemplo, o DeepSeekMoE 16B tem um desempenho tão bom como o LLaMA2 7B, utilizando menos 40% de recursos computacionais. Isto torna o modelo não só potente, mas também mais escalável e eficiente do que muitas alternativas tradicionais.

Esquema de três formas de selecionar experts num modelo.

Figura 2: Visualização do DeepSeekMoe (subfigura c). O número de parâmetros e os custos computacionais são iguais nas três arquiteturas. (DeepSeekMoE)

Como se tornam os especialistas mais capazes?

O DeepSeek utiliza um processo avançado de treino com otimização baseada em gradientes. Ao contrário do que acontece nas redes neuronais convencionais, no DeepSeek apenas os especialistas ativados recebem atualizações, o que lhes permite especializar-se rapidamente em determinadas tarefas. Assim, os especialistas aprendem apenas com inputs relevantes para si.

Processo de treino

  1. 1. Encaminhamento de tokens
    • A ‘função de gating’ determina que especialistas são ativados para cada token.
  2. 2. Forward pass
    • Apenas os especialistas selecionados processam o token e geram o resultado.
  3. 3. Backpropagation & aprendizagem
    • Os gradientes dos especialistas e da função de gating são atualizados com base na loss correspondente.
    • Pesos dos especialistas -> Cada especialista aprende apenas com os tokens que processa.
    • Função de gating -> aprende a melhorar a atribuição dos especialistas.

Os especialistas especializam-se através de:

  • - Atribuições da função de gating – Inputs semelhantes são encaminhados para o mesmo subconjunto de especialistas.
  • - Reforço de padrões – Cada especialista faz fine-tuning das suas respostas com base em tipos de dados frequentes.
  • - Técnicas de regularização – Evitam que alguns especialistas fiquem sobrecarregados enquanto outros continuam subutilizados.

Como os inputs com características específicas são constantemente encaminhados para o mesmo especialista, este acaba por se especializar numa determinada tarefa. Por exemplo, um especialista pode especializar-se em código de programação, outro em textos jurídicos e um terceiro em conversas do dia a dia.

Um risco frequente durante este processo é que alguns especialistas sejam demasiado solicitados, enquanto outros continuam subutilizados. Isto reduz a eficiência e a capacidade de generalização do modelo. Para resolver este problema, a DeepSeek utiliza técnicas de balanceamento de carga, como losses auxiliares (DeepSeekMoE), que penalizam a solicitação excessiva de um especialista, e encaminhamento ajustado por bias (DeepSeek-V3), que atribui a cada especialista um termo de bias dinâmico com base na sua carga.

Em resumo, os especialistas dos modelos DeepSeek melhoram através de:

  • - Processamento de dados semelhantes ao longo do tempo (especialização natural).
  • - Atualizações direcionadas dos gradientes (reforçando a sua especialização).
  • - Utilização de técnicas de balanceamento de carga (contribuição eficiente de todos os especialistas).

Em última análise, os especialistas especializados permitem:

  • - Melhor qualidade das respostas.
  • - Escalabilidade.
  • - Otimização de recursos em tempo real, que acelera o modelo e reduz os custos.

DeepSeek-V2 e DeepSeek-V3


A DeepSeek aperfeiçoou a sua arquitetura nos modelos DeepSeek-V2 e DeepSeek-V3. Estes modelos introduzem novas funcionalidades, como:

  • - Multi-Head Latent Attention (MLA)

Multi-Head Latent Attention é um novo mecanismo de atenção, mais rápido do que o tradicional Multi-Head Attention (MHA). Os modelos Transformer convencionais utilizam habitualmente Multi-Head Attention (MHA) (Vaswani et al., 2017), o que cria um estrangulamento que abranda a inferência. Para resolver este problema, a DeepSeek desenvolveu o mecanismo MLA para os modelos DeepSeek-V2 e DeepSeek-V3 (ver Figura 3).

  • - Auxiliary-Loss-Free Load Balancing

Uma alternativa mais eficiente às funções de perda auxiliares. Muitos modelos MoE, incluindo o DeepSeekMoE, precisam destas funções para evitar que alguns especialistas fiquem sobrecarregados enquanto outros permanecem sem utilização. O DeepSeek-V3 resolve este problema com a introdução da bias-adjusted routing strategy, que melhora a eficiência sem comprometer o equilíbrio da carga.

  • - FP8 Mixed Precision Training

A DeepSeek utiliza FP8 mixed precision arithmetic para reduzir a utilização de memória e o tempo de cálculo. Os cálculos são distribuídos entre uma precisão mais baixa e, quando necessário, uma precisão mais elevada, equilibrando a eficiência e a estabilidade numérica.

  • - Multi-Token Prediction (MTP)

Com Multi-Token Prediction, o modelo prevê vários tokens futuros em simultâneo, acelerando tanto o treino como a inferência. Nos LLM’s tradicionais, a previsão é feita um token de cada vez.

  • - Infraestrutura de treino avançada

Uma infraestrutura para resolver os estrangulamentos das GPU e permitir um treino eficiente a uma escala extremamente grande. O DeepSeek-V3 é treinado com DualPipe pipeline parallelism. Em conjunto com um sistema otimizado de comunicação entre nós, isto faz do DeepSeek-V3 um dos modelos MoE de grande escala mais eficientes até à data.

As diferenças entre as três variantes

Em resumo, as diferenças entre estas três variantes dos modelos são as seguintes:

  • - DeepSeekMoE é a versão de base, que utiliza uma arquitetura MoE tradicional e funções de perda auxiliares para equilibrar a carga.
  • - DeepSeek-V2 introduz melhorias no routing, FP8 mixed precision e Multi-Token Prediction para tornar o treino e a inferência mais eficientes.
  • - DeepSeek-V3 vai ainda mais longe com bias-adjusted routing, mixed precision mais avançada e uma infraestrutura melhorada para treino a uma escala extrema, aumentando ainda mais a eficiência.


O DeepSeek-V3 é, portanto, o modelo mais avançado e combina estas inovações para obter o máximo desempenho e eficiência (ver Figura 4).

Esquema que compara quatro formas de attention.

Figura 3: Visualização simplificada de vários mecanismos de atenção, com Multi-head Latent Attention (MLA) à extrema direita. Ao comprimir keys e values num único vetor latente, o MLA torna a inferência consideravelmente mais rápida. (DeepSeek-V2)

Esquema da arquitetura de um modelo DeepSeek com blocos transformer.

Figura 4: A arquitetura de base do DeepSeek-V2 e do DeepSeek-V3. (DeepSeek-V2)

DeepSeek-R1: um marco tecnológico

O DeepSeek-R1 foi o modelo que marcou a verdadeira rutura. Uma rutura que não só agitou a comunidade de IA, como também teve um amplo impacto na sociedade. Da queda das cotações em bolsa aos debates políticos acalorados sobre o futuro da IA, o DeepSeek-R1 provou que não é apenas mais um novo modelo, mas um marco tecnológico.

Este modelo utiliza Reinforcement Learning (RL), o que lhe permite raciocinar e tomar decisões de forma autónoma. Isto não só melhora o seu desempenho, como também mostra o que é possível quando se deixa o modelo pensar por si próprio.

Em termos de arquitetura, o DeepSeek R1 é idêntico às variantes DeepSeek-V2 e DeepSeek-V3. Utiliza as versões “only-pretrained” destes modelos, mas passa depois por um processo próprio de post-training.

Em termos simples, os responsáveis pelo desenvolvimento criaram um sistema de testes e verificação em torno do modelo e aplicaram-lhe um processo de RL. O modelo aprende ao ser recompensado por bons resultados. Durante este processo, utilizaram uma reward function simples (o equivalente, em RL, a uma loss function). A função é uma soma ponderada de duas componentes:

  • - Accuracy Reward – Se a tarefa tiver uma resposta objetivamente correta (como um problema de matemática), essa resposta é verificada através de vários testes adequados. O modelo é recompensado pela exatidão.
  • - Format Reward – O modelo é recompensado por seguir um processo de raciocínio estruturado.

Este processo de post-training leva a:

  • - Self-verification – O modelo verifica novamente as suas próprias respostas.
  • - Extended chain-of-thought – O modelo aprende a explicar o seu raciocínio de forma mais aprofundada.
  • - Exploratory reasoning – O modelo explora várias abordagens antes de chegar a uma conclusão.
  • - Reflection – O modelo questiona as suas próprias soluções e ajusta o seu processo de raciocínio.


Graças a este processo, o DeepSeek-R1 não só é exato, como também é mais fiável na geração de resultados estruturados e verificados.

O modelo final

Como resultado, o modelo final apresenta:

  • - Um chain-of-thought sólido para tarefas verificáveis.
  • - Alinhamento com diversos pedidos dos utilizadores na utilização quotidiana.
  • - Resultados mais seguros e mais controlados.

Desafios e riscos

Embora o DeepSeek ofereça muito potencial, também apresenta desafios e riscos:

1. Riscos de segurança do código aberto
O DeepSeek é de código aberto. Isso é simultaneamente uma vantagem e um risco. Torna o modelo transparente e permite desenvolver soluções à medida, mas também o deixa mais vulnerável a utilizações maliciosas, como a geração de desinformação, spam ou automatização contrária a princípios éticos.

2. Ecossistema e apoio aos programadores

Em comparação com modelos proprietários (como o GPT-4 da OpenAI), o DeepSeek tem um ecossistema mais reduzido de integrações, ferramentas e apoio da comunidade. Por isso, poderá ser mais difícil para o DeepSeek competir com modelos maiores a longo prazo. A taxa de adoção e os testes em situações reais determinarão se o modelo consegue, a longo prazo, competir eficazmente com os seus concorrentes de maior dimensão.

3. Enviesamento e limitações linguísticas

O modelo está fortemente otimizado para inglês e chinês, o que pode afetar o seu desempenho noutras línguas.

Surgiram rapidamente vários artigos que demonstravam a interferência e a censura do governo chinês (entre outros, CNN e The Guardian). Existem também preocupações com a privacidade, incluindo fugas de dados, que levaram vários países a impor restrições à utilização do DeepSeek (sobretudo em contextos profissionais) (entre outros, Wiz, NowSecure e BBC).

Em suma, o DeepSeek tem muito potencial como alternativa de código aberto aos LLMs de código fechado que até agora lideraram o mercado, mas o seu sucesso a longo prazo depende de melhorias contínuas na precisão e na segurança, bem como do crescimento do seu ecossistema.

O futuro do DeepSeek

O DeepSeek demonstra que os modelos de IA open-source podem competir com modelos proprietários. Oferece uma nova perspetiva sobre uma IA eficiente e escalável, ao mesmo tempo que suscita debate sobre transparência, segurança e ética no desenvolvimento de IA.

Com o DeepSeek-V3, a empresa mostra que os modelos open-source não se limitam a competir: podem até moldar o futuro da IA. A combinação de bom desempenho, escalabilidade e eficiência torna o DeepSeek revolucionário. Quer seja investigador, programador ou empresário – o DeepSeek está a mudar a forma como pensamos sobre os grandes modelos de linguagem. Podemos até dizer que o DeepSeek estabeleceu um novo padrão.

Além disso, a natureza open-source e eficiente do DeepSeek torna-o atrativo para aplicações empresariais, e não apenas para investigação. Falaremos mais sobre isso num próximo artigo do blogue. Já tem curiosidade em saber como a sua organização pode tirar partido destes desenvolvimentos? Teremos todo o gosto em ajudar. Marque uma reunião connosco e descubra as possibilidades.

Blog

Também poderá ter interesse nisto,

Subscreva a nossa newsletter.

Quer ser a primeira pessoa a saber quando publicamos um novo artigo no blogue?

Introduza um endereço de e-mail válido.