Um postal de Natal com IA, oferecido pela Data Science Lab
No ano passado, criámos na Data Science Lab um postal de Natal com IA generativa. Foi muito utilizado e continua a ser uma das nossas páginas mais…
DeepSeek posicionou-se de forma espetacular como um concorrente de peso no mundo dos Large Language Models (LLMs). Com as cotações das ações a oscilar e as tensões políticas a aumentar, foi difícil ignorar DeepSeek nas últimas semanas. Mas o que torna este modelo tão especial? É realmente revolucionário ou apenas uma alternativa mais económica a líderes de mercado como o ChatGPT da OpenAI? Neste artigo, analisamos a arquitetura técnica de DeepSeek e explicamos por que razão estes modelos são tão eficientes e rápidos.
Enquanto líderes de mercado como OpenAI, Meta e Google investem dezenas de milhares de milhões no desenvolvimento de LLMs, DeepSeek afirma ter treinado o seu modelo mais recente por apenas alguns milhões. Ainda assim, consegue aproximar-se surpreendentemente do desempenho destes nomes estabelecidos. DeepSeek alcançou assim uma combinação impressionante: a capacidade e a precisão de modelos de IA de referência, como o OpenAI-o1, com uma eficiência e escalabilidade notáveis. Ainda não tínhamos visto este equilíbrio entre desempenho e redução de custos a esta escala.
Figura 1: Desempenho de DeepSeek-R1 em benchmarks. (DeepSeek-R1)
Para compreender por que razão DeepSeek é tão rápido e eficiente, analisamos a sua arquitetura subjacente. Tal como a maioria dos LLMs avançados, DeepSeek baseia-se na arquitetura Transformer (Vaswani et al., 2017). Mas, enquanto os modelos convencionais de IA ativam todos os neurónios/parâmetros da rede para cada entrada, DeepSeek segue uma abordagem diferente com uma arquitetura Mixture-of-Experts (MoE). Para cada entrada, é ativada apenas uma pequena seleção de sub-redes especializadas - os ‘experts’-. A seleção depende da relevância de cada um para a entrada em questão.
Este mecanismo reduz drasticamente a capacidade de computação necessária e aumenta a velocidade do modelo, sem comprometer o desempenho. Por exemplo, DeepSeek-V3 contém 671 mil milhões de parâmetros, mas ativa apenas 37 mil milhões por token – apenas 18% do modelo total.
DeepSeekMoE é o motor por detrás da eficiência impressionante do DeepSeek. É o modelo MoE desenvolvido pelo próprio DeepSeek. O DeepSeekMoE é composto por vários especialistas e um mecanismo de seleção que determina quais são ativados para cada input (ver Figura 2).
Os modelos MoE tradicionais enfrentam dois grandes problemas:
O DeepSeekMoE resolve estas limitações com duas inovações fundamentais:
Graças a estas inovações, o DeepSeekMoE atinge um desempenho comparável ao dos modelos densos, mas com muito menos capacidade de processamento. Por exemplo, o DeepSeekMoE 16B tem um desempenho tão bom como o LLaMA2 7B, utilizando menos 40% de recursos computacionais. Isto torna o modelo não só potente, mas também mais escalável e eficiente do que muitas alternativas tradicionais.
Figura 2: Visualização do DeepSeekMoe (subfigura c). O número de parâmetros e os custos computacionais são iguais nas três arquiteturas. (DeepSeekMoE)
O DeepSeek utiliza um processo avançado de treino com otimização baseada em gradientes. Ao contrário do que acontece nas redes neuronais convencionais, no DeepSeek apenas os especialistas ativados recebem atualizações, o que lhes permite especializar-se rapidamente em determinadas tarefas. Assim, os especialistas aprendem apenas com inputs relevantes para si.
Os especialistas especializam-se através de:
Como os inputs com características específicas são constantemente encaminhados para o mesmo especialista, este acaba por se especializar numa determinada tarefa. Por exemplo, um especialista pode especializar-se em código de programação, outro em textos jurídicos e um terceiro em conversas do dia a dia.
Um risco frequente durante este processo é que alguns especialistas sejam demasiado solicitados, enquanto outros continuam subutilizados. Isto reduz a eficiência e a capacidade de generalização do modelo. Para resolver este problema, a DeepSeek utiliza técnicas de balanceamento de carga, como losses auxiliares (DeepSeekMoE), que penalizam a solicitação excessiva de um especialista, e encaminhamento ajustado por bias (DeepSeek-V3), que atribui a cada especialista um termo de bias dinâmico com base na sua carga.
Em resumo, os especialistas dos modelos DeepSeek melhoram através de:
Em última análise, os especialistas especializados permitem:
A DeepSeek aperfeiçoou a sua arquitetura nos modelos DeepSeek-V2 e DeepSeek-V3. Estes modelos introduzem novas funcionalidades, como:
Multi-Head Latent Attention é um novo mecanismo de atenção, mais rápido do que o tradicional Multi-Head Attention (MHA). Os modelos Transformer convencionais utilizam habitualmente Multi-Head Attention (MHA) (Vaswani et al., 2017), o que cria um estrangulamento que abranda a inferência. Para resolver este problema, a DeepSeek desenvolveu o mecanismo MLA para os modelos DeepSeek-V2 e DeepSeek-V3 (ver Figura 3).
Uma alternativa mais eficiente às funções de perda auxiliares. Muitos modelos MoE, incluindo o DeepSeekMoE, precisam destas funções para evitar que alguns especialistas fiquem sobrecarregados enquanto outros permanecem sem utilização. O DeepSeek-V3 resolve este problema com a introdução da bias-adjusted routing strategy, que melhora a eficiência sem comprometer o equilíbrio da carga.
A DeepSeek utiliza FP8 mixed precision arithmetic para reduzir a utilização de memória e o tempo de cálculo. Os cálculos são distribuídos entre uma precisão mais baixa e, quando necessário, uma precisão mais elevada, equilibrando a eficiência e a estabilidade numérica.
Com Multi-Token Prediction, o modelo prevê vários tokens futuros em simultâneo, acelerando tanto o treino como a inferência. Nos LLM’s tradicionais, a previsão é feita um token de cada vez.
Uma infraestrutura para resolver os estrangulamentos das GPU e permitir um treino eficiente a uma escala extremamente grande. O DeepSeek-V3 é treinado com DualPipe pipeline parallelism. Em conjunto com um sistema otimizado de comunicação entre nós, isto faz do DeepSeek-V3 um dos modelos MoE de grande escala mais eficientes até à data.
Em resumo, as diferenças entre estas três variantes dos modelos são as seguintes:
O DeepSeek-V3 é, portanto, o modelo mais avançado e combina estas inovações para obter o máximo desempenho e eficiência (ver Figura 4).
Figura 3: Visualização simplificada de vários mecanismos de atenção, com Multi-head Latent Attention (MLA) à extrema direita. Ao comprimir keys e values num único vetor latente, o MLA torna a inferência consideravelmente mais rápida. (DeepSeek-V2)
Figura 4: A arquitetura de base do DeepSeek-V2 e do DeepSeek-V3. (DeepSeek-V2)
O DeepSeek-R1 foi o modelo que marcou a verdadeira rutura. Uma rutura que não só agitou a comunidade de IA, como também teve um amplo impacto na sociedade. Da queda das cotações em bolsa aos debates políticos acalorados sobre o futuro da IA, o DeepSeek-R1 provou que não é apenas mais um novo modelo, mas um marco tecnológico.
Este modelo utiliza Reinforcement Learning (RL), o que lhe permite raciocinar e tomar decisões de forma autónoma. Isto não só melhora o seu desempenho, como também mostra o que é possível quando se deixa o modelo pensar por si próprio.
Em termos de arquitetura, o DeepSeek R1 é idêntico às variantes DeepSeek-V2 e DeepSeek-V3. Utiliza as versões “only-pretrained” destes modelos, mas passa depois por um processo próprio de post-training.
Em termos simples, os responsáveis pelo desenvolvimento criaram um sistema de testes e verificação em torno do modelo e aplicaram-lhe um processo de RL. O modelo aprende ao ser recompensado por bons resultados. Durante este processo, utilizaram uma reward function simples (o equivalente, em RL, a uma loss function). A função é uma soma ponderada de duas componentes:
Este processo de post-training leva a:
Graças a este processo, o DeepSeek-R1 não só é exato, como também é mais fiável na geração de resultados estruturados e verificados.
Como resultado, o modelo final apresenta:
Embora o DeepSeek ofereça muito potencial, também apresenta desafios e riscos:
1. Riscos de segurança do código aberto
O DeepSeek é de código aberto. Isso é simultaneamente uma vantagem e um risco. Torna o modelo transparente e permite desenvolver soluções à medida, mas também o deixa mais vulnerável a utilizações maliciosas, como a geração de desinformação, spam ou automatização contrária a princípios éticos.
2. Ecossistema e apoio aos programadores
Em comparação com modelos proprietários (como o GPT-4 da OpenAI), o DeepSeek tem um ecossistema mais reduzido de integrações, ferramentas e apoio da comunidade. Por isso, poderá ser mais difícil para o DeepSeek competir com modelos maiores a longo prazo. A taxa de adoção e os testes em situações reais determinarão se o modelo consegue, a longo prazo, competir eficazmente com os seus concorrentes de maior dimensão.
3. Enviesamento e limitações linguísticas
O modelo está fortemente otimizado para inglês e chinês, o que pode afetar o seu desempenho noutras línguas.
Surgiram rapidamente vários artigos que demonstravam a interferência e a censura do governo chinês (entre outros, CNN e The Guardian). Existem também preocupações com a privacidade, incluindo fugas de dados, que levaram vários países a impor restrições à utilização do DeepSeek (sobretudo em contextos profissionais) (entre outros, Wiz, NowSecure e BBC).
Em suma, o DeepSeek tem muito potencial como alternativa de código aberto aos LLMs de código fechado que até agora lideraram o mercado, mas o seu sucesso a longo prazo depende de melhorias contínuas na precisão e na segurança, bem como do crescimento do seu ecossistema.
O DeepSeek demonstra que os modelos de IA open-source podem competir com modelos proprietários. Oferece uma nova perspetiva sobre uma IA eficiente e escalável, ao mesmo tempo que suscita debate sobre transparência, segurança e ética no desenvolvimento de IA.
Com o DeepSeek-V3, a empresa mostra que os modelos open-source não se limitam a competir: podem até moldar o futuro da IA. A combinação de bom desempenho, escalabilidade e eficiência torna o DeepSeek revolucionário. Quer seja investigador, programador ou empresário – o DeepSeek está a mudar a forma como pensamos sobre os grandes modelos de linguagem. Podemos até dizer que o DeepSeek estabeleceu um novo padrão.
Além disso, a natureza open-source e eficiente do DeepSeek torna-o atrativo para aplicações empresariais, e não apenas para investigação. Falaremos mais sobre isso num próximo artigo do blogue. Já tem curiosidade em saber como a sua organização pode tirar partido destes desenvolvimentos? Teremos todo o gosto em ajudar. Marque uma reunião connosco e descubra as possibilidades.
No ano passado, criámos na Data Science Lab um postal de Natal com IA generativa. Foi muito utilizado e continua a ser uma das nossas páginas mais…
A IA generativa (GenAI) está a evoluir rapidamente. Vemos grandes avanços na qualidade, não só do texto, mas sobretudo das imagens e dos vídeos…
Desde o lançamento de ferramentas como o ChatGPT, o interesse pela IA generativa (GenAI) cresceu enormemente. As aplicações parecem não ter fim: da…
Quer ser a primeira pessoa a saber quando publicamos um novo artigo no blogue?
Obrigado pela sua inscrição!