Um postal de Natal com IA, oferecido pela Data Science Lab
No ano passado, criámos na Data Science Lab um postal de Natal com IA generativa. Foi muito utilizado e continua a ser uma das nossas páginas mais…
Os modelos de linguagem de grande dimensão (LLMs), como o ChatGPT, são populares. Não apenas para uso pessoal, mas também nas organizações. Pesquisar informações específicas em documentos da empresa, resumir grandes quantidades de texto ou processar dados de clientes de forma mais eficiente são algumas aplicações destes modelos cujo valor é fácil de reconhecer.
Mas pode simplesmente usar LLMs na sua organização? Quais são os custos? E o que acontece aos seus dados? Os LLMs apresentam riscos, mas estes dependem de muitos fatores. Um ponto de partida óbvio é, naturalmente, o LLM que escolhe e a forma como o configura. Isto depende do LLM e da sua configuração. Neste artigo, explicamos que tipos de LLM existem, como pode usar os seus dados em segurança com esta tecnologia e apresentamos uma visão geral para ajudar a escolher o LLM certo para a sua organização.
Antes de analisarmos os diferentes tipos de LLM, abordamos dois riscos que as organizações nos referem com frequência. Recebemos muitas perguntas sobre a confidencialidade dos dados (o armazenamento e a utilização cumprem os requisitos do GDPR?) e sobre resultados prejudiciais ou incorretos.
A proteção negligente dos dados pode ter consequências dispendiosas. Os dados sensíveis da empresa podem deixar de estar armazenados dentro da própria organização e até tornar-se acessíveis a terceiros. Em 2023, vimos esta negligência levar a violações de dados em várias empresas, incluindo a Samsung. Em consequência, segredos empresariais cruciais foram divulgados ao ChatGPT da OpenAI. Além de expor segredos empresariais, isto também implicou o incumprimento do regulamento europeu de privacidade, o GDPR (General Data Protection Regulation).
A geração involuntária de texto prejudicial pode representar um risco na utilização de LLMs. Devido aos dados de treino, os modelos podem incorporar, sem intenção, preconceitos e estereótipos. Isto pode levar à criação de textos ofensivos, discriminatórios ou até de incitamento ao ódio. Além das questões éticas, os resultados prejudiciais também podem ter consequências jurídicas. As empresas podem ser responsabilizadas pelos danos causados pelos textos que geram ou divulgam.
Estes riscos podem representar um desafio, mas há uma solução para cada um deles.
O ChatGPT é a versão online dos modelos LLM da OpenAI. A sua interface intuitiva permite utilizar um LLM sem conhecimentos técnicos. Se utilizar o ChatGPT sem alterar as definições, aceita que tudo o que introduzir seja armazenado nos servidores da OpenAI. Se partilhar aqui segredos da sua empresa, estará a violar as regras do RGPD, uma vez que os dados são armazenados nos Estados Unidos (pela OpenAI), e não na Europa. O custo de utilização do ChatGPT depende da forma como optar por o utilizar. Pode pagar uma subscrição mensal ou por utilização. O preço específico depende do tipo de modelo que selecionar e da intensidade de utilização.
Uma alternativa para utilizar os modelos da OpenAI, com maior atenção à privacidade, é recorrer diretamente à Application Programming Interface (API) da OpenAI. Assim, pode interagir diretamente com o ChatGPT sem passar por uma interface de utilizador (UI). A UI está mais orientada para interações simples, enquanto a API oferece maior controlo. Isto é especialmente útil para organizações que pretendem integrar os modelos da OpenAI nas suas próprias aplicações. O modelo que gera o texto é o mesmo do ChatGPT, mas com a sua própria interface.
Desde 1 de março de 2023, a API da OpenAI foi atualizada: os “prompts” e as respostas deixaram de ser utilizados para melhorar os modelos. Isto significa que os seus documentos permanecem confidenciais, sem divulgação de informação. É uma boa notícia para a proteção da informação da empresa. Para proteger os dados pessoais, a OpenAI oferece uma funcionalidade importante: pode pedir à OpenAI que complemente os seus termos e condições gerais com a sua Adenda de Tratamento de Dados. Tal como acontece com muitas grandes empresas tecnológicas norte-americanas, não pode impor o seu próprio acordo de tratamento de dados e tem de aceitar a versão da OpenAI. Ainda assim, um acordo de tratamento de dados que ofereça proteção é um requisito importante do RGPD para partilhar dados pessoais com “subcontratantes” como a OpenAI. A API funciona num regime de pagamento por utilização: paga por cada chamada.
Este serviço da Microsoft utiliza uma plataforma de alojamento: um ambiente integrado onde pode armazenar, gerir e aceder a aplicações, enquanto toda a infraestrutura é gerida por si. Muitas organizações já utilizam a plataforma cloud Microsoft Azure. Com o Azure OpenAI Service, pode esperar os mesmos padrões de segurança dos outros serviços Microsoft Azure. Portanto, sim, utiliza os mesmos modelos que o ChatGPT, mas gere-os através dessa plataforma de alojamento.
Com o Azure OpenAI Service, tem mais controlo sobre os textos gerados pelos modelos da OpenAI. Por predefinição, as respostas são armazenadas temporariamente na mesma região que o recurso, durante um período máximo de 30 dias. Estes dados são utilizados para debugging e para investigar eventuais utilizações indevidas do serviço. Se preferir que as respostas não sejam armazenadas, pode solicitá-lo à Microsoft. No que toca à proteção de dados, pode contar com o acordo de tratamento de dados padrão disponibilizado pela Azure, incluindo as cláusulas contratuais-tipo. O pagamento também segue o modelo pay-as-you-go.
O Databricks é também uma plataforma de alojamento onde pode implementar e gerir LLMs. Tem muitas opções à escolha, não só da OpenAI, mas também outros modelos específicos. É um ambiente versátil onde pode fazer fine-tuning do seu LLM, integrá-lo com pipelines de dados e gerir implementações de grande escala de forma eficiente. Isto torna-o adequado para ambientes de produção que exigem um elevado desempenho. No entanto, é mais técnico do que o Azure, pelo que precisa de conhecimentos de data science e data engineering. Por isso, é menos fácil de utilizar para quem não tem conhecimentos técnicos. O Databricks também dispõe de uma plataforma abrangente de segurança de dados e cumpre os requisitos do RGPD. Os custos de utilização de LLMs através do Databricks são, em geral, superiores aos das alternativas. Também aqui paga segundo o modelo pay-as-you-go.
Aqui, outros modelos servem de base ao LLM. Pode escolher entre uma grande variedade de modelos open-source, por exemplo, de diferentes dimensões. Utilizar um LLM local em vez de um modelo baseado numa API (closed-source) dá-lhe mais controlo. Com um LLM local, todos os dados são processados dentro da sua própria organização, o que reduz o risco de fugas de dados. Também fica a seu cargo a segurança, pois pode gerir o acesso ao modelo. Isto ajuda a minimizar os riscos de segurança e a criar uma abordagem à medida. Assim, é mais fácil cumprir as regras do RGPD, porque tem influência direta sobre a forma como os dados são tratados e armazenados.
Esta aplicação de LLM é a que demora mais tempo a implementar, porque é necessário montar toda a infraestrutura. Se quiser utilizar um LLM open-source, tem de o alojar na sua própria infraestrutura (on-premise), com GPUs potentes e espaço de armazenamento suficiente. É importante avaliar cuidadosamente estes requisitos e investir neles para evitar que a aplicação tenha um desempenho insuficiente ou seja lenta. Ao contrário do que acontece com os modelos closed-source referidos acima, também tem de assumir mais responsabilidade pelos resultados dos modelos open-source. Isto é simultaneamente uma vantagem e uma desvantagem. Não deve considerar apenas a exatidão das respostas, mas também a possibilidade de serem ofensivas. Para isso, pode aplicar diferentes técnicas de LLM que funcionam como mecanismos de proteção. Naturalmente, também deve verificar sempre a exatidão dos outros LLMs e continuar a pensar por si.
Se não analisar bem todas as possibilidades, os custos podem rapidamente disparar. Não é esse o objetivo, pois a rentabilidade e a viabilidade do projeto ficam depressa em risco. Mas não se preocupe: com uma abordagem cuidadosa, pode tirar o melhor partido do seu investimento!
Os custos de utilização de LLMs dependem de vários fatores:
Existem diferentes modelos de financiamento para diferentes implementações de LLM:
Temos várias aplicações de LLMs, cada uma com as suas características. Consoante as suas necessidades, podemos encontrar a opção que melhor corresponde aos seus critérios.
? Consoante as definições e o nível de utilização
Escalabilidade: A escalabilidade significa que os LLMs conseguem responder de forma flexível a várias situações e tarefas. Não estão limitados ao que já aprenderam: também se podem adaptar a novos dados e circunstâncias. Isto torna-os úteis e versáteis para várias aplicações específicas.
Privacidade dos dados: A privacidade dos dados diz respeito à capacidade de um LLM para proteger os dados dos utilizadores. Trata-se de armazenar, processar e partilhar informações pessoais de forma segura, em conformidade com a legislação de proteção de dados.
Desempenho SotA: “State-of-the-Art” (SotA) significa que, naquele momento, o modelo é considerado o melhor disponível em termos de precisão, relevância e desempenho global.
Custos: Refere-se aos custos associados à utilização de um LLM, incluindo infraestrutura, produção, manutenção e eventuais licenças.
Fine-tuning: O fine-tuning consiste em adaptar um LLM a requisitos, dados ou tarefas específicos para melhorar o seu desempenho num determinado caso de uso. Por exemplo, pode acrescentar conhecimento específico de uma área. O fine-tuning torna o modelo mais adequado a determinadas aplicações.
Os LLMs podem ajudar as organizações a tornar-se mais eficientes e inovadoras. A escolha de um LLM depende das necessidades da sua organização. Em muitos casos, o serviço Microsoft Azure OpenAI é uma boa solução. É fácil de utilizar e oferece segurança adequada para os dados, sobretudo para organizações que já utilizam o Azure. Se precisar de fazer adaptações mais técnicas ao seu LLM, o Databricks é uma boa alternativa que também garante a segurança dos dados. Se quiser manter o controlo total sobre o tratamento dos dados, alojar um LLM de código aberto na sua própria infraestrutura pode ser uma boa escolha. Dessa forma, tem controlo total sobre a utilização do seu LLM, os seus dados e os resultados que produz.
Em suma, com a abordagem certa, os LLMs podem ser um recurso valioso para qualquer organização. Gostaria de receber aconselhamento específico para a sua organização? Contacte-nos e teremos todo o gosto em ajudar.
* Para ter uma ideia dos preços atuais por token/palavra/caráter, consulte este site, que inclui uma calculadora útil: https://docsbot.ai/tools/gpt-openai-api-pricing-calculator
** Para ter uma ideia do desempenho dos LLMs, consulte este site: https://huggingface.co/spaces/lmsys/chatbot-arena-leaderboard
No ano passado, criámos na Data Science Lab um postal de Natal com IA generativa. Foi muito utilizado e continua a ser uma das nossas páginas mais…
A IA generativa (GenAI) está a evoluir rapidamente. Vemos grandes avanços na qualidade, não só do texto, mas sobretudo das imagens e dos vídeos…
Desde o lançamento de ferramentas como o ChatGPT, o interesse pela IA generativa (GenAI) cresceu enormemente. As aplicações parecem não ter fim: da…
Quer ser a primeira pessoa a saber quando publicamos um novo artigo no blogue?
Obrigado pela sua inscrição!