Glossário de IA

Termos que aparecem nas fichas deste site, explicados sem jargão técnico desnecessário.

A

Agente de IA
Um programa que usa IA para executar tarefas de forma mais autônoma — não só responde perguntas, mas pode navegar na web, usar outros programas, agendar coisas e tomar pequenas decisões sozinho a caminho de um objetivo.
AGI (Inteligência Artificial Geral)
Termo usado para descrever uma IA hipotética com capacidade intelectual equivalente ou superior à humana em praticamente qualquer tarefa cognitiva. As IAs atuais são estreitas (especializadas em tarefas específicas), não AGI.
Air-Gapped (Ambiente Isolado)
Ambiente computacional 100% isolado de qualquer rede externa ou internet. No contexto de IA, um copiloto air-gapped processa documentos ultra-confidenciais, códigos proprietários e dados de clientes localmente sem permitir que nenhum byte saia da infraestrutura interna, garantindo conformidade rigorosa com normas como LGPD e GDPR.
Alinhamento (Alignment)
O conjunto de práticas e pesquisas que busca garantir que os sistemas de IA ajam de acordo com os objetivos, valores éticos e intenções humanas, evitando respostas perigosas ou prejudiciais.
Alucinação
Quando uma IA generativa produz uma informação errada, mas com aparência de confiança e correção — por exemplo, inventa uma fonte que não existe. É uma limitação conhecida de modelos de linguagem; sempre vale conferir fatos importantes.
API
Sigla para "Application Programming Interface". É a forma como programas conversam entre si. Quando uma ferramenta de IA "tem API", significa que outros desenvolvedores podem integrá-la nos próprios sistemas, além de usá-la pela interface normal.
Assistente de código
Uma IA integrada a um editor de programação que sugere, completa ou até escreve trechos de código, e ajuda a explicar ou corrigir erros — como o GitHub Copilot ou o Cursor.
Automação
Fazer um processo acontecer sozinho, sem intervenção manual repetida. Ferramentas de automação com IA conectam serviços diferentes e usam IA em algum passo do processo (ex.: resumir um e-mail recebido e mandar pro Slack automaticamente).
AWQ (Activation-aware Weight Quantization)
Método avançado de quantização para GPUs que protege os 1% dos pesos mais sensíveis (canais de ativação mais relevantes) durante a compressão para 4 bits. Oferece alta velocidade em placas NVIDIA com Tensor Cores e retenção de raciocínio superior a quantizações uniformes tradicionais.

B

Banco vetorial
Banco de dados especializado em armazenar embeddings (representações matemáticas de textos, códigos ou imagens) para busca por similaridade semântica. É a espinha dorsal de sistemas de RAG e busca inteligente.
Benchmark
Testes padronizados usados para medir e comparar o desempenho de diferentes modelos de IA em tarefas específicas (como raciocínio matemático, programação ou compreensão de texto). Não deve ser o único critério para escolher uma ferramenta para o dia a dia.

C

Cadeia de pensamento (CoT)
Técnica em que a IA decompõe problemas complexos em etapas lógicas intermediárias antes de dar a resposta final. Muito usada em modelos de raciocínio para evitar erros em matemática e lógica.
Checkpoint Diligence (Auditoria de Pesos)
Prática de segurança e governança de software que consiste em auditar os termos legais de cada ponto de verificação (checkpoint) de modelo aberto no Hugging Face antes de adotá-lo em produção comercial. Essencial para evitar usar variantes com licenças não-comerciais ou de pesquisa (como FLUX.1 dev) em produtos que exigem licenças permissivas (como FLUX.1 schnell).
ChromaDB / LanceDB (Bancos Vetoriais Locais)
Bancos de dados vetoriais locais e de código aberto, projetados para rodar de forma leve e embutida (embedded) na própria aplicação sem exigir servidores complexos. Fundamentais para pipelines de RAG 100% offline, permitindo indexação e busca semântica em documentos confidenciais.
ComfyUI
Interface visual modular e avançada baseada em nós (nodes) para execução de modelos generativos de imagem e vídeo locais (como Stable Diffusion, FLUX e Wan). Permite controle cirúrgico de cada etapa do pipeline gráfico diretamente na GPU do usuário.

D

Deepfake
Mídia sintética gerada por IA que recria ou substitui o rosto, a voz ou os trejeitos de uma pessoa real com alto nível de realismo. Exige cautela redobrada contra fraudes e golpes de clonagem de voz.
Destilação
Técnica de treinamento que transfere o conhecimento de um modelo de IA gigante para um modelo muito menor e mais leve, mantendo boa parte da qualidade sem exigir placas de vídeo caríssimas para rodar.
Difusão
Técnica matemática usada pelos principais geradores de imagens (como FLUX, Stable Diffusion e Midjourney), que cria imagens nítidas a partir da remoção gradual de ruído estático aleatório.
Discord
Um aplicativo de chat em grupo (parecido com um misto de fórum e chat) muito usado por empresas de IA como canal oficial de comunidade — onde usuários trocam dúvidas, veem anúncios e dão feedback direto para a equipe.

E

EDP (Enterprise Data Protection)
Camada de segurança e privacidade ativada no Microsoft Copilot quando acessado com contas corporativas ou educacionais (Microsoft Entra ID). Sob a EDP, as conversas e arquivos enviados não são gravados a longo prazo, não são vistos por funcionários da Microsoft e são contratualmente impedidos de serem usados para treinar modelos de IA.
Embeddings locais
Modelos compactos especializados em converter textos em vetores numéricos (como Nomic-Embed, BGE-M3 e MiniLM) rodando diretamente na CPU ou GPU local. Permitem calcular a similaridade semântica de documentos para RAG sem enviar dados a provedores externos.
EXL2 (ExLlamaV2)
Formato de quantização de altíssimo desempenho desenvolvido especificamente para inferência rápida de LLMs em GPUs modernas. Permite quantizações com taxas fracionárias de bits (ex.: 3.5 ou 4.25 bits por peso) alcançando algumas das maiores velocidades de tokens por segundo em hardware doméstico.

F

Fine-tuning (ajuste fino)
Processo de pegar um modelo de IA já treinado e treiná-lo um pouco mais com dados específicos, pra que ele fique melhor em uma tarefa ou domínio particular (ex.: um modelo ajustado pra responder só sobre um assunto médico).
Fórum oficial
Um espaço de discussão mantido pela própria empresa por trás da ferramenta (diferente de comunidades não-oficiais, como muitos subreddits). Geralmente é o melhor lugar pra tirar dúvida direto com quem desenvolve o produto.

G

GGUF
Formato de arquivo binário padrão criado pelo projeto llama.cpp para empacotar modelos de linguagem quantizados em um único arquivo (.gguf). É o formato universal utilizado por softwares como LM Studio, Ollama e Jan para carregar modelos de forma eficiente em CPUs e GPUs domésticas.
GPU (Placa de vídeo)
Unidade de processamento gráfico do computador. Além de renderizar jogos e imagens, a GPU realiza os cálculos matriciais pesados que aceleram a geração de respostas e imagens por IA.
Grammar Sampling / Saída Estruturada
Técnica de amostragem na inferência local (suportada por llama.cpp, Instructor e Outlines) que impõe regras estritas de gramática (como EBNF ou JSON Schema), forçando a IA a gerar respostas exclusivamente no formato de dados desejado (como JSON válido tipado), eliminando quebras de código em integrações.
Grounding (Aterramento)
Conectar as respostas da IA a fontes reais e verificáveis (como páginas da web, bancos de dados ou arquivos enviados), reduzindo alucinações e garantindo respostas ancoradas em fatos comprovados.
GRPO (Group Relative Policy Optimization)
Algoritmo inovador de aprendizado por reforço popularizado pelo DeepSeek-R1. Permite que o modelo desenvolva habilidades avançadas de raciocínio lógico e autorreflexão comparando múltiplos caminhos de resolução em grupo, dispensando modelos de recompensa pesados e reduzindo custos de treinamento.

I

IA generativa
O tipo de inteligência artificial que cria coisas novas — texto, imagem, áudio, vídeo, código — a partir de um pedido (prompt), em vez de só classificar ou prever dados existentes. É a categoria que engloba a maioria das ferramentas listadas neste site.
IA local / self-hosted
Rodar um modelo de IA no seu próprio computador, em vez de usar um serviço na nuvem. Vantagem: mais privacidade e nenhum custo por uso. Desvantagem: exige um computador razoavelmente forte e os modelos costumam ser mais limitados que os de nuvem.
IA Sustentável (Green AI)
Pesquisa e implementação de modelos de IA projetados para menor consumo computacional e pegada de carbono reduzida. No Brasil, ganha destaque estratégico devido à matriz elétrica com mais de 87% de fontes renováveis para data centers ecológicos.
Inferência
O momento em que um modelo de IA já treinado é usado pra gerar uma resposta — ou seja, é o "rodar" o modelo no dia a dia, diferente do "treinar" o modelo (que acontece antes, uma vez, e exige muito mais recursos).

J

Janela de contexto (Context window)
O limite máximo de texto (medido em tokens) que o modelo consegue ler e levar em conta simultaneamente para formular a resposta. Quanto maior a janela de contexto, mais páginas de documentos ou histórico de conversa a IA pode analisar ao mesmo tempo, embora consuma mais memória RAM/VRAM.

L

LGPD em IA Generativa
Aplicação da Lei Geral de Proteção de Dados (Lei nº 13.709/2018) sobre sistemas de IA. Veda a introdução inadvertida de dados pessoais sensíveis em chats com modelos freemium que coletem prompts para retreinamento sem autorização expressa e controle de privacidade.
Llama Community License
Licença proprietária sob a qual a Meta disponibiliza os modelos da família Llama. Autoriza o uso gratuito comercial e acadêmico irrestrito até o limite de 700 milhões de usuários ativos mensais (MAU) do produto ou serviço no mês civil anterior, acima do qual exige a solicitação de uma licença comercial proprietária formal junto à Meta.
llama.cpp
Motor de inferência de código aberto ultra-otimizado em C/C++ criado por Georgi Gerganov. É a fundação técnica sobre a qual foram construídos softwares populares como Ollama, LM Studio e Jan, permitindo executar modelos de IA em processadores com instruções AVX/AMX, Apple Silicon e placas de vídeo.
LLM (modelo de linguagem)
Sigla para "Large Language Model", ou "modelo de linguagem grande". É o tipo de IA por trás de chatbots como ChatGPT, Claude e Gemini: um sistema treinado com uma quantidade enorme de texto, capaz de entender e gerar linguagem natural.
LoRA e QLoRA
Técnicas de fine-tuning eficiente de parâmetros (PEFT). O LoRA congela a maior parte dos pesos do modelo e treina apenas matrizes de baixo posto adicionais; o QLoRA aplica isso sobre pesos quantizados em 4 bits, permitindo calibrar modelos de ponta em GPUs domésticas com 8 a 16 GB de VRAM.

M

MCP (Model Context Protocol)
Padrão aberto de comunicação que permite a assistentes de IA se conectarem com segurança a ferramentas locais, bancos de dados e serviços externos sem necessidade de código proprietário para cada integração.
Memória Unificada (Apple Silicon)
Arquitetura dos chips Apple (M1/M2/M3/M4) onde CPU, GPU e Neural Engine compartilham a mesma memória ultrarrápida. Permite que um Mac com 32 GB, 64 GB ou mais carregue modelos gigantescos de IA inteiramente no barramento acelerado pela GPU sem as restrições normais de VRAM de placas tradicionais.
Modelo de raciocínio (Reasoning)
Modelos de IA treinados para "pensar antes de responder" (como a família OpenAI o1/o3 e DeepSeek-R1), gastando passos de processamento intermediários para conferir lógica, código e matemática antes de entregar a resposta final.
MoE (Mixture of Experts)
Arquitetura de rede neural onde apenas uma fração dos parâmetros (chamados de "especialistas") é ativada para processar cada token gerado. Isso permite que modelos grandes (como Mixtral ou DeepSeek) tenham respostas ricas gastando menos processamento imediato por palavra do que modelos densos tradicionais.
Multimodal
Um modelo de IA que entende e/ou gera mais de um tipo de conteúdo — por exemplo, texto e imagem ao mesmo tempo, em vez de só texto. A maioria dos modelos de IA mais recentes é multimodal.

N

NIA (Núcleo de Inteligência Artificial / MGI)
Unidade da Secretaria de Governo Digital (SGD) do Ministério da Gestão e Inovação que desenvolve frameworks de autoavaliação ética, guias práticos de engenharia de prompt e RAG para orientar o uso seguro de IA no setor público federal.

O

OBIA (Observatório Brasileiro de IA)
Estrutura prevista pelo PBIA vinculada ao MCTI para auditar a transparência algorítmica, monitorar a mitigação de vieses discriminatórios e acompanhar a evolução dos impactos socioeconômicos da IA na sociedade brasileira.
Open WebUI
Interface web auto-hospedada (self-hosted) de código aberto inspirada no ChatGPT, projetada para se conectar diretamente a servidores Ollama ou APIs locais. Oferece suporte a múltiplos usuários, autenticação, histórico de conversas, RAG de documentos e controle granular de prompts.
Open-source (código aberto)
Quando o código-fonte de um programa é público e qualquer pessoa pode ver, usar, modificar ou redistribuir (dentro dos termos da licença). No contexto de IA, também costuma envolver disponibilizar os "pesos" do modelo pra download.

P

Parâmetros
Os "ajustes internos" de um modelo de IA, definidos durante o treinamento — geralmente contados em bilhões (ex.: um modelo "de 8B" tem 8 bilhões de parâmetros). Em geral, mais parâmetros tende a significar mais capacidade, mas também exige mais hardware pra rodar.
PBIA (Plano Brasileiro de Inteligência Artificial)
Política de Estado (2024–2028) coordenada pelo MCTI com mais de 300 especialistas e 117 instituições, alocando R$ 23,03 bilhões para soberania tecnológica, infraestrutura de supercomputação, modelos de linguagem em português, serviços públicos e capacitação.
Pesos (weights)
Os arquivos que guardam o "conhecimento" de um modelo de IA já treinado. Quando uma ferramenta "disponibiliza os pesos", significa que você pode baixar o modelo e rodá-lo você mesmo, em vez de só acessá-lo por um site ou API.
Plano gratuito
A parte de um produto que pode ser usada sem pagar nada. Pode ter limites de uso, recursos ou velocidade em comparação com os planos pagos — é o que o Tudo Gratuito descreve em "O que oferece grátis" em cada ficha.
Prompt
O texto (ou imagem, ou áudio) que você fornece pra uma IA generativa como pedido ou instrução. A qualidade e a clareza do prompt costumam influenciar bastante a qualidade da resposta.
Prompt engineering
A prática de escrever prompts de forma mais estruturada e estratégica pra conseguir melhores resultados de uma IA generativa — por exemplo, dar exemplos, definir um papel pra IA assumir, ou pedir passo a passo.

Q

Quantização
Técnica de compressão que reduz o tamanho de um modelo de IA e a quantidade de memória necessária para executá-lo, diminuindo a precisão matemática dos pesos (ex.: de 16 bits para 4 bits, como no formato Q4_K_M). Permite rodar modelos avançados de 8B ou 14B em computadores comuns com perda mínima de qualidade.

R

RAG (geração aumentada por recuperação)
Uma técnica em que a IA busca informação em documentos ou fontes específicas antes de gerar a resposta, em vez de depender só do que aprendeu no treinamento. Ajuda a reduzir alucinações e permite que a IA "converse" sobre seus próprios arquivos.
Rate Limit e Erro HTTP 429
Mecanismo de proteção e contenção de tráfego (throttling) imposto por provedores de nuvem para limitar requisições por minuto (RPM) ou tokens por minuto (TPM) nos planos gratuitos. Quando a cota temporária é atingida, o servidor retorna o código de status HTTP 429 ("Too Many Requests"), paralisando integrações automáticas que não tratem tentativas com recuo exponencial.

S

Soberania Tecnológica
A autonomia e capacidade de um país ou instituição em conceber, treinar, auditar e hospedar seus próprios sistemas de IA, reduzindo a dependência econômica de moedas estrangeiras, termos arbitrários de big techs e vieses culturais de modelos importados.
Subreddit
Uma comunidade de discussão dentro do site Reddit, dedicada a um assunto específico. Muitos subreddits sobre ferramentas de IA são criados e mantidos por usuários, sem afiliação oficial com a empresa — o que não impede que sejam boas fontes de dúvida e discussão.

T

Temperatura (Temperature)
Parâmetro de amostragem que regula a previsibilidade da resposta da IA. Valores baixos (0.1 a 0.3) deixam as respostas mais literais, lógicas e consistentes; valores mais altos (0.7 a 1.0) incentivam maior variedade e criatividade de vocabulário, mas aumentam o risco de alucinação.
Token
A menor unidade de texto que um modelo de IA processa — geralmente um pedaço de palavra, não uma palavra inteira. Limites de uso e de contexto costumam ser medidos em tokens.
Transcrição (STT)
Converter áudio falado em texto escrito, usando IA — o oposto do TTS. Sigla de "Speech to Text" (fala para texto). O Whisper, da OpenAI, é um exemplo conhecido de ferramenta de transcrição.
TTS (texto para voz)
Sigla para "Text to Speech". É a tecnologia que converte texto escrito em áudio falado, com vozes que podem soar bastante naturais — usada pra narração, dublagem e assistentes de voz.

U

Unsloth / Axolotl
Frameworks modernos de código aberto desenvolvidos para acelerar e baratear o treinamento e ajuste fino (fine-tuning) de modelos abertos como Llama, Mistral e Qwen. O Unsloth, por exemplo, reduz o consumo de memória em até 80% e dobra a velocidade do processo em hardware de consumidor.

V

VRAM (Memória de Vídeo)
A memória ultrarrápida dedicada instalada diretamente na placa de vídeo (GPU). Ao executar IA local, quando o modelo cabe 100% dentro da VRAM, a velocidade de geração costuma ser de 5x a 15x mais rápida do que quando o processamento precisa recorrer à memória RAM principal do computador.