Triagem virtual (VS) é uma técnica computacional usada na descoberta de fármacos para pesquisar bibliotecas de pequenas moléculas a fim de identificar aquelas estruturas com maior probabilidade de se ligar a um alvo farmacológico, tipicamente um receptor proteico ou enzima. A triagem virtual foi definida como "avaliar automaticamente bibliotecas muito grandes de compostos" usando programas de computador. Como esta definição sugere, a VS tem sido em grande parte um jogo de números focando em como o enorme espaço químico de mais de 1060 compostos concebíveis pode ser filtrado para um número gerenciável que possa ser sintetizado, comprado e testado. Embora pesquisar todo o universo químico possa ser um problema teoricamente interessante, cenários de VS mais práticos focam em projetar e otimizar bibliotecas combinatórias direcionadas e enriquecer bibliotecas de compostos disponíveis a partir de repositórios internos de compostos ou ofertas de fornecedores. À medida que a precisão do método aumentou, a triagem virtual tornou-se uma parte integrante do processo de descoberta de fármacos. A triagem virtual pode ser usada para selecionar compostos de bancos de dados internos para triagem, escolher compostos que podem ser comprados externamente e decidir qual composto deve ser sintetizado em seguida.

Métodos Existem duas grandes categorias de técnicas de triagem: baseadas em ligante e baseadas em estrutura.

Métodos baseados em ligante Dado um conjunto de ligantes estruturalmente diversos que se ligam a um receptor, um modelo do receptor pode ser construído explorando a informação coletiva contida em tal conjunto de ligantes. Diferentes técnicas computacionais exploram as similaridades estruturais, eletrônicas, de forma molecular e físico-químicas de diferentes ligantes que poderiam implicar seu modo de ação contra um receptor molecular ou linhagens celulares específicas. Um ligante candidato pode então ser comparado ao modelo de farmacóforo para determinar se é compatível com ele e, portanto, provavelmente se ligará. Diferentes métodos de análise de similaridade química 2D têm sido usados para vasculhar bancos de dados em busca de ligantes ativos. Outra abordagem popular usada na triagem virtual baseada em ligante consiste em pesquisar moléculas com forma similar à de ativos conhecidos, pois tais moléculas se ajustarão ao sítio de ligação do alvo e, portanto, provavelmente se ligarão ao alvo. Há várias aplicações prospectivas desta classe de técnicas na literatura. Extensões farmacofóricas destes métodos 3D também estão disponíveis gratuitamente como servidores web. Além disso, a triagem virtual baseada em forma ganhou popularidade significativa.

Métodos baseados em estrutura A abordagem de triagem virtual baseada em estrutura inclui diferentes técnicas computacionais que consideram a estrutura do receptor que é o alvo molecular dos ligantes ativos investigados. Algumas dessas técnicas incluem docking molecular, modelagem de farmacóforo baseada em estrutura e simulações de dinâmica molecular. O docking molecular é a técnica baseada em estrutura mais utilizada e aplica uma função de pontuação para estimar a adequação de cada ligante contra o sítio de ligação do receptor macromolecular, ajudando a escolher os ligantes com maior afinidade. Atualmente, existem alguns servidores web orientados para triagem virtual prospectiva.

Métodos híbridos Métodos híbridos que dependem de similaridade estrutural e de ligante também foram desenvolvidos para superar as limitações das abordagens tradicionais de VLS. Estas metodologias utilizam informações de ligação ligante-baseadas em evolução para prever moléculas pequenas ligantes e podem empregar tanto similaridade estrutural global quanto similaridade de bolsa. Uma abordagem baseada em similaridade estrutural global emprega tanto uma estrutura experimental quanto um modelo proteico predito para encontrar similaridade estrutural com proteínas na biblioteca de holomodelos do PDB. Ao detectar similaridade estrutural significativa, a métrica de coeficiente de Tanimoto baseada em impressão digital 2D é aplicada para triar pequenas moléculas similares a ligantes extraídos de modelos PDB holo selecionados. As predições deste método foram avaliadas experimentalmente e mostram bom enriquecimento na identificação de pequenas moléculas ativas. O método especificado acima depende da similaridade estrutural global e não é capaz de selecionar a priori um sítio de ligação de ligante particular na proteína de interesse. Além disso, como os métodos dependem da avaliação de similaridade 2D para ligantes, eles não são capazes de reconhecer similaridade estereoquímica de pequenas moléculas que são substancialmente diferentes mas demonstram similaridade de forma geométrica. Para abordar estas preocupações, uma nova abordagem centrada em bolsa, PoLi, capaz de atingir bolsas de ligação específicas em modelos de holoproteína, foi desenvolvida e avaliada experimentalmente.

Infraestrutura computacional O cálculo de interações par-a-par entre átomos, que é um pré-requisito para a operação de muitos programas de triagem virtual, escala por

O (

N

2

)

{\displaystyle O(N^{2})}

, onde N é o número de átomos no sistema. Devido à escala quadrática, os custos computacionais aumentam rapidamente.

Abordagem baseada em ligante Métodos baseados em ligante tipicamente requerem uma fração de segundo para uma operação de comparação de estrutura única. Às vezes, uma única CPU é suficiente para realizar uma triagem grande em horas. No entanto, várias comparações podem ser feitas em paralelo para acelerar o processamento de um grande banco de dados de compostos.

Abordagem baseada em estrutura O tamanho da tarefa requer uma infraestrutura de computação paralela, como um cluster de sistemas Linux, executando um processador de fila de lotes para lidar com o trabalho, como Sun Grid Engine ou Torque PBS. Um meio de lidar com a entrada de grandes bibliotecas de compostos é necessário. Isso requer uma forma de banco de dados de compostos que possa ser consultado pelo cluster paralelo, entregando compostos em paralelo aos vários nós de computação. Motores de banco de dados comerciais podem ser muito pesados, e um mecanismo de indexação de alta velocidade, como Berkeley DB, pode ser uma escolha melhor. Além disso, pode não ser eficiente executar uma comparação por tarefa, porque o tempo de inicialização dos nós do cluster poderia facilmente superar a quantidade de trabalho útil. Para contornar isso, é necessário processar lotes de compostos em cada tarefa do cluster, agregando os resultados em algum tipo de arquivo de log. Um processo secundário, para minerar os arquivos de log e extrair candidatos de alta pontuação, pode então ser executado após a conclusão de todo o experimento.

Precisão O objetivo da triagem virtual é identificar moléculas de estrutura química nova que se ligam ao alvo macromolecular de interesse. Assim, o sucesso de uma triagem virtual é definido em termos de encontrar novos esqueletos moleculares interessantes, em vez do número total de hits. Interpretações da precisão da triagem virtual devem, portanto, ser consideradas com cautela. Taxas de hit baixas de esqueletos interessantes são claramente preferíveis a taxas de hit altas de esqueletos já conhecidos. A maioria dos testes de estudos de triagem virtual na literatura são retrospectivos. Nestes estudos, o desempenho de uma técnica de VS é medido por sua capacidade de recuperar um pequeno conjunto de moléculas previamente conhecidas com afinidade ao alvo de interesse (moléculas ativas ou apenas ativos) de uma biblioteca contendo uma proporção muito maior de inativos assumidos ou decoys. Existem várias maneiras distintas de selecionar decoys combinando as propriedades da molécula ativa correspondente e, mais recentemente, decoys também são selecionados de maneira não correspondente por propriedades. O impacto real da seleção de decoys, seja para fins de treinamento ou teste, também foi discutido. Em contraste, em aplicações prospectivas da triagem virtual, os hits resultantes são submetidos à confirmação experimental (por exemplo, medições de IC50). Há consenso de que os benchmarks retrospectivos não são bons preditores do desempenho prospectivo e, consequentemente, apenas estudos prospectivos constituem prova conclusiva da adequação de uma técnica para um determinado alvo.

Aplicação à descoberta de fármacos A triagem virtual é uma aplicação muito útil quando se trata de identificar moléculas hit como um começo para a química medicinal. À medida que a abordagem de triagem virtual começa a se tornar uma técnica mais vital e substancial dentro da indústria da química medicinal, a abordagem teve um aumento rápido.

Métodos baseados em ligante Métodos baseados em ligante são aplicados quando a estrutura tridimensional do receptor alvo é desconhecida. Em vez de modelar interações ligante-receptor diretamente, estas abordagens dependem das propriedades estruturais e físico-químicas de ligantes ativos conhecidos para prever como novos compostos podem se ligar.

Modelos de farmacóforo Um farmacóforo é definido como o conjunto de características estéricas e eletrônicas necessárias para garantir interações supramoleculares ótimas com um alvo biológico e para desencadear (ou bloquear) sua resposta biológica. Estas características tipicamente incluem doadores e aceptores de ligação de hidrogênio, regiões hidrofóbicas, anéis aromáticos, grupos carregados e funcionalidades de ligação a metais. A modelagem de farmacóforo é comumente aplicada no design de fármacos baseado em ligante quando a estrutura tridimensional da proteína alvo é desconhecida ou quando múltiplos ligantes ativos estão disponíveis. O fluxo de trabalho geral envolve várias etapas: Seleção de compostos ativos: Um conjunto representativo e estruturalmente diverso de ligantes biologicamente ativos é selecionado. A diversidade estrutural é importante para garantir que o modelo resultante capture características de interação essenciais em vez de características específicas do composto.Geração de conformeros: Como os ligantes são flexíveis, múltiplas conformações de baixa energia (conformeros) são geradas para cada molécula. Esta etapa visa aproximar a conformação bioativa, que geralmente é desconhecida em abordagens baseadas em ligante.Alinhamento e sobreposição molecular: Os conformeros gerados são sobrepostos para identificar arranjos espaciais comuns de características químicas chave. Ao alinhar elementos farmacofóricos compartilhados entre ligantes ativos, uma hipótese de farmacóforo é construída. Ao contrário de abordagens que dependem de uma única estrutura de referência, a modelagem de farmacóforo integra informações de múltiplos compostos ativos. Isso geralmente melhora a robustez e o desempenho preditivo, particularmente ao lidar com ligantes quimicamente diversos. No entanto, como múltiplos alinhamentos e combinações de características são possíveis, a modelagem de farmacóforo geralmente não produz uma única solução única. Portanto, as hipóteses geradas devem ser validadas usando conjuntos de teste externos ou dados experimentais.

Triagem virtual baseada em forma Abordagens de similaridade molecular baseadas em forma estabeleceram-se como técnicas de triagem virtual importantes e populares. Atualmente, a plataforma de triagem altamente otimizada ROCS (Rapid Overlay of Chemical Structures) é considerada o padrão de facto da indústria para triagem virtual centrada em ligante baseada em forma. Ela usa uma função gaussiana para definir volumes moleculares de pequenas moléculas orgânicas. A seleção da conformação de consulta é menos importante, tornando a triagem baseada em forma ideal para modelagem baseada em ligante: como a disponibilidade de uma conformação bioativa para a consulta não é o fator limitante para a triagem — é mais a seleção do(s) composto(s) de consulta que é decisiva para o desempenho da triagem. Outros métodos de similaridade molecular baseados em forma, como o Autodock-SS, também foram desenvolvidos.

Triagem virtual baseada em campo Métodos de triagem virtual baseados em campo estendem as abordagens de similaridade baseada em forma ao considerar não apenas a forma molecular, mas também os campos de interação físico-química que governam o reconhecimento ligante-receptor. Em vez de focar exclusivamente na sobreposição estrutural, estes métodos comparam potenciais de interação molecular, tais como Campos eletrostáticos Campos hidrofóbicos Campos estéricos Potenciais de ligação de hidrogênio Ao avaliar estas propriedades no espaço tridimensional, as abordagens baseadas em campo visam capturar os padrões de interação subjacentes responsáveis pela atividade biológica, permanecendo amplamente independentes do esqueleto químico específico da molécula de consulta. Comparados a métodos puramente baseados em forma, a triagem baseada em campo pode fornecer uma descrição mais sutil da similaridade molecular, particularmente quando compostos estruturalmente distintos compartilham perfis de interação semelhantes.

Relação quantitativa estrutura-atividade Modelos de Relação Quantitativa Estrutura-Atividade (QSAR) são modelos preditivos que relacionam descritores moleculares à atividade biológica usando um conjunto de dados de compostos ativos e inativos conhecidos. Em contraste com a análise qualitativa de relação estrutura-atividade (SAR), que identifica tendências dentro de classes estruturais, o QSAR fornece uma relação matemática quantitativa entre propriedades moleculares e respostas biológicas medidas.

Métodos QSAR tradicionais Abordagens QSAR tradicionais tipicamente dependem de descritores moleculares predefinidos — tais como propriedades físico-químicas, índices topológicos ou parâmetros eletrônicos — e aplicam técnicas de modelagem estatística incluindo: Mínimos quadrados ordinários (OLS) Regressão linear múltipla (MLR) Mínimos quadrados parciais (PLS) Estes métodos assumem uma relação linear entre descritores e atividade biológica. Os modelos QSAR são amplamente utilizados para priorizar compostos na descoberta e otimização de leads.

Aprendizado de máquina em QSAR Abordagens de aprendizado de máquina (ML) podem ser vistas como uma extensão da metodologia QSAR. Como os modelos QSAR clássicos, os métodos baseados em ML usam descritores moleculares ou representações estruturais (como impressões digitais moleculares, grafos) como características de entrada. No entanto, eles empregam algoritmos mais flexíveis capazes de modelar relações não lineares e complexas entre estrutura molecular e atividade biológica. No aprendizado supervisionado, os modelos são treinados em conjuntos de dados compostos por compostos ativos e inativos conhecidos (ou compostos com valores de atividade medidos). O modelo treinado é então usado para prever a atividade ou probabilidade de atividade para novos compostos. Algoritmos comuns de aprendizado de máquina aplicados na triagem virtual incluem: Árvores de decisão Máquinas de vetores de suporte (SVM) Florestas aleatórias k-Vizinhos mais próximos (k-NN) Redes neurais artificiais Estes modelos tipicamente produzem: Um valor de atividade previsto (regressão), ou Uma probabilidade de que um composto seja ativo (classificação), que pode então ser usada para classificação na triagem virtual.

Métodos baseados em estrutura Métodos baseados em estrutura dependem da estrutura tridimensional do alvo biológico, tipicamente obtida por cristalografia de raios X, espectroscopia de RMN ou microscopia crioeletrônica. Ao contrário das abordagens baseadas em ligante, estes métodos modelam explicitamente as interações entre um ligante e o sítio de ligação de um receptor.

Modelos de farmacóforo Na modelagem de farmacóforo baseada em estrutura, as características farmacofóricas são derivadas diretamente da estrutura tridimensional do sítio de ligação do alvo, em vez de um conjunto de ligantes ativos conhecidos. Características de interação chave - tais como doadores e aceptores de ligação de hidrogênio, regiões hidrofóbicas, resíduos carregados e sítios de ligação a metais - são identificadas com base no arranjo espacial dos resíduos de aminoácidos dentro da bolsa de ligação. Se uma estrutura de complexo proteína-ligante estiver disponível, características farmacofóricas também podem ser extraídas das interações ligante-receptor observadas. O modelo de farmacóforo resultante representa o padrão de interação essencial necessário para a ligação e pode ser usado para triar bibliotecas de compostos.

Docking molecular O docking molecular visa prever o modo de ligação (pose) e, em alguns casos, a afinidade de ligação de um ligante dentro do sítio ativo de uma proteína alvo. O docking envolve dois componentes principais: Algoritmo de busca – explora orientações e conformações possíveis do ligante dentro da bolsa de ligação.Função de pontuação – estima a força da interação ligante-receptor e classifica as poses previstas de acordo.O objetivo é identificar a pose de ligação mais provável para um determinado ligante e priorizar compostos com base em sua afinidade de ligação prevista.

Métodos de co-dobramento Métodos de co-dobramento preveem a estrutura de um complexo proteína-ligante modelando o receptor e o ligante simultaneamente, permitindo a adaptação conformacional durante a ligação. Ao contrário do docking clássico, que tipicamente trata o receptor como rígido ou semi-flexível, as abordagens de co-dobramento visam capturar efeitos de ajuste induzido de forma mais explícita. Frameworks recentes baseados em aprendizado profundo, como o Boltz-2, exemplificam esta estratégia ao prever estruturas de complexos ligados diretamente a partir de informações de sequência e ligante. Embora tais abordagens sejam computacionalmente mais exigentes do que o docking tradicional, elas são promissoras para refinar poses de ligação, melhorar a precisão estrutural e aprimorar fluxos de trabalho de triagem virtual baseada em estrutura, particularmente para alvos flexíveis ou desafiadores.

Ver também Computação em grade Triagem de alto rendimento Docking (molecular) Retro triagem Funções de pontuação Triagem em ultra-grande escala Base de dados ZINC

Referências

Leitura adicional

Ligações externas VLS3D – lista de mais de 2000 bancos de dados, ferramentas in silico online e independentes