Voltar ao blog

Roteamento de modelos: o que determina qual modelo recebe uma solicitação

Com a mesma assinatura e quase a mesma pergunta, a qualidade das respostas pode variar. Na maioria das vezes, a conta não foi alterada; o servidor apenas encaminhou a solicitação para outro modelo. Este artigo explica os fatores envolvidos e uma ordem prática de diagnóstico.

Mesmo em um plano avançado, a mesma pergunta pode receber respostas bem diferentes: às vezes detalhadas, com etapas de raciocínio completas; outras vezes rápidas demais, como se outra pessoa estivesse respondendo. A primeira suspeita costuma ser alguma alteração na conta. Na maioria dos casos, a conta está normal: aquela solicitação foi roteada pelo servidor para outro modelo.

O que é o roteamento

Serviços de IA raramente usam um único modelo para atender a todas as solicitações. Em geral, um conjunto de modelos divide o tráfego de acordo com regras. Sempre que chega uma solicitação, o servidor avalia algumas condições antes de decidir qual modelo vai processá-la.

CondiçãoComo afeta o roteamento
Nível da conta e cotaO conjunto de modelos disponíveis varia conforme a assinatura e a cota restante
Região e saída de redeO tipo e a estabilidade da saída afetam a avaliação de risco e, indiretamente, a alocação
Tamanho do contextoQuanto mais longa a conversa, menos informações podem ser levadas integralmente ao modelo
Tipo de tarefaAlgumas solicitações são classificadas como leves e enviadas a modelos menores
Carga atualEm horários de pico, mais solicitações podem ser desviadas para modelos que respondem mais rápido

账号配额、地区网络、上下文、任务类型和当前负载共同进入路由器并决定模型池

Do ponto de vista de engenharia, isso faz sentido. Usar o maior modelo para uma solicitação como “reescreva este trecho na voz passiva” tornaria custo e tempo de resposta difíceis de sustentar. Para o usuário, porém, isso aparece como variação de qualidade.

Como cada condição funciona

Nível da conta e cota são os fatores mais diretos. Planos diferentes e saldos diferentes de cota dão acesso a conjuntos de modelos distintos. Se houver um aviso claro de cota ou limitação de recurso, trata-se de um problema de cota, não do mecanismo de roteamento. Verifique separadamente o status da assinatura e os avisos do serviço.

Região e saída de rede são fatores fáceis de subestimar. Uma solicitação pode passar por uma avaliação de risco na infraestrutura, e o tipo e a reputação do IP de saída influenciam essa decisão. IPs de data center, IPs de proxy compartilhados por muitas pessoas, nós trocados com frequência ou saídas com histórico de anomalias têm mais chance de ser considerados de maior risco e, por isso, receber tratamento diferente. Clientes web e móveis expõem quantidades diferentes de informações do ambiente; a web pode fornecer mais dados, então a mesma conta pode se comportar de maneira distinta em clientes diferentes.

O tamanho do contexto é a causa mais comum. Em conversas longas, informações antigas podem ser comprimidas ou cortadas. Parece que o modelo ficou menos capaz, mas na prática ele consegue ver menos contexto. O ideal é abrir uma nova conversa e fornecer novamente as informações necessárias, em vez de continuar perguntando depois de milhares de turnos.

A classificação do tipo de tarefa prioriza eficiência. Reescritas simples e conversões de formato podem ser mais rápidas em um modelo leve sem grande diferença de resultado, então é natural que o sistema faça esse encaminhamento. Para obter uma resposta mais profunda, deixe a complexidade explícita no prompt: diga que é necessário raciocínio em várias etapas e quais alternativas precisam ser ponderadas. Isso facilita o reconhecimento da tarefa como complexa.

Há ainda a carga. Em períodos de pico, tanto a qualidade quanto a velocidade podem cair. Sempre que possível, tarefas complexas e importantes devem ser executadas fora desses horários.

Ordem de diagnóstico quando a qualidade cai

Primeiro, confirme o status da conta e da cota. Veja se há aviso de limite ou restrição de recurso; essas informações normalmente são fáceis de identificar e devem ser descartadas primeiro.

Segundo, abra uma nova conversa, faça a mesma pergunta e compare os resultados. Se houver uma melhora clara, o problema provavelmente é o contexto, não a conta.

Terceiro, observe o horário. Verifique se o problema se concentra em determinados períodos de pico.

Quarto, teste outra saída de rede. Preste atenção ao tipo de saída: IPs de data center e IPs de proxy compartilhados por muitos usuários tendem a acionar avaliações de risco com mais facilidade, e alternar repetidamente entre nós instáveis também é um sinal anormal.

Quinto, se os passos anteriores não explicarem o problema, entre em contato com o suporte ou verifique a própria conta. Muita gente pula os quatro primeiros passos, suspeita da conta de imediato e perde tempo com recursos que não resolvem a causa real.

Onde a cota é consumida

Se você se preocupa com o consumo, vale lembrar que as cotas normalmente são calculadas pelo uso, enquanto o contexto continua se acumulando. Em cada turno da mesma conversa, o histórico anterior precisa ser carregado; quanto mais turnos, maior a carga de cada solicitação. Dividir uma tarefa longa em várias conversas curtas com objetivos claros pode economizar cota e facilitar o encaminhamento de cada pedido para um modelo adequado.

Para medir de forma prática, separe os tipos de tarefa que você usa com frequência. Execute a mesma tarefa uma vez em uma conversa nova, registre o consumo e compare com uma conversa longa. A diferença numérica costuma ser mais clara do que a percepção subjetiva.

Como aumentar a chance de uma solicitação receber processamento mais profundo

Divida tarefas longas para que cada conversa tenha apenas um objetivo claro. Informe no prompt o tipo de tarefa, a profundidade desejada e o formato de saída; perguntas vagas são mais fáceis de classificar como simples. Faça novamente uma pergunta importante com outra formulação ou em outra conversa. Se os resultados forem muito diferentes, a solicitação pode ter sido enviada a um modelo leve. Transforme prompts frequentes e estáveis em modelos reutilizáveis em vez de recriá-los toda vez.

Também ajuda mudar a forma de enxergar o serviço: trate-o como um conjunto de capacidades distribuídas por regras, e não como um único modelo fixo. Assim, quando a qualidade variar, você tende a verificar primeiro se o pedido foi claro o suficiente, em vez de suspeitar da conta ou gastar esforço com uma contestação.