Este trabalho foi desenvolvido pelos pesquisadores João Victor Feio Gonçalves (UFPA), John Sousa (UFPA), Rafael Veiga (UFPA), Lucas de Lima Bastos (UNIFESSPA), Lucas de Sousa Pacheco (UFPA), Iago Medeiros (UFPA), Denis Rosário (UFPA) e Eduardo Coelho Cerqueira (UFPA).
Eles desenvolveram o ASTRA, um novo método projetado para otimizar o Aprendizado Federado em cenários onde os dados entre os dispositivos são altamente diversificados e desconexos. O núcleo da inovação reside na Regularização em Espaço Duplo, que combina restrições físicas nos pesos do modelo com uma auto-destilação semântica para garantir que as previsões locais permaneçam alinhadas com o objetivo global.
Para viabilizar o uso em dispositivos com recursos limitados, os autores implementam um Escalonamento Baseado em Currículo, ativando o modelo “instrutor” de forma intensa apenas no início e, posteriormente, de maneira periódica. O propósito do estudo é mitigar o desvio do cliente (client drift) e evitar a divergência catastrófica do sistema, alcançando uma precisão superior a métodos tradicionais com um aumento pequeno no custo computacional.
Client drift/Desvio do cliente
○ Em redes de borda, os dados apresentam grande assimetria entre os diferentes dispositivos (dados não IID).
○ O impacto no treinamento local acontece porque os clientes otimizam exclusivamente com base em seus próprios dados privados e as atualizações locais dos pesos divergem significativamente do objetivo global.
○ As consequências para o FL são estas:
■ Divergência catastrófica: a média de gradientes conflitantes destrói o desempenho global do modelo
■ Falhas de convergência: métodos padrão (como o FedAvg) apresentam grave instabilidade.
○ O objetivo então é:
■ Manter as atualizações locais semanticamente alinhadas com o consenso global sem suprimir o aprendizado local,
Dessa forma, os autores demonstram que é possível conciliar estabilidade estrutural e flexibilidade lógica para criar modelos de inteligência artificial descentralizados mais robustos e eficientes.
Teacher-Student Distillation
O Teacher-Student Distillation (destilação professor-aluno), no contexto das fontes, é uma técnica de abordagem semântica que visa alinhar as saídas de um modelo (logits) em vez de apenas seus pesos.
O conceito central baseia-se na transferência de “dark knowledge” (conhecimento obscuro) de um modelo “Professor” robusto para um modelo “Estudante” local. O Mecanismo de Funcionamento – a transferência ocorre através dos logits de saída (ativações pré-softmax) – procura minimizar a Divergência de Kullback-Leibler (KL) entre as distribuições de probabilidade do aluno e do professor.
A consistência semântica, que é reforçada nesse processo, é uma técnica que garante que as fronteiras de decisão do modelo local permaneçam alinhadas com o consenso global, permitindo que o modelo mantenha a lógica de classificação mesmo quando os pesos físicos mudam para se adaptar a dados locais.
Utiliza-se um parâmetro de temperatura para “suavizar” as distribuições de probabilidade; isso amplifica a importância das classes de baixa probabilidade, facilitando a transferência de relações entre classes (o “dark knowledge”) em vez de apenas rótulos rígidos.
O ASTRA utiliza uma variação chamada Self-Distillation (autodestilação), onde o modelo global congelado periodicamente atua como o Professor e o modelo local em treinamento é o Estudante.
Fase de mentoria
Depois da etapa inicial de estabilização do modelo, o método ASTRA entra em uma nova fase de treinamento: a Fase de Mentoria (Mentorship Phase). A proposta é que, em vez de manter a orientação do modelo global sobre os modelos locais durante todo o processo, o sistema passe a fazer intervenções periódicas, permitindo que os dispositivos trabalhem de forma mais autônoma.
No início do treinamento, na chamada Fase de Fundação, o modelo global — o “Professor” – orienta continuamente os modelos locais, os “Estudantes”. Na fase de Mentoria, essa relação muda. O Professor passa a acompanhar o aprendizado em intervalos determinados, funcionando como uma espécie de supervisor que intervém apenas quando necessário.
A cada ciclo de rodadas de treinamento, o Professor é ativado para realizar um check-in. Nesse momento, o modelo local recebe uma correção semântica que ajuda a manter suas previsões alinhadas ao objetivo global do sistema. Entre essas intervenções, porém, o Professor permanece inativo.
É nesse intervalo que entra o chamado Modo Autônomo. Sem a necessidade de executar as passagens à frente (forward passes) do modelo global para realizar a destilação, o modelo local pode se concentrar nos seus próprios dados e se especializar de acordo com as características daquele ambiente.
A estratégia tem também um impacto direto sobre o uso de recursos computacionais. Ao reduzir a frequência com que o modelo global precisa participar do treinamento, o ASTRA diminui o consumo de memória VRAM e o número de operações de ponto flutuante (FLOPs), um aspecto especialmente relevante para dispositivos de borda, que normalmente trabalham com recursos computacionais mais limitados.
A lógica pode ser comparada à relação entre um professor e seus alunos. Depois de apresentar os conceitos fundamentais, o professor não precisa acompanhar cada exercício realizado individualmente. Ele pode deixar os estudantes resolverem as questões sozinhos e, periodicamente, voltar para verificar o andamento, corrigir eventuais erros e oferecer novas orientações. No aprendizado federado, essa alternância busca equilibrar autonomia local e alinhamento global. O modelo local ganha espaço para aprender com seus próprios dados, enquanto as intervenções periódicas do modelo global ajudam a evitar que esse aprendizado se afaste excessivamente do objetivo comum, o já mencionado client drift.
Com essa abordagem, o ASTRA procura combinar a capacidade de adaptação aos dados locais com uma maior eficiência computacional, mantendo uma velocidade de treinamento próxima à do FedAvg, algoritmo de referência no aprendizado federado. A ideia central é transformar a relação entre os modelos global e local: menos supervisão contínua, mais autonomia — mas sem abrir mão de momentos estratégicos de orientação.
Desafio Computacional
Uma limitação crítica da destilação padrão é o custo computacional, pois exige uma passagem à frente (forward pass) do professor em cada etapa de treinamento. O ASTRA resolve isso ativando o sinal do professor apenas periodicamente, de acordo com um cronograma de currículo, para proteger os recursos de dispositivos de borda (edge devices). De tempos em tempos acontece a correção do modelo global. Não é possível ter o processo de mentoria ativa todo o tempo; mas a proposta é ter uma solução eficiente em que o modelo global não precise estar sempre instruindo; as coisas acontecem de forma autônoma e ele corrige o que for necessário de forma pontuada.