glossary

Por que o algospeak esconde conversas reais do monitoramento de keywords

Taras Shynkarenko
Taras Shynkarenko
Updated: 9 minutos de leitura
Por que o algospeak esconde conversas reais do monitoramento de keywordsPor que o algospeak esconde conversas reais do monitoramento de keywords

TL;DR

9 minutos de leitura

Algospeak é a prática de trocar por palavras em código os termos que o usuário acredita que o sistema de moderação de uma plataforma vai remover ou rebaixar, para que a postagem continue no ar e o público pretendido ainda a encontre. A reportagem do The Washington Post que popularizou o termo saiu em abril de 2022, e o primeiro estudo acadêmico da prática entrevistou 19 criadores do TikTok em 2023. Para quem faz monitoramento de keywords, algospeak é um problema silencioso de recall: a conversa acontece, sua lista de correspondência exata nunca a vê, e seus números de volume e sentimento estão errados numa direção que você não consegue enxergar.

O que é algospeak?

Trocar por uma palavra em código um termo que você espera que a plataforma remova ou enterre é algospeak, e é por isso que um assunto pode ser discutido em volume enquanto sua lista de keywords exatas relata silêncio. O mecanismo é a antecipação: quem posta adivinha o que um sistema automático de moderação vai sinalizar e escreve em volta desse palpite, mantendo o sentido legível para o público que quer alcançar. Isso faz do algospeak um problema de cobertura para o monitoramento, e não uma curiosidade linguística, porque a palavra substituta carrega a conversa e a palavra monitorada nunca aparece.

De onde vem o termo algospeak?

A palavra ganhou uso amplo com a reportagem de Taylor Lorenz no The Washington Post, publicada em 8 de abril de 2022 sob o título Internet 'algospeak' is changing our language in real time, from 'nip nops' to 'le dollar bean'. A expressão "le dollar bean" desse título é uma dessas substituições e significa lesbian, ou seja, lésbica. O texto define algospeak como "code words or turns of phrase users have adopted in an effort to create a brand-safe lexicon that will avoid getting their posts removed or down-ranked by content moderation systems", ou seja, palavras em código ou construções que os usuários adotaram para criar um léxico seguro para marcas, capaz de evitar que suas postagens sejam removidas ou rebaixadas por sistemas de moderação. O artigo é pago depois da seção de abertura, então a definição e os primeiros exemplos citados aqui são o que está publicamente legível na página do Post, e a atribuição é a que aparece ali, não a do texto completo. Nenhuma fonte que eu consiga alcançar aponta uma data de criação nem um autor único, então trate abril de 2022 como o momento em que o termo se espalhou, não como o momento em que foi inventado.

O primeiro estudo revisado por pares sobre a prática é You Can (Not) Say What You Want: Using Algospeak to Contest and Evade Algorithmic Content Moderation on TikTok, de Ella Steen, Kathryn Yurechko e Daniel Klug, publicado em acesso aberto na Social Media + Society em 31 de agosto de 2023. Os autores entrevistaram 19 criadores do TikTok e afirmam que o artigo deles é o primeiro a analisar algospeak como um fenômeno próprio das redes sociais. A conclusão importa para o monitoramento: os participantes anteciparam como o algoritmo leria um vídeo e escolheram substituições que escapavam da moderação sem impedir que o público-alvo encontrasse a postagem.

Uma mulher digita no celular, uma imagem da linguagem codificada usada para manter publicações no ar.

Como o algospeak aparece na prática?

Os exemplos abaixo são substituições documentadas em fontes de 2022 e 2023, não um dicionário atual. Steen e colegas descrevem algospeak como abreviar, escrever errado de propósito ou substituir palavras, e as formas circulam entre plataformas e comunidades.

Forma documentadaSignificado relatadoDocumentada emData
unalivemorto, morteThe Washington Postabril de 2022
SAviolência sexual, de sexual assaultThe Washington Postabril de 2022
spicy eggplantvibrador, literalmente berinjela picanteThe Washington Postabril de 2022
le$beanlésbica, de lesbianSteen, Yurechko e Klugagosto de 2023
seggssexo, de sexSteen, Yurechko e Klugagosto de 2023
clock appTikTok, literalmente app do relógioSteen, Yurechko e Klugagosto de 2023

Leia essa tabela como ilustração, não como uma lista para colar num construtor de consultas. Boa parte desse vocabulário existe porque as pessoas falam de automutilação, violência sexual, sexualidade, trabalho sexual e doença sob sistemas de moderação que suprimem esses assuntos, quebre a postagem alguma regra ou não. Steen e colegas apontam a falta de contexto, a aleatoriedade, a imprecisão e o viés contra comunidades marginalizadas como as falhas de moderação que impulsionam a prática.

Por que o algospeak quebra o monitoramento de keywords?

O monitoramento por correspondência exata mede a presença de uma sequência de texto, e o algospeak remove a sequência e deixa a conversa intacta. A falha é de recall, a fração das postagens relevantes que você realmente captura, não de precisão: as postagens que deram match continuam falando do seu assunto, então nada parece quebrado no feed, e as postagens que faltam não deixam rastro em lugar nenhum do sistema. Meça o recall diretamente em vez de presumi-lo.

Recall = correspondências do termo monitorado / todas as postagens sobre o assunto

Suponha que você leia as postagens de uma comunidade e julgue que 200 delas falam do seu assunto, e que seu termo monitorado apareça em 140. O recall é 140 / 200 = 0.70, então 30 por cento dessa conversa nunca chega ao seu painel. Esses valores são ilustrativos, não uma referência publicada, e o seu número vai variar por plataforma, comunidade e assunto.

Checagem de recall em uma comunidade
Correspondências capturadas140 de 200
Perdidas pela lista de keywords60 de 200 (30%)
O exemplo ilustrativo do post: posts julgados relevantes para o tema contra a parcela que o termo rastreado realmente capturou.

Como o algospeak distorce volume e sentimento?

As postagens que faltam enviesam tanto as contagens quanto o tom, porque o algospeak não se distribui de forma uniforme pela conversa. A substituição se concentra onde a pressão da moderação é mais forte, o que significa que as threads de crise, as queixas de saúde e as postagens sobre experiências ruins são as mais afetadas, enquanto o papo neutro sobre produto segue usando palavras comuns. Uma análise de sentimento rodada sobre essa amostra torta soa mais positiva do que a conversa real, e um gráfico de volume subestima cada pico que coincide com um assunto moderado.

Essa falha é diferente das duas queixas mais comuns sobre monitoramento. As keywords negativas resolvem falsos positivos, e a detecção de quase duplicatas resolve cópias repetidas de uma mesma história. Nenhuma das duas recupera uma postagem que sua consulta nunca capturou.

Um analista revisa gráficos em um laptop, representando o trabalho manual de amostragem que capta o que as listas de keywords deixam passar.

O que uma equipe de monitoramento pode realmente fazer?

Nada devolve a cobertura completa, e qualquer fornecedor que prometa um dicionário completo de algospeak está vendendo uma lista que se deteriora. Um preprint de Jan Fillies, Ronald E. Robertson e Jeffrey Hancock, Algospeak, Hiding in the Open, modela a prática como coevolução entre quem escapa e quem detecta, e é por isso que uma lista estática envelhece: o vocabulário se move em resposta a ser detectado. O mesmo trabalho aponta o teto desse movimento: uma substituição obscura o bastante para vencer todo detector deixa de ser entendida pelas pessoas para quem foi escrita.

Cinco coisas ajudam, em ordem decrescente de retorno:

Monitore comunidades além de sequências de texto. Acompanhar o feed inteiro de um subreddit captura postagens em que seu termo monitorado nunca aparece, e é para isso que servem o buscador de subreddits e o monitoramento de keywords no Reddit da RedReplier quando você usa os dois juntos.

RedReplier
RedReplier

Começar

Reddit, X, Bluesky e HN

Alertas de intenção em tempo real

Respostas IA ilimitadas

Classificado por intenção de compra

Leia amostras com periodicidade fixa. Puxe uma amostra aleatória de postagens das comunidades que importam para você, julgue a relevância na mão e calcule o recall acima. É assim que você descobre quais substituições estão vivas agora, e isso ainda funciona como controle de qualidade do seu monitoramento de marca.

Avalie significado, não grafia. A avaliação de relevância por IA pontua se uma postagem fala do seu assunto em vez de conter a sua sequência de texto, e a RedReplier explica por que cada menção foi sinalizada para que você possa auditar o julgamento.

Date sua lista de keywords. Coloque nela uma data de revisão, acrescente as substituições que sua amostragem encontrou e tire os termos que esfriaram. Seus operadores de busca booleana valem o ajuste, e esse ajuste nunca termina.

Relate a lacuna com honestidade. Quando apresentar volume ou sentimento a um stakeholder, diga quais assuntos você sabe que estão subcontados. Isso é um resultado melhor do que um gráfico confiante construído sobre uma consulta que você nunca testou.

Qual a diferença entre algospeak e outras gírias da internet?

Algospeak é uma resposta a um sistema de moderação, e as outras gírias de internet são uma resposta a uma comunidade. Steen e colegas traçam essa linha de forma explícita: leetspeak, LOLspeak, textspeak e variações parecidas existem para sinalizar identidade ou pertencimento a um grupo, enquanto algospeak é usado como reação a passar por moderação de conteúdo numa plataforma. A consequência para quem faz social listening, a escuta de conversas sociais, é que o algospeak anda no relógio das políticas de plataforma e não no da cultura, então um termo que estava em código no trimestre passado pode ser texto comum neste trimestre.

Quem acredita que sua conta está suprimida muda o jeito de escrever antes de mudar o que diz, e esse é o mesmo instinto por trás das teorias populares do verbete sobre o shadowban no Reddit.

Perguntas frequentes

Quem criou o termo algospeak?

Nenhuma fonte que eu consiga verificar aponta um autor único. A reportagem de Taylor Lorenz no The Washington Post de 8 de abril de 2022 é o texto creditado por popularizar a palavra, e Steen, Yurechko e Klug citam esse artigo quando ligam o fenômeno ao TikTok. A afirmação segura é que o termo se espalhou em 2022, não que uma única pessoa o inventou.

Algospeak é coisa só do TikTok?

Não. Steen e colegas escrevem que algospeak existe em muitas plataformas sociais, ainda que esteja bastante ligado ao TikTok, por causa do formato audiovisual do TikTok e da sua moderação algorítmica. Um preprint de 2026 sobre detecção de linguagem codificada anotou postagens do TikTok e do Bluesky, o que é evidência de que a prática não se restringe a um app.

Algospeak afeta o monitoramento de marca ou só o de assuntos?

O monitoramento de assuntos leva o baque maior. Sistemas de moderação policiam temas, não nomes de marca, então sua marca sobrevive em texto comum enquanto o assunto ao redor dela é substituído. A exceção é a postagem que junta sua marca a um assunto suprimido, que é exatamente a postagem que você mais quer ver.

Dá para simplesmente adicionar termos de algospeak à minha lista de keywords?

Você pode adicionar os que a sua própria amostragem encontrar, e deve fazer isso. O que você não consegue é ficar em dia, porque o vocabulário muda em resposta à detecção e varia de comunidade para comunidade. Trate qualquer lista que você montar como um piso que se deteriora e precisa de uma data de revisão.

Escrever sobre algospeak é o mesmo que ajudar as pessoas a burlar a moderação?

Não. Descrever que a substituição acontece, e medir quanto de uma conversa ela esconde, é uma questão de pesquisa e de medição. Publicar uma tabela mantida de substituições atuais é outro ato, com outras consequências, e é por isso que os exemplos acima são citações datadas e não uma lista de trabalho.

Como saber se algospeak é um problema real para as minhas keywords?

Faça o teste de recall. Pegue uma amostra aleatória de postagens de uma comunidade que discute seu assunto, julgue a relevância de cada uma na mão e divida o número que seus termos monitorados capturaram pelo número que realmente falava do assunto. Se essa razão estiver perto de 1, algospeak não é o seu gargalo. Se não estiver, agora você sabe o tamanho da lacuna em vez de chutar.

Por que keywords negativas ou detecção de quase duplicados não resolvem a lacuna do algospeak?

Keywords negativas removem falsos positivos das correspondências que você já tem, e a detecção de quase duplicados agrupa cópias de uma mesma história. Nenhuma das duas ferramentas adiciona um post que a sua string nunca capturou, e essa é exatamente a lacuna que o algospeak cria.

Por que uma lista de algospeak fica desatualizada tão rápido?

Um preprint de Fillies, Robertson e Hancock modela o algospeak como uma coevolução entre quem evita a moderação e quem a detecta, então o vocabulário muda em reação a ser detectado. O mesmo estudo aponta o limite desse movimento: uma substituição obscura o bastante para enganar todo detector deixa de ser compreensível para o público a que se destinava. Qualquer lista que você monte é um piso que se degrada e precisa de uma data de revisão.

Quais assuntos são mais afetados pela substituição do algospeak?

Steen, Yurechko e Klug ligam a prática a assuntos que os sistemas de moderação suprimem independente de o post violar uma regra, como automutilação, agressão sexual, sexualidade, trabalho sexual e doença. A substituição se concentra onde a pressão de moderação é mais forte, então threads de crise, queixas de saúde e posts sobre experiências adversas são os mais afetados, enquanto a conversa neutra sobre produtos continua usando palavras claras.

RedReplier
RedReplier

Começar

Reddit, X, Bluesky e HN

Alertas de intenção em tempo real

Respostas IA ilimitadas

Classificado por intenção de compra

Algospeak tem relação com as teorias de shadowban?

Os dois vêm do mesmo instinto: quem acredita que uma plataforma age contra si muda seu comportamento para contornar isso. O texto sobre o shadowban do Reddit documenta esse mesmo instinto nas teorias populares que as pessoas constroem em torno de uma suposta supressão. O algospeak aplica esse instinto às palavras em vez de à frequência de posts ou ao comportamento da conta.

Veja-nos mais no Google

Um clique marca a RedReplier como fonte preferida e nossos artigos passam a aparecer mais acima nas suas Principais notícias, no modo IA e nas visões gerais com IA.

Antes de você ir...

RedReplier

RedReplier

Alcance cada comprador que procura o que você vende

O RedReplier monitora Reddit, X, Bluesky e Hacker News em tempo real, classifica cada tópico por intenção de compra e redige a sua resposta, para que você chegue primeiro.

Reddit, X, Bluesky e HN

Alertas de intenção em tempo real

Respostas IA ilimitadas

Classificado por intenção de compra

Artigos relacionados