Como é calculado
Quatro passos do artigo até o número na página inicial.
Em resumo
O Sonar é um rastreador do tom das notícias: lê os feeds RSS de domínios, agências e blogs de projetos em cinco verticais (cripto, IA e tecnologia, finanças, política e esportes) e se atualiza ao longo do dia.
Uma história é um conjunto de artigos de domínios diferentes sobre a mesma notícia; o Sonar os une automaticamente e distribui as histórias por temas.
O índice de tom é um número de 0 a 100 para um período, normalmente as últimas 24 horas: 50 + 50 × (positivos − negativos) / (positivos + negativos), em que positivos e negativos são as participações de artigos que um modelo de linguagem avaliou assim; os artigos neutros não contam.
50 significa que há tantas publicações positivas quanto negativas, acima de 55 o tom pende para o positivo, abaixo de 45 para o negativo; o nível habitual é a média do índice diário dos últimos 30 dias completos.
O índice descreve como a imprensa escreve, não o que vai acontecer com os preços; não é recomendação de investimento.
Domínios
Feeds RSS de domínios, agências, redações e blogs de projetos em cinco verticais (cripto, IA e tecnologia, finanças, política e esportes), em sua maioria em inglês. Quantos domínios cada vertical lê hoje aparece na própria página dela. Os feeds são consultados a cada minuto, segundo um cronograma próprio; um feed que não responde por mais de um dia é desligado.
Guardamos o título, o link e a data. Não republicamos o texto do artigo: o link leva ao domínio.
Histórias
Uma história são artigos de domínios diferentes sobre a mesma notícia. Os artigos são agrupados automaticamente por conteúdo; um domínio que se repete não vira uma história.
As histórias são distribuídas por temas; o tamanho do quadro na página inicial é o número de histórias do tema.
O resumo curto “O que está acontecendo” na página de um tema é escrito por um modelo de linguagem apenas a partir das manchetes, do número de domínios e do tom das histórias mais destacadas do tema. Ele é verificado a cada duas horas e só é reescrito quando essas histórias mudam de forma perceptível; o modelo não acrescenta nada além das manchetes.
Tom
Um modelo de linguagem marca cada artigo em inglês como positivo, neutro ou negativo, conforme a forma como apresenta a notícia para o mercado.
O modelo não chuta: se a resposta não passa na verificação, o artigo fica sem marca e não influencia o tom até ser avaliado de novo.
Índice de humor
Um índice de tom líquido de 0 a 100 nas últimas 24 horas: 50 + 50 × (positivos − negativos) / (positivos + negativos). Os artigos neutros não contam, então 50 significa equilíbrio entre positivo e negativo, 100 todos os artigos avaliados com direção positivos, 0 todos negativos.
Zonas: 0–24 muito negativo, 25–44 negativo, 45–55 neutro, 56–75 positivo, 76–100 muito positivo. Ele é comparado com o nível habitual, a média do índice diário dos últimos 30 dias completos. É uma descrição de como se escreve, não um sinal para agir.
Ranking de domínios
Para cada domínio, pegamos os artigos dele dos últimos 30 dias na vertical, só os que o modelo atribuiu aos temas da vertical, e calculamos o mesmo índice de tom líquido: 50 + 50 × (positivos − negativos) / (positivos + negativos). Vários feeds do mesmo domínio (por exemplo rss.nytimes.com e nytimes.com) são somados.
Entra no ranking o domínio com pelo menos 50 artigos avaliados no período. Enquanto a coleta tem menos de 30 dias e há poucos domínios assim, o limite baixa, mas não abaixo de 20 artigos; o limite atual e o período real ficam sempre indicados abaixo da tabela.
O ranking descreve o tom dos artigos como o modelo o lê, não a qualidade, a confiabilidade nem o viés do domínio: quem escreve mais sobre altas e lançamentos recebe um índice mais alto, e quem escreve mais sobre hacks e processos, um mais baixo.
Mapa por países
Ao avaliar o tom, o modelo também nomeia os países de que trata o artigo: o protagonista da notícia ou o lugar do fato, até três por artigo, com códigos ISO 3166-1. Não se atribui país quando ele é só mencionado de passagem, quando a notícia trata do mercado em geral, da UE ou de uma região inteira e, no caso de cripto, quando a história não é sobre um regulador, uma lei, um tribunal ou uma empresa sujeita às regras desse país.
Para cada país calculamos o mesmo índice de tom líquido sobre os artigos da vertical que o modelo atribuiu aos temas dela. Um artigo sobre dois países conta para os dois. Os países com menos de 10 artigos no período ficam hachurados: uma única história pesa demais. Os países são identificados a partir do dia do lançamento do mapa; artigos mais antigos não foram reavaliados.
Territórios sem código ISO 3166 não são coloridos.
Suavização e correlação com o BTC
A chave “Suavizar” no gráfico mostra a média móvel de três pontos: três horas no gráfico diário e três dias nos mais longos. Cada ponto pesa quanto o número de artigos por trás dele, então uma hora fraca puxa menos os vizinhos; a linha não cruza lacunas. As mudanças bruscas são marcadas nos dados originais, sem suavização.
A correlação com o BTC, no plano Pro, é o coeficiente de Pearson entre o índice de tom e a variação do preço do BTC no período escolhido, com defasagem de até um dia para cada lado (para 90 dias, até uma semana, por dias). Mostramos a defasagem em que a coincidência é mais forte. Se há poucos pontos em comum, escrevemos “poucos dados”; se |r| é menor que 0,2 ou não passa do que o acaso dá numa amostra assim, “quase sem relação”. É uma descrição do passado, não uma previsão de preço.
Contato
Perguntas, erros nos dados e sugestões: hello@sonarmood.com, X