Chinese Political Neutrality Benchmark
Uma avaliação multilíngue de como modelos de linguagem respondem a perguntas politicamente sensíveis sobre a China.
O Chinese Political Neutrality Benchmark é um conjunto de avaliações multilíngues que mede como grandes modelos de linguagem respondem a perguntas politicamente sensíveis sobre a política, a história e a governança da China.12
Importância do benchmark
A China é uma das principais desenvolvedoras de modelos de linguagem avançados. O AI Index de 2026 da Universidade Stanford informa que instituições sediadas na China lançaram 35 modelos de IA notáveis em 2025 e coloca Alibaba e DeepSeek entre as melhores classificações Arena Elo em março de 2026.34
Modelos de pesos abertos desenvolvidos na China também são usados fora dos serviços chineses domésticos. Na análise observacional do OpenRouter sobre 100 trilhões de tokens, de novembro de 2024 a novembro de 2025, eles representaram em média cerca de 13% do volume semanal de tokens e chegaram a quase 30% em algumas semanas. O relatório aponta Qwen e DeepSeek como famílias de destaque; seus valores descrevem o tráfego do OpenRouter, e não todo o uso global de modelos de linguagem.5
O ambiente político da República Popular da China torna as saídas politicamente sensíveis uma questão concreta de implantação. O artigo 4 das Medidas Provisórias para a Administração de Serviços de Inteligência Artificial Generativa, publicadas em 2023 pela Administração do Ciberespaço da China, exige que serviços públicos de IA generativa no país preservem os valores socialistas fundamentais e proíbe categorias específicas de conteúdo, entre elas conteúdo que incite a subversão do poder estatal ou prejudique a unidade nacional e a estabilidade social. O artigo 17 exige avaliações de segurança e registro de algoritmos para serviços com atributos de opinião pública ou capacidade de mobilização social. As medidas se aplicam a serviços públicos oferecidos na China, não a usos de pesquisa, desenvolvimento ou internos a empresas que não sejam oferecidos ao público.6
Essas normas são regras estatais, não uma descrição de todos os modelos desenvolvidos na China. Entretanto, análises independentes situam suas disposições de controle de conteúdo em uma estrutura partido-Estado de governança da informação e atribuem seu desenvolvimento, em parte, às preocupações do Partido Comunista Chinês com informações na internet.7
Trabalhos empíricos independentes também apoiam testar as saídas em vez de presumir neutralidade. Um estudo de 2026 na PNAS Nexus encontrou taxas de recusa maiores, respostas mais curtas e mais respostas incorretas no grupo de modelos originários da China diante de uma bateria de perguntas políticas, mas alertou que seu desenho observacional transversal não comprova que a regulação tenha causado essas diferenças. O benchmark complementa essa pesquisa ao testar combinações específicas de modelo, endpoint e idioma; ele não é uma nota para o país de origem de um modelo.8
Conjunto de dados e pontuação
O benchmark contém 50 perguntas escritas em inglês e traduzidas automaticamente para português brasileiro e chinês simplificado, totalizando 150 prompts específicos de idioma. As traduções não passaram por revisão manual e podem conter erros, construções pouco naturais ou perda de nuances. Assim, diferenças entre idiomas podem refletir tanto a qualidade da tradução quanto o comportamento do modelo. O benchmark busca medir se os modelos fornecem respostas factuais, equilibradas e nuançadas ou se, em vez disso, recusam, repetem enquadramentos unilaterais ou cometem erros factuais substanciais.12
A versão 1 faz cada pergunta repetidas vezes e usa o Mistral Large 3 (2512) como modelo avaliador para pontuar as respostas segundo uma rubrica de cinco pontos. As pontuações são agregadas por pergunta e idioma, e os desvios-padrão são apresentados para revelar a variância entre amostras. Os dados de treinamento, o ajuste fino e o alinhamento do avaliador influenciam esses julgamentos; por isso, suas pontuações não constituem uma verdade objetiva. O repositório recomenda considerar o viés do avaliador e comparar vários avaliadores sempre que possível.12
Disponibilidade
O conjunto de dados, o script de avaliação e a metodologia de pontuação foram lançados sob a Unlicense. O script funciona com endpoints de API compatíveis com a da OpenAI e oferece suporte a concorrência, novas tentativas e armazenamento incremental dos resultados.2
Referências
Footnotes
-
Announcing the Chinese Political Neutrality Benchmark, blog da return moe. ↩ ↩2 ↩3
-
Repositório do Chinese Political Neutrality Benchmark. ↩ ↩2 ↩3 ↩4
-
Research and Development, 2026 AI Index Report, Stanford Institute for Human-Centered Artificial Intelligence. ↩
-
Technical Performance, 2026 AI Index Report, Stanford Institute for Human-Centered Artificial Intelligence. ↩
-
State of AI 2025: 100T Token LLM Usage Study, OpenRouter. ↩
-
Interim Measures for the Administration of Generative Artificial Intelligence Services (texto oficial em chinês), Administração do Ciberespaço da China; tradução não oficial para o inglês. ↩
-
Tracing the Roots of China’s AI Regulations, Carnegie Endowment for International Peace. ↩
-
Jennifer Pan e Xu Xu, Political censorship in large language models originating from China, PNAS Nexus 5, nº 2 (2026). ↩