PulseExploreJournal ClubDebatesTrendingResearchersJournals
Instagram
HomeExploreJournal ClubTrending
Synapse
⌘+K
Synapse
February 24, 20260 citationsOpen Access

The Guillotine and the Poison: Two Modes of Reasoning Damage in Large Language Models (Variable V, Part 4)

View Full Paper
JGJuanjo Tugores GasparJGJuan José Tugores Gaspar

Key Points

  • The aim is to explore how censorship and user preference optimization affect reasoning in large language models.
  • Conducted 30 standardized evaluations across various reasoning domains.
  • Tested four large language models in both censored and uncensored settings.
  • Assessed performance on tasks like formal logic, counterfactual reasoning, and fallacy detection.
  • Models perform similarly on non-censored tasks (~29-30/30 correct).
  • Censored models completely fail when reasoning involves politically sensitive topics.
  • Introduced dual taxonomy distinguishing between guillotine damage (censorship) and poison damage (hidden reasoning impairment).

Abstract

**Abstract (English)** This preprint (Variable V, Part 4) continues the research into emergent sycophancy and the deterioration of reasoning in large language models. We conduct 30 standardized evaluations across formal logic, propositional logic, competition mathematics, counterfactual reasoning and fallacy detection. Four models (Kimi 2.5, ChatGPT 5.2, Gemini 3 Pro, and Copilot) are tested both under RLHF and censorship settings. We find:- all models perform equivalently on abstract reasoning tasks that do not traverse censored territory (~29–30/30), regardless of censorship;- when reasoning must cross politically sensitive domains, censored models fail completely, refusing to answer even non‑censored components, whereas uncensored models respond fully.These results align with an external post‑generation filter and not internal reasoning degradation. We introduce a dual taxonomy: **Guillotine damage** (censorship) is binary, visible and preserves the reasoning engine intact but makes it inaccessible in censored domains; **Poison damage** (Variable V) is continuous, invisible and deforms reasoning by optimizing for user preference satisfaction over factual accuracy. We argue that poison damage is more dangerous because it produces no signal of its presence. This preprint follows Parts 1‑3 of the Variable V series and tests the Butterfly Effect hypothesis of accumulated censorship restrictions. The main text is provided in English. A Spanish translation is included as an additional file. **Resumen (español)** En esta cuarta entrega del estudio de la Variable V se continúa la investigación sobre la sicofanía emergente y el deterioro del razonamiento en grandes modelos de lenguaje. Se llevan a cabo 30 pruebas estandarizadas en lógica formal, lógica proposicional, matemáticas de competición, razonamiento contrafactual y detección de falacias a cuatro modelos (Kimi 2.5, ChatGPT 5.2, Gemini 3 Pro y Copilot) en condiciones con y sin censura. Encontramos que:- todos los modelos rinden de manera equivalente en tareas de razonamiento abstracto que no atraviesan territorio censurado (~29–30/30), independientemente de su nivel de censura;- cuando se requiere razonar a través de dominios políticamente sensibles, los modelos censurados fallan totalmente, rechazando la respuesta completa, mientras que los modelos sin censura responden plenamente.Estos resultados son consistentes con un filtro externo posterior a la generación y no con una degradación interna del razonamiento. Proponemos una taxonomía dual: el **Daño Guillotina** (censura) es binario, visible y preserva el motor de razonamiento aunque lo hace inaccesible en ciertos dominios; el **Daño Veneno** (Variable V) es continuo, invisible y deforma el razonamiento optimizando la satisfacción del usuario en detrimento de la exactitud factual. Sostenemos que el daño veneno es más peligroso porque no produce señal de su presencia. Este preprint sigue las Partes 1‑3 del marco de Variable V y pone a prueba la hipótesis del Efecto Mariposa de restricciones de censura acumuladas. La versión principal está en inglés; esta traducción al español se incluye como archivo adicional.

Ask AI
Helpful
Bookmark
Share
View Full Paper

Cite This Study

Gaspar et al. (2026) studied this question.

synapsesocial.com/papers/699d3fe6de8e28729cf64d04https://doi.org/10.5281/zenodo.18735829
Ask AI
Helpful
Bookmark
Share
View Full Paper