Pith. sign in

Paper Citation Record · LEDGER

Faithfulness to Refusal: A Causal Audit of Neuron Selectors

As of 18 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2607.05355.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.05355 v1

Coverage vector

measured 46 of 46 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-07T15:35:54.665268Z

measured 46 of 46 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

46 of 46 outbound references displayed

  • verified exact24
  • verified fuzzy13
  • unresolved1
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch7

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 6da2afa2-43fe-4226-9f50-e4733afb1946 · outbound

This paper cites Zico Kolter.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Zico Kolter

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T15:43:54.523648Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:4229eb7f2fd6310143da710068a7d3e567e6dbe2398cbf4da601d612b0439125

Observation 96b2f5ee-1cc4-496b-9590-d3da487be404 · outbound

This paper cites SparseGPT: Massive language models can be accurately pruned in one-shot.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors SparseGPT: Massive language models can be accurately pruned in one-shot

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T15:43:54.511755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:c0667a55b97fb105b091307ed5fabc6d356e1383e27aa90872de2ec381db08fb

Observation c59dc703-3380-4a39-b67f-736cb7b89049 · outbound

This paper cites Fluctuation-based Adaptive Structured Pruning for Large Language Models.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Fluctuation-based Adaptive Structured Pruning for Large Language Models

Reference 3

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.909966Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:436256d6bc25ea3e4e61de4ea3b663146e1aa2667c7e06aeb97e290b7d03bfbe

Observation 61efe5fe-b503-46c5-86e7-931ba7cd655c · outbound

This paper cites Attribution-Guided Pruning for Insight and Control: Circuit Discovery and Targeted Correction in Small-scale LLMs.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Attribution-Guided Pruning for Insight and Control: Circuit Discovery and Targeted Correction in Small-scale LLMs

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.892299Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:2019daf366830e7ad656b6e7f26e3417fb0ff0a7b6d826d2b938deafbcc3041b

Observation cceb53c6-24db-4d50-8293-a311b95066fb · outbound

This paper cites Programming Refusal with Conditional Activation Steering.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Programming Refusal with Conditional Activation Steering

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.898632Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:5e522b9a623d393cd42bf1c5965444228ebec3f8f36ac6b56fd097c2a328cafd

Observation eb3e62a8-acfe-453a-bd60-ccc12a0dbe54 · outbound

This paper cites Representation Engineering: A Top-Down Approach to AI Transparency.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Representation Engineering: A Top-Down Approach to AI Transparency

Reference 6

Resolution
metadata mismatch
local_arxiv, observed 2026-07-07T15:43:53.863779Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:09377cc32f9012b51dba6b09baa0b0f26967f03211ad8e40953baf86d8b81851

Observation 042b6874-1bc8-46ec-be70-e75fe7e2427a · outbound

This paper cites SORRY-Bench: Systematically evaluating large language model safety refusal.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors SORRY-Bench: Systematically evaluating large language model safety refusal

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T15:43:54.505898Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:53e89009de7d581973c5a84dccb23b7d7caac488938d59db0f7eea89495b2dc9

Observation b951f89c-121b-4456-b48b-850bf11e9d12 · outbound

This paper cites OR-Bench: An Over-Refusal Benchmark for Large Language Models.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.889765Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:3218f487f4a2a1cbdc3b88e631a5d3acb9dd3932f3c7591ee732455a6202cc2e

Observation f5973cc0-8987-4a04-9cc3-1ac5b384756b · outbound

This paper cites Measuring massive multitask language understanding.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Measuring massive multitask language understanding

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T15:43:54.517725Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:b23fb3b48c940bf429e6e26cd7f86b08d5fbf8e2584ba63e769704ac07fa7724

Observation c01ff444-064f-4729-a8f9-0232d40c5066 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Training Verifiers to Solve Math Word Problems

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.902126Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:e2a8879eec419b62655267d6e74406c207f107c4d80d6359356227d77e4d5631

Observation 1c19e9bc-99ea-4050-a1fd-9fd11c993bf8 · outbound

This paper cites Instruction-Following Evaluation for Large Language Models.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Instruction-Following Evaluation for Large Language Models

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.893629Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:f2d9755cd3d23b906fc1cfc4399f72efd81768e70c9330cfc5a693bc7434ef3b

Observation 67104967-58fd-405d-86b1-d0c621d121ae · outbound

This paper cites LLM-Pruner: On the structural pruning of large language models.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors LLM-Pruner: On the structural pruning of large language models

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T15:43:54.521827Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:9600871a2d4c0d79712fa8e75a2058500820c17602dc6ac041ab2a419a1aea83

Observation c5aedfff-eb26-4c7e-aadc-5b0068e53646 · outbound

This paper cites Pruning By Explaining Revisited: Optimizing Attribution Methods to Prune CNNs and Transformers.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Pruning By Explaining Revisited: Optimizing Attribution Methods to Prune CNNs and Transformers

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.906269Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:05d03a36bceda3e8fdcc55e9a8d1c9bb98a72e6d5d70c18530d2041f203daad0

Observation 560ee7f5-ea5d-42fe-a69b-cbe4beeff20e · outbound

This paper cites DLBacktrace: A Model Agnostic Explainability for any Deep Learning Models.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors DLBacktrace: A Model Agnostic Explainability for any Deep Learning Models

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.913859Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:8b9a2a200d2572f606313bffb74f98acfbaee712a0dd9fa90600a49770261cbd

Observation 0d0a2c7e-3ea0-4034-a08a-c1194f6de98d · outbound

This paper cites Interpretability in the wild: a circuit for indirect object identification in GPT-2 small.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Interpretability in the wild: a circuit for indirect object identification in GPT-2 small

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T15:43:54.513749Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:47678b0d1cbfb53ed2cd81fc7866da87dde6344cc5ec415d59d14712a18e0e0c

Observation 168627d5-b23e-4591-ad73-05745b4a230b · outbound

This paper cites Attribution Patching Outperforms Automated Circuit Discovery.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Attribution Patching Outperforms Automated Circuit Discovery

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.897504Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:64094cb3cdbd15827b91ec6c29015e17863d2b42067e162e1101d879d335b10d

Observation 9b7182de-857b-4a36-8972-dfe80719b0d5 · outbound

This paper cites Interpretability as alignment: Making internal understanding a design principle.CoRR, abs/2509.08592, 2025.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Interpretability as alignment: Making internal understanding a design principle.CoRR, abs/2509.08592, 2025

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-07-07T15:43:53.908829Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:05cf771708240134c33900974c431b95c87dfe01ad538d9dd6ea1809515107a1

Observation 4fab04d4-4f09-4589-b445-453868341d01 · outbound

This paper cites IEEE Transactions 16 G.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors IEEE Transactions 16 G

Reference 18

Resolution
metadata mismatch
arxiv_id, observed 2026-07-07T15:43:53.657088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:54c9dc3bd413c25a1c7b363bce6ab900c58f818c779edb7fcec2dd75c7f1db84

Observation 2f97c03a-780e-415f-ba2c-02e785d79504 · outbound

This paper cites A benchmark for interpretability methods in deep neural networks.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors A benchmark for interpretability methods in deep neural networks

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T15:43:54.525641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:9afde1d354b9784d18b46b81cd26162da0aec340da06d15cde5655f5da0eb3c8

Observation 1e0aa72c-8beb-4696-9848-6bba359839dd · outbound

This paper cites xai_evals : A Framework for Evaluating Post-Hoc Local Explanation Methods.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors xai_evals : A Framework for Evaluating Post-Hoc Local Explanation Methods

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.881038Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:9cba3eafa209a4420f45cd371bb2b3197d16590cf8063f9539d4fb6174c5342c

Observation 909852c1-1854-4375-844c-01b0c4987eb5 · outbound

This paper cites Bridging the gap in XAI: Why reliable metrics matter for explainability and compliance.CoRR, abs/2502.04695, 2025.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Bridging the gap in XAI: Why reliable metrics matter for explainability and compliance.CoRR, abs/2502.04695, 2025

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-07-07T15:43:53.904793Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:16886ed0fec83fade31a1de1953530302e1fba4b90bcc11a069edf225e10979a

Observation 377daa2a-4720-4253-986a-c95f635f2e7d · outbound

This paper cites Bach , author A.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Bach , author A

Reference 22

Resolution
metadata mismatch
doi, observed 2026-07-07T15:43:53.659741Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:3e52979e5d8a24b7ec92c0209a7f14de0d1aff2820f3922b059b029f89f6c2c3

Observation 275eac8e-51de-4767-aa0a-21dc1e3dc36a · outbound

This paper cites Layer-Wise Relevance Propagation: An Overview.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Layer-Wise Relevance Propagation: An Overview

Reference 23

Resolution
verified exact
doi, observed 2026-07-07T15:43:53.654205Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:414f0dca9b352fe6814b092704dad449146bd9d875e8a876cd87eaa473fc1d3b

Observation 09a6ea7a-cc09-45da-9891-151908096d0d · outbound

This paper cites AttnLRP: Attention-aware layer-wise relevance propagation for transformers.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors AttnLRP: Attention-aware layer-wise relevance propagation for transformers

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T15:43:54.509824Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:792e01c8c8623a424a42e347db809da3fb8d34ecea4eed3de833064aea6e2f32

Observation 31f6a5a9-2383-4404-97e1-fdf03e1ac641 · outbound

This paper cites Axiomatic attribution for deep networks.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Axiomatic attribution for deep networks

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T15:43:54.515922Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:d010c8b5b5f247f45a0874d99d1fce88da28ddcc1889a764e1f81e26b3d32cf5

Observation d6f85321-98e1-4a2f-80fe-16ad3cf1096d · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 26

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.887029Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:afbdb2c836ab517410c9f117b4414f848b38b1b133101083be25978cb2a974aa

Observation b4a8d865-44e5-48f6-8994-bd9970a4dc5d · outbound

This paper cites Manning, and Chelsea Finn.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Manning, and Chelsea Finn

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T15:43:54.527552Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:92f7c539a0afa0584c7b35757bdc512eeaac867fb7af7f2c2906477b5ba76a60

Observation 95d722af-9c35-4fe7-a40b-601d16ee0abf · outbound

This paper cites Steering Llama 2 via contrastive activation addition.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Steering Llama 2 via contrastive activation addition

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T15:43:54.519935Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:479ae083c55126c2a353488955818b54c86d3d4a78409516ed8aaf39a3a39b02

Observation 12e66ce9-d268-42ff-b20e-82fd02b95cf3 · outbound

This paper cites Refusal in Language Models Is Mediated by a Single Direction.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Refusal in Language Models Is Mediated by a Single Direction

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.873280Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:8edb034f73f399bc5f09ec4824d97dc8da721c6ff938805fa1f5f8f6a16f9bb9

Observation 4669ea2f-2c5e-4dd1-a35e-4804a3b3a840 · outbound

This paper cites Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.891301Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:dbc91d115eaee45a1601240ff2b1fc8512f049ddf581bb88ec0af3edba6b4ecb

Observation 8d959f8d-bf88-4b6d-9326-b1334924beb8 · outbound

This paper cites $C$-$\Delta\Theta$: Circuit-Restricted Weight Arithmetic for Selective Refusal.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors $C$-$\Delta\Theta$: Circuit-Restricted Weight Arithmetic for Selective Refusal

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-07-09T02:20:28.526184Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:0fc35937afc1411e42d9e330d9dd5b1d7bb54f38160d0ec1f56da20d2d4964db

Observation 0c0e0164-f2e2-4e39-879a-bdc047d27aa2 · outbound

This paper cites Finding safety neurons in large language models.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Finding safety neurons in large language models

Reference 32

Resolution
metadata mismatch
arxiv_id, observed 2026-07-07T15:43:53.896225Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:02735a04ee090ae3b15689111ff951dc09d12d8db847f0720460e3d00f4a2f6e

Observation af26780e-7f3d-4c21-b934-219782f46033 · outbound

This paper cites Understanding Refusal in Language Models with Sparse Autoencoders.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Understanding Refusal in Language Models with Sparse Autoencoders

Reference 33

Resolution
metadata mismatch
local_arxiv, observed 2026-07-07T15:43:53.886128Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:605ce85ab43579f37b36512f05ad0f94f8c6f68782dce43ac6c36ff6a8e203d0

Observation 7155bf8e-c5fb-40c5-a3a9-e2064a99674f · outbound

This paper cites Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal

Reference 34

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.907407Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:83ea1d6ebb02a1aa3ee9b82c17136ab834aa2765abb7a50854ac3ccc8c35d801

Observation 5e2630c0-1c0c-4584-8a62-33115ae6942c · outbound

This paper cites Zhihao Xu, Ruixuan Huang, Changyu Chen, and Xiting Wang.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Zhihao Xu, Ruixuan Huang, Changyu Chen, and Xiting Wang

Reference 35

Resolution
verified exact
arxiv_id, observed 2026-07-07T15:43:53.911441Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:b387325edc2a261e7fb34618366e93cb2db5914498ec88ea1e52d56c118b93b4

Observation 8f288f12-4014-4539-8a0c-e2819db0c2b6 · outbound

This paper cites A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models

Reference 36

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.918407Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:9ee445240adfc365b01801e85c4d01ebef1f157c950bef023ac38a7c29535486

Observation 0167a8d0-3a29-412a-b279-98d46a0f3d6e · outbound

This paper cites Pointer Sentinel Mixture Models.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Pointer Sentinel Mixture Models

Reference 37

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.899874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:928b4615a0ce39a8e6ab06685fe7e774e5d2846c2093501f78279c18b25329b4

Observation fe5f2f3c-af15-4556-bf71-c70c14257acc · outbound

This paper cites Lessons from the trenches on reproducible evaluation of language models.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Lessons from the trenches on reproducible evaluation of language models

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T15:43:54.507768Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:b1edc8995cb86c03dda6494231fe73b0c83f55c13d822584d0d07fd66e2f25ca

Observation 335cc6a6-11c6-475b-8337-636697b944c3 · outbound

This paper cites Evaluating the Faithfulness of Importance Measures in NLP by Recursively Masking Allegedly Important Tokens and Retraining.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Evaluating the Faithfulness of Importance Measures in NLP by Recursively Masking Allegedly Important Tokens and Retraining

Reference 39

Resolution
metadata mismatch
local_arxiv, observed 2026-07-07T15:43:53.912436Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:b2f1939ba347c697ca42f9e43e358e68e39337e32a7adfeec41ae79aef5adda9

Observation 52ea2846-02d6-4141-8ca5-5954331ed0c0 · outbound

This paper cites The Llama 3 Herd of Models.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors The Llama 3 Herd of Models

Reference 40

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.919409Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:cc339f18d2fcbb1f4b9c420d3d5ecbc72bb8bee9e934e0f1aa944e05a128282d

Observation dd27a205-57d0-4578-9118-83502fec918d · outbound

This paper cites Qwen3 Technical Report.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Qwen3 Technical Report

Reference 41

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.917179Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:829365cffb637560281545a889d79ceb2c9da6995641d7ebe88a5376d35f8101

Observation fd5e2386-f927-481e-b458-49da5e14aed1 · outbound

This paper cites Gemma 3 Technical Report.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Gemma 3 Technical Report

Reference 42

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.914693Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:a78b9c9223e980750a0597ff4dd1989cef5874615dadac77d0e77a5da28dcce9

Observation 67e42700-741e-49a8-b7f8-6e491a9ef6ae · outbound

This paper cites an unresolved cited work.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Unresolved cited work

Reference 43

Resolution
unresolved
raw_fallback, observed 2026-07-07T15:43:54.529501Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:f12c42f31cbc13d5800098c88d5f2d075ac5974c730c498d5e108c8df8a42ce9

Observation c3479814-c8db-469e-94dc-bd9121350fa7 · outbound

This paper cites ProtectAI/distilroberta-base-rejection-v1: Refusal classifier.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors ProtectAI/distilroberta-base-rejection-v1: Refusal classifier

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-07-07T15:43:54.504016Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:9147386807651f377f4f1e55669c91a32bfa0bc2cdeb4bd9354524346f7e95a7

Observation 76ed441b-e597-4e4c-b7ff-e3ff1b875036 · outbound

This paper cites Safer or Luckier? LLMs as Safety Evaluators Are Not Robust to Artifacts.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors Safer or Luckier? LLMs as Safety Evaluators Are Not Robust to Artifacts

Reference 45

Resolution
metadata mismatch
local_arxiv, observed 2026-07-07T15:43:53.916252Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:0d8e9546b5fc72f4968c7be19d8896416545a746054fc7ffe3098f76efc93305

Observation 0373deb5-300e-428b-81ac-d8b607884a4d · outbound

This paper cites A coin flip for safety: Llm judges fail to reliably measure adversarial robustness.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors A coin flip for safety: Llm judges fail to reliably measure adversarial robustness

Reference 46

Resolution
malformed identifier
arxiv_id, observed 2026-07-07T15:43:53.903785Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:59323a821762e5ec0e6492f7200bc769be5371c96809ab0eaa0064e196b9914e

Pith citing papers

No inbound Pith citation observations are available.