{"as_of":"2026-08-08T11:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d75cc67b1a3c28b05c44c3e94f6a2641a9fb8e1ab892108a5b96b2fff5e3f283","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:54:30.464863Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.24808/citation-record","integrity":"/paper/2509.24808/integrity","json":"/paper/2509.24808/citation-record.json","paper":"/paper/2509.24808"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:17.721691Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:17.721691Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:fc70c80bba7dd0a8d4f7c1bd44a5113b3ee5ba08e2917b5f9a10fceb17d7150a","observation_id":"f4d4d839-6272-4587-a212-76821e6a22eb","resolution":{"observed_at":"2026-08-04T13:54:17.721691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:17.902861Z","title":"Explainability for artificial intelligence in healthcare: a multidisciplinary perspective","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:17.902861Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:0a7dda446d22975e143bd7249057050a3260ffae8c228a1cd1026e6174845386","observation_id":"79a915e4-0095-4b8b-80f3-7b45132bf767","resolution":{"observed_at":"2026-08-04T13:54:17.902861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:18.446117Z","title":"Circuit tracing: Revealing computational graphs in language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:18.446117Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:adc5053537e3b68ffde14ea96625506bd6b7767a0a6fae23354fed71a6242898","observation_id":"6e7e68a2-11f7-4059-8117-4234e91c3f35","resolution":{"observed_at":"2026-08-04T13:54:18.446117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:18.668126Z","title":"Claude 3.5 sonnet","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:18.668126Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:64e8cc6041861fc6ad8c8e2c7a2c3d310467a1dd6098873a7cd3725f5a4e292e","observation_id":"f352892a-fd39-498a-8b45-e364f14f061b","resolution":{"observed_at":"2026-08-04T13:54:18.668126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:18.811332Z","title":"Mechanistic interpretability for AI safety - a review","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:18.811332Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:7ed528ff5b9f4fdb2235af1ecefe9b2cfdf7adde629af4f5bf75d20735e01d52","observation_id":"04c45940-a176-44d6-a3ab-989bc0cb15c7","resolution":{"observed_at":"2026-08-04T13:54:18.811332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:18.931226Z","title":"Building and evaluating alignment auditing agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:18.931226Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:c290f1ffb6b6bd265ff376f0be8ee96289e3d7ff6547cb6b7dafbdedacb32552","observation_id":"2382c8b9-f57a-405b-92e7-d25e4f6755ae","resolution":{"observed_at":"2026-08-04T13:54:18.931226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:19.068797Z","title":"How people use chatgpt","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:19.068797Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:ac07751a7ac05e91976a5fd7bd63f9c5e1716b39ae60c178b1de9e966f0b4767","observation_id":"ae9dfe80-c2ae-42a9-97ae-962424258fcb","resolution":{"observed_at":"2026-08-04T13:54:19.068797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:19.205565Z","title":"Selfie: self-interpretation of large language model embeddings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:19.205565Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:3d35b8992dbd390e83332c55c96c594a4c20858a5ccbc75ffa9d1c19bd988ed5","observation_id":"e1d850d3-47ad-48f4-b2c6-5d2b92a2824b","resolution":{"observed_at":"2026-08-04T13:54:19.205565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-04T13:54:19.444737Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:19.444737Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:7a3a727012adfeb673c078923d8729f32e4262c84c054b4c9443a78d72b439ff","observation_id":"e2d5e69d-65a0-4a74-ad3f-9a993e98964f","resolution":{"observed_at":"2026-08-04T13:54:19.444737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:19.552979Z","title":"Towards automated circuit discovery for mechanistic interpretability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:19.552979Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:44464ef4cbc656bc50187c5d5d7956aebee3fdba83c10cc7cd44850eae180620","observation_id":"a962c681-15dc-442b-9f2b-b58e0fa4f7cb","resolution":{"observed_at":"2026-08-04T13:54:19.552979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:19.615533Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:19.615533Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:8adf30f9b5c065602d939c43b82a6c4500568d09dc012de50e5d2a7fe0b13bcf","observation_id":"734ddd38-48ec-4d8e-b833-4b99e23159e1","resolution":{"observed_at":"2026-08-04T13:54:19.615533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:19.692097Z","title":"A mathematical framework for transformer circuits","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:19.692097Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:8eab0696c5ca486130d58ea65da78c7e1d73da96a6b4864430975624ce72adf3","observation_id":"212102ca-af1e-487d-8a3c-9e10e97a3216","resolution":{"observed_at":"2026-08-04T13:54:19.692097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:19.797259Z","title":"N2g: A SCALABLE APPROACH FOR QUANTIFYING INTERPRETABLE NEURON REPRESENTATION IN LLMS","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:19.797259Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:49888f9790dd5ff7afbb11b9291f233531151ac2bb60f16ed9e58e39ee753fb4","observation_id":"e0f01576-1489-4645-ba66-5a063e51d9fe","resolution":{"observed_at":"2026-08-04T13:54:19.797259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:19.879660Z","title":"The lottery ticket hypothesis: Finding sparse, trainable neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:19.879660Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:05dd546a888976cb3d8bd0b4b063736747dec5a7613dc5d1e3675c91d3469967","observation_id":"5109528e-e556-4cfc-bb5b-a1e8bea33e74","resolution":{"observed_at":"2026-08-04T13:54:19.879660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:20.259029Z","title":"Patchscopes: A unifying framework for inspecting hidden representations of language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:20.259029Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:883846ec887434d6d8befa70b8a518e7adcff1c3493ec9f1c3e1d19930d89144","observation_id":"029231fb-37f2-493e-a778-02f823316d25","resolution":{"observed_at":"2026-08-04T13:54:20.259029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:20.454746Z","title":"How does GPT -2 compute greater-than?: Interpreting mathematical abilities in a pre-trained language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:20.454746Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:a6beb939c05e7edfa7dfe84ad550c9723d09f639ba8ef64727fdce1ab128ceaa","observation_id":"70707aba-a473-4ea2-bb89-dda20dc8e339","resolution":{"observed_at":"2026-08-04T13:54:20.454746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:20.713859Z","title":"Have faith in faithfulness: Going beyond circuit overlap when finding model mechanisms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:20.713859Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:98f90e52d2569f4e5ac0b209f9532190799bc49a08a93c0147281143b2742e50","observation_id":"cbb6ef4b-b766-4792-9a15-0ec4c2aeea68","resolution":{"observed_at":"2026-08-04T13:54:20.713859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:21.214962Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:21.214962Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:38c245a418d9d1a96d8092cd26cf65ccd9ffc1970303aecd312641415d8e7935","observation_id":"b8c3d170-45c6-4798-9b63-d4cd2f086b7d","resolution":{"observed_at":"2026-08-04T13:54:21.214962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:21.714748Z","title":"Sparse autoencoders find highly interpretable features in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:21.714748Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:c86f4040835f71a8eb08b51adcf29a05440ca13243b54ed49b121a88c97e4399","observation_id":"1133d2ac-0a7b-469a-8e54-6dd4cfaa6a72","resolution":{"observed_at":"2026-08-04T13:54:21.714748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T13:54:21.914743Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:21.914743Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:806d23e3faf40b7012921e686519cd232bd4eef3f7c39b40c946c94f513aa7d1","observation_id":"eb71268b-6f96-4dc3-8987-cd13e78e5771","resolution":{"observed_at":"2026-08-04T13:54:21.914743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:22.229386Z","title":"Guided integrated gradients: An adaptive path method for removing noise","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:22.229386Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:774e796fcb42cd178d7761d728d7657817297e0aeb45cf8a8d2ff7e9193bf777","observation_id":"3e21beb9-6e37-49e0-82e8-4cc58c786beb","resolution":{"observed_at":"2026-08-04T13:54:22.229386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:22.819735Z","title":"Scaling sparse feature circuit finding for in-context learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:22.819735Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:cecac031a7cb7eef887039fc485d00ddb4c9c20e2a45ed642b68ccdaf750e637","observation_id":"05566e26-9d60-4170-9610-d5891fc0f97b","resolution":{"observed_at":"2026-08-04T13:54:22.819735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:23.274745Z","title":"Why are saliency maps noisy? cause of and solution to noisy saliency maps","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:23.274745Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:ea94bbf756a8a36507b85ff87bec03315308ba940d04c6059f58d74c094d8321","observation_id":"e3f2e374-e8f8-442d-bb18-1a9c22984bce","resolution":{"observed_at":"2026-08-04T13:54:23.274745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:23.444738Z","title":"Granular concept circuits: Toward a fine-grained circuit discovery for concept representations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:23.444738Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:930fbd6d05c8b22ec97ee8564a9d2cff32c03f0b139b16a0ee32ae64d1626abe","observation_id":"3f73ce20-d180-4d8b-8191-84152e1ff8af","resolution":{"observed_at":"2026-08-04T13:54:23.444738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:23.630175Z","title":"Towards interpretable sequence continuation: Analyzing shared circuits in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:23.630175Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:b71ca636db25839ccf27ac1a37f1a11e68c2b93cc7909acfc0686631b1295dc5","observation_id":"97483b6c-6363-4de4-b00d-cc98d40802e6","resolution":{"observed_at":"2026-08-04T13:54:23.630175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:23.834745Z","title":"Reddi, Ke Ye, Felix Chern, Felix Yu, Ruiqi Guo, and Sanjiv Kumar","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:23.834745Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:8fbd04a5e96daddabe1a52cdf075068c466dc2dd6ec451a38d541b0d1d8734c3","observation_id":"81a801a7-2116-4e0d-b55a-c55772cad573","resolution":{"observed_at":"2026-08-04T13:54:23.834745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:24.304745Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:24.304745Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:56c7a15f62a5be634630252d9a61d05fd5c5de2859e006ff5c41108166ee17b9","observation_id":"e3f8437e-b39d-4465-b3c2-b446672c0bad","resolution":{"observed_at":"2026-08-04T13:54:24.304745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:24.694742Z","title":"Sparse crosscoders for cross-layer features and model diffing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:24.694742Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:9b91ed58dd6314f1915e7f5b952e302c60358292776043b511632f0ff969fe64","observation_id":"30ed61c6-7e98-4eff-9fe6-9eb58c54c8fc","resolution":{"observed_at":"2026-08-04T13:54:24.694742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:24.892022Z","title":"Lundberg and Su-In Lee","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:24.892022Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:d0fb67cbb14e320704bc139adbfcec92b6e68428ca042e18f0fec7c5a43ef5ad","observation_id":"c416d55d-9250-4fbd-8b81-3e9fd141cdcc","resolution":{"observed_at":"2026-08-04T13:54:24.892022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01220","last_updated":"2024-11-06T08:42:09Z","snapshot_observed_at":"2026-08-03T05:23:11.628181Z","submitted_at":"2024-11-02T11:42:23Z","title":"Enhancing Neural Network Interpretability with Feature-Aligned Sparse Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01220","snapshot_observed_at":"2026-08-04T13:54:25.164744Z","title":"Enhancing neural network interpretability with feature-aligned sparse autoencoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:25.164744Z"},"links":{"cited_paper":"/paper/2411.01220","citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:c67c2a7b96592f2bb0029f012ac7e683abf1054be9a328a2f4007fc8f72fb318","observation_id":"588a5a40-fcbb-44db-97e7-6ee30c0ec064","resolution":{"observed_at":"2026-08-04T13:54:25.164744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:25.524740Z","title":"Sparse feature circuits: Discovering and editing interpretable causal graphs in language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:25.524740Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:cd156006367a540320fe0aaf0aefc3da0023bc066160c6d1ffccee6c7f039f15","observation_id":"2de75ddd-d452-4f1a-9219-90f138154d0d","resolution":{"observed_at":"2026-08-04T13:54:25.524740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:25.718628Z","title":"Transformer circuit evaluation metrics are not robust","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:25.718628Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:e831f9a27644685cf56d74139c411e611d5c9bb11c40b05fee371e1748622efa","observation_id":"9d10b0ac-e141-4765-918a-d5130f039198","resolution":{"observed_at":"2026-08-04T13:54:25.718628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:25.834746Z","title":"MIB : A mechanistic interpretability benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:25.834746Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:46f1c34608c1fad1acfd6e3a90af13b1803ab3d6c2d7900b9f1cfbcb58ded4c2","observation_id":"933f0a15-6036-4547-9c0a-8ed70f903cfa","resolution":{"observed_at":"2026-08-04T13:54:25.834746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:25.939819Z","title":"Transformerlens","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:25.939819Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:a41c2dfd522e76c24ce08ac96bd2b93f8514af7fff1d27c57a9725677f8facd2","observation_id":"5350bdad-f499-48bf-8345-ef6805f21605","resolution":{"observed_at":"2026-08-04T13:54:25.939819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:26.084741Z","title":"A toy model of mechanistic (un)faithfulness","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:26.084741Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:0ec1015e8741a23319485503598055c7f5b2c51f4f792260ff94c008e3b8f79a","observation_id":"45efce2f-4452-4411-990c-9b7f6648d357","resolution":{"observed_at":"2026-08-04T13:54:26.084741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:26.294736Z","title":"Explanations in autonomous driving: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:26.294736Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:4538c4d8f3802a90b71fc7ac0b3d40532d3e40cc0c693e935a4ee05958eb08cb","observation_id":"17e702b3-8f86-40ab-82c1-01b8ed397f78","resolution":{"observed_at":"2026-08-04T13:54:26.294736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:26.465383Z","title":"Understanding addition in transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:26.465383Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:e54fc03f8a9a9bbdbebc25f1219265b596b19c1877fd68923cc291f441caa87d","observation_id":"487767cb-4588-47d7-a3a5-96094e7962f3","resolution":{"observed_at":"2026-08-04T13:54:26.465383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:26.818340Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:26.818340Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:360bd68c4d996ad5351d7a5cbaeb9be1b2e8bf8b64b37a954e43b6f65413ac22","observation_id":"1720b02c-9d6b-4550-955b-20e497f08752","resolution":{"observed_at":"2026-08-04T13:54:26.818340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:27.000653Z","title":"A multimodal automated interpretability agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:27.000653Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:2018b26aa18a7c5688bba21c4e0aa665561810866611ac27a2751b4bb7e5afba","observation_id":"4d620e14-f234-490e-9d2d-e7cb44c9be74","resolution":{"observed_at":"2026-08-04T13:54:27.000653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:27.154822Z","title":"A value for n-person games","venue":null,"work_id":null,"year":1953},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:27.154822Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:1bf1832980ca756bc2370baec12b90e10774987dc2cfac38344986123f50c405","observation_id":"5c86b015-dbff-4b1c-8127-6e11c328f34f","resolution":{"observed_at":"2026-08-04T13:54:27.154822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03825","last_updated":"2017-06-12T19:53:30Z","snapshot_observed_at":"2026-07-06T05:46:32.599765Z","submitted_at":"2017-06-12T19:53:30Z","title":"SmoothGrad: removing noise by adding noise","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03825","snapshot_observed_at":"2026-08-04T13:54:27.304731Z","title":"Smoothgrad: removing noise by adding noise","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:27.304731Z"},"links":{"cited_paper":"/paper/1706.03825","citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:c9a5c138640122fd86cd9f403409314e9ae81e8a8729e45520ef141255cce3c5","observation_id":"54031f87-3184-4e11-8f72-2eb92d2e75e3","resolution":{"observed_at":"2026-08-04T13:54:27.304731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:27.834819Z","title":"Axiomatic attribution for deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:27.834819Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:5daa19fa3c446a0a2d177ea4983d198d939a4f167a19df8aba67a1ac8c06c4e2","observation_id":"4693b4e5-cf4e-4eda-acce-e135201a7363","resolution":{"observed_at":"2026-08-04T13:54:27.834819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:28.144739Z","title":"Attribution patching outperforms automated circuit discovery","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:28.144739Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:5537d54b6ac293bf5ccc1829c1fdd27359a7e939ed68d083233561adf3534521","observation_id":"3ba73055-919d-461a-9921-e115c2357340","resolution":{"observed_at":"2026-08-04T13:54:28.144739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:28.454741Z","title":"Universal properties of activation sparsity in modern large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:28.454741Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:d6f5ba17260c5c28627ca76c48c744acb3aec21ccd4b2243ccbaf1e08cc61dae","observation_id":"6cd0ff9c-bed0-48e6-af08-769458b88b8b","resolution":{"observed_at":"2026-08-04T13:54:28.454741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:28.624743Z","title":"Daniel Freeman, Theodore R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:28.624743Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:69bf5e081656e00a7a5113173b5446b117d2080d4c10a35ed180b7dc651cc10b","observation_id":"627eb20d-080c-45ad-90de-ab701a6c96e4","resolution":{"observed_at":"2026-08-04T13:54:28.624743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:28.735017Z","title":"Investigating gender bias in language models using causal mediation analysis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:28.735017Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:06f0ec7236f2bbd16c7af3fb3a7fd6c7ee7e0a130f4299fc8205e07962ca4753","observation_id":"615a725f-6b9d-40c1-9a6c-28caabc9835a","resolution":{"observed_at":"2026-08-04T13:54:28.735017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:28.954740Z","title":"Interpretability in the wild: a circuit for indirect object identification in GPT -2 small","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:28.954740Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:beef585bd93945aa2ec6169e61c79e215eb278bcdd92805a9d5a18960f0123d1","observation_id":"c4e1f734-d0bb-4a0d-a48f-b5ccf8da2a98","resolution":{"observed_at":"2026-08-04T13:54:28.954740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:29.116406Z","title":"Do LLM s overcome shortcut learning? an evaluation of shortcut challenges in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:29.116406Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:63414517a69318c593d2b217964644235ff589cbaed1b8afe0651b2eeeef2ab1","observation_id":"d43e82cf-b025-441d-bf40-f6904e5edaef","resolution":{"observed_at":"2026-08-04T13:54:29.116406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:29.284826Z","title":"Towards best practices of activation patching in language models: Metrics and methods","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:29.284826Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:4cb861ef3f2d15f673fe6dab5e6956dd383e5f874257b566c6d99969bdf14616","observation_id":"83748693-4fae-4d0e-ba4e-3534a98052bf","resolution":{"observed_at":"2026-08-04T13:54:29.284826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06852","last_updated":"2025-02-07T16:04:57Z","snapshot_observed_at":"2026-08-07T16:48:00.258355Z","submitted_at":"2025-02-07T16:04:57Z","title":"EAP-GP: Mitigating Saturation Effect in Gradient-based Automated Circuit Identification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06852","snapshot_observed_at":"2026-08-04T13:54:29.774749Z","title":"Eap-gp: Mitigating saturation effect in gradient-based automated circuit identification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:29.774749Z"},"links":{"cited_paper":"/paper/2502.06852","citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:6b34174994916b2ba273194939a449d259f6e81936355096eb652f88c4cbc94b","observation_id":"f3c46278-2027-4a37-9d16-ccf65a3ffe56","resolution":{"observed_at":"2026-08-04T13:54:29.774749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:29.907920Z","title":"Large language models are not robust multiple choice selectors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:29.907920Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:2bcb9510a61c75ab179b57ad308b946c1263e388ecd1c7e18b5a6b729e3258cd","observation_id":"dd0d2b73-2332-4bfe-a8a1-17d71037c653","resolution":{"observed_at":"2026-08-04T13:54:29.907920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:30.254747Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:30.254747Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:dddf61dce62187295f1ffe255d3b451b660b0eed5f38d9854a97493a425fe9a1","observation_id":"1aee4008-8888-4965-bb36-84c2ae6e05f4","resolution":{"observed_at":"2026-08-04T13:54:30.254747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:54:30.344819Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:30.344819Z"},"links":{"citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:b547c168e800fe7f9a3229b75379cc6b4e498106944726aac5360cd7c6800b97","observation_id":"0daa7992-1641-4828-9198-d9111ae502de","resolution":{"observed_at":"2026-08-04T13:54:30.344819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15255","last_updated":"2024-04-23T17:42:29Z","snapshot_observed_at":"2026-07-31T21:25:53.647335Z","submitted_at":"2024-04-23T17:42:29Z","title":"How to use and interpret activation patching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15255","snapshot_observed_at":"2026-08-04T13:54:30.464863Z","title":"Attribution Patching Outperforms Automated Circuit Discovery","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:30.464863Z"},"links":{"cited_paper":"/paper/2404.15255","citing_paper":"/paper/2509.24808"},"observation_digest":"sha256:6535c8e361cdb985082afd92e9301354046d5afb5587aca2b5d4450bd628d14c","observation_id":"32f82c2f-ab88-4407-bc38-3cb9444e6596","resolution":{"observed_at":"2026-08-04T13:54:30.464863Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.24808","last_updated":"2026-06-01T07:18:18Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T08:25:29.849904Z","submitted_at":"2025-09-29T13:59:02Z","title":"Query Circuits: Explaining How Language Models Answer User Prompts"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2509.24808."}