{"as_of":"2026-08-11T06:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c948b8c84286bae8f5b8cb9fe98081f87009c7c602d31596b0bd71c9ff965fcf","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T17:13:51.408311Z","state":"measured"},{"denominator":166,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":166,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":137,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:18:23.641247Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":50,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2301.05217","last_updated":"2023-10-19T21:25:32Z","snapshot_observed_at":"2026-08-02T10:20:00.635719Z","submitted_at":"2023-01-12T18:56:49Z","title":"Progress measures for grokking via mechanistic interpretability","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-14T21:52:56.040569Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2301.05217"},"observation_digest":"sha256:9ddef16c314357eb5d3f5f54a8017726733c630664833f19a6ba41bf5d5d51ae","observation_id":"bd07232b-7a32-41ac-ac35-9ab414b28ddb","resolution":{"observed_at":"2026-05-14T21:52:56.157111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2303.08112","last_updated":"2025-11-11T01:13:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-14T17:47:09Z","title":"Eliciting Latent Predictions from Transformers with the Tuned Lens","version":6},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-12T16:54:37.382049Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2303.08112"},"observation_digest":"sha256:fb8adcc263a86afaf8e572323c92123e57900729c126b33fca2141de32dcde11","observation_id":"16867590-ebb7-473c-bb39-a4221f87c667","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-07-06T16:19:05.495349Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-24T06:42:23.274826Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2309.08600"},"observation_digest":"sha256:37aa197f9e910093135a6060bdefb28455aae6ef2877594d957a285900a529c0","observation_id":"9b262013-a5bf-47ad-a29c-b8745b7cc891","resolution":{"observed_at":"2026-05-24T06:44:02.219327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:6f2e0aead184a4c562a57eb4a932deca58b8611dae693aa5781d618b35b2ccbc","observation_id":"06c1682f-2943-4fdf-9c88-a1c241b5c5a9","resolution":{"observed_at":"2026-05-16T07:02:53.926612Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2404.15255","last_updated":"2024-04-23T17:42:29Z","snapshot_observed_at":"2026-07-31T21:25:53.647335Z","submitted_at":"2024-04-23T17:42:29Z","title":"How to use and interpret activation patching","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T20:34:06.888683Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2404.15255"},"observation_digest":"sha256:07dbadd5f87bccbb969410bc08bb491410108863c3b1d26362399f42181fba3a","observation_id":"5eb24e17-4314-437f-9002-6296ee8a9797","resolution":{"observed_at":"2026-05-16T20:34:06.947508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2408.05147","last_updated":"2024-08-19T07:51:05Z","snapshot_observed_at":"2026-08-04T11:44:14.524984Z","submitted_at":"2024-08-09T16:06:42Z","title":"Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T05:47:19.953111Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2408.05147"},"observation_digest":"sha256:0a705607eb5da27ccdb9abc362e46f7852c46bc09ee6ae334afa1841fe3eaae0","observation_id":"73623492-eea4-4e80-a147-caa65323a6c5","resolution":{"observed_at":"2026-05-15T05:47:20.043114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-10T22:18:23.641247Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small.arXiv preprint arXiv:2211.00593,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02045","last_updated":"2025-01-03T18:44:43Z","snapshot_observed_at":"2026-08-10T22:12:18.524765Z","submitted_at":"2025-01-03T18:44:43Z","title":"METAGENE-1: Metagenomic Foundation Model for Pandemic Monitoring","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:23.641247Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2501.02045"},"observation_digest":"sha256:d12d5395a8f2b18d74cfc554cc9ee691fa4a1f800905dd20cbc898388b4c0b5d","observation_id":"74c04229-41bc-4e49-a463-c0e69e89325a","resolution":{"observed_at":"2026-08-10T22:18:23.641247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-10T21:28:16.037905Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.06254","last_updated":"2025-02-18T17:10:39Z","snapshot_observed_at":"2026-08-11T00:14:04.887753Z","submitted_at":"2025-01-09T02:54:19Z","title":"Rethinking Evaluation of Sparse Autoencoders through the Representation of Polysemous Words","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T21:28:16.037905Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2501.06254"},"observation_digest":"sha256:739b5fc1f0cdf839a127109dc83f727074ab9d7679bca1f08a7fa1883b9f694c","observation_id":"506f5d05-097b-47e5-8de2-c7c498d0d4b7","resolution":{"observed_at":"2026-08-10T21:28:16.037905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-10T20:15:28.427015Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09240","last_updated":"2025-01-16T01:54:23Z","snapshot_observed_at":"2026-08-11T02:56:41.628302Z","submitted_at":"2025-01-16T01:54:23Z","title":"Task Vectors in In-Context Learning: Emergence, Formation, and Benefit","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.427015Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2501.09240"},"observation_digest":"sha256:fcc6a251acc621ad7c81de38aa392141359050fb6058b7026bc259a94ae1d668","observation_id":"fb34adb7-acd4-4b6a-83e0-145a026b5f36","resolution":{"observed_at":"2026-08-10T20:15:28.427015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-10T14:55:02.270268Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.14926","last_updated":"2025-02-07T19:22:32Z","snapshot_observed_at":"2026-08-11T04:39:18.129364Z","submitted_at":"2025-01-24T21:31:12Z","title":"Interpretability in Parameter Space: Minimizing Mechanistic Description Length with Attribution-based Parameter Decomposition","version":4},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-10T14:55:02.270268Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2501.14926"},"observation_digest":"sha256:69f57f199df16b13a858d07a5f0f0f726bed2368d05b4a187c3b580fd55d013c","observation_id":"afab162a-b487-4298-9b9a-441122dd8fd5","resolution":{"observed_at":"2026-08-10T14:55:02.270268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-10T14:43:14.745081Z","title":"Inter- pretability in the wild: a circuit for indirect object identification in gpt-2 small.arXiv preprint arXiv:2211.00593,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15054","last_updated":"2025-06-08T18:34:17Z","snapshot_observed_at":"2026-08-10T14:37:57.620121Z","submitted_at":"2025-01-25T03:34:15Z","title":"Unraveling Token Prediction Refinement and Identifying Essential Layers in Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:43:14.745081Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2501.15054"},"observation_digest":"sha256:3b132da4133cde0ba9c6e985fc1751263ac4346004c1f4e118de282ab0a85484","observation_id":"2ac73ebc-e5f0-4645-b3e4-e0a97897b17c","resolution":{"observed_at":"2026-08-10T14:43:14.745081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-09T23:32:04.152449Z","title":"Sumio Watanabe","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18666","last_updated":"2025-01-30T15:56:25Z","snapshot_observed_at":"2026-08-10T22:25:34.743761Z","submitted_at":"2025-01-30T15:56:25Z","title":"Structure Development in List-Sorting Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T23:32:04.152449Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2501.18666"},"observation_digest":"sha256:7194f851b82dfa447590f9cd73e683c64ef38cbf43928379e802561be70e1249","observation_id":"0556a0d9-92db-4033-b964-1d228dfcbde1","resolution":{"observed_at":"2026-08-09T23:32:04.152449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-09T22:08:49.514280Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18887","last_updated":"2025-05-29T16:49:00Z","snapshot_observed_at":"2026-08-09T22:01:38.611459Z","submitted_at":"2025-01-31T04:42:45Z","title":"Towards Unified Attribution in Explainable AI, Data-Centric AI, and Mechanistic Interpretability","version":3},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-09T22:08:49.514280Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2501.18887"},"observation_digest":"sha256:ff3fa829fd6627fe5514da8e0173ecb2ece2aaa0af982e19739e338b2a579f7c","observation_id":"6699a44f-329f-4556-90f4-bbebab7ace34","resolution":{"observed_at":"2026-08-09T22:08:49.514280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-09T14:29:20.143673Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01803","last_updated":"2025-02-03T20:30:46Z","snapshot_observed_at":"2026-08-10T05:05:40.545983Z","submitted_at":"2025-02-03T20:30:46Z","title":"Discovering Chunks in Neural Embeddings for Interpretability","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-09T14:29:20.143673Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2502.01803"},"observation_digest":"sha256:8ba475947ee963dd9438fe1d09b8d56637649b9b332b069ede06e30e4ffaa63e","observation_id":"dbe5dc59-dc06-4da0-aeb6-7b7df836aba7","resolution":{"observed_at":"2026-08-09T14:29:20.143673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-09T12:08:22.889317Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02470","last_updated":"2025-07-25T10:41:54Z","snapshot_observed_at":"2026-08-10T06:26:34.580026Z","submitted_at":"2025-02-04T16:44:38Z","title":"Studying Cross-cluster Modularity in Neural Networks","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T12:08:22.889317Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2502.02470"},"observation_digest":"sha256:bff18e0ac17e4e6a568bdc7cfb6e38320f6d70868e9bddbfbccbf2f9d428d4ba","observation_id":"b5677b01-3877-4b22-961c-ac1a439d4c43","resolution":{"observed_at":"2026-08-09T12:08:22.889317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-08T23:51:29.437526Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04030","last_updated":"2025-06-25T14:44:30Z","snapshot_observed_at":"2026-08-09T18:05:30.973187Z","submitted_at":"2025-02-06T12:47:25Z","title":"Fine, I'll Merge It Myself: A Multi-Fidelity Framework for Automated Model Merging","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T23:51:29.437526Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2502.04030"},"observation_digest":"sha256:5a806965d9529339a78b95b03c438b1b4dffa5589bc037a44b6d2812e1dd6c62","observation_id":"3faaf77c-0529-4876-97a7-607826861f51","resolution":{"observed_at":"2026-08-08T23:51:29.437526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-08T21:12:13.878104Z","title":"Inter- pretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-10T11:45:33.745155Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.878104Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:b9d4c6392dbaa3403ef5640008732b85a95d5ea8247b38fb969af8a7e03fc2d9","observation_id":"2ab72c83-bf32-4747-89cd-887135d947a0","resolution":{"observed_at":"2026-08-08T21:12:13.878104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-08T19:15:55.076336Z","title":"Interpretability in the wild: a circuit for indirect object identification in GPT-2 small, November 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05475","last_updated":"2025-02-08T07:24:04Z","snapshot_observed_at":"2026-08-09T02:15:12.668653Z","submitted_at":"2025-02-08T07:24:04Z","title":"You Are What You Eat -- AI Alignment Requires Understanding How Data Shapes Structure and Generalisation","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-08-08T19:15:55.076336Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2502.05475"},"observation_digest":"sha256:a797321038885f04ddc9f8c1140f6b1ef508c77e494755023b90eed4a7cf42c0","observation_id":"9d1b64ae-978c-4a90-b109-83f02abc0433","resolution":{"observed_at":"2026-08-08T19:15:55.076336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-08T14:48:44.813113Z","title":"Variengien, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06656","last_updated":"2025-02-19T16:05:47Z","snapshot_observed_at":"2026-08-09T07:08:16.327947Z","submitted_at":"2025-02-10T16:47:00Z","title":"A Frontier AI Risk Management Framework: Bridging the Gap Between Current AI Practices and Established Risk Management","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T14:48:44.813113Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2502.06656"},"observation_digest":"sha256:f7ccfa32aca18dff4ed7dbd23f8400b490f8e717c85d6842f02eb6c33f0db4a6","observation_id":"c7766895-4d45-4b23-ab7f-ee6e2c54a899","resolution":{"observed_at":"2026-08-08T14:48:44.813113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-08T11:01:28.934946Z","title":"Wu, K., Wu, E., and Zou, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08059","last_updated":"2025-02-12T01:54:21Z","snapshot_observed_at":"2026-08-09T15:28:40.614192Z","submitted_at":"2025-02-12T01:54:21Z","title":"On Mechanistic Circuits for Extractive Question-Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T11:01:28.934946Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2502.08059"},"observation_digest":"sha256:f9aa044b89091746a7e2c627248f8035b58a7505f46b1267e94e9f3f1a05bc29","observation_id":"b43ceb3a-bc7d-49f0-8ed7-1d01645c071e","resolution":{"observed_at":"2026-08-08T11:01:28.934946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-07T22:56:40.300816Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09022","last_updated":"2025-02-14T05:46:53Z","snapshot_observed_at":"2026-08-10T22:44:19.537002Z","submitted_at":"2025-02-13T07:19:05Z","title":"Mechanistic Unveiling of Transformer Circuits: Self-Influence as a Key to Model Reasoning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T22:56:40.300816Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2502.09022"},"observation_digest":"sha256:fbcfe7ec55d7d4a7f992735df528f8ab7b174a2047ac70131e4716e2f50549ce","observation_id":"edb7054f-6d58-4845-83de-4659040a41f8","resolution":{"observed_at":"2026-08-07T22:56:40.300816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-07T15:39:19.823946Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14406","last_updated":"2025-09-09T05:59:48Z","snapshot_observed_at":"2026-08-08T09:33:42.546942Z","submitted_at":"2025-05-20T14:20:30Z","title":"Pierce the Mists, Greet the Sky: Decipher Knowledge Overshadowing via Knowledge Circuit Analysis","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:39:19.823946Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2505.14406"},"observation_digest":"sha256:e9eea28c01c2ce3a8384b41ffbcf2a4e1a0a9b9124ad8c710506f0f5b50e101d","observation_id":"55c3bffa-c6e7-440d-88ef-8f86b156cbb9","resolution":{"observed_at":"2026-08-07T15:39:19.823946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-07T15:38:01.163498Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14436","last_updated":"2025-05-20T14:42:03Z","snapshot_observed_at":"2026-08-08T17:55:32.735439Z","submitted_at":"2025-05-20T14:42:03Z","title":"Neural Incompatibility: The Unbridgeable Gap of Cross-Scale Parametric Knowledge Transfer in Large Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:01.163498Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2505.14436"},"observation_digest":"sha256:69649159f981e91b1678b367fc4198f5657c128fbd418f96e10a80623406eaa5","observation_id":"b2fd7b59-8fd2-4e9c-9f18-1af68ddb3d58","resolution":{"observed_at":"2026-08-07T15:38:01.163498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-07T15:37:03.554660Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14467","last_updated":"2025-05-20T15:01:56Z","snapshot_observed_at":"2026-08-09T08:50:01.183608Z","submitted_at":"2025-05-20T15:01:56Z","title":"Void in Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:37:03.554660Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2505.14467"},"observation_digest":"sha256:4531ab990a0f0bcb138681c363b0fc42a40304bfd0b78c6c7420a91d2db82601","observation_id":"498a66e8-0e85-4739-925d-87adffcf6165","resolution":{"observed_at":"2026-08-07T15:37:03.554660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-07T15:00:58.165439Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16694","last_updated":"2025-06-10T05:24:12Z","snapshot_observed_at":"2026-08-09T18:40:45.336378Z","submitted_at":"2025-05-22T13:59:30Z","title":"Beyond Induction Heads: In-Context Meta Learning Induces Multi-Phase Circuit Emergence","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:00:58.165439Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2505.16694"},"observation_digest":"sha256:ddd2559507d81a4fc63bce4cd15f4fe79e92753748176c03b96b990fcfd94f5c","observation_id":"3e2c7f5a-3e4c-447f-84e2-551669f66c45","resolution":{"observed_at":"2026-08-07T15:00:58.165439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-07T14:18:02.941819Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19548","last_updated":"2025-05-26T06:11:18Z","snapshot_observed_at":"2026-08-07T14:09:28.826325Z","submitted_at":"2025-05-26T06:11:18Z","title":"How Syntax Specialization Emerges in Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:18:02.941819Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2505.19548"},"observation_digest":"sha256:93a58343414a6c221c7ccb3592960cb204b315d96e8c9779dbc33048fd960825","observation_id":"726d0a80-e229-4ab5-8293-e2c5e2121d26","resolution":{"observed_at":"2026-08-07T14:18:02.941819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-07T13:43:23.280878Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21191","last_updated":"2025-05-27T13:40:28Z","snapshot_observed_at":"2026-08-09T03:47:08.331722Z","submitted_at":"2025-05-27T13:40:28Z","title":"Unveiling Instruction-Specific Neurons & Experts: An Analytical Framework for LLM's Instruction-Following Capabilities","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:43:23.280878Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2505.21191"},"observation_digest":"sha256:f313f6d93527134733823c5f1db91b72ad699c08e375f1f7566844ffb24c45e0","observation_id":"10673e84-3e3d-497b-91a0-9cf3f210ee49","resolution":{"observed_at":"2026-08-07T13:43:23.280878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-07T13:31:01.134755Z","title":"Interpretability in the Wild: A Circuit for Indirect Object Identiﬁcation in GPT-2 Small","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21664","last_updated":"2025-05-27T18:44:30Z","snapshot_observed_at":"2026-08-08T04:22:44.431117Z","submitted_at":"2025-05-27T18:44:30Z","title":"Expert Survey: AI Reliability & Security Research Priorities","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:31:01.134755Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2505.21664"},"observation_digest":"sha256:23f3d0862afe4bc52a6452fdf89f53851caf9af8f1595b30698ccaca78aa29a7","observation_id":"a44dc603-4a85-406b-9742-f1b0b0604356","resolution":{"observed_at":"2026-08-07T13:31:01.134755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-07T12:35:19.671001Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24244","last_updated":"2025-05-30T06:08:36Z","snapshot_observed_at":"2026-08-08T01:27:55.223811Z","submitted_at":"2025-05-30T06:08:36Z","title":"Mamba Knockout for Unraveling Factual Information Flow","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:19.671001Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2505.24244"},"observation_digest":"sha256:513ff82f3f622d536983502c4f4b20a407d533dba739d9545a9f4b1165f5515a","observation_id":"e34ae475-2f13-495c-9b01-b3495503fece","resolution":{"observed_at":"2026-08-07T12:35:19.671001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-07T12:13:19.352932Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00253","last_updated":"2025-06-08T23:37:10Z","snapshot_observed_at":"2026-08-07T21:55:20.181434Z","submitted_at":"2025-05-30T21:41:44Z","title":"Aligned but Blind: Alignment Increases Implicit Bias by Reducing Awareness of Race","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:19.352932Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2506.00253"},"observation_digest":"sha256:4a5782ececfd2ae0344df5e1471abdc51543282e516bbf15ee1e6eabc62b2188","observation_id":"25085deb-1076-4066-a0b5-1f3681d0afe1","resolution":{"observed_at":"2026-08-07T12:13:19.352932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-07T10:29:44.987123Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-09T14:59:56.685734Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.987123Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:26d4433d05eb09ce1c3b6c875651f40e5162784b6a3c4e59173b133ebad8cb44","observation_id":"795ad8e5-0f9c-470e-b00f-ec2eff7fd9fe","resolution":{"observed_at":"2026-08-07T10:29:44.987123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-07T05:44:34.868186Z","title":"In- terpretability in the wild: a circuit for indirect object identification in gpt-2 small.ArXiv, abs/2211.00593,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07406","last_updated":"2026-07-06T04:18:12Z","snapshot_observed_at":"2026-08-09T08:30:35.837462Z","submitted_at":"2025-06-09T03:59:28Z","title":"InverseScope: Scalable Activation Inversion for Interpreting Large Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:34.868186Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2506.07406"},"observation_digest":"sha256:af2711ded4ebe04d4cc4d14d4e0f57e4d9fef05e287dac63a3268a9980ca5e17","observation_id":"f2b18c6f-035b-4e61-bfb7-531a1aa1829f","resolution":{"observed_at":"2026-08-07T05:44:34.868186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-07T04:59:23.693310Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09251","last_updated":"2025-08-04T16:57:32Z","snapshot_observed_at":"2026-08-10T08:26:32.587684Z","submitted_at":"2025-06-10T21:22:51Z","title":"Extrapolation by Association: Length Generalization Transfer in Transformers","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:23.693310Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2506.09251"},"observation_digest":"sha256:72398b598104c80e57dc9bf0ffbf1ac35e02d9ba489804dd7d9ef466d65cdb70","observation_id":"f79164a6-a64d-4590-95be-a8493a301f24","resolution":{"observed_at":"2026-08-07T04:59:23.693310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-06T22:48:39.358150Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20790","last_updated":"2025-09-04T11:41:34Z","snapshot_observed_at":"2026-08-09T03:26:19.673933Z","submitted_at":"2025-06-25T19:26:31Z","title":"Stochastic Parameter Decomposition","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T22:48:39.358150Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2506.20790"},"observation_digest":"sha256:a49d6f37430e4f800abd9e6c72bfc059fa80bcfabd8f6a8f65d65661e710bd44","observation_id":"39793d58-ccfa-490b-b150-96a62e62d4c3","resolution":{"observed_at":"2026-08-06T22:48:39.358150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-06T20:47:07.394735Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-10T06:21:14.308985Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:07.394735Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:a6f9facd785bf65f7259bc353eba94bc863fdd1da555e84c5988e0b0fde22394","observation_id":"85216b34-3275-4f8e-8904-190d27a6f832","resolution":{"observed_at":"2026-08-06T20:47:07.394735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-06T20:31:17.798498Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.798498Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:566bd2fdff6564f20120f496f27e9a5df6da1613b409c5007888af3db5f5c9a4","observation_id":"a1e61622-ebda-4274-882d-000351d125d4","resolution":{"observed_at":"2026-08-06T20:31:17.798498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-07T10:18:59.242409Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02870","last_updated":"2025-06-06T10:50:08Z","snapshot_observed_at":"2026-08-08T01:09:03.836574Z","submitted_at":"2025-06-06T10:50:08Z","title":"Loki's Dance of Illusions: A Comprehensive Survey of Hallucination in Large Language Models","version":1},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:59.242409Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2507.02870"},"observation_digest":"sha256:939e028d0f100d2ad7ff992af0f138af48656cf459ef908bc2d4645bdd5daf89","observation_id":"92c1d813-3288-4c50-858a-a1b32c741045","resolution":{"observed_at":"2026-08-07T10:18:59.242409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-06T19:14:31.787447Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06203","last_updated":"2025-07-10T16:43:36Z","snapshot_observed_at":"2026-08-07T04:57:37.201438Z","submitted_at":"2025-07-08T17:29:07Z","title":"A Survey on Latent Reasoning","version":2},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-08-06T19:14:31.787447Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2507.06203"},"observation_digest":"sha256:c39ca8716e2f57ee952098c2d10ffcae6ae56d8538069e35d3a344cc955f7293","observation_id":"7b4444bd-35fc-4680-8718-f0de87b4c9c1","resolution":{"observed_at":"2026-08-06T19:14:31.787447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-06T18:00:51.725380Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09406","last_updated":"2025-07-12T21:29:49Z","snapshot_observed_at":"2026-08-10T06:51:19.549363Z","submitted_at":"2025-07-12T21:29:49Z","title":"Adversarial Activation Patching: A Framework for Detecting and Mitigating Emergent Deception in Safety-Aligned Transformers","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:51.725380Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2507.09406"},"observation_digest":"sha256:37bbb7a15955bf29c42eeaa835d0ddb057dcb4e23fe069fbce1f6203ba7ace63","observation_id":"82a0b61e-b35f-4d95-a5da-5a758d3c941d","resolution":{"observed_at":"2026-08-06T18:00:51.725380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-06T17:51:44.752240Z","title":"ISSN: 2640-3498","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09897","last_updated":"2025-08-06T13:21:56Z","snapshot_observed_at":"2026-08-08T23:27:58.133219Z","submitted_at":"2025-07-14T04:07:43Z","title":"Algorithm Development in Neural Networks: Insights from the Streaming Parity Task","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:51:44.752240Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2507.09897"},"observation_digest":"sha256:98d141b2ecf6443076ecf9b24656e5bd5654c9b1f1a1421782e2309d97f4ea6b","observation_id":"3a97b7dc-8cdf-41a1-9c7d-070759ea9c63","resolution":{"observed_at":"2026-08-06T17:51:44.752240Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-06T17:52:01.676363Z","title":"Wang, Y ., Ma, X., Zhang, G., Ni, Y ., Chandra, A., Guo, S., Ren, W., Arulraj, A., He, X., Jiang, Z., Li, T., Ku, M., Wang, K., Zhuang, A., Fan, R., Yue, X., and Chen, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10616","last_updated":"2025-07-25T11:09:53Z","snapshot_observed_at":"2026-08-09T20:00:51.058029Z","submitted_at":"2025-07-13T19:04:17Z","title":"Scalpel vs. Hammer: GRPO Amplifies Existing Capabilities, SFT Replaces Them","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:01.676363Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2507.10616"},"observation_digest":"sha256:fc8688918922bac089007d613c2a9cd5d10efd1ff2771b4e3e97ba8aff7c988f","observation_id":"0d1d4c40-723c-48b0-92a5-ca7436e0cd66","resolution":{"observed_at":"2026-08-06T17:52:01.676363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-06T17:05:04.509549Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:04.509549Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2507.11771"},"observation_digest":"sha256:44c3a9ce5a2e22d57fbaffb65a604a971b5de1e231a4af9296bc65f075f4cf31","observation_id":"2201a38b-4fcd-4c41-8296-90544649bed1","resolution":{"observed_at":"2026-08-06T17:05:04.509549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-06T17:03:16.793689Z","title":"Inter- pretability in the wild: a circuit for indirect object identification in gpt-2 small.arXiv preprint arXiv:2211.00593,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11878","last_updated":"2026-07-06T01:46:44Z","snapshot_observed_at":"2026-08-10T18:30:43.579180Z","submitted_at":"2025-07-16T03:48:03Z","title":"LLMs Encode Harmfulness and Refusal Separately","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:03:16.793689Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2507.11878"},"observation_digest":"sha256:40940cc38c6312637a0366b9861f6bed31b54badf7568970b6ca37333a529b4c","observation_id":"51295c71-28af-4e5a-b7f4-85e9fa1a7d44","resolution":{"observed_at":"2026-08-06T17:03:16.793689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-06T16:40:44.385051Z","title":"Interpretability in the wild: a circuit for indirect object identification in GPT-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12950","last_updated":"2025-07-18T09:19:19Z","snapshot_observed_at":"2026-08-08T08:02:10.889574Z","submitted_at":"2025-07-17T09:43:20Z","title":"Insights into a radiology-specialised multimodal large language model with sparse autoencoders","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T16:40:44.385051Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2507.12950"},"observation_digest":"sha256:cbe2c70ab0cb58282574b66ca318db84da898fa0b03ddd905419c0de620a94a4","observation_id":"f76758b2-cf9a-4c8c-8444-5c3b49d110d9","resolution":{"observed_at":"2026-08-06T16:40:44.385051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-06T15:24:45.806155Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15977","last_updated":"2025-07-21T18:17:18Z","snapshot_observed_at":"2026-08-08T15:45:05.019347Z","submitted_at":"2025-07-21T18:17:18Z","title":"On the transferability of Sparse Autoencoders for interpreting compressed models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T15:24:45.806155Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2507.15977"},"observation_digest":"sha256:baec05df8ca90160f16dc6af9a8caa87968e342fad5c4c9e4acc854307c0a3a7","observation_id":"64e739de-8800-4a24-926d-73ab73659a3f","resolution":{"observed_at":"2026-08-06T15:24:45.806155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-06T05:30:19.195128Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01728","last_updated":"2025-08-03T11:45:38Z","snapshot_observed_at":"2026-08-09T21:44:14.276471Z","submitted_at":"2025-08-03T11:45:38Z","title":"Granular Concept Circuits: Toward a Fine-Grained Circuit Discovery for Concept Representations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:19.195128Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2508.01728"},"observation_digest":"sha256:95bbf218c79e9ec15eed2b961bc63f05417f6c42028619ace3c8ed5e47173204","observation_id":"500d88f3-9155-479b-b9c1-1b0dec2ce635","resolution":{"observed_at":"2026-08-06T05:30:19.195128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T18:01:19.714746Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.15875","last_updated":"2025-08-21T10:36:00Z","snapshot_observed_at":"2026-08-08T12:29:06.386568Z","submitted_at":"2025-08-21T10:36:00Z","title":"NEAT: Concept driven Neuron Attribution in LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T18:01:19.714746Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2508.15875"},"observation_digest":"sha256:41a13f500e5d188522c0c57f65afe53fa5b28c32db2c85e04f386ef9d967f093","observation_id":"8c86245e-2728-4fdc-affe-b2b977a3905b","resolution":{"observed_at":"2026-08-05T18:01:19.714746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T17:37:53.695806Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.16109","last_updated":"2025-08-22T05:54:11Z","snapshot_observed_at":"2026-08-10T03:57:56.248075Z","submitted_at":"2025-08-22T05:54:11Z","title":"From Indirect Object Identification to Syllogisms: Exploring Binary Mechanisms in Transformer Circuits","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T17:37:53.695806Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2508.16109"},"observation_digest":"sha256:8c69f9e7399df467dfd247f096c66e96351ff355eee779828de18ec0fcb7786b","observation_id":"cd91d2a0-b672-47c7-bdc3-51f66fabe751","resolution":{"observed_at":"2026-08-05T17:37:53.695806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T17:16:33.076002Z","title":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.16930","last_updated":"2025-08-23T07:30:18Z","snapshot_observed_at":"2026-08-09T16:55:24.799888Z","submitted_at":"2025-08-23T07:30:18Z","title":"HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:33.076002Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2508.16930"},"observation_digest":"sha256:e44816b4bc46f9bec9c01f9d5a93aab24fe85f73fa8cda73c62b034c5aca746c","observation_id":"019fb5de-08b8-4526-ab5f-2d97bed4325b","resolution":{"observed_at":"2026-08-05T17:16:33.076002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-04T18:50:56.711463Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09650","last_updated":"2025-09-11T17:41:29Z","snapshot_observed_at":"2026-08-10T17:00:56.081022Z","submitted_at":"2025-09-11T17:41:29Z","title":"All for One: LLMs Solve Mental Math at the Last Token With Information Transferred From Other Tokens","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T18:50:56.711463Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2509.09650"},"observation_digest":"sha256:660ca0d1af86fa6a9852ed0f5d024eab0e226bc52757dcc6d03d63dd2637ec52","observation_id":"dac7148a-b2ec-45d9-a02f-1e1b7f3be1e3","resolution":{"observed_at":"2026-08-04T18:50:56.711463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2509.09708","last_updated":"2026-04-28T03:29:39Z","snapshot_observed_at":"2026-08-10T21:52:19.966437Z","submitted_at":"2025-09-07T02:29:07Z","title":"Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-18T18:56:13.680353Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2509.09708"},"observation_digest":"sha256:fa4190e40485b399d5d2207e60790bfc616e4ea3754fdb8127dbfef4622cd726","observation_id":"78f72428-eba0-4732-a9e6-1ca4723e0d93","resolution":{"observed_at":"2026-05-18T18:56:45.794536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-04T16:40:31.230569Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.230569Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:1bc8b2f7d33a10631d44a5267f9f22e408ec32286f1f127371875fc319ca6d09","observation_id":"4b27728d-2133-4603-9263-342399895f24","resolution":{"observed_at":"2026-08-04T16:40:31.230569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-03T03:50:17.552737Z","title":"arXiv preprint arXiv:2211.00593 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.06841","last_updated":"2026-05-31T17:09:07Z","snapshot_observed_at":"2026-08-09T07:23:34.031341Z","submitted_at":"2026-02-06T16:34:29Z","title":"From Features to Actions: Explainability in Traditional and Agentic AI Systems","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T03:50:17.552737Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2602.06841"},"observation_digest":"sha256:0c8b4c4d95b704258010eb9a4c40cf527874c99421ba98a21db793d6110b20ee","observation_id":"b19b3df4-f598-416f-ac83-e9462e2f911c","resolution":{"observed_at":"2026-08-03T03:50:17.552737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-03T00:02:45.942638Z","title":"Inter- pretability in the wild: A circuit for indirect object identification in GPT-2 small.arXiv preprint arXiv:2211.00593,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:45.942638Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:ecfadec19f0c00c9b25290516d48697c7add3f867008019a8cb10dfc7e153e6d","observation_id":"26f2a1fc-a6e3-4916-ab4e-87dbfafc3d56","resolution":{"observed_at":"2026-08-03T00:02:45.942638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-02T20:46:32.835730Z","title":"Interpretability in the wild: a circuit for indi- rect object identification in gpt-2 small.arXiv preprint arXiv:2211.00593, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.22600","last_updated":"2026-07-06T18:07:55Z","snapshot_observed_at":"2026-08-10T18:38:17.977304Z","submitted_at":"2026-02-26T04:09:11Z","title":"Transformers converge to invariant algorithmic cores","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T20:46:32.835730Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2602.22600"},"observation_digest":"sha256:3fc7252aa8878aa62dc5f44b1df367c0da52da7fb7b6c5c3d3dcfe026cc70129","observation_id":"2e26656e-1c79-49ac-b8b8-7fb793272cb3","resolution":{"observed_at":"2026-08-02T20:46:32.835730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-02T16:59:55.496930Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small.arXiv preprint arXiv:2211.00593,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.01457","last_updated":"2026-07-27T01:12:54Z","snapshot_observed_at":"2026-08-03T08:25:00.376375Z","submitted_at":"2026-04-01T23:06:58Z","title":"Wired for Overconfidence: A Mechanistic Perspective on Inflated Verbalized Confidence in LLMs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T16:59:55.496930Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2604.01457"},"observation_digest":"sha256:fa0a9e1c0526e0d3552276d99a3ac8cb721ea46954af71684d16ffa99438888a","observation_id":"bb22fcdc-9130-478d-995c-dfdbbe5d6e62","resolution":{"observed_at":"2026-08-02T16:59:55.496930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2604.01590","last_updated":"2026-04-04T12:13:25Z","snapshot_observed_at":"2026-08-03T19:48:13.554394Z","submitted_at":"2026-04-02T04:01:50Z","title":"PhiNet: Speaker Verification with Phonetic Interpretability","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T21:12:27.804372Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2604.01590"},"observation_digest":"sha256:668844c019528fb0a873de3cbcad4ac92177f6ce5c2c3292bac1852142868482","observation_id":"44187884-afe5-412c-a825-b27170415412","resolution":{"observed_at":"2026-05-13T21:13:16.407720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2604.02645","last_updated":"2026-05-27T03:28:39Z","snapshot_observed_at":"2026-07-13T13:45:53.718036Z","submitted_at":"2026-04-03T02:15:32Z","title":"Speaking of Language: Reflections on Metalanguage Research in NLP","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T20:23:55.117913Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2604.02645"},"observation_digest":"sha256:3bb047a57562ba246c43ad03ed9c96f6d54c67fd9afc0c16d71b3b11cc894c86","observation_id":"5b7272f9-483c-48c7-88b3-15cefa33a3f9","resolution":{"observed_at":"2026-05-13T20:28:14.115088Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2604.04982","last_updated":"2026-04-04T23:13:55Z","snapshot_observed_at":"2026-08-02T14:39:32.415726Z","submitted_at":"2026-04-04T23:13:55Z","title":"CURE:Circuit-Aware Unlearning for LLM-based Recommendation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T16:47:25.256063Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2604.04982"},"observation_digest":"sha256:29d2654628004aa50e9d5abc945318205abf03e220fff9495759a8cf1edcf114","observation_id":"1ca5196b-4a7d-425b-9f27-2468f91b1fea","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-07-13T12:04:13.336341Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.04984","last_updated":"2026-05-12T14:04:41Z","snapshot_observed_at":"2026-08-06T05:41:23.373110Z","submitted_at":"2026-04-05T00:44:02Z","title":"A Numerical PDEs Approach to Evolution Equations in Shape Analysis Based on Regularized Morphoelasticity","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T12:04:13.336341Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2604.04984"},"observation_digest":"sha256:0f3800f1ccd7888f4c9a16e9401f8ec8ca9651170c1051be85c52b8e975195e4","observation_id":"10d8aaa4-b06a-482a-bec8-22e97b4d6c68","resolution":{"observed_at":"2026-07-13T12:04:13.336341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2604.08192","last_updated":"2026-04-09T12:44:19Z","snapshot_observed_at":"2026-07-06T22:57:22.475588Z","submitted_at":"2026-04-09T12:44:19Z","title":"Inside-Out: Measuring Generalization in Vision Transformers Through Inner Workings","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T18:28:49.855280Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2604.08192"},"observation_digest":"sha256:9c6ac759a4c108bb7fe25dba9175ef03a882b9f35c646d8ca6e162004e77afcc","observation_id":"8a2fadcb-f376-4d46-8e0b-9b5e98569108","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2604.13258","last_updated":"2026-04-14T19:43:43Z","snapshot_observed_at":"2026-07-06T23:01:19.191464Z","submitted_at":"2026-04-14T19:43:43Z","title":"Hessian-Enhanced Token Attribution (HETA): Interpreting Autoregressive LLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-10T15:23:53.906870Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2604.13258"},"observation_digest":"sha256:ec837eceb76c85042747747f36b41dcde4746c94b0d2cf8d3c3730437571c2a3","observation_id":"24aed8c1-dc66-43b6-acd5-c4ed346fcbca","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2604.15409","last_updated":"2026-04-16T15:59:40Z","snapshot_observed_at":"2026-07-06T23:02:58.361418Z","submitted_at":"2026-04-16T15:59:40Z","title":"The Illusion of Equivalence: Systematic FP16 Divergence in KV-Cached Autoregressive Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T11:23:37.593409Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2604.15409"},"observation_digest":"sha256:aa9cf8b77b2b7b3ce998c7c3eed09110fb9c10399716a818ba777976a981daad","observation_id":"0c9a623c-fb56-483c-b557-82967e02c085","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2604.17673","last_updated":"2026-04-20T00:02:00Z","snapshot_observed_at":"2026-07-06T23:04:41.564912Z","submitted_at":"2026-04-20T00:02:00Z","title":"Grokking of Diffusion Models: Case Study on Modular Addition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T05:28:08.221886Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2604.17673"},"observation_digest":"sha256:fbb2dce27ca7eaf718f2717f8ab1d06b862a557daf373818cf098a0299e73dbf","observation_id":"9da0b9f1-91f3-469b-8bc6-b7a1b140cd55","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2604.19052","last_updated":"2026-04-21T03:58:47Z","snapshot_observed_at":"2026-07-06T23:05:48.885141Z","submitted_at":"2026-04-21T03:58:47Z","title":"Cell-Based Representation of Relational Binding in Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-10T02:21:04.591556Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2604.19052"},"observation_digest":"sha256:acc37b3732423384ba63a0ce3ba10803833cee75fceb83019bfd019da15cabcd","observation_id":"95491ea6-98c9-4d5e-b15a-dcaccddc61d3","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2604.23862","last_updated":"2026-05-28T09:21:15Z","snapshot_observed_at":"2026-07-06T23:10:02.659384Z","submitted_at":"2026-04-26T20:09:25Z","title":"Graph Memory Transformer (GMT)","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T06:27:32.790728Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2604.23862"},"observation_digest":"sha256:7382c53984f1f40d361c8b96cb899267c270c77be1cea8c1d31141917141b47a","observation_id":"f4f6c0fb-a348-48aa-aebc-3816b7489f5a","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2604.27401","last_updated":"2026-04-30T04:13:33Z","snapshot_observed_at":"2026-07-06T23:12:52.141592Z","submitted_at":"2026-04-30T04:13:33Z","title":"Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-07T08:34:14.310656Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2604.27401"},"observation_digest":"sha256:59af110fc0547f79fbcd50f11098016b3a50aaec1b5426bc4a202cf3eac1088e","observation_id":"0ade4e87-c831-40a6-b1c2-565b4b6acb68","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.00333","last_updated":"2026-05-18T20:20:23Z","snapshot_observed_at":"2026-08-02T02:43:02.274304Z","submitted_at":"2026-05-01T01:23:37Z","title":"Borrowed Geometry: Cross-Distribution Head-Importance Fingerprints of Frozen Pretrained Gemma 4 31B","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T00:26:22.118037Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.00333"},"observation_digest":"sha256:03929fa250600f1a4608baa8ee916f3d729f6b6e6cc4e2c9077606142ac1405f","observation_id":"295211e9-5eef-4df4-9d7e-4673d45abf88","resolution":{"observed_at":"2026-05-21T00:29:17.274052Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.00817","last_updated":"2026-08-03T16:34:49Z","snapshot_observed_at":"2026-08-06T23:37:48.639557Z","submitted_at":"2026-05-01T17:55:47Z","title":"When LLMs Stop Following Steps: A Diagnostic Study of Procedural Execution in Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-09T18:51:59.402906Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.00817"},"observation_digest":"sha256:4fdb9a1b1635dbf5d8302107f904390768f8e0078fab67659c6b8daeb3c1b35f","observation_id":"f1e482b1-5b50-4bb2-a4d2-320534f6f623","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.05076","last_updated":"2026-05-24T22:21:17Z","snapshot_observed_at":"2026-07-06T23:17:43.402046Z","submitted_at":"2026-05-06T16:11:09Z","title":"High-Dimensional Statistics: Reflections on Progress and Open Problems","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-05-08T15:35:08.202464Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.05076"},"observation_digest":"sha256:929eba106a4b0bc96eade9cabf49ebcd4ec98a353686276e0cdd76699701b579","observation_id":"e32a04dc-ddcd-4fd8-a4c8-97ea88e54705","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.05076","last_updated":"2026-05-24T22:21:17Z","snapshot_observed_at":"2026-07-06T23:17:43.402046Z","submitted_at":"2026-05-06T16:11:09Z","title":"High-Dimensional Statistics: Reflections on Progress and Open Problems","version":2},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-06-30T23:25:55.375541Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.05076"},"observation_digest":"sha256:fc69012be51948a98bb41fd1c20a496d0a2ee25b4a1a0bbcb31297bf470f9c4d","observation_id":"c6febe8e-9fbb-410c-96b4-25db81a0247d","resolution":{"observed_at":"2026-07-01T13:15:45.970687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.05653","last_updated":"2026-05-07T04:09:11Z","snapshot_observed_at":"2026-08-06T19:38:14.702022Z","submitted_at":"2026-05-07T04:09:11Z","title":"Negative Before Positive: Asymmetric Valence Processing in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T11:13:15.576248Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.05653"},"observation_digest":"sha256:3634edafca2e832b74e01f90a583ad597a568bb34b3bc1cde26f653ca9159c26","observation_id":"8d9d24ba-9a3f-4b3e-99f6-c11c8e7502dc","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.07127","last_updated":"2026-05-08T02:04:22Z","snapshot_observed_at":"2026-08-08T15:39:20.745466Z","submitted_at":"2026-05-08T02:04:22Z","title":"The Position Curse: LLMs Struggle to Locate the Last Few Items in a List","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T02:46:46.241768Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.07127"},"observation_digest":"sha256:f9e77093129de98d0f2dc71ae65b6573d08e7987c0c3e02355eabb1d64684075","observation_id":"60d326e6-7a38-4a6a-87a5-ab761f42f2bf","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.07209","last_updated":"2026-05-08T03:57:41Z","snapshot_observed_at":"2026-07-06T23:19:35.885430Z","submitted_at":"2026-05-08T03:57:41Z","title":"Hallucination Detection via Activations of Open-Weight Proxy Analyzers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T02:43:07.105363Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.07209"},"observation_digest":"sha256:72e2872ee90b267cada820a0875c2bbb0187637125b56fa95dc6bf6d60228d27","observation_id":"9bac8d96-335f-4482-96c3-bb725c4417a6","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.07984","last_updated":"2026-05-08T16:44:21Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T16:44:21Z","title":"Where's the Plan? Locating Latent Planning in Language Models with Lightweight Mechanistic Interventions","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-11T03:14:17.072349Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.07984"},"observation_digest":"sha256:fcf31002633aa8f64b1f0ac8b93ae6404e329a255d85f4a3ca79f4f9ea6683ed","observation_id":"624c863e-9194-4106-b8a0-391d003b3199","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.07990","last_updated":"2026-05-08T16:47:08Z","snapshot_observed_at":"2026-08-02T18:36:12.949377Z","submitted_at":"2026-05-08T16:47:08Z","title":"Tool Calling is Linearly Readable and Steerable in Language Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-11T03:09:11.013914Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.07990"},"observation_digest":"sha256:3d23731326b37c8a97c7ab0887ea0fd281ad119b048a27ec753ffda0f100d684","observation_id":"06313e4a-423a-41a2-b486-a89aa6c50ec0","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.08853","last_updated":"2026-05-09T10:05:22Z","snapshot_observed_at":"2026-08-03T05:44:03.275032Z","submitted_at":"2026-05-09T10:05:22Z","title":"Architecture, Not Scale: Circuit Localization in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T02:19:23.901130Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.08853"},"observation_digest":"sha256:d8dad73fd488c6b5d1131de2202310c8b2d41c2b225db02a2ee52ad764532b75","observation_id":"b8a59202-11fd-4fe6-8ee4-3e64790d516c","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.09195","last_updated":"2026-05-09T22:27:31Z","snapshot_observed_at":"2026-07-29T22:50:26.989270Z","submitted_at":"2026-05-09T22:27:31Z","title":"The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T01:55:32.734498Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.09195"},"observation_digest":"sha256:9f86eec549c1506793dd1ee26199a3ea77aa674c2e2ddcb49debd21ed880f0b4","observation_id":"70994fb7-94ea-4d5d-96c8-85c819f99643","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.09881","last_updated":"2026-05-11T02:11:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T02:11:47Z","title":"Dissecting Jet-Tagger Through Mechanistic Interpretability","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:09.296991Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.09881"},"observation_digest":"sha256:83ec480437a44663dc3692827632b4534c1bbf854cd10e32f43482b13f004433","observation_id":"2e2b1232-1b81-4600-84a8-3288a850731b","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.10504","last_updated":"2026-05-11T13:01:12Z","snapshot_observed_at":"2026-07-06T23:22:28.318343Z","submitted_at":"2026-05-11T13:01:12Z","title":"Learning Less Is More: Premature Upper-Layer Attention Specialization Hurts Language Model Pretraining","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T04:12:20.784347Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.10504"},"observation_digest":"sha256:1aee870373de0e33a9c461dc80252c55bb2a8210c8fa55d55beb02fa370e23c5","observation_id":"e30a75e0-8f51-4920-8f12-ef35c4eeb491","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.12207","last_updated":"2026-05-12T14:46:00Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T14:46:00Z","title":"Not How Many, But Which: Parameter Placement in Low-Rank Adaptation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-13T06:13:55.497799Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.12207"},"observation_digest":"sha256:4751861dd8dbb5259356bfa193753b2657bde80f8fd69ec2ca066a46c5ef0df2","observation_id":"6701c411-84e5-4ab4-b5f3-a6b8f4729de6","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.12299","last_updated":"2026-05-12T15:52:30Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:52:30Z","title":"GKnow: Measuring the Entanglement of Gender Bias and Factual Gender","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-13T04:50:43.547037Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.12299"},"observation_digest":"sha256:a01a469fa169154a3ddc8031290ffc356d60dbdc9c90da1b6f057ecfe35ecd69","observation_id":"ba5cb654-c967-4782-a1b5-f4f2a2ad089c","resolution":{"observed_at":"2026-05-13T17:13:51.588363Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.12809","last_updated":"2026-05-12T23:01:29Z","snapshot_observed_at":"2026-07-06T23:24:27.821980Z","submitted_at":"2026-05-12T23:01:29Z","title":"Correcting Influence: Unboxing LLM Outputs with Orthogonal Latent Spaces","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-14T20:17:01.224864Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.12809"},"observation_digest":"sha256:b1296d80d06c21ded7bbca3a4aeacdb00dc9d8e4ead702071e3b1a8166df9038","observation_id":"144bb3e7-cbed-4722-99e3-b7f307725fff","resolution":{"observed_at":"2026-05-14T20:17:55.505913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.13625","last_updated":"2026-05-13T14:52:40Z","snapshot_observed_at":"2026-08-10T21:06:03.819596Z","submitted_at":"2026-05-13T14:52:40Z","title":"How to Interpret Agent Behavior","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-14T18:23:25.269217Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.13625"},"observation_digest":"sha256:68efa2e95cb575eb0f81f91109ee60827c43c54d88bc4f2975c83605660d1368","observation_id":"df8da93c-ed81-44b9-bbf3-ef552741e46c","resolution":{"observed_at":"2026-05-14T18:27:35.915812Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.15164","last_updated":"2026-05-14T17:54:28Z","snapshot_observed_at":"2026-08-02T22:54:03.046548Z","submitted_at":"2026-05-14T17:54:28Z","title":"Position: Behavioural Assurance Cannot Verify the Safety Claims Governance Now Demands","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:04.274840Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.15164"},"observation_digest":"sha256:0636823eeeea85ad5420207861d470e0a73683d47ac95cb60578a79653501b31","observation_id":"a254d540-c15f-4cb6-bff0-884c2fcae2d8","resolution":{"observed_at":"2026-06-30T20:55:03.906712Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.17493","last_updated":"2026-05-17T15:04:15Z","snapshot_observed_at":"2026-08-04T11:32:13.622858Z","submitted_at":"2026-05-17T15:04:15Z","title":"Beyond Linear Superposition: Discovering Climate Features in AI Weather Models with KAN-SAE","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T14:48:03.631853Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.17493"},"observation_digest":"sha256:1ba5a3c6ec0e1db7d1fa8d86ab266871e55786770133a20bdce174fa87d46509","observation_id":"7a215416-a70c-4cab-a9be-a0aead2162ef","resolution":{"observed_at":"2026-05-20T14:48:23.205344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.19250","last_updated":"2026-05-19T01:47:53Z","snapshot_observed_at":"2026-07-06T23:30:02.207108Z","submitted_at":"2026-05-19T01:47:53Z","title":"Causal Evidence for Attention Head Imbalance in Modality Conflict Hallucination","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T06:25:43.369455Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.19250"},"observation_digest":"sha256:f388abddda5602b8ffb457cc519082e606edb5caf30ea3d500a33f2dbfb13eb6","observation_id":"fad22ae8-4744-45ba-a445-697e11bd43c6","resolution":{"observed_at":"2026-05-20T06:28:05.509681Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.21770","last_updated":"2026-05-20T22:06:08Z","snapshot_observed_at":"2026-08-02T18:47:19.614133Z","submitted_at":"2026-05-20T22:06:08Z","title":"Manifold-Guided Attention Steering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T09:14:12.029680Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.21770"},"observation_digest":"sha256:7ea74ce2b2a3f1bd8e136f92bd0052940c92aff654356b22362e2d83df96ebd3","observation_id":"d0b69103-8ec1-4b6f-a902-5c481152ec00","resolution":{"observed_at":"2026-05-22T09:14:45.333190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.22462","last_updated":"2026-05-21T13:25:16Z","snapshot_observed_at":"2026-07-06T23:32:49.530788Z","submitted_at":"2026-05-21T13:25:16Z","title":"From Correlation to Cause: A Five-Stage Methodology for Feature Analysis in Transformer Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T06:56:18.332754Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.22462"},"observation_digest":"sha256:6ba58dbd1a9c76e3cc1efa92c587b2a5dbb146b4ef336d25b174f53593e72ea3","observation_id":"4ecd92ed-d6ef-4ffd-8726-637478f30ca8","resolution":{"observed_at":"2026-05-22T07:01:11.963153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.25225","last_updated":"2026-06-11T16:48:48Z","snapshot_observed_at":"2026-08-05T03:30:45.468471Z","submitted_at":"2026-05-24T19:26:25Z","title":"Transformer Field Theory: A Response-Theoretic Approach to Mechanistic Interpretability","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T11:58:53.868902Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.25225"},"observation_digest":"sha256:e6c652e6c65cc0d6f57756c18d5dbd17b3c9ffe3f97a7f202a1c8da3b47466b3","observation_id":"c25b2f2a-f7fb-4b4f-a9eb-49ae70c531fa","resolution":{"observed_at":"2026-06-30T12:04:38.219967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.25427","last_updated":"2026-05-25T04:58:23Z","snapshot_observed_at":"2026-07-06T23:35:21.734804Z","submitted_at":"2026-05-25T04:58:23Z","title":"Binding Visual Features Point by Point","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:44.793896Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.25427"},"observation_digest":"sha256:0765be5631b866817fff844a4b280a9e38d6378d9ccb504dab2cc98658782258","observation_id":"318a0fc9-99c2-44c0-a366-d59510d6a87f","resolution":{"observed_at":"2026-06-29T23:44:03.323191Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.27033","last_updated":"2026-05-26T13:55:08Z","snapshot_observed_at":"2026-08-06T04:40:28.567525Z","submitted_at":"2026-05-26T13:55:08Z","title":"Tracing Computation Density in LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T18:20:33.014687Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.27033"},"observation_digest":"sha256:d315a40a7d5fd811f78d482bb847adb85656f5ffde767ca2946903ed424bf80b","observation_id":"fabec0ee-ae7b-4e8e-a546-cf076f665328","resolution":{"observed_at":"2026-06-29T18:23:50.638460Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2605.29901","last_updated":"2026-05-28T13:23:13Z","snapshot_observed_at":"2026-08-08T08:54:10.774577Z","submitted_at":"2026-05-28T13:23:13Z","title":"Dissecting the Black Box: Circuit-Level Analysis of LLM Vulnerability Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T07:09:12.429033Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2605.29901"},"observation_digest":"sha256:02fc67c71a833a710fc720f655934d76eb43ad48e5f82c422c578f83b271ffd5","observation_id":"6f718af9-9b38-4c18-a23d-36789c7c6ed3","resolution":{"observed_at":"2026-06-29T07:13:16.594466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2606.01914","last_updated":"2026-06-01T08:49:47Z","snapshot_observed_at":"2026-08-07T09:22:05.649025Z","submitted_at":"2026-06-01T08:49:47Z","title":"Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T14:29:34.220222Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2606.01914"},"observation_digest":"sha256:cc9b3868a561c8f4cb4454e06dec598b34a8a6fb0eb1580ba2353114781f1756","observation_id":"9d4c1b38-3e18-4c41-9c1e-be69f6bb65e6","resolution":{"observed_at":"2026-07-01T23:16:24.594953Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2606.03280","last_updated":"2026-06-05T14:15:49Z","snapshot_observed_at":"2026-07-06T23:43:31.629075Z","submitted_at":"2026-06-02T07:46:01Z","title":"A Negative Result on Cross-Model Activation Transfer in a Pythia Multi-Hop Setting","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T09:52:58.807254Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2606.03280"},"observation_digest":"sha256:2384cdc6b6b229dbc1310a9bf293ff8c54c05348c930a3e9535f0e97aa3656fc","observation_id":"63e274be-e5d8-4e06-b022-a065b5ec8a76","resolution":{"observed_at":"2026-07-02T03:36:29.800981Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2606.03879","last_updated":"2026-06-02T16:46:42Z","snapshot_observed_at":"2026-08-07T17:02:56.856514Z","submitted_at":"2026-06-02T16:46:42Z","title":"Beyond Encoder Accumulation: Measuring Encoder Roles in Multi-Encoder VLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T11:08:36.451147Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2606.03879"},"observation_digest":"sha256:16e6f002aa841cb4617c6c1fa0c8a39ae1dbbf0689138c4fa58d2d7573852729","observation_id":"2c07424f-6a92-4b99-a595-ceb5bbfca97d","resolution":{"observed_at":"2026-07-02T02:16:26.475224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2606.05165","last_updated":"2026-06-03T17:59:36Z","snapshot_observed_at":"2026-08-03T01:52:33.394210Z","submitted_at":"2026-06-03T17:59:36Z","title":"STRIDE: Training Data Attribution via Sparse Recovery from Subset Perturbations","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-28T07:39:16.719604Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2606.05165"},"observation_digest":"sha256:3c509c33b98a94b37cbf70492217ba647e8ba8acab842716304456d83bcffe42","observation_id":"0bb5532a-d2b0-472f-aaa0-dfc50bd77957","resolution":{"observed_at":"2026-07-02T06:06:41.392147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2606.05378","last_updated":"2026-06-03T19:27:07Z","snapshot_observed_at":"2026-08-02T19:05:32.019530Z","submitted_at":"2026-06-03T19:27:07Z","title":"Pattern Selectivity is Not Task-Causal Structure: A Cross-Architecture Mechanistic Study of Composed-Task Circuits in 1B-Class Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T07:07:58.170765Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2606.05378"},"observation_digest":"sha256:948fe33bf4587b1e6c32cc92e5db6bcbb6a326de42f15e40bd2bbd42bbfa4ccf","observation_id":"367da854-a7ea-46fe-a2d0-b520df8d094b","resolution":{"observed_at":"2026-07-02T07:06:44.456142Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2606.06333","last_updated":"2026-06-04T16:08:25Z","snapshot_observed_at":"2026-08-02T07:30:20.394633Z","submitted_at":"2026-06-04T16:08:25Z","title":"Subspace-Aware Sparse Autoencoders for Effective Mechanistic Interpretability","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T02:07:18.198225Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2606.06333"},"observation_digest":"sha256:5afd4661b5410a522ce38f4d87b4f38668dbfa74564552066ac495e21202de43","observation_id":"0390f0d2-67fb-423e-ac7e-3417df484cc7","resolution":{"observed_at":"2026-06-28T02:11:29.080954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2606.07414","last_updated":"2026-06-05T16:06:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-05T16:06:47Z","title":"Sparsely gated tiny linear experts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T22:49:49.299925Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2606.07414"},"observation_digest":"sha256:749a73800593419ea16e5a0d5f91a5418d65014bd1302301f3c9ac3aba3f5f03","observation_id":"fe30d291-3b8f-4a69-8570-afdda8478029","resolution":{"observed_at":"2026-07-02T16:17:09.306780Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2211.00593/citation-record","integrity":"/paper/2211.00593/integrity","json":"/paper/2211.00593/citation-record.json","paper":"/paper/2211.00593"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners","venue":null,"work_id":"63429aa6-0c8a-41f5-ac95-3960dadf41a5","year":1901},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:2f317d26db440a190fb06be275a1d22ff59325eaff42dcd0c0152dcbd30ac4f4","observation_id":"98497d3c-b10e-453e-bf8d-596debd99853","resolution":{"observed_at":"2026-05-13T17:13:51.545755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A literature survey of recent advances in chatbots","venue":null,"work_id":"a70b48fd-0211-42f2-881e-b610c0ba0e31","year":2022},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:ec49daa14888be61bd736d6fe320d4c2b3f785d0c660e7f36e029590ba5999bd","observation_id":"f08b166d-a709-4013-bfc6-bfdd73254e67","resolution":{"observed_at":"2026-05-13T17:13:51.549189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A mathematical framework for transformer circuits","venue":null,"work_id":"29a1e678-f416-4561-b3dd-8b577be8fbd2","year":2021},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:1c9e8098221e3f89129f0444aec7ba2a91d1ddd3a01dd9b7b002f505bef87563","observation_id":"37bfacbe-9204-4eb2-bea1-7d8fd4956da3","resolution":{"observed_at":"2026-05-13T17:13:51.550951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Causal abstractions of neural networks","venue":null,"work_id":"39190767-1184-4c7f-8e56-02bea9191c0f","year":2021},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:467bc2d36c8d9c41cb5dfdb9e0a1e25077e60280041874592275473a56ad3ef7","observation_id":"279f0de2-acd0-49f9-a6b9-22cbb44214f2","resolution":{"observed_at":"2026-05-13T17:13:51.552747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05862","last_updated":"2022-09-20T16:49:56Z","snapshot_observed_at":"2026-08-10T17:14:06.401883Z","submitted_at":"2022-06-13T00:22:50Z","title":"X-Risk Analysis for AI Research","version":7},"cited_work":{"arxiv_id":"2206.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.05862","snapshot_observed_at":"2026-07-03T08:07:45.450496Z","title":"X-Risk Analysis for AI Research","venue":null,"work_id":"bf80b5c8-e3d0-4a74-98cc-d60d4b26fa3d","year":2022},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/2206.05862","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:7b8d9fe632aa7888e36ed6e39c6943d03dd4db5dd3556b0b8a0ed5294231cda6","observation_id":"9f534c03-5115-4764-b4f2-8f1ad9c98b99","resolution":{"observed_at":"2026-05-13T17:13:51.482305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Natural language descriptions of deep visual features","venue":null,"work_id":"ca082070-5f31-41d0-a0b3-9fe4f110992f","year":2021},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:29dac04a77c872b3824597d0570859d0e61f66f88c0e16da20f9050a5fa40114","observation_id":"2c858597-b301-4dc6-906d-460d218ead17","resolution":{"observed_at":"2026-05-13T17:13:51.554390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are sixteen heads really better than one? Advances in neural information processing systems, 32","venue":null,"work_id":"7f0acc10-07fd-4b88-9242-210dc5960534","year":2019},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:92f70d256665c7fec08dba843d381e59c81e80935866a6b8ff53fce90f69f06f","observation_id":"a30b5c23-be6f-47a9-a6e5-036ea59af1d5","resolution":{"observed_at":"2026-05-13T17:13:51.556608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Compositional explanations of neurons","venue":null,"work_id":"59065556-d35b-44ec-835f-038afb38a659","year":2020},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:9e6c371e884f7ea27d7ffd9d9f64b3661037932cd653110d292176c10fec02e6","observation_id":"e7b7134a-9388-4c94-94a5-4c1dc9906e5f","resolution":{"observed_at":"2026-05-13T17:13:51.558173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A mechanistic interpretability analysis of grokking","venue":null,"work_id":"23bae3ec-6fdb-44d3-938f-241e2a4d7d2b","year":2022},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:f79e970d4b416d517afd3471dbd433d5c432ea40d356f1e6996c35e0522cdffb","observation_id":"dd0c2e2d-b8be-4964-881f-6ac73b41eef2","resolution":{"observed_at":"2026-05-13T17:13:51.559969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mechanistic interpretability, variables, and the importance of interpretable bases","venue":null,"work_id":"6ce50e84-296a-4700-894f-b9d79c5a0948","year":2022},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:cf71838fe6c5988aa01b266a8939d5819403db690250d28ac9ba7651b022f040","observation_id":"403d4df1-c521-44a9-b835-c04f501e2754","resolution":{"observed_at":"2026-05-13T17:13:51.561992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.23915/distill.00024.001","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distill , year =","venue":"Distill","work_id":"baa301ce-c6dc-4579-9bd6-78d2f7cdf765","year":2020},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:f39535795ed56c781f2465d8d7aa19be17999214f0cdf0cf7f5e70619c8f75ca","observation_id":"f8d5f64c-cf8f-4a71-8f2a-54eba66d1f20","resolution":{"observed_at":"2026-05-13T17:13:51.448603Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-24T13:23:33.70929+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T13:23:33.70929+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"d32fd3de-b200-47e1-823f-c47e9019f299","year":2019},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:f3fe553b8f7a457310259687a8b044f35f0263b9e5b52fd42e442831ea38aae5","observation_id":"f436f922-3967-4911-80db-da477de89f2e","resolution":{"observed_at":"2026-05-13T17:13:51.564180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.13243","last_updated":"2023-08-18T21:14:43Z","snapshot_observed_at":"2026-07-06T13:35:43.467393Z","submitted_at":"2022-07-27T01:59:13Z","title":"Toward Transparent AI: A Survey on Interpreting the Inner Structures of Deep Neural Networks","version":6},"cited_work":{"arxiv_id":"2207.13243","doi":"10.48550/arxiv.2207.13243","metadata_source":"pith","pith_arxiv_id":"2207.13243","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Toward Transparent AI: A Survey on Interpreting the Inner Structures of Deep Neural Networks , shorttitle =","venue":"cs.LG","work_id":"36d62a11-c9ef-409d-a782-eee5af418131","year":2022},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/2207.13243","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:481151a9e750b1b5203aca5a3f8852ec6790b1076ca9c4157979d2f29f755df3","observation_id":"aca4400f-afb2-45ac-a7bb-c249b2619fb9","resolution":{"observed_at":"2026-05-13T17:13:51.504124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"2c5e81ad-a48a-4163-b187-7559afdb9d60","year":2017},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:094a6e9ed49493840f8274d7b5be83512c986fd9f6a379d85a3e87be13b2b2cd","observation_id":"a96bd0e0-3982-45cb-93ba-5e824f313142","resolution":{"observed_at":"2026-05-13T17:13:51.566263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Investigating gender bias in language models using causal mediation analysis","venue":null,"work_id":"99d37e3e-6392-4e54-a181-e46e1bdbbb16","year":2020},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:d05ed0b14d43f7aa670c4ad2b800a4e7a62b1408d16a800a1e3240aa0cd15695","observation_id":"3169fad0-860b-48ac-b990-01b8e1e848e4","resolution":{"observed_at":"2026-05-13T17:13:51.568214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":"2206.07682","doi":"10.48550/arxiv.2206.07682","metadata_source":"pith","pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emergent Abilities of Large Language Models","venue":"cs.CL","work_id":"6ea3375b-837c-4640-a175-be7525aa3c6d","year":2022},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:1fad5a56ec23171b84a04397a730b936fa6673b1d308584b8a1c5d66dde9839e","observation_id":"d0cd3606-387a-4966-b84e-6cd3416991a9","resolution":{"observed_at":"2026-05-13T17:13:51.497753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-07T00:09:07.34152+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T00:09:07.34152+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shifting machine learning for healthcare from development to deployment and from models to data","venue":null,"work_id":"ba3210f2-a3ab-4751-96cf-6af9ebd3fa11","year":2022},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:e4b10679ac136c87c85c594e0133a905c35974c51aefbedc89025d960d1ce73d","observation_id":"4e3bd3c9-e00a-434a-a5a9-f123127dc550","resolution":{"observed_at":"2026-05-13T17:13:51.569974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06087","last_updated":"2021-06-22T05:40:01Z","snapshot_observed_at":"2026-08-03T08:43:53.459112Z","submitted_at":"2021-06-10T23:50:51Z","title":"Causal Analysis of Syntactic Agreement Mechanisms in Neural Language Models","version":3},"cited_work":{"arxiv_id":"2106.06087","doi":"10.48550/arxiv.2106.06087","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.06087","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Causal analysis of syntactic agreement mechanisms in neural language models","venue":"arXiv (Cornell University)","work_id":"7648b9fe-cdc0-40f3-bb55-209349331db8","year":2021},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/2106.06087","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:b0cb840f0409e894d72d6d6b5bc1861962a9fa7bcb61c091b8ba52a9378eb214","observation_id":"17f4ee92-3301-4a0c-8146-1327c7c89752","resolution":{"observed_at":"2026-05-13T17:13:51.442503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05950","last_updated":"2019-08-09T15:51:47Z","snapshot_observed_at":"2026-07-06T07:53:03.268985Z","submitted_at":"2019-05-15T05:47:23Z","title":"BERT Rediscovers the Classical NLP Pipeline","version":2},"cited_work":{"arxiv_id":"1905.05950","doi":"10.48550/arxiv.1905.05950","metadata_source":"arxiv_reference","pith_arxiv_id":"1905.05950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1905.05950 , year=","venue":"arXiv (Cornell University)","work_id":"47ec8f99-dad5-484e-bf9c-6fd2871df72b","year":2019},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/1905.05950","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:6b668ff2553cbd0669f7b1e1aeff4eac824fa479e1d89956e578f24c6662e2d7","observation_id":"2d3a1646-5ffe-4ddb-a530-9b526f550ba3","resolution":{"observed_at":"2026-05-13T17:13:51.446046Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 , subtitle =","venue":null,"work_id":"01c558b7-f9d4-4609-8db9-83ecffe6d420","year":2019},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:f218da05d18a223851e13a32d08ce6354a0256f055d54ddd8706545578f83f28","observation_id":"3d26bd71-74cf-4a5d-8c6c-369a06076975","resolution":{"observed_at":"2026-05-13T17:13:51.571557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.01444","last_updated":"2017-04-06T09:48:20Z","snapshot_observed_at":"2026-08-10T18:53:33.889403Z","submitted_at":"2017-04-05T14:20:28Z","title":"Learning to Generate Reviews and Discovering Sentiment","version":2},"cited_work":{"arxiv_id":"1704.01444","doi":"10.48550/arxiv.1704.01444","metadata_source":"pith","pith_arxiv_id":"1704.01444","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning to Generate Reviews and Discovering Sentiment","venue":"cs.LG","work_id":"3a589728-009a-467e-a1d9-ed3624e82dcb","year":2017},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/1704.01444","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:f3818d6bcda1c3275ab299a07f3d254e10a5e1da6856f5aa162878e922c894ba","observation_id":"bf0796bc-9d44-4fb9-8347-a1754cf14598","resolution":{"observed_at":"2026-05-13T17:13:51.452248Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00737","last_updated":"2021-06-01T19:23:20Z","snapshot_observed_at":"2026-08-09T19:52:58.456549Z","submitted_at":"2021-06-01T19:23:20Z","title":"Implicit Representations of Meaning in Neural Language Models","version":1},"cited_work":{"arxiv_id":"2106.00737","doi":"10.48550/arxiv.2106.00737","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.00737","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2106.00737 (2021)","venue":null,"work_id":"6cbe6e30-5d16-41f2-b489-16880d76c2fa","year":2021},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/2106.00737","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:c3f6358fa2ac2f76b72744d5874296323366ae49372c6aa3ce6639fe07fd7a2a","observation_id":"cd5c7a01-5b11-47d7-8b76-2285a6854c9a","resolution":{"observed_at":"2026-05-13T17:13:51.455778Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.07143","last_updated":"2021-04-14T22:04:48Z","snapshot_observed_at":"2026-07-06T10:59:45.440838Z","submitted_at":"2021-04-14T22:04:48Z","title":"An Interpretability Illusion for BERT","version":1},"cited_work":{"arxiv_id":"2104.07143","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.07143","snapshot_observed_at":"2026-07-02T12:46:57.379107Z","title":"arXiv preprint arXiv:2104.07143 , year=","venue":null,"work_id":"173e8a4d-408c-45b6-bdca-18f800578acb","year":2021},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/2104.07143","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:e50ac096d69d3ef54a0ce7ace8d68d4f73df526e8b769ad646b095c5f11c1d05","observation_id":"a175f726-d97d-4094-8d9e-db3489192e8d","resolution":{"observed_at":"2026-05-13T17:13:51.507126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p19-1452","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:57:06.622429Z","title":"Proceedings of the 57th Conference of the Association for Computational Linguistics","venue":"Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics","work_id":"a5d8023d-21a2-4ef7-b56a-fcf22613129e","year":2019},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:ae3c35323f57350955e91f59e8000ee58d145c53e1e8efe7f0d2a90a10160c06","observation_id":"7a387258-f02b-4a01-ae25-77cd1a6846ed","resolution":{"observed_at":"2026-05-13T17:13:51.458733Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-11T21:49:11.053571+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T21:49:11.053571+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"8319ab7d-1238-4874-b8c6-e6e332d80417","year":2022},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:ec57a53e77e28d69d985d9094d7e4641680cf605e126382f2dc30ab8a1c3bfd6","observation_id":"68a0559c-f58b-49cf-9553-2b7f506d0b5a","resolution":{"observed_at":"2026-05-13T17:13:51.573549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04301","last_updated":"2023-02-17T23:18:30Z","snapshot_observed_at":"2026-07-06T13:18:57.269780Z","submitted_at":"2022-06-09T06:30:17Z","title":"Unveiling Transformers with LEGO: a synthetic reasoning task","version":3},"cited_work":{"arxiv_id":"2206.04301","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04301","snapshot_observed_at":"2026-07-01T15:45:48.023940Z","title":"Unveiling T ransformers with LEGO : a synthetic reasoning task","venue":null,"work_id":"bdce0202-9a53-4ec3-be23-ee73b697f9e6","year":2022},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/2206.04301","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:6a340b8c2700e678b5bce47f9040591bef1da13621e23d3d73cf00b618c5eeb1","observation_id":"02091e11-3423-48e0-ae27-57225f28dfd2","resolution":{"observed_at":"2026-05-13T17:13:51.491461Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.08799","last_updated":"2023-01-15T21:53:00Z","snapshot_observed_at":"2026-08-10T04:33:41.770371Z","submitted_at":"2022-07-18T17:55:05Z","title":"Hidden Progress in Deep Learning: SGD Learns Parities Near the Computational Limit","version":3},"cited_work":{"arxiv_id":"2207.08799","doi":"10.48550/arxiv.2207.08799","metadata_source":"arxiv_reference","pith_arxiv_id":"2207.08799","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Information Processing Systems , year =","venue":"arXiv (Cornell University)","work_id":"92192172-5c98-475d-ab81-1f83e1a2d120","year":2022},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/2207.08799","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:8c0e6cfca0dc25f758b09c45b2a329f92dfe4de18f74901683aea3aff6f0105c","observation_id":"fbc2d07d-597a-42d0-9b66-0e56c0f3a6b1","resolution":{"observed_at":"2026-05-13T17:13:51.494465Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv , year=","venue":null,"work_id":"83476e15-6e45-416e-87da-6fe354a4185f","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:36c20cbbbd182af1d655c2e7f4ce245b33a29c164aa70787aa51683eaf409b3f","observation_id":"7f3fa369-c0d2-41a8-bb75-9482dfaf0adc","resolution":{"observed_at":"2026-05-13T17:13:51.575342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":"2209.11895","doi":"10.1145/3411763.3451760","metadata_source":"pith","pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In-context Learning and Induction Heads","venue":"cs.LG","work_id":"db2b0911-2758-4a2a-99dc-15b14b91bd5e","year":2022},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:0c272c121e19068ed31074f8389722369c32cd9a5a382cae3f4ec1af82a6510f","observation_id":"a4280cf2-37d2-4e9a-88ec-6d2c4dd77aa7","resolution":{"observed_at":"2026-05-13T17:13:51.501018Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-23T02:23:10.795052+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T02:23:10.795052+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Information , volume=","venue":null,"work_id":"72a55f82-f62b-431e-ad79-7d04a6594134","year":2022},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:2bc38f0c0dd26dba3548561d47bb238fe8ba7dfb34b19934286e7011556bfbfa","observation_id":"d0820cd9-5070-49fe-8f27-45396e23d4e7","resolution":{"observed_at":"2026-05-13T17:13:51.577082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nature Biomedical Engineering , pages=","venue":null,"work_id":"68fb0525-60ab-48d2-a6f0-d79c98add174","year":2022},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:40636747ef17e65c43fd29579d3b81ef025c54882346c34f93421ece39655e67","observation_id":"5d100709-e2bc-449b-963f-4322db7bd8d1","resolution":{"observed_at":"2026-05-13T17:13:51.578696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ArXiv , year=","venue":null,"work_id":"d9daf270-b220-4ae4-8d39-60324d07ccdc","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:4480bf23a20ebde23413ff116978fdcebac0c96bdc5fa4a8b3307abac8202ee1","observation_id":"63ae8442-2c60-4ab8-a8bd-741f909d8abd","resolution":{"observed_at":"2026-05-13T17:13:51.580503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13916","last_updated":"2022-06-16T21:12:42Z","snapshot_observed_at":"2026-07-06T11:52:19.105210Z","submitted_at":"2021-09-28T17:59:36Z","title":"Unsolved Problems in ML Safety","version":5},"cited_work":{"arxiv_id":"2109.13916","doi":"10.48550/arxiv.2109.13916","metadata_source":"pith","pith_arxiv_id":"2109.13916","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unsolved Problems in ML Safety","venue":"cs.LG","work_id":"a4b59a6c-1b80-4562-afd6-0e6d0126d3bc","year":2021},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/2109.13916","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:2b0daf92df97c461cc8dec170bb26be1abdbd289e864e96a02eb8a8ec39084c7","observation_id":"0f9dba28-98ec-4cc6-96b0-f2beed018285","resolution":{"observed_at":"2026-05-16T20:45:28.030299Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"7047514b-d3ad-49ae-bc49-c173908b0478","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:adbe81803dc62b5dc4585505acbba48959a9eabf6ff3b2319c75c9aea9d66943","observation_id":"83cfc6fa-cb3e-40e9-8621-b986875ff7cd","resolution":{"observed_at":"2026-05-13T17:13:51.582070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"a5244ca8-177d-43ce-a50c-b2407f5cd59a","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:f21acc076411caf084e6f647c59c8afe06c08cee4e639d1eb105aae45a027f9e","observation_id":"44a715b7-5696-4efb-bead-36a3fdf5c9d2","resolution":{"observed_at":"2026-05-13T17:13:51.583817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00737","last_updated":"2021-06-01T19:23:20Z","snapshot_observed_at":"2026-08-09T19:52:58.456549Z","submitted_at":"2021-06-01T19:23:20Z","title":"Implicit Representations of Meaning in Neural Language Models","version":1},"cited_work":{"arxiv_id":"2106.00737","doi":"10.48550/arxiv.2106.00737","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.00737","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2106.00737 (2021)","venue":null,"work_id":"6cbe6e30-5d16-41f2-b489-16880d76c2fa","year":2021},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/2106.00737","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:7b34f219b2351dba2affde68d7b52388b9de839e36e65c98abbb346eff62b7e2","observation_id":"0bd8dc7d-0387-4449-b96d-a2ae2a04cfad","resolution":{"observed_at":"2026-05-13T17:13:51.479376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":"dc3bd14e-50aa-454f-92ca-193b880e6beb","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:892e5e698bec435e41b0c143529c7220033268211634b34e6220f4568f88c41d","observation_id":"a1cb9589-f8aa-417a-9e46-03544b49338a","resolution":{"observed_at":"2026-05-13T17:13:51.585785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"c7d89452-3b0f-4446-917a-a9bc7e69fd9a","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:a1a575a1b5754dd91746d9f77d19871711906782d381d8af98bdd04854bb2ad8","observation_id":"91650fe7-4249-4906-8bf1-82e44e07705b","resolution":{"observed_at":"2026-05-13T17:13:51.587697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07483","last_updated":"2022-08-01T10:04:00Z","snapshot_observed_at":"2026-08-01T19:50:32.092983Z","submitted_at":"2021-10-14T15:57:07Z","title":"On the Pitfalls of Analyzing Individual Neurons in Language Models","version":3},"cited_work":{"arxiv_id":"2110.07483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.07483","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2110.07483 , year=","venue":null,"work_id":"743c0a5c-55ff-4203-8db9-4b310c1515f6","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/2110.07483","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:c9f2cc88df113fe4302ce640d18053c461edaf05512f3ec48f1a8d6ca0fa1851","observation_id":"602f23f7-0f08-449c-adc1-1ddda406da47","resolution":{"observed_at":"2026-05-13T17:13:51.467058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06087","last_updated":"2021-06-22T05:40:01Z","snapshot_observed_at":"2026-08-03T08:43:53.459112Z","submitted_at":"2021-06-10T23:50:51Z","title":"Causal Analysis of Syntactic Agreement Mechanisms in Neural Language Models","version":3},"cited_work":{"arxiv_id":"2106.06087","doi":"10.48550/arxiv.2106.06087","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.06087","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Causal analysis of syntactic agreement mechanisms in neural language models","venue":"arXiv (Cornell University)","work_id":"7648b9fe-cdc0-40f3-bb55-209349331db8","year":2021},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/2106.06087","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:dd2b52f1756e45170caed1b58e75fe0d67a5ff86d37d6efd58026f6a89075de0","observation_id":"2ee3c801-d141-4173-bcaa-57024fc6ff31","resolution":{"observed_at":"2026-05-13T17:13:51.473392Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ArXiv , year=","venue":null,"work_id":"358e7003-e902-413c-9508-000f690e9eab","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:074f051ca97b64645ba9f17f6b7cc7cd9071af8ab4bbcfc0badd22522c896980","observation_id":"88621bf4-43d0-4af1-a283-d2ae7a49a5bf","resolution":{"observed_at":"2026-05-13T17:13:51.509351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:16:04.245786Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"36e5c7fa-cf02-4d02-965c-999414b2b869","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:d85f08ce9ecb9442dca8d7ebb18cb19cd90cea5fe9c1b752ff49ab2fc5a50445","observation_id":"047ba2cb-c305-4d86-96f3-3e6a46377144","resolution":{"observed_at":"2026-05-13T17:13:51.511277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.13243","last_updated":"2023-08-18T21:14:43Z","snapshot_observed_at":"2026-07-06T13:35:43.467393Z","submitted_at":"2022-07-27T01:59:13Z","title":"Toward Transparent AI: A Survey on Interpreting the Inner Structures of Deep Neural Networks","version":6},"cited_work":{"arxiv_id":"2207.13243","doi":"10.48550/arxiv.2207.13243","metadata_source":"pith","pith_arxiv_id":"2207.13243","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Toward Transparent AI: A Survey on Interpreting the Inner Structures of Deep Neural Networks , shorttitle =","venue":"cs.LG","work_id":"36d62a11-c9ef-409d-a782-eee5af418131","year":2022},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/2207.13243","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:f45c3b45ca7b6c00fa02faa008369862eba704477ac37a7d27db8c229eef92b5","observation_id":"c7072732-3db9-4ae0-b905-d61d79902e7f","resolution":{"observed_at":"2026-05-13T17:13:51.437696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.02535","last_updated":"2023-12-24T23:11:19Z","snapshot_observed_at":"2026-08-10T04:19:02.056520Z","submitted_at":"2022-09-06T14:36:57Z","title":"Analyzing Transformers in Embedding Space","version":3},"cited_work":{"arxiv_id":"2209.02535","doi":"10.48550/arxiv.2209.02535","metadata_source":"pith","pith_arxiv_id":"2209.02535","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Preprint","venue":"cs.CL","work_id":"c380335a-7738-461a-b4c3-a818f55ef3ea","year":2022},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/2209.02535","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:0b45817bfe92ac24ff2e6bee196e7d475fe975dc7229a9b337d078a60023f3f4","observation_id":"ffe00a29-866d-49e0-b687-5fcbbec3926f","resolution":{"observed_at":"2026-05-13T17:13:51.476307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14913","last_updated":"2021-09-05T17:32:27Z","snapshot_observed_at":"2026-08-07T23:50:29.977330Z","submitted_at":"2020-12-29T19:12:05Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","version":2},"cited_work":{"arxiv_id":"2012.14913","doi":"10.18653/v1/2021.emnlp-main.446","metadata_source":"pith","pith_arxiv_id":"2012.14913","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","venue":"cs.CL","work_id":"af95ed34-d603-4b8d-b5d5-582dd09e9938","year":2020},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/2012.14913","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:52a411328d27e7d3ebf99d34c0bbebeff866a58e14e8f4eaa0454e07d7122036","observation_id":"ea483a46-26a0-4d1f-82c7-33a2bd8eaa54","resolution":{"observed_at":"2026-05-13T23:35:50.837220Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-03T23:38:07.231994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T23:38:07.231994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.05262","last_updated":"2023-01-13T15:16:16Z","snapshot_observed_at":"2026-07-06T12:36:34.388460Z","submitted_at":"2022-02-10T18:59:54Z","title":"Locating and Editing Factual Associations in GPT","version":5},"cited_work":{"arxiv_id":"2202.05262","doi":"10.1088/0305-4470/12/11/017","metadata_source":"pith","pith_arxiv_id":"2202.05262","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Locating and Editing Factual Associations in GPT","venue":"cs.CL","work_id":"76e1af45-4ec0-480a-a37a-3287197ded39","year":2022},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/2202.05262","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:20860deb9a78dfc6e3d6d6aeb043def918533bc8cbfe744c0d0d8aae1aeebbf9","observation_id":"3ec52625-53b6-4a57-98cb-bfecf08c22ed","resolution":{"observed_at":"2026-05-16T09:58:57.694057Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distill , year =","venue":null,"work_id":"b984e820-06d9-46a8-9fa3-0a95ebec0a9f","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:d2fbcfa3617e8812d09f89637d4ade50278f8fea7105672554720a85f11c077e","observation_id":"2eeb5839-af2f-4a12-b879-b8301d1766ea","resolution":{"observed_at":"2026-05-13T17:13:51.513258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:07:05.804778Z","title":"Scaling Learning Algorithms Towards","venue":null,"work_id":"bb2761cc-98d0-411b-92f6-803773d64460","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:ede0812e652fa7954ddd7eb72336636b7c9f4b1aed3165f6369eaeb8a274e501","observation_id":"aa4caf6d-a2c5-4beb-9462-bd4c3efeed6d","resolution":{"observed_at":"2026-05-13T17:13:51.515215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:07:05.766846Z","title":"and Osindero, Simon and Teh, Yee Whye , journal =","venue":null,"work_id":"0a5921e3-ac4e-46f1-85ae-866119a87be0","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:16ef33db238887f72a5c615079767bc144b8e98d174926d1e739d128caaf156f","observation_id":"0bb6b7e6-a66e-430a-84ca-5f5a148e293f","resolution":{"observed_at":"2026-05-13T17:13:51.517180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T21:57:45.913036Z","title":"2016 , publisher=","venue":null,"work_id":"cf0899e0-53ee-4591-aae4-f38fa5ac12ad","year":2016},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:845b709153b94ed3b849c48c2a025652a86c72b2e3ebef37982131d818adc0ec","observation_id":"c4d53185-b7e1-4f5e-a6d2-c3c023af842a","resolution":{"observed_at":"2026-05-13T17:13:51.519294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"93c2f998-c721-4a6c-b412-54e0215ffc0a","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:ee36238a2e15efd8261d6abfe03c4a44a942f67ca98540c1b6e82b5c2cb60174","observation_id":"25fd0f4f-fec7-4df4-9f3a-f64fef9fc1cc","resolution":{"observed_at":"2026-05-13T17:13:51.521096Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T11:32:21.990690Z","title":"2021 , journal=","venue":null,"work_id":"ffb16516-de02-48a9-8273-a7f486550436","year":2021},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:7bbbe8b02eaff08879a8ab066817ff2f002f1e5557c1e1d90bd97428603c58c8","observation_id":"62c4ebf3-4e48-4c0a-9285-de5df982d558","resolution":{"observed_at":"2026-05-13T17:13:51.523060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"68d645c8-a558-433b-99b7-1ea905e46bd0","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:4b544cf1275926104c5fe1a50b6a1ba0cf5a8588dff12b1d4ab68befe0243421","observation_id":"c0987cb3-bed0-4b35-99b5-fc5ddbc65541","resolution":{"observed_at":"2026-05-13T17:13:51.524818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , editor=","venue":null,"work_id":"782efd70-72b2-4b26-99de-e941e20bd607","year":2021},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:09aec4de28963c1af5926a9b28425a51ccbbe133f0a9f494bf0049ddf9f5a00a","observation_id":"f4af84f0-fff2-4cdd-8fff-2ac8df776418","resolution":{"observed_at":"2026-05-13T17:13:51.526724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , description =","venue":null,"work_id":"82b73205-1736-41eb-a970-abecffdd312f","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:3f5e17e4b54bc040f6df1642b0e04d9ff122ddb83c30dc7b0dc5f5f158b9f00c","observation_id":"b18e8659-7b93-4b86-9abe-7341cee8e46c","resolution":{"observed_at":"2026-05-13T17:13:51.528723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:37:03.657431Z","title":"Language Models are Few-Shot Learners , url =","venue":null,"work_id":"518a19dc-59e5-4fa9-b31b-b2c1f0d6676c","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:0401f63252c452dafcf7b53b22867b3aaebfc9c2d2b421ca874e8c50ad5bcf33","observation_id":"0cc76915-2cdf-4107-bcab-6983442b219a","resolution":{"observed_at":"2026-05-13T17:13:51.530521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:06:59.872326Z","title":"Distill , year =","venue":null,"work_id":"8c2aad41-d483-4550-bd4c-59f3b2372ae7","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:d262bee518997d47e6f2a0c1be3f2cdcb5071504c3a880d876b6617126affd10","observation_id":"5991bd5f-0b1f-47cf-b598-1d91be5347a0","resolution":{"observed_at":"2026-05-13T17:13:51.532356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:08:02.288369Z","title":null,"venue":null,"work_id":"296b9de5-0258-4b29-832c-3abf245789ad","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:d221714282396212f0b2331375cdcb019839804054b950b37f5d9fd585f4c9a5","observation_id":"b0c57649-e011-4981-a64d-b48d65a89eb4","resolution":{"observed_at":"2026-05-13T17:13:51.534412Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sanity Checks for Saliency Maps , url =","venue":null,"work_id":"d3b283d2-c80f-478e-bd3e-4672e08f2738","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:134ad8d601068d546bd3208d865fe6e3b8dc279fa00a77e15fa055147bfba9da","observation_id":"c482a09a-28d9-46ee-ab98-a981aff2145a","resolution":{"observed_at":"2026-05-13T17:13:51.537065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GitHub repository , howpublished =","venue":null,"work_id":"84d46750-06fb-4d48-bf70-9f98ff3c13b4","year":2022},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:8ec5b0e1f68f55c05307964e486ba5657cdd46af68e5ba6f3ac5d67cf3192525","observation_id":"1d6857b2-b1d1-47bb-a8fd-528a0afa2dc3","resolution":{"observed_at":"2026-05-13T17:13:51.538794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"07ae05f0-6171-49c9-b55b-db39fa7685b6","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:ff1a0187f9e25c73611f781c9e7510eb35fce77c07a4b27780a107ce2b7572d9","observation_id":"81bd157d-3446-4f4c-bed0-dc027aa9cdbc","resolution":{"observed_at":"2026-05-13T17:13:51.540381Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"837a3678-7b9a-4b2b-8ddc-a69133c39d01","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:753b4d6e75bac7b1b94d74185640960d8b38a6cb157ac70699bf83392a0d4f78","observation_id":"15f9fe67-6c11-4ac6-ab47-fc57bdde959b","resolution":{"observed_at":"2026-05-13T17:13:51.542011Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.07532","last_updated":"2020-12-04T22:53:18Z","snapshot_observed_at":"2026-07-06T10:24:12.354087Z","submitted_at":"2020-12-04T22:53:18Z","title":"An overview of 11 proposals for building safe advanced AI","version":1},"cited_work":{"arxiv_id":"2012.07532","doi":"10.48550/arxiv.2012.07532","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.07532","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2020 , month = dec, journal =","venue":"arXiv (Cornell University)","work_id":"331fbd5f-e582-4340-ba99-b8d4df1a7778","year":2012},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"cited_paper":"/paper/2012.07532","citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:56a3b647547983e5f42ac1e62adfd5030f157534ed779f08196a7883e93ceb52","observation_id":"c49db7c6-8185-4259-95d3-9fff7cd80529","resolution":{"observed_at":"2026-05-13T17:13:51.461849Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n19-1357","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A ttention is not E xplanation","venue":null,"work_id":"80233ae8-2e9c-4369-9eaf-eb4fcfd7bebb","year":2019},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:fad79c4aad818f0da775239172b9bc841671ac4f456e1e8f3b8e163130d4ec76","observation_id":"06f26e36-fbd1-47b3-aeed-72ee147eb75d","resolution":{"observed_at":"2026-05-13T17:13:51.464099Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-22T07:23:16.029039+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T07:23:16.029039+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimal Brain Damage , url =","venue":null,"work_id":"d9a50a1b-991e-488a-a8b6-81139a63836f","year":null},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:a3f8ac6405cf839f988c9b174eb4cc9c74b8b773a7785836a14b7e85278476bc","observation_id":"878d1a18-f906-423c-ad06-2020161a1e8d","resolution":{"observed_at":"2026-05-13T17:13:51.543568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , journal=","venue":null,"work_id":"8c0fb377-037b-4d75-9d12-f4bc91b0b923","year":2022},"citing_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-13T17:13:51.408311Z"},"links":{"citing_paper":"/paper/2211.00593"},"observation_digest":"sha256:4bf7e6e60e0b9e459b5658af1d7a4ac3ccb6fb26c651325df1f4b8a7565a6b92","observation_id":"26bf98f5-93e2-45b6-8e3c-209314a33acc","resolution":{"observed_at":"2026-05-13T17:13:51.547451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":10,"parse_uncertain":1,"unresolved":4,"verified_exact":13,"verified_fuzzy":38},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 100 inbound Pith citation observations for arXiv:2211.00593."}