{"as_of":"2026-08-08T05:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6a31db7cef6b2d9d00b7714cda9931e36c9470ef16eab1b5a4779ae6715c9939","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:29:45.002961Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:04:06.753097Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-14T21:18:00.318407Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05166","snapshot_observed_at":"2026-08-04T10:04:06.753097Z","title":"Collacciani, C., Rambelli, G., and Bolognesi, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12229","last_updated":"2026-07-17T09:58:13Z","snapshot_observed_at":"2026-08-04T10:04:04.263399Z","submitted_at":"2025-10-14T07:31:29Z","title":"Analysing Moral Bias in Finetuned LLMs through Mechanistic Interpretability","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T10:04:06.753097Z"},"links":{"cited_paper":"/paper/2506.05166","citing_paper":"/paper/2510.12229"},"observation_digest":"sha256:278506184a60120a76576faea900b74e0cc29c25337d8b93af3d388d95716657","observation_id":"6a2ef335-0406-48f7-87ce-ccb2a49563dd","resolution":{"observed_at":"2026-08-04T10:04:06.753097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05166","snapshot_observed_at":"2026-08-04T09:08:58.465833Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective.arXiv preprint arXiv:2506.05166, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17256","last_updated":"2026-06-03T19:38:37Z","snapshot_observed_at":"2026-08-07T07:03:33.676041Z","submitted_at":"2025-10-20T07:43:53Z","title":"Explainability of Large Language Models: Opportunities and Challenges toward Generating Trustworthy Explanations","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-04T09:08:58.465833Z"},"links":{"cited_paper":"/paper/2506.05166","citing_paper":"/paper/2510.17256"},"observation_digest":"sha256:fc345e694905d68bae8525ba9f1d576f7d7e34692f9f31848bd747a26f06a72b","observation_id":"aa71bf9e-5315-4636-9005-727082cadf69","resolution":{"observed_at":"2026-08-04T09:08:58.465833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"cited_work":{"arxiv_id":"2506.05166","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05166","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dissect- ing bias in llms: A mechanistic interpretability perspective","venue":null,"work_id":"6c9eb716-e4ca-4bf4-8485-043a67bced39","year":2025},"citing_paper":{"arxiv_id":"2604.06052","last_updated":"2026-06-03T23:00:54Z","snapshot_observed_at":"2026-07-13T16:39:05.932007Z","submitted_at":"2026-03-29T22:06:21Z","title":"Attention, May I Have Your Decision? Localizing Generative Choices in Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T21:09:28.032659Z"},"links":{"cited_paper":"/paper/2506.05166","citing_paper":"/paper/2604.06052"},"observation_digest":"sha256:3d01cb985bab7492c64ec75911697c27ab4e641ff2ebf2cfcb8e8c79e46b56cf","observation_id":"75533c7d-b5d6-4745-b05d-4ef1be771b61","resolution":{"observed_at":"2026-05-14T21:18:00.320812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"cited_work":{"arxiv_id":"2506.05166","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05166","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dissect- ing bias in llms: A mechanistic interpretability perspective","venue":null,"work_id":"6c9eb716-e4ca-4bf4-8485-043a67bced39","year":2025},"citing_paper":{"arxiv_id":"2605.12299","last_updated":"2026-05-12T15:52:30Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:52:30Z","title":"GKnow: Measuring the Entanglement of Gender Bias and Factual Gender","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-13T04:50:43.547037Z"},"links":{"cited_paper":"/paper/2506.05166","citing_paper":"/paper/2605.12299"},"observation_digest":"sha256:8dff9dbed754042a62e57a53f0ec4f3444a6f31ecaa628694ee475f646aae566","observation_id":"d9d1ab2f-48c3-4301-a161-5a866954f5e9","resolution":{"observed_at":"2026-05-13T04:52:16.728754Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05166/citation-record","integrity":"/paper/2506.05166/integrity","json":"/paper/2506.05166/citation-record.json","paper":"/paper/2506.05166"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:44.768165Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.768165Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:4bca3ef171a5102e6f94acf6567a6dabd7b3bdb7a23e7fe843310dcb8705d6e3","observation_id":"3772aed2-6acb-4a08-a69c-7a524d6ca671","resolution":{"observed_at":"2026-08-07T10:29:44.768165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:44.778131Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.778131Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:c77577b30378eca971d29b5736724ee60d0986847230466dbeffa2919ab808d6","observation_id":"e06ece96-14c5-464e-834d-dc7ad7b63282","resolution":{"observed_at":"2026-08-07T10:29:44.778131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:44.786484Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.786484Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:9be30605ce71afc5b518b732e840effd3258b84b47087b15d3639bb188ebad03","observation_id":"39a7a4ba-b128-4fe7-9ec3-41d8d5ca2ab9","resolution":{"observed_at":"2026-08-07T10:29:44.786484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:45.572219Z","title":"Stubbersfield","venue":null,"work_id":"9ed037f0-765f-4758-9930-b976c95ba50f","year":2023},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.794108Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:d9292b1d0a1361a8b087cf2a5adadb581ef302911aaa18c2f7a60d21e9022ef8","observation_id":"fcfed349-23e6-4ade-af55-189c39c41452","resolution":{"observed_at":"2026-08-07T10:29:45.577242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:45.556295Z","title":"Science in the age of large language models","venue":null,"work_id":"bd77b106-0110-4256-b193-2829799695eb","year":2023},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.802060Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:5638abbbc6998ae9dee49f737762e64afa2768bb5874f89a256ff9d14ce8bf40","observation_id":"ec4dd6b9-8fdc-4074-b803-81dd46760915","resolution":{"observed_at":"2026-08-07T10:29:45.561584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06121","last_updated":"2016-06-20T13:58:45Z","snapshot_observed_at":"2026-07-06T05:00:35.763958Z","submitted_at":"2016-06-20T13:58:45Z","title":"Quantifying and Reducing Stereotypes in Word Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06121","snapshot_observed_at":"2026-08-07T10:29:44.807248Z","title":"Quantifying and reducing stereotypes in word embeddings","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.807248Z"},"links":{"cited_paper":"/paper/1606.06121","citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:7e453f05fb55bf021b16708e9b19dfeefd0c6f5748ea0e705a87735466dcd0ed","observation_id":"a5cd9e91-6d6b-45aa-9955-547dceb2b4b0","resolution":{"observed_at":"2026-08-07T10:29:44.807248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:45.539615Z","title":"Man is to computer programmer as woman is to homemaker? debiasing word embeddings","venue":null,"work_id":"54220aa2-5cfa-4446-a36f-75aa3ba247a1","year":2016},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.814121Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:0852c53bd3436f3976771b13d4861895e0ad382c82564106a04c61acab4a25f5","observation_id":"efc5a07e-07a5-4a00-aa93-730a8a3a21fd","resolution":{"observed_at":"2026-08-07T10:29:45.546048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12611","last_updated":"2023-10-19T09:39:21Z","snapshot_observed_at":"2026-07-06T16:35:31.876632Z","submitted_at":"2023-10-19T09:39:21Z","title":"Identifying and Adapting Transformer-Components Responsible for Gender Bias in an English Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12611","snapshot_observed_at":"2026-08-07T10:29:44.819483Z","title":"Identifying and adapting transformer-components responsible for gender bias in an english language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.819483Z"},"links":{"cited_paper":"/paper/2310.12611","citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:75ea78ba9488899958c821a8544c4b6bd13d9a0fa629748ab56c6de1045cca57","observation_id":"a4c7aba8-cf3a-4836-ba85-db936d2ed7c8","resolution":{"observed_at":"2026-08-07T10:29:44.819483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:44.827250Z","title":"Towards automated circuit discovery for mechanistic interpretability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.827250Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:788064b19466eeda7d1f9e10f2041bb25969cd557b717c7b0acf321a9c206cec","observation_id":"0b4416e2-4e1f-4970-a8e2-a74e81159d52","resolution":{"observed_at":"2026-08-07T10:29:44.827250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:45.515152Z","title":"Gallegos, Ryan A","venue":null,"work_id":"605f9f84-cefb-4699-bbd9-7aa9caa6f3dd","year":2024},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.834649Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:4c6c4bd1dc27431564f8265f8b824a12348430ab9deb765f04b2ab06d41787ce","observation_id":"66ee3a01-cf46-4cfe-ae0f-d8639c625ca7","resolution":{"observed_at":"2026-08-07T10:29:45.520197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:44.841155Z","title":"Causal abstractions of neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.841155Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:a056adbe5b9a0867506faaf9a83ef1677f3231b76b6e314f488721b1aba35937","observation_id":"358dd5c8-2a99-49ff-879c-add0019436fa","resolution":{"observed_at":"2026-08-07T10:29:44.841155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:45.489328Z","title":"Multimodal neurons in artificial neural networks","venue":null,"work_id":"602099ff-2733-4142-b5a7-1a1f91a59b78","year":2021},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.849885Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:d7511253d3f4543807945664d7359786aa490bda158d3917b27a745683cec1a4","observation_id":"9e3a3c02-6824-4351-b7b7-f80224012029","resolution":{"observed_at":"2026-08-07T10:29:45.494054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05969","last_updated":"2023-05-16T16:24:55Z","snapshot_observed_at":"2026-08-06T15:07:58.170997Z","submitted_at":"2023-04-12T16:46:43Z","title":"Localizing Model Behavior with Path Patching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05969","snapshot_observed_at":"2026-08-07T10:29:44.855872Z","title":"Localizing model behavior with path patching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.855872Z"},"links":{"cited_paper":"/paper/2304.05969","citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:7d42574a024e0dae6d648323e92f41e683c4a165357f79f829125f3f6da387b9","observation_id":"9b87056f-b8f7-4591-ae43-061283bd12ea","resolution":{"observed_at":"2026-08-07T10:29:44.855872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:45.472451Z","title":"C hat GPT based data augmentation for improved parameter-efficient debiasing of LLM s","venue":null,"work_id":"13ef977d-d2fc-4229-abf7-4d77e6e5645a","year":2024},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.861398Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:595a292917a2d628aeb0b28de6d175a37b698b5c0c6665708ac02565b803a9d2","observation_id":"97959f3a-54bf-4423-9ae8-50f52bc579d7","resolution":{"observed_at":"2026-08-07T10:29:45.477923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:45.454595Z","title":"distilbert-base-uncased-finetuned-sst-2-english (revision bfdd146), 2022","venue":null,"work_id":"7fc3b0c6-7c3c-4aa8-b6b1-433ba438f607","year":2022},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.867114Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:86c86878a9c2f13e4c8392124794c88b9d843304761f63204f3b5ebce50fddb3","observation_id":"78ad67f0-2229-4412-89cb-86380b5dfe33","resolution":{"observed_at":"2026-08-07T10:29:45.461355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:45.439158Z","title":"Shovon, and Gene Kim","venue":null,"work_id":"7494f3f6-5d3b-4a6c-be96-85a3bcb77489","year":2024},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.872004Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:7852b59db9c9db9ef134d845301edd59aba94c0d5ca867662c06612b421cf46d","observation_id":"16c76e03-68e9-4de1-9c26-09f0ed430230","resolution":{"observed_at":"2026-08-07T10:29:45.444004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:45.422803Z","title":"The impact of debiasing on the performance of language models in downstream tasks is underestimated","venue":null,"work_id":"c527f56b-b93f-446f-b8b5-1300851d540a","year":2023},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.877309Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:f34528e4a5f018ab15192d5a8019729cbb96978269ee0293198d3257c37a926c","observation_id":"c8a8dcd2-ad11-46bf-af70-bcb691cfda39","resolution":{"observed_at":"2026-08-07T10:29:45.428479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12865","last_updated":"2024-02-20T09:57:08Z","snapshot_observed_at":"2026-07-06T17:32:44.565172Z","submitted_at":"2024-02-20T09:57:08Z","title":"Backward Lens: Projecting Language Model Gradients into the Vocabulary Space","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12865","snapshot_observed_at":"2026-08-07T10:29:44.882463Z","title":"Backward lens: Projecting language model gradients into the vocabulary space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.882463Z"},"links":{"cited_paper":"/paper/2402.12865","citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:88bbb437739f497c24d65e434c1d885376d1f1cff98a5bd796bcbd8b346edd25","observation_id":"d0f81c75-6dd2-4d9a-9ad1-a456da917fd3","resolution":{"observed_at":"2026-08-07T10:29:44.882463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02080","last_updated":"2025-04-02T08:53:23Z","snapshot_observed_at":"2026-08-07T17:32:14.086206Z","submitted_at":"2025-03-03T21:59:01Z","title":"Linear Representations of Political Perspective Emerge in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02080","snapshot_observed_at":"2026-08-07T10:29:44.887656Z","title":"Linear representations of political perspective emerge in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.887656Z"},"links":{"cited_paper":"/paper/2503.02080","citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:ce434b77dd3de228298831c08bf23c7e7bdfa19fb757bc1bfc20244734c815d8","observation_id":"f1d12fa1-2227-4053-9c63-9e7738c4a344","resolution":{"observed_at":"2026-08-07T10:29:44.887656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:45.406476Z","title":"Gender bias and stereotypes in large language models","venue":null,"work_id":"732c289a-f2a4-4aa9-a26b-708f34eee3a3","year":2023},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.893433Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:e5f653bb6987dc464ce9b291c23626a02dbc57a2fee5eec485074ceb6ce038d7","observation_id":"02b82d85-c601-4faf-8e6c-89115c2f9854","resolution":{"observed_at":"2026-08-07T10:29:45.411906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:45.390655Z","title":"Sparse feature circuits: Discovering and editing interpretable causal graphs in language models","venue":null,"work_id":"778bf65a-737e-4e43-bbf5-97d5f693c64a","year":2025},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.899079Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:35fd2f84af642d2f97de89dba4822a07f2ca1cbdde52d9c2706e82550b682f45","observation_id":"791accd6-099f-44b4-a176-3cb679e6cb5b","resolution":{"observed_at":"2026-08-07T10:29:45.395503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:44.904438Z","title":"Locating and editing factual associations in gpt","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.904438Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:e9ea1db4a4f3b16545fbb6dc61564eb49ba7056c0e3f78d3cb4885689d3df108","observation_id":"bf25f2f4-f439-4c5c-bcda-4c18322f57d3","resolution":{"observed_at":"2026-08-07T10:29:44.904438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05217","last_updated":"2023-10-19T21:25:32Z","snapshot_observed_at":"2026-08-02T10:20:00.635719Z","submitted_at":"2023-01-12T18:56:49Z","title":"Progress measures for grokking via mechanistic interpretability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.05217","snapshot_observed_at":"2026-08-07T10:29:44.911625Z","title":"Progress measures for grokking via mechanistic interpretability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.911625Z"},"links":{"cited_paper":"/paper/2301.05217","citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:5c59d2f56c8e282975e3f540a2366fb9e39642a6505de7fd0a47cc2538528a5d","observation_id":"66267b2e-0673-442c-8df7-403023597f77","resolution":{"observed_at":"2026-08-07T10:29:44.911625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:45.364506Z","title":"Nationality bias in text generation","venue":null,"work_id":"fb6dc163-154f-448e-a5a1-1211f9a5792d","year":2023},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.917276Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:1266b4cbc0e1780fb48ffc3d56cbd4c92bda3806dc24e1ceed5467c74aa34b4d","observation_id":"bc928338-d764-4f8e-b201-698f2db36b69","resolution":{"observed_at":"2026-08-07T10:29:45.369665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:45.349049Z","title":"Biases in large language models: Origins, inventory, and discussion","venue":null,"work_id":"75c53894-ff85-4d7f-a9c4-fad6c6416f06","year":2023},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.921954Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:0b256e5494023ff1e6c8d23ac05bf91976f5840b9ea2df397df97c7fd6ad6e17","observation_id":"5ff7eb45-af62-47df-b791-e1d12b8744d1","resolution":{"observed_at":"2026-08-07T10:29:45.354171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:45.332132Z","title":"Mechanistic interpretability, variables, and the importance of interpretable bases","venue":null,"work_id":"33e15f35-e98e-4bad-8473-c0b08b50fc4b","year":2022},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.928556Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:72d51a976199c2413c4a6e8fd53113e95429d8834cd3b909086260e498b3bf8e","observation_id":"847c158c-e188-4133-9580-7cf2bc72b50b","resolution":{"observed_at":"2026-08-07T10:29:45.337615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:44.934254Z","title":"Zoom in: An introduction to circuits","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.934254Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:7c28eb034c00dd98dc219abeb067a4db21771bb86a0dfb7e504029529e1ab595","observation_id":"9d893a85-de54-4037-a156-6432b71273b4","resolution":{"observed_at":"2026-08-07T10:29:44.934254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:45.304987Z","title":"Gender biases in automatic evaluation metrics for image captioning","venue":null,"work_id":"f25c25c5-4da1-4031-9885-52ddae1c0021","year":2023},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.942668Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:1e3d382a892d71d97a7382d282120f3c3abb6e62f7cb602155c5c31c7e4ad1ff","observation_id":"135a2cb1-9ab0-45a4-b8d0-a2cede383089","resolution":{"observed_at":"2026-08-07T10:29:45.310828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:44.948884Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.948884Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:f5462b9c8faec88ecad43a987e5d108bcf1ec2935916d7aef675a63a3d54a3c2","observation_id":"0cf90f9a-f802-4b7f-a6c8-98685c9a04c0","resolution":{"observed_at":"2026-08-07T10:29:44.948884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"cs/0306050","last_updated":"2003-06-12T12:35:00Z","snapshot_observed_at":"2026-08-01T18:48:46.592760Z","submitted_at":"2003-06-12T12:35:00Z","title":"Introduction to the CoNLL-2003 Shared Task: Language-Independent Named Entity Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"cs/0306050","snapshot_observed_at":"2026-08-07T10:29:44.953942Z","title":"Introduction to the conll-2003 shared task: Language-independent named entity recognition","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.953942Z"},"links":{"cited_paper":"/paper/cs/0306050","citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:f51be21d16ee227e8c167e93d90e3fd236640a9cb4b823e23c64b8b90c1f705d","observation_id":"c7fc6bcb-07b2-4be0-9c34-a6165b7b0261","resolution":{"observed_at":"2026-08-07T10:29:44.953942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:45.279743Z","title":"Investigating gender bias in large language models through text generation","venue":null,"work_id":"e28e73da-fc72-4a82-a6c3-5f1aed65b68f","year":2024},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.958941Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:5322e823087fa3fe762c195eb6a25822a8068964a99322097a5b18c48802af2d","observation_id":"8fede18b-8b4e-4c08-b56d-f4889fe45dbd","resolution":{"observed_at":"2026-08-07T10:29:45.285328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10348","last_updated":"2023-11-20T11:31:16Z","snapshot_observed_at":"2026-08-05T12:23:04.102477Z","submitted_at":"2023-10-16T12:34:43Z","title":"Attribution Patching Outperforms Automated Circuit Discovery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10348","snapshot_observed_at":"2026-08-07T10:29:44.964417Z","title":"Attribution patching outperforms automated circuit discovery","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.964417Z"},"links":{"cited_paper":"/paper/2310.10348","citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:f07a7210b03a47f36c31d64c7807895967bc5736102df3ee4f9599a40c6e6d54","observation_id":"ef6e9eec-cce5-4f92-9452-88191b5a20b1","resolution":{"observed_at":"2026-08-07T10:29:44.964417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:45.261568Z","title":"Attribution patching outperforms automated circuit discovery","venue":null,"work_id":"2d0da481-d5dd-42d9-9fe8-6567a7881d24","year":2024},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.969616Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:493300248e3953c63e967b8c06cb077d7bfc5b9264ffd83586878bca50b2fd8c","observation_id":"7bb28f1c-b4cf-4562-bbc5-b74d822a9173","resolution":{"observed_at":"2026-08-07T10:29:45.268077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T10:29:44.976406Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.976406Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:ca19106b0084eb135076c460e26a6d99f04633d226c702d329e70fecfdf18e1b","observation_id":"6d1dcac1-8530-40f4-81a1-002bab812bb4","resolution":{"observed_at":"2026-08-07T10:29:44.976406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:44.981245Z","title":"Investigating gender bias in language models using causal mediation analysis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.981245Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:d61b9b603490b2072b80a585c1759e73827098e2031fddada084e19ef6ce6097","observation_id":"6e513610-6d58-4c62-a29b-0ed757fc2a36","resolution":{"observed_at":"2026-08-07T10:29:44.981245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-07T10:29:44.987123Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.987123Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:e99fbb5da440872187d72f1a60080a8ec97b4d32b752d29878268e0d9f3c2797","observation_id":"795ad8e5-0f9c-470e-b00f-ec2eff7fd9fe","resolution":{"observed_at":"2026-08-07T10:29:44.987123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.12471","last_updated":"2019-10-01T18:41:05Z","snapshot_observed_at":"2026-07-06T06:42:15.167440Z","submitted_at":"2018-05-31T13:52:06Z","title":"Neural Network Acceptability Judgments","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.12471","snapshot_observed_at":"2026-08-07T10:29:44.993184Z","title":"Neural network acceptability judgments","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.993184Z"},"links":{"cited_paper":"/paper/1805.12471","citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:66b805dc728c77966d6cae90fa1df0c6f852fcb96d49855e6953683b6ab6947b","observation_id":"26a9f4e5-0caa-4643-80c8-0ee51cb33f37","resolution":{"observed_at":"2026-08-07T10:29:44.993184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:44.998131Z","title":"Interpretability at scale: Identifying causal mechanisms in alpaca","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:44.998131Z"},"links":{"citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:eb40b57360eda82361cf39de4a870e1513526d44321c04a1c3a683695983daca","observation_id":"79525a86-b6b0-4a39-b3e9-d08605577f50","resolution":{"observed_at":"2026-08-07T10:29:44.998131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16042","last_updated":"2024-01-17T04:07:06Z","snapshot_observed_at":"2026-08-08T04:58:14.317234Z","submitted_at":"2023-09-27T21:53:56Z","title":"Towards Best Practices of Activation Patching in Language Models: Metrics and Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16042","snapshot_observed_at":"2026-08-07T10:29:45.002961Z","title":"Towards best practices of activation patching in language models: Metrics and methods, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:29:45.002961Z"},"links":{"cited_paper":"/paper/2309.16042","citing_paper":"/paper/2506.05166"},"observation_digest":"sha256:d2c34089e38d320f1102f0700d2ac2fe4994ae1ae4c211b1056ca240cd446628","observation_id":"45d1bd76-2e0c-4611-b48c-608a999fa62a","resolution":{"observed_at":"2026-08-07T10:29:45.002961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05166","last_updated":"2025-06-06T01:35:43Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T10:20:48.656603Z","submitted_at":"2025-06-05T15:43:34Z","title":"Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 4 inbound Pith citation observations for arXiv:2506.05166."}