{"as_of":"2026-08-14T01:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7c0eb801d6056ad2c7fda0862938405b1223ae6006f9721fd33ad0cb711ba888","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":45,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:21:24.356298Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-11T23:21:24.356298Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02605","last_updated":"2025-05-24T15:21:24Z","snapshot_observed_at":"2026-08-12T10:22:28.813828Z","submitted_at":"2024-12-03T17:34:50Z","title":"Interpretable Company Similarity with Sparse Autoencoders","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T23:21:24.356298Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2412.02605"},"observation_digest":"sha256:77e82342c5baca560f006f8da6a49d331dfce17dc7d4e1879904b17838aef932","observation_id":"93ba4555-f892-4879-b9d5-5d231f5d255a","resolution":{"observed_at":"2026-08-11T23:21:24.356298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-10T19:34:26.933320Z","title":"URL https://arxiv.org/abs/2410.13928","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09929","last_updated":"2025-04-02T13:20:40Z","snapshot_observed_at":"2026-08-13T18:12:49.685101Z","submitted_at":"2025-01-17T02:55:23Z","title":"Interpretable Steering of Large Language Models with Feature Guided Activation Additions","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T19:34:26.933320Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2501.09929"},"observation_digest":"sha256:b626a0ab245878eac956d1cebb65ef4821c3352ba5e306da5a845e9d06439940","observation_id":"bf2712e3-c2a5-4c81-826a-ad5abe3ff685","resolution":{"observed_at":"2026-08-10T19:34:26.933320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-10T14:02:12.790737Z","title":"arXiv:2410.13928 Piantadosi, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15740","last_updated":"2025-01-27T03:06:06Z","snapshot_observed_at":"2026-08-13T19:26:18.474749Z","submitted_at":"2025-01-27T03:06:06Z","title":"Propositional Interpretability in Artificial Intelligence","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:02:12.790737Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2501.15740"},"observation_digest":"sha256:5165198684f40ea13fae40cd128b85b9eccc28313b599c651cc2d9d94963943f","observation_id":"490207d3-85f9-47f7-8811-19206fda2a07","resolution":{"observed_at":"2026-08-10T14:02:12.790737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-10T11:58:37.143219Z","title":"Automatically interpreting millions of features in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16615","last_updated":"2025-01-29T19:18:45Z","snapshot_observed_at":"2026-08-13T13:13:06.261872Z","submitted_at":"2025-01-28T01:24:16Z","title":"Sparse Autoencoders Trained on the Same Data Learn Different Features","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T11:58:37.143219Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2501.16615"},"observation_digest":"sha256:f5a47d1ee3ba242e61ae43750e5ded28d4528f454baca3790cd808706f75524d","observation_id":"5b5e109b-dc60-434f-b6d1-9e38a1c46758","resolution":{"observed_at":"2026-08-10T11:58:37.143219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-10T01:04:57.206452Z","title":"Automatically interpreting millions of features in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18052","last_updated":"2025-05-21T21:35:16Z","snapshot_observed_at":"2026-08-10T00:48:44.785512Z","submitted_at":"2025-01-29T23:29:47Z","title":"SAeUron: Interpretable Concept Unlearning in Diffusion Models with Sparse Autoencoders","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T01:04:57.206452Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2501.18052"},"observation_digest":"sha256:9868d0adc5c8305525c05f2cf92f90ee956bb737c54668b94e2f98165a015dba","observation_id":"d3ae2cc8-7ddf-476a-8d9e-5e36b9d259a3","resolution":{"observed_at":"2026-08-10T01:04:57.206452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-09T22:24:53.884852Z","title":"Automatically interpreting millions of features in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18823","last_updated":"2025-02-12T18:35:15Z","snapshot_observed_at":"2026-08-11T02:09:42.977983Z","submitted_at":"2025-01-31T00:36:30Z","title":"Transcoders Beat Sparse Autoencoders for Interpretability","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T22:24:53.884852Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2501.18823"},"observation_digest":"sha256:cd5d3891ba9f4fc7e4db072f48bd554b9555ddab3ba22eafc1da0b8d2f41184b","observation_id":"8d3227a6-362c-4f27-9081-ab790f79be4d","resolution":{"observed_at":"2026-08-09T22:24:53.884852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-09T22:21:50.763556Z","title":"doi: 10.23915/distill.00024.001","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18838","last_updated":"2025-01-31T01:12:50Z","snapshot_observed_at":"2026-08-12T21:37:32.465541Z","submitted_at":"2025-01-31T01:12:50Z","title":"Partially Rewriting a Transformer in Natural Language","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T22:21:50.763556Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2501.18838"},"observation_digest":"sha256:dd3e20631c914a00f84790791dd1bd79fa31103f7c42d7afd2b51f8ac70152a7","observation_id":"d1a4bfb8-1bce-41ae-bf01-96cc4d3259b4","resolution":{"observed_at":"2026-08-09T22:21:50.763556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-09T16:58:44.732303Z","title":"Automatically interpreting millions of features in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01032","last_updated":"2025-02-03T03:54:41Z","snapshot_observed_at":"2026-08-10T06:32:02.689922Z","submitted_at":"2025-02-03T03:54:41Z","title":"Converting MLPs into Polynomials in Closed Form","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T16:58:44.732303Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2502.01032"},"observation_digest":"sha256:d760331dc2af4f3184e45480575368a626ce17fd57ec078d40e0439ce401dc88","observation_id":"7018977c-9838-49b4-badc-ba1620c36b4b","resolution":{"observed_at":"2026-08-09T16:58:44.732303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-08T11:42:07.609217Z","title":"Automatically Interpreting Millions of Features in Large Lan- guage Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07771","last_updated":"2025-02-11T18:55:57Z","snapshot_observed_at":"2026-08-13T09:22:58.255729Z","submitted_at":"2025-02-11T18:55:57Z","title":"Breaking Down Bias: On The Limits of Generalizable Pruning Strategies","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T11:42:07.609217Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2502.07771"},"observation_digest":"sha256:40f47e17ef28e02f06d3613900dfb20306125f4e3c95a68a543a85f7d9242f35","observation_id":"404a1caf-9e0e-48b1-b0bc-f3deb3b9ee22","resolution":{"observed_at":"2026-08-08T11:42:07.609217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-07T14:44:43.094342Z","title":"Automati- cally interpreting millions of features in large language models.arXiv preprint arXiv:2410.13928,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17769","last_updated":"2025-06-12T11:54:13Z","snapshot_observed_at":"2026-08-10T17:21:02.901066Z","submitted_at":"2025-05-23T11:41:41Z","title":"Inference-Time Decomposition of Activations (ITDA): A Scalable Approach to Interpreting Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:43.094342Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2505.17769"},"observation_digest":"sha256:e9cb11ca6caefc2bba580d752d6b6a088c81bf5a8bde870012c0e926919bfdad","observation_id":"ec0bdb8c-202d-4452-97e6-e8969bf8b555","resolution":{"observed_at":"2026-08-07T14:44:43.094342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-07T14:03:02.798784Z","title":"Automatically interpreting millions of features in large language models.arXiv preprint arXiv:2410.13928, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-13T05:33:15.150849Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:02.798784Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:904b68817dd96ef975e28ceba28a5057a55eafc27811ada57c6b00f4f9bfd870","observation_id":"69d5d226-67de-45f7-aa85-cd7999a7ea30","resolution":{"observed_at":"2026-08-07T14:03:02.798784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-07T12:35:26.125107Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24473","last_updated":"2025-06-05T11:42:24Z","snapshot_observed_at":"2026-08-09T06:27:07.999203Z","submitted_at":"2025-05-30T11:20:44Z","title":"Train One Sparse Autoencoder Across Multiple Sparsity Budgets to Preserve Interpretability and Accuracy","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:26.125107Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2505.24473"},"observation_digest":"sha256:65b712a09413784f99aa1f6ae3ec57da36f7a5b7f1c93438c6353b3596b35565","observation_id":"0dced67a-930b-4899-906d-9d518eb3e32c","resolution":{"observed_at":"2026-08-07T12:35:26.125107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-06T18:24:51.640958Z","title":"Automatically interpreting millions of features in large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08473","last_updated":"2025-07-11T10:31:53Z","snapshot_observed_at":"2026-08-09T04:21:05.525989Z","submitted_at":"2025-07-11T10:31:53Z","title":"Evaluating SAE interpretability without explanations","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:24:51.640958Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2507.08473"},"observation_digest":"sha256:f654267eb2e2cbef329ea776fa4aa178032b5ec9921e3aa745863826122755da","observation_id":"6e6b6711-37ba-499f-b663-95b831dca041","resolution":{"observed_at":"2026-08-06T18:24:51.640958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-06T16:40:43.382708Z","title":"Automatically Interpreting Millions of Features in Large Language Models , December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12950","last_updated":"2025-07-18T09:19:19Z","snapshot_observed_at":"2026-08-08T08:02:10.889574Z","submitted_at":"2025-07-17T09:43:20Z","title":"Insights into a radiology-specialised multimodal large language model with sparse autoencoders","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T16:40:43.382708Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2507.12950"},"observation_digest":"sha256:d373eaa2df4fcbabf321a655c531111282b1eb730eb60e1ac69dafa8be06c95d","observation_id":"e3a332b2-4bc4-4fd7-a769-e59f5658fa1c","resolution":{"observed_at":"2026-08-06T16:40:43.382708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-06T16:40:29.278577Z","title":"Automatically interpreting millions of features in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12990","last_updated":"2025-07-17T10:57:49Z","snapshot_observed_at":"2026-08-08T10:53:21.043716Z","submitted_at":"2025-07-17T10:57:49Z","title":"Teach Old SAEs New Domain Tricks with Boosting","version":1},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-06T16:40:29.278577Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2507.12990"},"observation_digest":"sha256:a19419146e1e3f3bcc25c0c276fb3e928b9173513687b8e052986b3af45dc62c","observation_id":"cc944e05-a04d-4239-905f-0ffb17c18ff6","resolution":{"observed_at":"2026-08-06T16:40:29.278577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-06T11:01:42.861396Z","title":"Are the current topic modeling evaluation metrics enough?","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.23220","last_updated":"2026-06-27T15:55:39Z","snapshot_observed_at":"2026-08-11T07:03:47.381776Z","submitted_at":"2025-07-31T03:17:43Z","title":"Model Directions, Not Words: Mechanistic Topic Models Using Sparse Autoencoders","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T11:01:42.861396Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2507.23220"},"observation_digest":"sha256:c397b99c6654f329e6d93fd20c726f4fff9e6832f3b46780c4c6e7b99b0d5170","observation_id":"f5a8fa38-3718-4b12-9db2-5754e64ce507","resolution":{"observed_at":"2026-08-06T11:01:42.861396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T14:27:25.448907Z","title":"Automatically interpreting millions of features in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21324","last_updated":"2025-08-29T04:42:17Z","snapshot_observed_at":"2026-08-09T09:00:42.140024Z","submitted_at":"2025-08-29T04:42:17Z","title":"Distribution-Aware Feature Selection for SAEs","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T14:27:25.448907Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2508.21324"},"observation_digest":"sha256:1703a9f957399f8ffb8828659addaad41e10556cf660b9c34be961cbd3347d13","observation_id":"38cada16-d398-4e83-9f60-d806293f9950","resolution":{"observed_at":"2026-08-05T14:27:25.448907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2509.18127","last_updated":"2026-04-14T10:00:44Z","snapshot_observed_at":"2026-08-02T17:25:00.233548Z","submitted_at":"2025-09-11T11:22:43Z","title":"Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-18T18:13:01.662828Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2509.18127"},"observation_digest":"sha256:0f7f5ea90842dcc30e4fd1481e7dfb865ea79a83e192775c2e25db29fc3616d7","observation_id":"51200a8a-a44b-4b9a-a1cf-f3c2243dc8dd","resolution":{"observed_at":"2026-05-18T18:16:43.727392Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2511.01680","last_updated":"2026-07-15T14:09:50Z","snapshot_observed_at":"2026-08-04T00:23:23.110922Z","submitted_at":"2025-11-03T15:42:32Z","title":"Making Interpretable Discoveries from Unstructured Data: A High-Dimensional Multiple Hypothesis Testing Approach","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-18T01:56:50.978054Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2511.01680"},"observation_digest":"sha256:7e8dead662df53387b887ad0b40dbe40c4ca96236283f821ae16b16d121fe238","observation_id":"8f99d151-6988-49f1-b0a0-644c1b031df4","resolution":{"observed_at":"2026-05-18T02:00:40.020715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-04T00:23:29.455409Z","title":"Automatically Interpreting Millions of Features in Large Language Models , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.01680","last_updated":"2026-07-15T14:09:50Z","snapshot_observed_at":"2026-08-04T00:23:23.110922Z","submitted_at":"2025-11-03T15:42:32Z","title":"Making Interpretable Discoveries from Unstructured Data: A High-Dimensional Multiple Hypothesis Testing Approach","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T00:23:29.455409Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2511.01680"},"observation_digest":"sha256:a0740443ae351973bafa2eadf34d0b1f9ffbd2f502305e6ec0d7f90678303b11","observation_id":"80cfe4ec-b4c5-455a-9f9b-ca5f4da4545e","resolution":{"observed_at":"2026-08-04T00:23:29.455409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-03T00:02:44.908484Z","title":"Automatically Interpreting Millions of Features in Large Language Models.arXiv preprint arXiv:2410.13928,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":1995,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:44.908484Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:a33bd9ceb4d7d8f923dc818ec75dedc68f23f1590d43b4f799f3083c188067ab","observation_id":"40fa6dbd-3e7a-44e4-9b18-20d62b4e15f5","resolution":{"observed_at":"2026-08-03T00:02:44.908484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-02T23:00:26.827244Z","title":"Automatically interpreting millions of features in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15278","last_updated":"2026-05-31T02:07:13Z","snapshot_observed_at":"2026-08-08T02:47:52.848942Z","submitted_at":"2026-02-17T00:33:53Z","title":"Visual Persuasion: What Influences Decisions of Vision-Language Models?","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T23:00:26.827244Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2602.15278"},"observation_digest":"sha256:0ac413a9a87a99000d180d248096b1e1ea6d9a8b95df8ffb7b16e068aefd9717","observation_id":"24ca6d44-11fb-4f92-bdf2-1bd1d35942ab","resolution":{"observed_at":"2026-08-02T23:00:26.827244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-02T17:47:09.249674Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.21014","last_updated":"2026-07-21T12:14:44Z","snapshot_observed_at":"2026-08-07T08:02:07.416035Z","submitted_at":"2026-03-22T02:20:33Z","title":"CLT-Forge: A Scalable Library for Cross-Layer Transcoders and Attribution Graphs","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T17:47:09.249674Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2603.21014"},"observation_digest":"sha256:2962302bff4e5780c6026e6270168845d1d52184ae1e9d5998954f9db6969052","observation_id":"f0a86bbe-392a-4f0e-b54e-70c86ce35603","resolution":{"observed_at":"2026-08-02T17:47:09.249674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2604.03436","last_updated":"2026-04-03T20:20:28Z","snapshot_observed_at":"2026-08-12T23:52:09.595447Z","submitted_at":"2026-04-03T20:20:28Z","title":"MetaSAEs: Joint Training with a Decomposability Penalty Produces More Atomic Sparse Autoencoder Latents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-13T19:42:57.683378Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2604.03436"},"observation_digest":"sha256:48e0c0afed3f6f697d3f0147e79a378c5fcb8d0a1af175a699cc393d86f3ac61","observation_id":"99504919-6994-4918-bf36-9c0050b1a81a","resolution":{"observed_at":"2026-05-13T19:43:11.174235Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-04T05:36:47.912974Z","title":"Automatically interpreting millions of features in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03532","last_updated":"2026-08-02T18:42:26Z","snapshot_observed_at":"2026-08-13T21:16:12.155888Z","submitted_at":"2026-04-04T00:56:13Z","title":"LangFIR: Discovering Sparse Language-Specific Features from Monolingual Data for Language Steering","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T05:36:47.912974Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2604.03532"},"observation_digest":"sha256:357f437851361c71393e9d39fab1c7cfbb5abde8728d3a3f83cce4523defb2b6","observation_id":"18442c76-67d5-4f2f-b0b5-2d67361ad47b","resolution":{"observed_at":"2026-08-04T05:36:47.912974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2604.08846","last_updated":"2026-04-10T01:01:56Z","snapshot_observed_at":"2026-08-13T19:19:16.724751Z","submitted_at":"2026-04-10T01:01:56Z","title":"Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T18:04:05.157103Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2604.08846"},"observation_digest":"sha256:687edfb4e7feefd18562f6982e3ffc807208110616b3525f3864beac8f848e16","observation_id":"68a18cc7-8459-40cc-9acb-5163d2c730bb","resolution":{"observed_at":"2026-05-11T05:35:57.738845Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2605.06494","last_updated":"2026-05-07T16:15:16Z","snapshot_observed_at":"2026-08-13T15:40:07.078663Z","submitted_at":"2026-05-07T16:15:16Z","title":"From Token Lists to Graph Motifs: Weisfeiler-Lehman Analysis of Sparse Autoencoder Features","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T09:41:01.775116Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2605.06494"},"observation_digest":"sha256:345aee0e1b36f0b0765a57fca29b8e155c51e7a4a35116b7e4600d47a7b42da5","observation_id":"e7e69111-eaf2-43e7-a12a-c31c0c074c66","resolution":{"observed_at":"2026-05-11T20:16:11.098765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2605.07922","last_updated":"2026-05-11T02:18:14Z","snapshot_observed_at":"2026-08-13T10:23:38.689080Z","submitted_at":"2026-05-08T15:57:37Z","title":"Tree SAE: Learning Hierarchical Feature Structures in Sparse Autoencoders","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T03:13:58.543525Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2605.07922"},"observation_digest":"sha256:7b92899419e4a2b042b809e386f750c89abe72f8e39719053a6b2ad4fdf4c2d2","observation_id":"c22a0357-cea8-4493-bb17-9119b92e3f35","resolution":{"observed_at":"2026-05-11T03:15:54.269344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2605.07922","last_updated":"2026-05-11T02:18:14Z","snapshot_observed_at":"2026-08-13T10:23:38.689080Z","submitted_at":"2026-05-08T15:57:37Z","title":"Tree SAE: Learning Hierarchical Feature Structures in Sparse Autoencoders","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T03:35:50.776347Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2605.07922"},"observation_digest":"sha256:a878fb0020b7db14b5670a6e6cb3d1bdbfd21d6ec28dee21c205cbe152891924","observation_id":"9408900b-b8ff-4f83-aad1-f656f7fbcb0e","resolution":{"observed_at":"2026-05-12T07:16:25.542255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2605.11920","last_updated":"2026-05-12T10:36:02Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T10:36:02Z","title":"Domain Restriction via Multi SAE Layer Transitions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T05:54:21.707023Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2605.11920"},"observation_digest":"sha256:dc21c7ebab8864433f67829cb38ceb6017908792850319353dda79f8a10def51","observation_id":"92412ab3-e893-4d21-a272-7edffd59c421","resolution":{"observed_at":"2026-05-13T06:02:23.786790Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2605.12412","last_updated":"2026-05-12T17:09:41Z","snapshot_observed_at":"2026-08-11T04:19:07.969715Z","submitted_at":"2026-05-12T17:09:41Z","title":"Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space","version":1},"reference_index":168,"source":"arxiv_source","source_observed_at":"2026-05-13T05:17:34.283917Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2605.12412"},"observation_digest":"sha256:e8c126c6080b662d12856b8cdcc15cf3ae68c65265aefca3423849e68ebbad55","observation_id":"5b619e30-0b39-4ad3-92ea-65ee8030c09b","resolution":{"observed_at":"2026-05-13T05:27:19.296590Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2605.12874","last_updated":"2026-05-13T01:41:38Z","snapshot_observed_at":"2026-08-11T13:31:38.798886Z","submitted_at":"2026-05-13T01:41:38Z","title":"Descriptive Collision in Sparse Autoencoder Auto-Interpretability: When One Explanation Describes Many Features","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T20:27:38.363693Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2605.12874"},"observation_digest":"sha256:d8f3782c11828cb1668e40ad7b05792bc41b7aa0577aed6ea1e990c216f1904e","observation_id":"90c19cd7-8b28-4b13-9d10-29df29899b30","resolution":{"observed_at":"2026-05-14T20:29:27.959279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2605.14192","last_updated":"2026-05-13T23:18:07Z","snapshot_observed_at":"2026-08-11T12:40:59.527049Z","submitted_at":"2026-05-13T23:18:07Z","title":"Why Retrieval-Augmented Generation Fails: A Graph Perspective","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T04:47:44.904830Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2605.14192"},"observation_digest":"sha256:c68398ebced70607d7928dc598c26b2f4500582f7e19ebac5d473955124069f1","observation_id":"2023cc4a-ebf5-4238-84e6-b6d728fb9fbd","resolution":{"observed_at":"2026-05-15T04:49:44.307236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2605.14694","last_updated":"2026-05-14T11:10:52Z","snapshot_observed_at":"2026-08-13T21:44:52.464758Z","submitted_at":"2026-05-14T11:10:52Z","title":"The Rate-Distortion-Polysemanticity Tradeoff in SAEs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T21:13:01.880935Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2605.14694"},"observation_digest":"sha256:000d3a17b13a60e8535fbd3974823b88d44ee130f4e96bb4aa0f6b5ee4e49a15","observation_id":"4472d2ca-8d2f-417b-ba76-a821d63b5696","resolution":{"observed_at":"2026-06-30T21:15:04.067379Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2605.18229","last_updated":"2026-05-18T11:20:57Z","snapshot_observed_at":"2026-08-13T18:31:05.869475Z","submitted_at":"2026-05-18T11:20:57Z","title":"Are Sparse Autoencoder Benchmarks Reliable?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T12:43:13.014365Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2605.18229"},"observation_digest":"sha256:604889c392c997e0e8f274de822d878ecc6c69a7198098111c30cacfb0a22312","observation_id":"54eeb67b-f683-4846-b5c7-6f591391cb73","resolution":{"observed_at":"2026-05-20T12:43:16.763156Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2605.18789","last_updated":"2026-05-07T15:12:42Z","snapshot_observed_at":"2026-07-06T23:29:38.069295Z","submitted_at":"2026-05-07T15:12:42Z","title":"Features have life history. And we should care","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T23:31:30.350171Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2605.18789"},"observation_digest":"sha256:976f41d24f3abd9f918a300d1e33a532e958d58e258c19501c111a3d39649fa6","observation_id":"e599bae1-869d-471e-af08-ac21f317a024","resolution":{"observed_at":"2026-05-20T23:33:50.874513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2606.08496","last_updated":"2026-06-07T07:54:25Z","snapshot_observed_at":"2026-07-31T19:48:50.729266Z","submitted_at":"2026-06-07T07:54:25Z","title":"SAEExplainer: Interpreting SAE Features with Activation-Guided Preference Optimization","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-27T18:35:47.513717Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2606.08496"},"observation_digest":"sha256:0027465e020a1e8442df5c80f083f6038a41f95ae2080e3331500a4b743aa8b0","observation_id":"7ffd95b3-ce31-4606-902a-cf1f63dc9dc1","resolution":{"observed_at":"2026-07-02T22:57:25.986871Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2606.10029","last_updated":"2026-06-08T18:09:37Z","snapshot_observed_at":"2026-08-12T22:41:52.311413Z","submitted_at":"2026-06-08T18:09:37Z","title":"Interpreting and Steering a Text-to-Speech Language Model with Sparse Autoencoders","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T17:09:36.845217Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2606.10029"},"observation_digest":"sha256:3970461675b6ed145322ec94c31e2d8fb43a8a9e02076abbe6eda499d1fdfc97","observation_id":"59891a17-6ca1-43c0-a706-ff00c4581768","resolution":{"observed_at":"2026-07-03T00:27:30.040455Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2606.11722","last_updated":"2026-06-10T06:53:58Z","snapshot_observed_at":"2026-08-13T03:25:55.208169Z","submitted_at":"2026-06-10T06:53:58Z","title":"ICA Lens: Interpreting Language Models Without Training Another Dictionary","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T10:21:58.878499Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2606.11722"},"observation_digest":"sha256:bea1839deb56bfacd55b4844cfdb7c099251aa3de705fc23f4118025bd15dca4","observation_id":"aca94aaf-78fb-4915-a67b-705996dd12b4","resolution":{"observed_at":"2026-07-03T09:17:49.074626Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2606.12360","last_updated":"2026-06-10T17:31:16Z","snapshot_observed_at":"2026-08-12T19:07:36.925722Z","submitted_at":"2026-06-10T17:31:16Z","title":"Anatomy of Post-Training: Using Interpretability to Characterize Data and Shape the Learning Signal","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-27T10:32:57.295159Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2606.12360"},"observation_digest":"sha256:936358c5c0472c7c0b1cf7be87d6a2272362fa417a3b08a1aac05786c6d10443","observation_id":"b94cef44-8a3d-49b8-9a8b-b2329d44269a","resolution":{"observed_at":"2026-07-03T09:07:47.877710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2606.21197","last_updated":"2026-06-19T08:08:43Z","snapshot_observed_at":"2026-08-06T09:20:12.413278Z","submitted_at":"2026-06-19T08:08:43Z","title":"Extraction and Analysis of Multimodal Concepts in Vision Language Models through Sparse Autoencoders","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T14:22:34.708361Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2606.21197"},"observation_digest":"sha256:401b587cf38182cd11b4621a3a9e73ef1c1856f5b9d10df47b4c9f17efdbd78a","observation_id":"be03c80f-db8d-48c6-9e78-80c0d70d54a6","resolution":{"observed_at":"2026-06-26T14:29:31.008385Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.13928","doi":"10.48550/arxiv.2410.13928","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically interpreting millions of features in large language models","venue":"arXiv (Cornell University)","work_id":"e7fd7fcc-4a8e-4299-ae13-7030d44df0e5","year":2024},"citing_paper":{"arxiv_id":"2606.22994","last_updated":"2026-06-22T08:12:34Z","snapshot_observed_at":"2026-08-08T15:52:49.568637Z","submitted_at":"2026-06-22T08:12:34Z","title":"Do Sparse Autoencoders Learn Meaningful Concept Hierarchies?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T08:46:48.220801Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2606.22994"},"observation_digest":"sha256:509ece80cc6aacb6f6a88d80fef221865700cc4d7b6d73596daa4fa5dbb74c57","observation_id":"f5c018c0-08fe-4128-a372-79e995f9b0fa","resolution":{"observed_at":"2026-07-04T10:29:45.385912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-07-13T05:35:58.568346Z","title":"arXiv preprint arXiv:2410.13928 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08946","last_updated":"2026-07-09T21:15:40Z","snapshot_observed_at":"2026-08-14T00:00:10.480230Z","submitted_at":"2026-07-09T21:15:40Z","title":"Training, Reading, and Editing Legible Transformers","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-13T05:35:58.568346Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2607.08946"},"observation_digest":"sha256:d9b4285918e8c458cdac1274cd8984db474847a7978fb95d78c508ba9f415fca","observation_id":"e6cb9511-ab47-4020-be0c-38adefadde2f","resolution":{"observed_at":"2026-07-13T05:35:58.568346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-01T23:15:30.760858Z","title":"Automatically interpreting millions of features in large language models.arXiv preprint arXiv:2410.13928, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15495","last_updated":"2026-07-16T22:54:30Z","snapshot_observed_at":"2026-08-07T08:22:43.917790Z","submitted_at":"2026-07-16T22:54:30Z","title":"Verbalizable Representations Form a Global Workspace in Language Models","version":1},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-08-01T23:15:30.760858Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2607.15495"},"observation_digest":"sha256:7d25e3938c76f5151984e2fdb8a8bcbd46b0dece85714cb6cb69f89e004cfaa6","observation_id":"378236f7-3528-43ed-b6df-9fe19f1c222f","resolution":{"observed_at":"2026-08-01T23:15:30.760858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-05T17:48:46.321102Z","title":"Automatically Interpreting Millions of Features in Large Language Models , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03507","last_updated":"2026-08-04T11:49:16Z","snapshot_observed_at":"2026-08-12T14:31:13.239675Z","submitted_at":"2026-08-04T11:49:16Z","title":"ChronoLens: Measuring Language Change Across Time, Languages, and Linguistic Levels","version":1},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-08-05T17:48:46.321102Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2608.03507"},"observation_digest":"sha256:11092c6ef53c041e3cd9aae26ad4b5a575d78ee61b3d53182e629708ab71cba3","observation_id":"77f466a6-23af-49c0-9269-a828189cd789","resolution":{"observed_at":"2026-08-05T17:48:46.321102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.13928/citation-record","integrity":"/paper/2410.13928/integrity","json":"/paper/2410.13928/citation-record.json","paper":"/paper/2410.13928"},"outbound":[],"paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T22:20:40.366642Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 45 inbound Pith citation observations for arXiv:2410.13928."}