{"as_of":"2026-08-09T09:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c7ef7d85683de636b9a7060aee8e68c448a6a771c40768fc3659a8c0aa1b28ab","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:31:39.220992Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21468/citation-record","integrity":"/paper/2506.21468/integrity","json":"/paper/2506.21468/citation-record.json","paper":"/paper/2506.21468"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.866551Z","title":"How can we be so dense? the benefits of using highly sparse representations, 2019","venue":null,"work_id":"fe0b9763-a0e7-45b6-9c9e-aa6cd742a24c","year":2019},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:19.862785Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:408d35c46a1c07de5034b94158234f66d82f96d0197aaebdab2d16b6b4d8e86c","observation_id":"789d64b4-69c1-41fb-80dd-51772945f630","resolution":{"observed_at":"2026-08-06T22:31:44.922624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:34.787577Z","title":"Generating long sequences with sparse transformers, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:34.787577Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:6d41960b22f14c0953f2fdcc9f2bf56094089c58c87f341cd48cecfa6f1f50ea","observation_id":"252a90f8-e166-4ccf-8aa8-0427bd7175dd","resolution":{"observed_at":"2026-08-06T22:31:34.787577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T22:31:34.894657Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:34.894657Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:08752f98c3a2220cdfc5601b17e27d35655ee82477bb520b9bc3554419b68fcd","observation_id":"674b7941-d134-4ec2-b182-617c4b245cb5","resolution":{"observed_at":"2026-08-06T22:31:34.894657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.739432Z","title":"[Full Post] Progress Update #1 from the GDM Mech Interp Team","venue":null,"work_id":"f629a0ba-34c1-4cf9-ac72-61b71eafff20","year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.076386Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:54f9853a8e5c5a0d93fa134b252d440a74755c0244c40a3897755b2b6238632c","observation_id":"7a6bcd59-399b-4e81-a450-405ea058ef91","resolution":{"observed_at":"2026-08-06T22:31:44.790819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:35.158355Z","title":"Sparse autoencoders find highly interpretable features in language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.158355Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:79648a9b04d368a7d76f2d72e5814e7a7ecfaf625ec081a159d3e1837551a2bb","observation_id":"ba9b874e-ce44-4514-9642-ba67d7764f98","resolution":{"observed_at":"2026-08-06T22:31:35.158355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.630217Z","title":"Rigging the lottery: Making all tickets winners","venue":null,"work_id":"28a75298-7eb8-4b60-804a-a6d95764bc42","year":2020},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.321207Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:2d102dcbeba19cdff564418a6de71cf3d8c003ca41b8784496200bedb978840a","observation_id":"f0204e56-9a10-4e7c-947b-1d805f936fb0","resolution":{"observed_at":"2026-08-06T22:31:44.685373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.512794Z","title":"Sparsity in transformers: A systematic literature review","venue":null,"work_id":"c0c20002-0924-42c4-a546-d2362fa3fee4","year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.434488Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:bec5c39440b3552dbc500766652fb6f4f291583cfbcd2c3cfe3a03ff9a39b9a8","observation_id":"30ea9f6d-00f7-4f49-964f-0f3dc6a16879","resolution":{"observed_at":"2026-08-06T22:31:44.560982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:35.530869Z","title":"Detecting hallucinations in large language models using semantic entropy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.530869Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:2963621f0042cd5693eaed393ec82e17eca31fd6c77158fe40f6ea4b7879cae3","observation_id":"72d4a652-94cd-4b34-a2aa-d89f288ff9b0","resolution":{"observed_at":"2026-08-06T22:31:35.530869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.409582Z","title":"Scaling and evaluating sparse autoencoders, 2024","venue":null,"work_id":"adf0da22-03fa-466c-bcb7-e96fdcfedc1b","year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.680217Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:01511cc29b961ce41d852b849f4eda4068e03dac7a74789b67e2e99b89cbb509","observation_id":"6f137638-06ec-406b-9ce0-061a3bf57b53","resolution":{"observed_at":"2026-08-06T22:31:44.452327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.323249Z","title":"The language model evaluation harness, 2024","venue":null,"work_id":"de92f63f-e001-4e6e-9270-912a21074f07","year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.732571Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:9c63d2f1733d0a6d9d5bc96c8759e97d7f00e60830714e0fe0e7b91b1bc7a0ac","observation_id":"f4e0c28a-7209-4240-955b-333c6e0ea7da","resolution":{"observed_at":"2026-08-06T22:31:44.370392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.205708Z","title":"Causal Abstractions of Neural Networks","venue":null,"work_id":"68242395-4ef5-4d72-849b-019a56891779","year":2021},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.794053Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:d28c6a6ae3fc77c7045533513bd7d6bd096c0c9ab7b117dddb45e7b876d791b4","observation_id":"ee4dd635-db57-410b-9324-1787e68f3a5c","resolution":{"observed_at":"2026-08-06T22:31:44.255996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.098224Z","title":"The State of Sparse Training in Deep Reinforcement Learning","venue":null,"work_id":"1d33476d-3caf-48c7-8d03-255166755321","year":2022},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.872432Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:95f2a3a62a2d8d290d38e59eed90b68d1e308de831813a53a843121685f83499","observation_id":"04f5fb92-8a51-49c8-b8d4-d99b82567568","resolution":{"observed_at":"2026-08-06T22:31:44.158063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.993708Z","title":"Memory-efficient transformers via top-k attention, 2021","venue":null,"work_id":"4f22e5dc-f213-4c99-9747-b8ef6c66dfb7","year":2021},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.032941Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:91b86951e991c47faa95c511ad4d338dfb755e9b5d894026984e1082dfd7ceca","observation_id":"aa35ef23-a1e2-4365-8576-b6daf9a5c923","resolution":{"observed_at":"2026-08-06T22:31:44.047952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.884597Z","title":"Llama scope: Extracting millions of features from llama-3.1-8b with sparse autoencoders, 2024","venue":null,"work_id":"856de5fe-cae0-4e36-9593-79f2cb9408ac","year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.096247Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:8fa9ca53d910b98c2cf96c10efdca29886396746b8422e55337df29fd7e3c9f2","observation_id":"3f7984cd-049b-4bda-86f3-9384fd31b028","resolution":{"observed_at":"2026-08-06T22:31:43.933604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.772022Z","title":"Hindupur, Ekdeep Singh Lubana, Thomas Fel, and Demba Ba","venue":null,"work_id":"0ad427de-5570-4cd7-a1e8-3f6f43f01442","year":2025},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.144498Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:12b05cdd0f457563855d85edfebc73290a2f65e8a1bb72553d7e606859928dd9","observation_id":"cdb4a400-794b-422a-b9db-23e9e5554868","resolution":{"observed_at":"2026-08-06T22:31:43.826679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13896","last_updated":"2021-12-27T20:41:01Z","snapshot_observed_at":"2026-08-06T03:45:25.217182Z","submitted_at":"2021-12-27T20:41:01Z","title":"Two Sparsities Are Better Than One: Unlocking the Performance Benefits of Sparse-Sparse Networks","version":1},"cited_work":{"arxiv_id":"2112.13896","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.13896","snapshot_observed_at":"2026-08-06T22:31:39.485775Z","title":"Two Sparsities Are Better Than One: Unlocking the Performance Benefits of Sparse-Sparse Networks","venue":"cs.LG","work_id":"cc058575-b76c-47ed-bcee-b6ed824cc133","year":2021},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.250242Z"},"links":{"cited_paper":"/paper/2112.13896","citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:cf9115dc74cb9e1b5058c92bfd384ed93a742e554d5c09384454cc08d1d4c2af","observation_id":"93a23817-5ae8-4063-9a61-cc7a57c7407d","resolution":{"observed_at":"2026-08-06T22:31:39.565510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.676880Z","title":"How llms learn: Tracing internal representations with sparse autoencoders, 2025","venue":null,"work_id":"45df477e-1c36-4544-a638-8f8090bb35f9","year":2025},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.341495Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:ee86715945c0ee666dc218ebe08fce65cc517cff5451bf0ca97c160df38ccd91","observation_id":"431d5c70-f9cd-434d-b265-d0c8d173ceb6","resolution":{"observed_at":"2026-08-06T22:31:43.727068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.567275Z","title":"Sparse is enough in scaling transformers, 2021","venue":null,"work_id":"188e5fb5-43ca-4737-9f27-22a5e1ed679a","year":2021},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.403525Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:9d9d64d899a979754358d169c1076d9a8bbd4be8c091aa799604cf44e796692d","observation_id":"d3c0bed0-dcef-4bad-a2a3-7229280fc0ad","resolution":{"observed_at":"2026-08-06T22:31:43.615792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03517","last_updated":"2021-06-07T11:13:05Z","snapshot_observed_at":"2026-07-06T11:16:40.406758Z","submitted_at":"2021-06-07T11:13:05Z","title":"Top-KAST: Top-K Always Sparse Training","version":1},"cited_work":{"arxiv_id":"2106.03517","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.03517","snapshot_observed_at":"2026-08-06T22:31:39.343701Z","title":"Top-KAST: Top-K Always Sparse Training","venue":"cs.LG","work_id":"89d23a65-a561-4ffc-912d-a8e368c9d2d4","year":2021},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.509531Z"},"links":{"cited_paper":"/paper/2106.03517","citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:f73e8753f22dc963792a567a4c8ff82f436bd45bd04c080a67dc14c3284dd666","observation_id":"d7578cb5-abb8-45ff-b7d9-85726b9abc70","resolution":{"observed_at":"2026-08-06T22:31:39.411734Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.419584Z","title":"Saebench: A comprehensive benchmark for sparse autoen- coders in language model interpretability, 2025","venue":null,"work_id":"b9182837-59fd-453b-b776-cfabce630223","year":2025},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.629380Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:8e16b2af798b718b0370afbd141c589354ffb55eb72f1669a55f33058bc98964","observation_id":"4f91072b-f53e-4f6f-b9bf-d3d8d7b64d13","resolution":{"observed_at":"2026-08-06T22:31:43.505754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.238322Z","title":"Concept steerers: Leveraging k-sparse autoencoders for controllable generations, 2025","venue":null,"work_id":"4beccd7d-375b-4c94-93d6-2396bf206a6e","year":2025},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.737124Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:de561557973f0cf38f690ddee69252fba950b048f1b6dbc61e38505cfbec7085","observation_id":"1d8d7c24-9783-465d-9c80-be28083f430a","resolution":{"observed_at":"2026-08-06T22:31:43.327447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.088532Z","title":"Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation","venue":null,"work_id":"385d25f3-47f3-45ef-a725-9ed0d4602149","year":2023},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.842439Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:8f2771ed45d6fb18f1875a6a78aa9bf097b49609e615171f229217d750a95cc4","observation_id":"88cbb3b3-8ac3-4ba0-8158-3b1251dba858","resolution":{"observed_at":"2026-08-06T22:31:43.166195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:42.931527Z","title":"Soft Threshold Weight Reparameterization for Learnable Sparsity","venue":null,"work_id":"33e1e462-ba05-4b84-987e-9656e788cb7d","year":2020},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.925606Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:da5704099a14292c55c81ab2e44e97d4c1a9515c1be3d2ffb8fc82e573c257d7","observation_id":"3edfc9c7-94f6-4281-a590-880224887ad8","resolution":{"observed_at":"2026-08-06T22:31:43.002177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:42.724521Z","title":"Sparse autoencoders do not find canonical units of analysis, 2025","venue":null,"work_id":"8bed8ee2-d614-438b-85cf-370d0d145ae0","year":2025},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.983433Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:20a9de1ab9b38fea580392c984fb9f6ae44a51ab86bfc3a88cc9b6d3a5c2eb92","observation_id":"a05d54fd-ae7b-4413-b870-4cecc3413d54","resolution":{"observed_at":"2026-08-06T22:31:42.807089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:37.056013Z","title":"Gemma scope: Open sparse autoencoders everywhere all at once on gemma 2, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.056013Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:f56fd76e3b20e7eea260162dc284526a2deac6561fb218f6128ddf5f30003b20","observation_id":"5f4fba51-bb4a-4ebd-9a82-f17b303fec40","resolution":{"observed_at":"2026-08-06T22:31:37.056013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:37.178870Z","title":"Decoupled Weight Decay Regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.178870Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:67385f18a5c8bec041b712323f59784633630a7adf98a3ddc93170222140559e","observation_id":"0e04cee2-46f0-46d1-ade5-282892edb508","resolution":{"observed_at":"2026-08-06T22:31:37.178870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:42.536416Z","title":"Learning sparse neural networks through l_0 regularization","venue":null,"work_id":"1dbe86c1-7ef7-4596-8050-47cd70c0332c","year":2018},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.243550Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:caf3bece0c9feed96ff28c8bf84d2ece5a0d8fea06312583e96bbbbfd2659212","observation_id":"dfa20b76-4411-44f4-807f-6be32170786e","resolution":{"observed_at":"2026-08-06T22:31:42.623753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:37.336793Z","title":"Fineweb-edu: the finest collection of educational content, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.336793Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:0089a34028976afeb64addb68de8cf71ae0e9699ff1eda6df8eb11d8f99a9bce","observation_id":"8a792f02-b2c6-45e8-b471-bb1f4f042e41","resolution":{"observed_at":"2026-08-06T22:31:37.336793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:42.326452Z","title":"Winner-take-all autoencoders","venue":null,"work_id":"96fc224a-0b32-47cb-afe3-acebd8413345","year":2015},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.409944Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:a6c2cdf27b192f5fca6a806d5a4f76508d76ab787c0a1c063e5d465a15be4f61","observation_id":"c81c18f1-a5e1-419b-878a-9a4b2a29115b","resolution":{"observed_at":"2026-08-06T22:31:42.399846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:42.166222Z","title":"Pointer Sentinel Mixture Models","venue":null,"work_id":"67b7214a-a9b0-484c-a76b-72ebb90081b0","year":2017},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.516145Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:fcb352c2b387c07c5a5af31ac89c75c7db54525c9f8dd54317a0acf6df0a2b0f","observation_id":"cf1a13db-df4e-4f85-8d87-3a1f51a45d56","resolution":{"observed_at":"2026-08-06T22:31:42.252639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:41.979927Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":"abd5ce17-e55a-45b8-9d30-da756840dae3","year":2018},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.572894Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:791566f8a5d47946d7e3307f4c000dde504134c96e3fe17d108e89f21dcd8321","observation_id":"6cc3d4c0-c29f-45dc-b26e-406dba71cc93","resolution":{"observed_at":"2026-08-06T22:31:42.067358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:41.789934Z","title":"Nguyen, Madeleine Gibescu, Antonio Liotta, and et al","venue":null,"work_id":"6b7a54bb-7d2f-431b-9e07-b20284fc8404","year":2018},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.620117Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:5cd4432e1f426ba021c2140d19dd54155361e4b52359ae295252a02038ce6bfe","observation_id":"69e9c625-3b6b-45ee-883a-cc68e008da50","resolution":{"observed_at":"2026-08-06T22:31:41.886349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:41.581765Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":"c883d9ad-63ef-4c05-bd18-e817e7734a1b","year":2016},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.666381Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:36814ee06e5a5d3c6e1f65685137b88fd37c7bb8ce32aa6629d61d13c77e28f2","observation_id":"2a719d09-833e-4914-8ee3-0b74cd9203b5","resolution":{"observed_at":"2026-08-06T22:31:41.688817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:41.373164Z","title":"Sparse autoencoders trained on the same data learn different features, 2025","venue":null,"work_id":"97f57fdb-7e35-414d-994e-26e5601e1669","year":2025},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.703915Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:11b613fd0a18b83a8028a07de6f11df1623b9b74472d71f9ed7a0a19a8e65088","observation_id":"6dd0f983-9ab7-4e9c-8faf-5f2e127b6e35","resolution":{"observed_at":"2026-08-06T22:31:41.469546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:41.152547Z","title":"Automatically interpreting millions of features in large language models, 2024","venue":null,"work_id":"e2ee9980-091c-45a9-82fd-3e93fb5ee493","year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.798385Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:d63dbf95d74886c5f164d05e7362105f7da52992b47f05b4cf600d2a304103a7","observation_id":"0754bfa7-a587-49c0-ab97-1f49c4ce81b1","resolution":{"observed_at":"2026-08-06T22:31:41.268686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:40.937084Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","venue":null,"work_id":"74cca70f-1528-46c1-9539-0cdf45f62607","year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.854065Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:c76867e2cb53e92e611d3c1440df6475976845468d98062695e65dd8e6fe1d7b","observation_id":"a1125760-f628-4ca2-9ebb-4d6f608633bf","resolution":{"observed_at":"2026-08-06T22:31:41.035447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:37.972247Z","title":"Improving dictionary learning with gated sparse autoencoders, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.972247Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:f3beea778390ff6b6dda6685a4faf12b161104ce3bc62f15fd90597da824b433","observation_id":"d02c0341-8289-4f6a-9e93-7c948279a759","resolution":{"observed_at":"2026-08-06T22:31:37.972247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:38.142907Z","title":"Winogrande: an adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.142907Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:6a2d79683718ebad5cfa9ad7d2726611454c66438c8091ee30d01de1f4f94e88","observation_id":"acedd645-2f42-434a-8ef1-aebff0af90bb","resolution":{"observed_at":"2026-08-06T22:31:38.142907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:40.764914Z","title":"Taking features out of superposition with sparse autoencoders","venue":null,"work_id":"8a4f341d-8901-4c86-a588-a56bc97f30e4","year":2023},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.258973Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:fbaacb9749cf81cab0ec9f68a6115e7952f64c6e272176a4d67f167030b6b75f","observation_id":"8f6dab73-abb4-4500-b8d5-f326759064a8","resolution":{"observed_at":"2026-08-06T22:31:40.851527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:38.370614Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.370614Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:bf13379607a7ae5c6c3d61e1c4b4338b8e2271fad49bdfffb22b9211afae5485","observation_id":"ed8b5f35-897e-4c8d-9f38-e00bfacbbac6","resolution":{"observed_at":"2026-08-06T22:31:38.370614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:40.562786Z","title":"A survey on sparse autoencoders: Interpreting the internal mechanisms of large language models, 2025","venue":null,"work_id":"a410872f-7025-4ec9-b81e-2a05dfd87e06","year":2025},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.509917Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:0850306bb9d87f5b258778c141e21005300b563edcd50896a96d0cd88292c525","observation_id":"1ddad81e-ea7a-41e9-b420-c9e5d64197bd","resolution":{"observed_at":"2026-08-06T22:31:40.670077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17230","last_updated":"2023-10-26T08:28:48Z","snapshot_observed_at":"2026-08-04T17:23:12.853347Z","submitted_at":"2023-10-26T08:28:48Z","title":"Codebook Features: Sparse and Discrete Interpretability for Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17230","snapshot_observed_at":"2026-08-06T22:31:38.680344Z","title":"Codebook features: Sparse and discrete interpretability for neural networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.680344Z"},"links":{"cited_paper":"/paper/2310.17230","citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:1efa5c7e556e8310b40363961019f9601820cef23baca98c102dd74042ab318d","observation_id":"9c0496bf-71fc-42ea-a76c-b215fc6f7781","resolution":{"observed_at":"2026-08-06T22:31:38.680344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:40.376833Z","title":"Daniel Freeman, Theodore R","venue":null,"work_id":"055c0b89-de7a-448b-98ac-51f752f8ebeb","year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.794923Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:8bf49354a2d2cd348b21fd44da87b2ac47c7e83cbae510e430e27a42a0f2db3e","observation_id":"e1b8015f-8dca-48ee-a6d5-94e0197c7317","resolution":{"observed_at":"2026-08-06T22:31:40.462326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T22:31:38.890079Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.890079Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:0c383dbaae2f33765f0f74b788a3035e23ff18f02c117186704f1e63be9a7657","observation_id":"4e902680-9768-47c0-aae7-a1a9b5f98c7c","resolution":{"observed_at":"2026-08-06T22:31:38.890079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:40.189887Z","title":"Meta Lingua: A minimal PyTorch LLM training library, 2024","venue":null,"work_id":"a2313bea-bf6a-4395-937b-71849c415705","year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.998159Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:974a1782d750a457f66d467db555b80b24da3d0261e6aeca846e94df3023d243","observation_id":"3ea79e63-1c97-4e4a-ad6c-80dc996c16ab","resolution":{"observed_at":"2026-08-06T22:31:40.282755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:40.005399Z","title":"Tracking the feature dynamics in llm training: A mechanistic study, 2025","venue":null,"work_id":"e052c69f-a287-45f8-a02d-3d2b2ddc8a7f","year":2025},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.060459Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:204c3a058c8a5b622f8532185008bc53c1059db0b6a6760a0c9e057d90e83059","observation_id":"373449a0-f1a3-45e0-b63a-24c6155ab499","resolution":{"observed_at":"2026-08-06T22:31:40.093824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:39.807955Z","title":"STEP: Staged parameter-efficient pre-training for large language models","venue":null,"work_id":"17b54228-febe-46d7-bb5c-44fa719728af","year":2025},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.121952Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:50c2267ef855822323c372d3faff491c84c27509447e648c09bbc927f0042a50","observation_id":"b26d6674-e1c9-49fd-a3d2-63892221c21a","resolution":{"observed_at":"2026-08-06T22:31:39.921354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:39.655389Z","title":"HellaSwag: Can a machine really finish your sentence? In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics , pages 4791–4800, 2019","venue":null,"work_id":"fe0fbbfd-e9f3-423a-8454-e0aa56bbcfa1","year":2019},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.176817Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:c798b6da8cf79a47e1b32913bfa6b141d20bb1585d93de44eceb6e014967d2ca","observation_id":"4a13895a-5f6b-42e3-a2c2-6056c77dd21a","resolution":{"observed_at":"2026-08-06T22:31:39.727732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-06T22:31:39.220992Z","title":"PyTorch FSDP: Experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.220992Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:0f83bbd6ce7caf6337edabc37b1d1efc0517e8055dff309462611e98e266c99c","observation_id":"757b2521-884d-4004-a072-b40518b8c712","resolution":{"observed_at":"2026-08-06T22:31:39.220992Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T22:22:07.489459Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":12,"verified_exact":1,"verified_fuzzy":34},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2506.21468."}