{"as_of":"2026-08-05T14:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9926b25cd30513db3206bfe69ca922be16c09505ec3fdb0a5996a2e785cdb554","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T07:26:37.559459Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:34:28.320684Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T17:08:44.006954Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"cited_work":{"arxiv_id":"2605.09165","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.09165","snapshot_observed_at":"2026-07-03T17:08:44.006954Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","venue":"cs.LG","work_id":"b5dc978e-4719-4b1f-a8b5-98e003943ac7","year":2026},"citing_paper":{"arxiv_id":"2606.24898","last_updated":"2026-06-12T13:23:18Z","snapshot_observed_at":"2026-07-06T23:59:23.407216Z","submitted_at":"2026-06-12T13:23:18Z","title":"Dense Supervision Is Not Enough: The Readout Blind Spot in Looped Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T04:27:48.590008Z"},"links":{"cited_paper":"/paper/2605.09165","citing_paper":"/paper/2606.24898"},"observation_digest":"sha256:6ef06280e3eb9b20fa0d9c643c1644b636859b5062681f8f11898baac647dd8c","observation_id":"956782ee-58a1-44a1-bbe2-b9b7db90e466","resolution":{"observed_at":"2026-07-03T17:08:44.008245Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.09165","snapshot_observed_at":"2026-08-01T21:34:28.320684Z","title":"arXiv preprint arXiv:2605.09165 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16051","last_updated":"2026-07-20T15:59:50Z","snapshot_observed_at":"2026-08-01T21:34:23.247712Z","submitted_at":"2026-07-17T15:28:43Z","title":"Loop the Loopies!","version":2},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-08-01T21:34:28.320684Z"},"links":{"cited_paper":"/paper/2605.09165","citing_paper":"/paper/2607.16051"},"observation_digest":"sha256:4e2a4b7527664eb7a3f02bea4d0bf1adfa5584af62cb37b8247d863a1801f418","observation_id":"3f0ffe69-439e-470a-86ee-8a5bbddbc55f","resolution":{"observed_at":"2026-08-01T21:34:28.320684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.09165/citation-record","integrity":"/paper/2605.09165/integrity","json":"/paper/2605.09165/citation-record.json","paper":"/paper/2605.09165"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1807.03819","last_updated":"2019-03-05T16:46:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-07-10T18:39:15Z","title":"Universal Transformers","version":3},"cited_work":{"arxiv_id":"1807.03819","doi":"10.48550/arxiv.1807.03819","metadata_source":"pith","pith_arxiv_id":"1807.03819","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal Transformers","venue":"cs.CL","work_id":"8e5baefe-d209-411c-aefc-5acaa9275c8a","year":2018},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/1807.03819","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:63b76581d12f815fe8013ba18b617389134133bb5794d50065ec9a42e0bd5ee5","observation_id":"af9ae7f5-b4c6-43fd-9394-60f4ef6c3fd7","resolution":{"observed_at":"2026-07-01T07:35:29.141390Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.25741","last_updated":"2026-07-01T23:25:58Z","snapshot_observed_at":"2026-08-04T07:30:51.188041Z","submitted_at":"2025-10-29T17:45:42Z","title":"Scaling Latent Reasoning via Looped Language Models","version":5},"cited_work":{"arxiv_id":"2510.25741","doi":"10.48550/arxiv.2510.25741","metadata_source":"pith","pith_arxiv_id":"2510.25741","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Latent Reasoning via Looped Language Models","venue":"cs.CL","work_id":"0c087b6b-1850-498b-9197-a0a85ed89937","year":2025},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2510.25741","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:44c374030b254ef5d0311fa20828862898484c01d2965e7fb4ab8a87344bcbfd","observation_id":"08f630f4-af7e-4624-b4fa-8085d07a2458","resolution":{"observed_at":"2026-07-01T07:35:29.143836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:22.789498+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:22.789498+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"cited_work":{"arxiv_id":"2502.05171","doi":"10.1016/0041-5553(81)90075-6","metadata_source":"pith","pith_arxiv_id":"2502.05171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","venue":"cs.LG","work_id":"1ee7474f-a930-486e-897c-207b8755f2c9","year":2025},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2502.05171","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:e13c469db93c0ce9508005ba25b1f2038ba1600a23c3a68ecb3f011796d6583e","observation_id":"6cddd360-fa1d-4001-8120-9b26c997f321","resolution":{"observed_at":"2026-07-01T07:35:29.150966Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:13be3da56b6d11b68734e8bdd4f4aebab0299dd5181ea03f5cc3ddd6f0ac52e0","observation_id":"ebb975bf-74c0-48fa-b4e2-f7c2f1b49285","resolution":{"observed_at":"2026-07-01T07:35:29.146101Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":"1701.06538","doi":"10.48550/arxiv.1701.06538","metadata_source":"pith","pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","venue":"cs.LG","work_id":"2c6b3f6d-54e4-4df7-baa7-475a490799af","year":2017},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:6cf358ef936c44ae91c7e5125ee378f2f178ce50b3bd30727841b6d6ff54a092","observation_id":"96cdd294-7655-4f0a-a445-07e850fc2128","resolution":{"observed_at":"2026-07-01T07:35:29.148683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:32:41.162798Z","title":"MoEUT: Mixture-of-Experts Universal Transformers","venue":null,"work_id":"604c6b1d-43b1-4bb2-94bb-2203999c00b7","year":null},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:89ab56259ff45cf985e0c3941d0603feba274cd035122b7cc135434b30bc627c","observation_id":"fc17ab31-d334-406e-a644-6bbe10371ba7","resolution":{"observed_at":"2026-07-06T15:32:41.166003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:32:41.174331Z","title":null,"venue":null,"work_id":"44a6630f-60c4-45d3-b1d2-ce5e3afc6bdc","year":2016},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:8804feda2aa57f4c564ab5f1b8014412a0d136191a3023c3038766e4d1cd0ce5","observation_id":"30f10f13-7b88-4333-b5e3-bfc05eb0cfd9","resolution":{"observed_at":"2026-07-06T15:32:41.175489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2016.790000","doi":"10.1109/icpr.2016.7900006","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL http://ieeexplore.ieee.org/document/ 7900006/","venue":null,"work_id":"06b9dae8-c94c-4d1c-94dd-e01cda74d0b5","year":2016},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:96ff3fa984aa6569ad0c8afa65780c89c9877dbcf876c6f88abc0a1e9cf3b458","observation_id":"8f2f846e-f696-481b-9a95-f94bf96ddf75","resolution":{"observed_at":"2026-07-01T07:35:28.527666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.12993","last_updated":"2020-04-27T17:58:05Z","snapshot_observed_at":"2026-08-04T21:17:00.414753Z","submitted_at":"2020-04-27T17:58:05Z","title":"DeeBERT: Dynamic Early Exiting for Accelerating BERT Inference","version":1},"cited_work":{"arxiv_id":"2004.12993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2004.12993","snapshot_observed_at":"2026-07-04T13:19:50.449132Z","title":"DeeBERT: Dynam ic Early Exiting for Accelerating BERT Inference","venue":null,"work_id":"1d9ce0aa-b85e-4fca-8bde-cc21a6e6e0f2","year":2020},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2004.12993","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:1c403d57b461c6838bbc3d138ee4768dfc82c4462f2a5e39f349661be6bc6f16","observation_id":"12411a4e-616a-47d4-8169-a10b05fa6253","resolution":{"observed_at":"2026-07-01T07:35:29.162165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07061","last_updated":"2022-10-25T17:44:17Z","snapshot_observed_at":"2026-07-06T13:31:28.340143Z","submitted_at":"2022-07-14T17:00:19Z","title":"Confident Adaptive Language Modeling","version":2},"cited_work":{"arxiv_id":"2207.07061","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.07061","snapshot_observed_at":"2026-07-04T09:59:45.315505Z","title":"arXiv preprint arXiv:2207.07061 , year=","venue":null,"work_id":"e1924365-405d-4d8f-a85e-cfb486b651d7","year":2022},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2207.07061","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:7421a6b625eeb395b77119144d9bfe9ae89261feabcb0ff8bb0c62598919eec7","observation_id":"7b3c31ce-afb1-40e2-bb03-9e3114b67417","resolution":{"observed_at":"2026-07-01T07:35:29.157001Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":"2104.09864","doi":"10.48550/arxiv.2104.09864","metadata_source":"pith","pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","venue":"cs.CL","work_id":"4e5eee26-cd04-4c7a-988f-3e6d1a1f0eb9","year":2021},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:ab70bbd16b058f4d7a47722d5ece80bc28322a3a2b8f152a2928a9c30eb3250f","observation_id":"340b20d4-83df-4fb3-a089-43013b248b20","resolution":{"observed_at":"2026-07-01T07:35:29.144506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:47.452101+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:47.452101+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":"2002.05202","doi":"10.48550/arxiv.2002.05202","metadata_source":"pith","pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLU Variants Improve Transformer","venue":"cs.LG","work_id":"17d0763c-1016-41ab-a478-478e890765eb","year":2020},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:f576dd71ef030cc124908539ad3248d3054503b7b64b005855649ee7ff8a6436","observation_id":"4f4bb4fd-9db1-453f-85dd-52893aceb77f","resolution":{"observed_at":"2026-07-01T07:35:29.149543Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:32:41.170621Z","title":"Root Mean Square Layer Normalization","venue":null,"work_id":"8d4bdcb8-c235-4024-a741-f48d914407b4","year":2019},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:2f283af3d0545b2f842b009c1025dee6d07976bb706a6fc73cfe9c423e831717","observation_id":"7e856c73-559c-4b1d-bff5-27469d4ea621","resolution":{"observed_at":"2026-07-06T15:32:41.171792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6589.35867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T07:35:29.130061Z","title":"Switch transformers: scaling to trillion parameter models with simple and efficient sparsity.J","venue":null,"work_id":"03264918-2abd-4ebe-806b-ba99153762c5","year":2022},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:d155cdab2628c3666a2eba40a43670e11ab2361fbdd04c3bb690a9c0093defcf","observation_id":"252f9fdf-be00-47a8-a6d7-a4206bc4ecd0","resolution":{"observed_at":"2026-07-01T07:35:29.131604Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:32:41.166667Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models, April","venue":null,"work_id":"09c53be8-1799-4aba-9537-8092e6d7b435","year":null},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:70f4bbc7626c9b7ef96487dc88d3f68814481a94340ab1a31632ccc914bbf629","observation_id":"6ae657e2-4a9d-45a9-b8fa-3a8e84edd563","resolution":{"observed_at":"2026-07-06T15:32:41.168219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:b570c2a7d4af0bb0844037a120aead149a0bb022e9800ec78394a02f5598690e","observation_id":"a8545f5e-dea0-4647-b36b-3b57af46b590","resolution":{"observed_at":"2026-07-01T07:35:29.151888Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":"2401.04088","doi":"10.48550/arxiv.2401.04088","metadata_source":"pith","pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixtral of Experts","venue":"cs.LG","work_id":"0de8c352-9daa-4e1e-8c7b-3d0dec69f369","year":2024},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:a2f9b4a045905aecda212f475f81a3c9f477af86c5545bf858c67632e5b4c5b3","observation_id":"ace89dca-a025-4f73-a417-b3b1e17513b4","resolution":{"observed_at":"2026-07-01T07:35:29.139849Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-03T21:15:21.591567Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:db939d14663b7bdfdb2c9940778163f8f005125d889fe225f3e97f1483b06175","observation_id":"8e1563b3-a639-4f80-b3cb-96f1a24bc552","resolution":{"observed_at":"2026-07-01T07:35:29.134236Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.09752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:09:15.185738Z","title":"µ-parametrization for mixture of experts","venue":null,"work_id":"62e853f3-89d4-4c66-b43d-a2a6c7f0db29","year":2025},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:13c451fc2e02ae446bcea04961993663d5568f6fcc3d31f3ec2761772a87f298","observation_id":"8d7e4e47-4e11-4c1f-9fc7-d0c71b3b12b6","resolution":{"observed_at":"2026-07-01T07:35:29.137134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:ea68ca842d89ca2cb3304076051d86a743b2f2ed38b3b9e32bb83e565edf53d8","observation_id":"78d1846f-9335-4d9d-9343-6f08a72c761e","resolution":{"observed_at":"2026-07-01T07:35:29.154592Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":"2406.17557","doi":"10.48550/arxiv.2406.17557","metadata_source":"pith","pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","venue":"cs.CL","work_id":"1ac90585-1330-4f90-8836-6382fa63c4eb","year":2024},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:0573abcb90d1fe3ae9f369a411161da7dc88e60280c4e8baf46d5535960cf0bf","observation_id":"0c737458-8940-4103-a9d9-b1a1f75a123a","resolution":{"observed_at":"2026-07-01T07:35:29.164556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":"2404.06395","doi":"10.48550/arxiv.2404.06395","metadata_source":"pith","pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","venue":"cs.CL","work_id":"f20a4304-bd39-414a-923b-d18322e29258","year":2024},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:b837a7676926452bb5d77ddf40faf531f074632d62cc0e6f46b8bb78e2fad96c","observation_id":"0a558ddc-639f-478e-a3e9-510344677a4e","resolution":{"observed_at":"2026-07-01T07:35:29.142171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01483","last_updated":"2025-08-02T20:36:52Z","snapshot_observed_at":"2026-07-06T22:06:52.899807Z","submitted_at":"2025-08-02T20:36:52Z","title":"Training Dynamics of the Cooldown Stage in Warmup-Stable-Decay Learning Rate Scheduler","version":1},"cited_work":{"arxiv_id":"2508.01483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.01483","snapshot_observed_at":"2026-07-01T07:35:29.145833Z","title":"Training Dynamics of the Cooldown Stage in Warmup-Stable-Decay Learning Rate Scheduler, August 2025","venue":null,"work_id":"8b0358ac-cab2-404f-b301-43a6cf75227e","year":2025},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2508.01483","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:8b8acbf02b69d97df45f5b307ac92f1de5048ab051fe3a2b9f07a4b6dbd884d9","observation_id":"912ed991-2177-4a6b-84d1-51791829ffd9","resolution":{"observed_at":"2026-07-01T07:35:29.147307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08446","last_updated":"2025-02-11T18:59:26Z","snapshot_observed_at":"2026-08-02T04:58:48.093084Z","submitted_at":"2024-06-12T17:37:09Z","title":"OLMES: A Standard for Language Model Evaluations","version":2},"cited_work":{"arxiv_id":"2406.08446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08446","snapshot_observed_at":"2026-07-03T16:48:39.417321Z","title":"Olmes: A standard for language model evaluations","venue":null,"work_id":"5eb8c12c-3fc3-4566-b5e8-a7408678ffed","year":2025},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2406.08446","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:abd92e0a461ed48a2593d4ead010c33795b7304e43aaec83c2480eece9f6d1ce","observation_id":"19f4615f-ead4-43ca-8814-52ef30da456b","resolution":{"observed_at":"2026-07-01T07:35:29.159520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:32:41.168829Z","title":null,"venue":null,"work_id":"e4cc2be3-47bd-47e0-ab47-3725ea60185e","year":2026},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:3daf36c5b87ae6bbd8b96a7309d3cfdaad79310cfbb4a4c9dadc97c9d34634df","observation_id":"1678ac11-6a11-4607-b776-7df0c13b453f","resolution":{"observed_at":"2026-07-06T15:32:41.170030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:32:41.178083Z","title":"interpreting GPT: the logit lens — LessWrong","venue":null,"work_id":"c80105b1-c01f-4f1a-a102-5eaa650f4cb0","year":null},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:d1d4e6a9612549dd5d4ec9736698f46f54b62dd9ccff415949402caef82ff21f","observation_id":"8ea638cf-0782-4ebb-b23c-db06c9603c45","resolution":{"observed_at":"2026-07-06T15:32:41.179388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:32:41.176092Z","title":null,"venue":null,"work_id":"f7311685-90d0-4388-9a8a-086a1b888d90","year":null},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:34062ced5880c03ef2267f773b78de31a19011f0ef67e8b709ad3d1bc2f11410","observation_id":"66c4dcfe-c260-41f7-bad6-0cee2d519e0a","resolution":{"observed_at":"2026-07-06T15:32:41.177501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10837","last_updated":"2023-11-21T13:58:00Z","snapshot_observed_at":"2026-07-06T16:34:11.453458Z","submitted_at":"2023-10-16T21:23:16Z","title":"Approximating Two-Layer Feedforward Networks for Efficient Transformers","version":3},"cited_work":{"arxiv_id":"2310.10837","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10837","snapshot_observed_at":"2026-07-01T07:35:29.119466Z","title":"Approximating two-layer feedforward networks for efficient transformers.arXiv preprint arXiv:2310.10837","venue":null,"work_id":"f5009881-2b7f-4c4d-9d59-12451474cafc","year":2023},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2310.10837","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:a84168080c2d2eb8ce77b36a74d5b914815684c203e697251326264ac970466b","observation_id":"012e7808-59e0-460c-b772-3acd216a5213","resolution":{"observed_at":"2026-07-01T07:35:29.121225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07987","last_updated":"2024-09-30T21:19:29Z","snapshot_observed_at":"2026-08-03T12:04:56.535363Z","submitted_at":"2023-12-13T09:00:21Z","title":"SwitchHead: Accelerating Transformers with Mixture-of-Experts Attention","version":3},"cited_work":{"arxiv_id":"2312.07987","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.07987","snapshot_observed_at":"2026-07-11T03:27:46.660519Z","title":"SwitchHead: Accelerating Transformers with Mixture-of-Experts Attention, September 2024","venue":"cs.LG","work_id":"ccf4f481-e6c9-4911-9040-cacbf6460992","year":2023},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2312.07987","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:dd437219839488c921a1ecbc35351ab144a688d7f6e49f117282f4b71cb6ee3a","observation_id":"82b6ef2c-655b-4686-ac88-54e268505ad6","resolution":{"observed_at":"2026-07-01T07:35:29.123697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":"1607.06450","doi":"10.1007/978-3-319-32025-0","metadata_source":"pith","pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer Normalization","venue":"stat.ML","work_id":"20a2d720-0046-4c7c-bcd6-327ec8143f69","year":2016},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:95166fd39cc5a4d260694d3577bd1fa88633f0be87af25cf6d3bbc46c2744062","observation_id":"16c6fe74-1d7f-4843-a6e4-2b631db4cdb7","resolution":{"observed_at":"2026-07-01T07:35:29.126150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.681","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"L ayer S kip: Enabling Early Exit Inference and Self-Speculative Decoding","venue":null,"work_id":"31ebf2f1-9b25-46da-b184-ae5d773ad1ee","year":2024},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:1c623ee99c741e50d00e15be36c992b06163ab01afeea9f11f3baa821cd57b01","observation_id":"19915ffc-48c3-483d-833a-1635d2273075","resolution":{"observed_at":"2026-07-01T07:35:28.530348Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T20:19:07.853648+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T20:19:07.853648+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":"2404.02258","doi":"10.48550/arxiv.2404.02258","metadata_source":"pith","pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","venue":"cs.LG","work_id":"6dcdd707-a37b-49a9-9531-4fc6f5b9ed84","year":2024},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:bc7d60c4a11f2457bae2f6aab9a39cc43b515833d17dae95f7127b48ed54023c","observation_id":"1de4db74-4a21-4dd7-b6b2-3b4b7cb1b546","resolution":{"observed_at":"2026-07-01T07:35:29.113057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.10524","doi":"10.48550/arxiv.2507.10524","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixture-of-recursions: Learning dynamic recur- sive depths for adaptive token-level computation.arXiv preprint arXiv:2507.10524","venue":"arXiv (Cornell University)","work_id":"ed1d0e33-93b9-4552-99a2-207324938ead","year":2025},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:580d9c31c481c62211d73c38dbde3e915b3ce8b1eecd800ee0567bd99ed86a1e","observation_id":"59aaef27-6760-4cdf-a2ec-0da6d6763c27","resolution":{"observed_at":"2026-07-01T07:35:29.115807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.01618","doi":"10.48550/arxiv.2505.01618","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don’t be lazy: Completep enables compute-efficient deep transformers","venue":"ArXiv.org","work_id":"85f11780-ed20-4881-8d31-bb0834b58027","year":2025},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:441055d4101cf268f8ad55926faf47a82295b6b7a90b76a095e99dcde825871c","observation_id":"f9b073a9-3594-4bd7-a615-fd79224e0d35","resolution":{"observed_at":"2026-07-01T07:35:29.118338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":1,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":3,"verified_exact":19,"verified_fuzzy":4},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 2 inbound Pith citation observations for arXiv:2605.09165."}