{"as_of":"2026-08-08T16:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d8391137cf2f6ff22a6d4a2e81d29332b094b6576693c841a4dbcc2eca54c0e","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T02:11:16.513360Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14427/citation-record","integrity":"/paper/2607.14427/integrity","json":"/paper/2607.14427/citation-record.json","paper":"/paper/2607.14427"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-02T02:11:13.508966Z","title":"GQA: Training generalized multi-query transformer models from multi-head checkpoints.arXiv preprint arXiv:2305.13245, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:13.508966Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:30226b0a2524124f1c28762e97718a2acdde5c678885fab98d5e83829b8ea802","observation_id":"bffdc4e3-6a1c-4939-9d5b-6a0cdf1f7e03","resolution":{"observed_at":"2026-08-02T02:11:13.508966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02737","snapshot_observed_at":"2026-08-02T02:11:13.651051Z","title":"SmolLM2: When smol goes big – data-centric training of a small language model.arXiv preprint arXiv:2502.02737, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:13.651051Z"},"links":{"cited_paper":"/paper/2502.02737","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:12928b0a16ed92f745c6e3f20803a712f20dd4f7ec4393c5cbd800b51ae36331","observation_id":"9d1e1e34-15cd-4601-8118-0259002d4f67","resolution":{"observed_at":"2026-08-02T02:11:13.651051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:11:13.810740Z","title":"Mixture-of-recursions: Learning dynamic recursive depths for adaptive token-level computation.arXiv preprint arXiv:2507.10524, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:13.810740Z"},"links":{"citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:db15ab13c43ba78568fdfcfeb243cca7258a2dcc63ef1b8d4804cbd5b0567976","observation_id":"15a154a3-b546-4fe2-b9f7-e10eb352530b","resolution":{"observed_at":"2026-08-02T02:11:13.810740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.05407","last_updated":"2021-09-02T08:48:41Z","snapshot_observed_at":"2026-07-06T11:28:17.810519Z","submitted_at":"2021-07-12T13:24:03Z","title":"PonderNet: Learning to Ponder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.05407","snapshot_observed_at":"2026-08-02T02:11:13.947284Z","title":"PonderNet: Learning to ponder.arXiv preprint arXiv:2107.05407, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:13.947284Z"},"links":{"cited_paper":"/paper/2107.05407","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:314d1231356d728cf5e316ac23868a5cfc0c701a60412679c043fc8cbbbf5e5b","observation_id":"d4575402-d871-496d-a3e7-56479f56c5e5","resolution":{"observed_at":"2026-08-02T02:11:13.947284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.21999","last_updated":"2026-05-03T23:45:19Z","snapshot_observed_at":"2026-08-08T02:11:25.652010Z","submitted_at":"2026-04-23T18:30:01Z","title":"Universal Transformers Need Memory: Depth-State Trade-offs in Adaptive Recursive Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.21999","snapshot_observed_at":"2026-08-02T02:11:14.129619Z","title":"Universal transformers need memory: Depth-state trade-offs in recurrent language models.arXiv preprint arXiv:2604.21999, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:14.129619Z"},"links":{"cited_paper":"/paper/2604.21999","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:5b5eaa36ed8abe81dd78d205b05986645295c135180b597623fadade984ddc5d","observation_id":"928e9500-c1ab-4903-abd3-4c5d5dc35b1b","resolution":{"observed_at":"2026-08-02T02:11:14.129619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03819","last_updated":"2019-03-05T16:46:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-07-10T18:39:15Z","title":"Universal Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03819","snapshot_observed_at":"2026-08-02T02:11:14.285419Z","title":"Uni- versal transformers","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:14.285419Z"},"links":{"cited_paper":"/paper/1807.03819","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:33488a7507b0aabd74572f9ec0f181b6734092ed09849bbb495a5f33b6c6f79a","observation_id":"4e5f5782-94e1-46eb-83a1-db0765b00862","resolution":{"observed_at":"2026-08-02T02:11:14.285419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02628","last_updated":"2023-07-05T19:59:09Z","snapshot_observed_at":"2026-07-06T15:50:49.116859Z","submitted_at":"2023-07-05T19:59:09Z","title":"SkipDecode: Autoregressive Skip Decoding with Batching and Caching for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02628","snapshot_observed_at":"2026-08-02T02:11:14.454774Z","title":"SkipDecode: Autoregressive skip decoding with batching and caching for efficient llm inference.arXiv preprint arXiv:2307.02628, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:14.454774Z"},"links":{"cited_paper":"/paper/2307.02628","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:f2f204853337f28728205f18c9780ae06e384121083796dd6cc1bbd7b99ed93d","observation_id":"bf4ba506-0967-4a2d-ac28-8682fd074c09","resolution":{"observed_at":"2026-08-02T02:11:14.454774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07759","last_updated":"2023-05-24T23:30:43Z","snapshot_observed_at":"2026-08-04T10:35:00.917001Z","submitted_at":"2023-05-12T20:56:48Z","title":"TinyStories: How Small Can Language Models Be and Still Speak Coherent English?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07759","snapshot_observed_at":"2026-08-02T02:11:14.582249Z","title":"TinyStories: How small can language models be and still speak coherent english?arXiv preprint arXiv:2305.07759, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:14.582249Z"},"links":{"cited_paper":"/paper/2305.07759","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:6a21583d8d2135c097f5e74398049ef59468a8f80ab2b99bf6b767291fd409b6","observation_id":"e54e4c6a-e925-4a8e-8f66-61838f3d0209","resolution":{"observed_at":"2026-08-02T02:11:14.582249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16710","last_updated":"2024-10-18T04:02:31Z","snapshot_observed_at":"2026-08-08T01:15:44.293937Z","submitted_at":"2024-04-25T16:20:23Z","title":"LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16710","snapshot_observed_at":"2026-08-02T02:11:14.732055Z","title":"LayerSkip: Enabling early exit inference and self-speculative decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:14.732055Z"},"links":{"cited_paper":"/paper/2404.16710","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:62770cf7a2103098f7d6efa57dded5894bb54229be20042bc55d61671fc33e1e","observation_id":"3d93ce17-e426-441a-9ad9-6306c37e10a7","resolution":{"observed_at":"2026-08-02T02:11:14.732055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05171","snapshot_observed_at":"2026-08-02T02:11:14.888008Z","title":"Scaling up test-time compute with latent reasoning: A recurrent depth approach.arXiv preprint arXiv:2502.05171, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:14.888008Z"},"links":{"cited_paper":"/paper/2502.05171","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:a5553753a1dc221d0d87c41c03f97617753abd07ee47e1710608bfb56b3d0099","observation_id":"58ad91f2-0cb3-4941-b63f-47ceb72dffcc","resolution":{"observed_at":"2026-08-02T02:11:14.888008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.08983","last_updated":"2017-02-21T16:21:21Z","snapshot_observed_at":"2026-08-04T14:24:45.814840Z","submitted_at":"2016-03-29T22:09:00Z","title":"Adaptive Computation Time for Recurrent Neural Networks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.08983","snapshot_observed_at":"2026-08-02T02:11:15.102556Z","title":"Adaptive computation time for recurrent neural networks.arXiv preprint arXiv:1603.08983, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:15.102556Z"},"links":{"cited_paper":"/paper/1603.08983","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:f03c3c4d5f641a91c890b26554ce9815794b4b749f14b99391fb06671bacf0e3","observation_id":"4c007706-e6ab-490e-b29b-6e88e6bf5510","resolution":{"observed_at":"2026-08-02T02:11:15.102556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:11:15.291743Z","title":"LoopFormer: Elastic-depth looped transformers with shortcut consistency","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:15.291743Z"},"links":{"citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:38d372e1d4110feb9323a0c251d88ced7e1849fcc71157463ede155fb8b8bf97","observation_id":"13bef610-a4b3-48c8-baba-075bb40cfc3f","resolution":{"observed_at":"2026-08-02T02:11:15.291743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-02T02:11:15.412312Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:15.412312Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:50ab6be8256f27e02652551912f3731e8ed069313c6e93e57c17710bbac6535f","observation_id":"637c62c6-6d6e-4921-a3d3-ef2872959bec","resolution":{"observed_at":"2026-08-02T02:11:15.412312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-02T02:11:15.588268Z","title":"The FineWeb datasets: Decanting the web for the finest text data at scale.arXiv preprint arXiv:2406.17557, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:15.588268Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:3f3b7a2d6bbadf19d03a2bae8b632225c535118621b6de5414d9db4c653e0f0a","observation_id":"3f2c8873-1fa9-4001-8f17-ef43c54d9999","resolution":{"observed_at":"2026-08-02T02:11:15.588268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:11:15.705842Z","title":"Rao et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:15.705842Z"},"links":{"citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:9763b2b6095099047727394ad019b43edd0a62216b84065883218d2841947cc2","observation_id":"c6bc1fa6-fa78-4563-a566-ccd52bbfd934","resolution":{"observed_at":"2026-08-02T02:11:15.705842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-02T02:11:15.817770Z","title":"Mixture-of-depths: Dynamically allocating compute in transformer-based language models.arXiv preprint arXiv:2404.02258, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:15.817770Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:4093f7022ce471f3d32ac3e3a0671390188b1fbcd7f5b5e7d3e0fc17c289845d","observation_id":"48c0a03a-7d61-4feb-834d-905662959a56","resolution":{"observed_at":"2026-08-02T02:11:15.817770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07061","last_updated":"2022-10-25T17:44:17Z","snapshot_observed_at":"2026-07-06T13:31:28.340143Z","submitted_at":"2022-07-14T17:00:19Z","title":"Confident Adaptive Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.07061","snapshot_observed_at":"2026-08-02T02:11:15.941481Z","title":"Confident adaptive language modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:15.941481Z"},"links":{"cited_paper":"/paper/2207.07061","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:1eec7f2dfa7d2a5cfa202026ab9d2e5e732adebfd2f6297da612b9ee683665f5","observation_id":"18876a6a-65bf-4505-bc80-fe044b0dc32f","resolution":{"observed_at":"2026-08-02T02:11:15.941481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-02T02:11:16.062703Z","title":"GLU variants improve transformer.arXiv preprint arXiv:2002.05202, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:16.062703Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:2802b4b2fff5a7da69f650136dda24afe3390bb16ccc69e956885b3bcbc7d472","observation_id":"3f1548c6-79f8-4b6d-a462-085bd2862b19","resolution":{"observed_at":"2026-08-02T02:11:16.062703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-02T02:11:16.178719Z","title":"RoFormer: Enhanced transformer with rotary position embedding.Neurocomputing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:16.178719Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:54c6ed34c4820cff02c9f89d7191a0f9cb3337fd5f255df83270f13b8cb1bcb7","observation_id":"e03f9504-f999-46c5-b18b-1b566548980a","resolution":{"observed_at":"2026-08-02T02:11:16.178719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-02T02:11:16.285397Z","title":"LLaMA: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:16.285397Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:de259a2d954bee39c897733e9b19b2f9299e70d30cb1f1805530545ca73aafdd","observation_id":"33cc853a-d9e6-47dd-8e6c-fd41aa0c53cf","resolution":{"observed_at":"2026-08-02T02:11:16.285397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:11:16.345368Z","title":"Whitfield et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:16.345368Z"},"links":{"citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:0320cd3284ee8e4454e6bb9d8dc7121efe9962219f3472cf6bfa2bcadae971a9","observation_id":"aed49fa9-93f4-46df-805f-d5e66e9fb49f","resolution":{"observed_at":"2026-08-02T02:11:16.345368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07467","last_updated":"2019-10-16T16:44:22Z","snapshot_observed_at":"2026-08-08T08:22:25.110228Z","submitted_at":"2019-10-16T16:44:22Z","title":"Root Mean Square Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07467","snapshot_observed_at":"2026-08-02T02:11:16.427367Z","title":"Root mean square layer normalization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:16.427367Z"},"links":{"cited_paper":"/paper/1910.07467","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:df4e5c744a5c357bce3a4f24cb52e4fa97f1b40c55c405a50313e80084a177be","observation_id":"ea20cac2-1617-4a50-9906-1bf661cb5fe6","resolution":{"observed_at":"2026-08-02T02:11:16.427367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.25741","last_updated":"2026-07-01T23:25:58Z","snapshot_observed_at":"2026-08-04T07:30:51.188041Z","submitted_at":"2025-10-29T17:45:42Z","title":"Scaling Latent Reasoning via Looped Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.25741","snapshot_observed_at":"2026-08-02T02:11:16.513360Z","title":"Zhu et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T02:11:16.513360Z"},"links":{"cited_paper":"/paper/2510.25741","citing_paper":"/paper/2607.14427"},"observation_digest":"sha256:d9f4a66be098b3deb0d032d500122ad6951ecc8e310d57810794fb1b92c8b4ab","observation_id":"ec5d48a4-d7f2-4618-b9ce-e8426e8dc95f","resolution":{"observed_at":"2026-08-02T02:11:16.513360Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14427","last_updated":"2026-07-15T23:38:44Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T08:11:54.028155Z","submitted_at":"2026-07-15T23:38:44Z","title":"Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2607.14427."}