{"as_of":"2026-08-07T23:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:821d44fdd1c211a307be344ee69411448bc339bc42560fb82943bcebef0f470d","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:05:25.943958Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:00:20.206489Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.13491","snapshot_observed_at":"2026-08-04T09:00:20.206489Z","title":"DeepLoop: Depth Scaling for Looped Transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02346","last_updated":"2026-08-03T14:59:21Z","snapshot_observed_at":"2026-08-07T10:30:33.609944Z","submitted_at":"2026-08-03T14:59:21Z","title":"Loop-Mamba: A Loop Mamba with Degradation-Aware and Shared Memory for Old Photo Restoration","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T09:00:20.206489Z"},"links":{"cited_paper":"/paper/2607.13491","citing_paper":"/paper/2608.02346"},"observation_digest":"sha256:32b4e3a4c418b097fb4947b35547526de34d6c76bd0d7d55dcaa2fa8efe20efb","observation_id":"baf61db0-02d6-4a67-88c3-7e01ccf72a50","resolution":{"observed_at":"2026-08-04T09:00:20.206489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.13491/citation-record","integrity":"/paper/2607.13491/integrity","json":"/paper/2607.13491/citation-record.json","paper":"/paper/2607.13491"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:05:25.943958Z","title":"We test this prediction directly with a single-axis sweep over the exponentp at fixedR=3 on the GPT-2 small backbone","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.943958Z"},"links":{"citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:237c672a12cda58553fe67804c9f81a24d0fbd993038f7c557e70a4892ebcddd","observation_id":"7d8143d7-22d8-4bfa-ac71-09948ed90cd5","resolution":{"observed_at":"2026-08-02T05:05:25.943958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05171","snapshot_observed_at":"2026-08-02T05:05:25.255642Z","title":"Scaling up test-time compute with latent reasoning: A recurrent depth approach.arXiv preprint arXiv:2502.05171,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.255642Z"},"links":{"cited_paper":"/paper/2502.05171","citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:35510d78df04ebfeb0e25c9ae120dba4490383c67eac6114d7ed90462cbedc53","observation_id":"4688a474-d262-4da3-bbdc-759ffb373a48","resolution":{"observed_at":"2026-08-02T05:05:25.255642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02226","last_updated":"2024-04-21T03:39:21Z","snapshot_observed_at":"2026-08-06T21:01:03.193755Z","submitted_at":"2023-10-03T17:32:41Z","title":"Think before you speak: Training Language Models With Pause Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02226","snapshot_observed_at":"2026-08-02T05:05:25.293025Z","title":"Think before you speak: Training language models with pause tokens.arXiv preprint arXiv:2310.02226,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.293025Z"},"links":{"cited_paper":"/paper/2310.02226","citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:29bbd9bd1904c06a2d273c77381879dfea5549cd8e89c753fd73b2eb46c2d56a","observation_id":"51fd1338-e877-4b76-9ef7-4fb9d4d55b48","resolution":{"observed_at":"2026-08-02T05:05:25.293025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.08983","last_updated":"2017-02-21T16:21:21Z","snapshot_observed_at":"2026-08-04T14:24:45.814840Z","submitted_at":"2016-03-29T22:09:00Z","title":"Adaptive Computation Time for Recurrent Neural Networks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.08983","snapshot_observed_at":"2026-08-02T05:05:25.336423Z","title":"Adaptive computation time for recurrent neural networks.arXiv preprint arXiv:1603.08983,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.336423Z"},"links":{"cited_paper":"/paper/1603.08983","citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:19efde2e1b75d6b44f611a8794432dabcaccee6b1725c557caed50e367c3765f","observation_id":"a57bc42c-8a0a-4825-b8b2-1ffd28471b8c","resolution":{"observed_at":"2026-08-02T05:05:25.336423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-02T05:05:25.423184Z","title":"Training compute-optimal large language models.arXiv preprint arXiv:2203.15556,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.423184Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:d558f3e11e99b0397ea7447552c06262a55c55f5f70980b4903f7bbf4d48a7ff","observation_id":"3ea5ab9a-7864-44ca-9a21-4c0f9db82f1a","resolution":{"observed_at":"2026-08-02T05:05:25.423184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-02T05:05:25.461381Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.461381Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:9c8d367edc0bc59760245b7499619518e487b95008f4f567d0a4afd5a4053d18","observation_id":"a033c654-852b-4cea-956f-7be28130c703","resolution":{"observed_at":"2026-08-02T05:05:25.461381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-07-06T08:24:44.631342Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11942","snapshot_observed_at":"2026-08-02T05:05:25.496749Z","title":"Albert: A lite bert for self-supervised learning of language representations.arXiv preprint arXiv:1909.11942,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.496749Z"},"links":{"cited_paper":"/paper/1909.11942","citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:9a59e3050cb5646bceecfb920d6bde2163e5a3613ede7e7da038d17679ec1093","observation_id":"d1adb5a0-6984-4e3f-9708-c132d8c7a7de","resolution":{"observed_at":"2026-08-02T05:05:25.496749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:05:25.581738Z","title":"Subformer: Exploring weight sharing for parameter efficiency in generative transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.581738Z"},"links":{"citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:8ae09623ff62a2e60d8eb6f5a8596542a65fb3081d93d779ca160c5a0e1ee612","observation_id":"24b1bc02-b38c-4dfd-b649-30ea0c125ae6","resolution":{"observed_at":"2026-08-02T05:05:25.581738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17416","last_updated":"2025-02-24T18:49:05Z","snapshot_observed_at":"2026-08-07T17:52:21.542087Z","submitted_at":"2025-02-24T18:49:05Z","title":"Reasoning with Latent Thoughts: On the Power of Looped Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17416","snapshot_observed_at":"2026-08-02T05:05:25.615490Z","title":"Reasoning with latent thoughts: On the power of looped transformers.arXiv preprint arXiv:2502.17416,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.615490Z"},"links":{"cited_paper":"/paper/2502.17416","citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:ab36fa2fd19ac0d9bebdb6872df74dd42712131efb738b04816293b634031520","observation_id":"e76d8fd9-76ac-4873-8ebc-75ad7cc8651a","resolution":{"observed_at":"2026-08-02T05:05:25.615490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02244","last_updated":"2023-10-12T17:50:31Z","snapshot_observed_at":"2026-08-06T03:52:25.161270Z","submitted_at":"2023-10-03T17:50:40Z","title":"Tensor Programs VI: Feature Learning in Infinite-Depth Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02244","snapshot_observed_at":"2026-08-02T05:05:25.727834Z","title":"Tensor programs vi: Feature learning in infinite-depth neural networks.arXiv preprint arXiv:2310.02244, 2023a","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.727834Z"},"links":{"cited_paper":"/paper/2310.02244","citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:d0d09c3b96d0201717b0504b1068c070f1528c3655821f5da44c8ab9c61d4dd2","observation_id":"43a20b59-8207-448e-8146-886ab29ac9f2","resolution":{"observed_at":"2026-08-02T05:05:25.727834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.00417","last_updated":"2026-07-27T23:05:42Z","snapshot_observed_at":"2026-08-03T13:08:22.353654Z","submitted_at":"2026-01-01T18:11:38Z","title":"Deep Delta Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.00417","snapshot_observed_at":"2026-08-02T05:05:25.797553Z","title":"Deep delta learning.arXiv preprint arXiv:2601.00417,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.797553Z"},"links":{"cited_paper":"/paper/2601.00417","citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:2de5d6586f82c2ce42f64c272e3c252065deec9c2a6f26180e0219f17afff34a","observation_id":"ffb217f5-4f37-4f21-9fc6-08be4b760cf4","resolution":{"observed_at":"2026-08-02T05:05:25.797553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:05:25.885020Z","title":"24); training uses the same FineWeb-Edu 50BT data and schedule but on4×H200 141GB GPUs","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":1024,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.885020Z"},"links":{"citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:662648ea306b7af55fc01e85a0956ba40a669e3c22ab93f894d8d1a1095b2b62","observation_id":"6529b4a7-67c0-43a4-ba10-6f763ce01537","resolution":{"observed_at":"2026-08-02T05:05:25.885020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-02T05:05:25.388448Z","title":"Training large language models to reason in a continuous latent space.arXiv preprint arXiv:2412.06769,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.388448Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:e01b9d43a3fc131a4032d57997a7309525553852b8ccc0d544489df459bb6402","observation_id":"8f5460ee-ff24-4378-8f35-f2cc1cef677a","resolution":{"observed_at":"2026-08-02T05:05:25.388448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21734","last_updated":"2025-08-04T08:45:08Z","snapshot_observed_at":"2026-08-06T13:55:12.607273Z","submitted_at":"2025-06-26T19:39:54Z","title":"Hierarchical Reasoning Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21734","snapshot_observed_at":"2026-08-02T05:05:25.655492Z","title":"Hierarchical reasoning model.arXiv preprint arXiv:2506.21734,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.655492Z"},"links":{"cited_paper":"/paper/2506.21734","citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:0521f90fce54697996a63dfa28fa2aa58ce1eb2cd7f8fb749fe4962ed183bb00","observation_id":"c1a3d0d8-4bad-41f9-8938-720584511857","resolution":{"observed_at":"2026-08-02T05:05:25.655492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:05:25.536046Z","title":"Understanding the difficulty of training transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.536046Z"},"links":{"citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:d81888d229eee7a1e575fde64d29decbfb5e2bc96c4aa502cc957d1370ff3470","observation_id":"4f915f51-9122-4c70-a914-d11e4763450c","resolution":{"observed_at":"2026-08-02T05:05:25.536046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03819","last_updated":"2019-03-05T16:46:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-07-10T18:39:15Z","title":"Universal Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03819","snapshot_observed_at":"2026-08-02T05:05:25.173822Z","title":"Universal transformers.arXiv preprint arXiv:1807.03819,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.173822Z"},"links":{"cited_paper":"/paper/1807.03819","citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:a0f31039a6d7bb3b9d072a198487d193d6799a6810b6ab3e7225f6c6d4e0e8d7","observation_id":"5e78b15b-420d-4b80-b576-85133cf31047","resolution":{"observed_at":"2026-08-02T05:05:25.173822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.05407","last_updated":"2021-09-02T08:48:41Z","snapshot_observed_at":"2026-07-06T11:28:17.810519Z","submitted_at":"2021-07-12T13:24:03Z","title":"PonderNet: Learning to Ponder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.05407","snapshot_observed_at":"2026-08-02T05:05:24.981055Z","title":"Pondernet: Learning to ponder.arXiv preprint arXiv:2107.05407,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:24.981055Z"},"links":{"cited_paper":"/paper/2107.05407","citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:a95271ff5b3b0d62d43fd74e97b7dedc2188e6db443157dd0945cd64b3c54a09","observation_id":"9a32a304-b21d-4a35-afbe-ab95480ae931","resolution":{"observed_at":"2026-08-02T05:05:24.981055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16620","last_updated":"2023-12-08T18:19:44Z","snapshot_observed_at":"2026-07-06T16:25:01.609308Z","submitted_at":"2023-09-28T17:20:50Z","title":"Depthwise Hyperparameter Transfer in Residual Networks: Dynamics and Scaling Limit","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16620","snapshot_observed_at":"2026-08-02T05:05:25.062788Z","title":"Depthwise hyperpa- rameter transfer in residual networks: Dynamics and scaling limit.arXiv preprint arXiv:2309.16620,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.062788Z"},"links":{"cited_paper":"/paper/2309.16620","citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:d95951192d9808afd2875936abbcdf84f56516c641ff49472f3e4a01c6c45a9f","observation_id":"68bcd095-042b-47ed-a5ca-ab7bc458c5f6","resolution":{"observed_at":"2026-08-02T05:05:25.062788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01547","last_updated":"2019-11-25T13:02:04Z","snapshot_observed_at":"2026-07-06T08:34:41.399203Z","submitted_at":"2019-11-05T00:31:38Z","title":"On the Measure of Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01547","snapshot_observed_at":"2026-08-02T05:05:25.126875Z","title":"On the measure of intelligence.arXiv preprint arXiv:1911.01547,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.126875Z"},"links":{"cited_paper":"/paper/1911.01547","citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:684dfa90e909464653cf9089482ce24c536e707358fa55d9e66707918821c106","observation_id":"e9899462-613a-42c4-9cdc-e16ce89aa748","resolution":{"observed_at":"2026-08-02T05:05:25.126875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:05:25.210943Z","title":"15 Khashayar Gatmiry, Nikunj Saunshi, Sashank J Reddi, Stefanie Jegelka, and Sanjiv Kumar","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T05:05:25.210943Z"},"links":{"citing_paper":"/paper/2607.13491"},"observation_digest":"sha256:f9520ccbaa278dbb4b92ad82a90e1350b16b9a25b2f06c53d58217db5d2b5498","observation_id":"3f0cac54-33b1-4a22-ada1-bdf5a03f30e7","resolution":{"observed_at":"2026-08-02T05:05:25.210943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13491","last_updated":"2026-07-15T06:37:05Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T10:33:55.264647Z","submitted_at":"2026-07-15T06:37:05Z","title":"DeepLoop: Depth Scaling for Looped Transformers"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 1 inbound Pith citation observation for arXiv:2607.13491."}