{"as_of":"2026-08-21T17:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:601fb09ae6675ba30452e3d358616a336e06c176f8a14beb4d02e6e36e77af3c","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:12:36.460382Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.01855/citation-record","integrity":"/paper/2505.01855/integrity","json":"/paper/2505.01855/citation-record.json","paper":"/paper/2505.01855"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-19T04:42:40.974785Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-16T04:12:36.359553Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin.Attention Is All You Need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.359553Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:bda1ed5da87541d9ac38cc5a7c36ea8a250e35df03abbd95e6f650a4c9680d2f","observation_id":"650b011a-e6ec-4ed4-9724-6b431c81b4e7","resolution":{"observed_at":"2026-08-16T04:12:36.359553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-16T04:12:36.365389Z","title":"Brown et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.365389Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:3db87f48f4ecaad59f824cd4b4f4ef7ed7bf83dcde3effc2077265b4a27addf0","observation_id":"457b876e-4083-45e2-ba3e-0ffd5e664dfc","resolution":{"observed_at":"2026-08-16T04:12:36.365389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03819","last_updated":"2019-03-05T16:46:19Z","snapshot_observed_at":"2026-08-13T07:34:17.550838Z","submitted_at":"2018-07-10T18:39:15Z","title":"Universal Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03819","snapshot_observed_at":"2026-08-16T04:12:36.370559Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.370559Z"},"links":{"cited_paper":"/paper/1807.03819","citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:c7a4d4c6ea7ea4bba8d36a1653d7457be10211afc353474c9f2df5670a658277","observation_id":"73369a2f-3d35-4099-8073-6cad5bd82b9d","resolution":{"observed_at":"2026-08-16T04:12:36.370559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13196","last_updated":"2023-01-30T18:57:31Z","snapshot_observed_at":"2026-08-16T15:59:03.055969Z","submitted_at":"2023-01-30T18:57:31Z","title":"Looped Transformers as Programmable Computers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13196","snapshot_observed_at":"2026-08-16T04:12:36.376248Z","title":"Lee, and Dim- itris Papailiopoulos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.376248Z"},"links":{"cited_paper":"/paper/2301.13196","citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:7a8c018aeea2ec7373dc10a94755737c231e3475157c923b7b3ecfd104a76919","observation_id":"0774c4e8-00cc-4e04-a25d-31b31e81b1e0","resolution":{"observed_at":"2026-08-16T04:12:36.376248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12424","last_updated":"2024-03-16T21:10:38Z","snapshot_observed_at":"2026-08-16T14:41:35.235110Z","submitted_at":"2023-11-21T08:32:38Z","title":"Looped Transformers are Better at Learning Learning Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12424","snapshot_observed_at":"2026-08-16T04:12:36.382037Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.382037Z"},"links":{"cited_paper":"/paper/2311.12424","citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:21a8c7c6072ab82caf354addddfc31216fd663b8d8f19f7067cd7c69b8209c4d","observation_id":"6054bce5-4cd7-4ef5-9257-1e454c7897d0","resolution":{"observed_at":"2026-08-16T04:12:36.382037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15647","last_updated":"2025-05-12T03:51:20Z","snapshot_observed_at":"2026-08-17T01:49:18.255013Z","submitted_at":"2024-09-24T01:21:17Z","title":"Looped Transformers for Length Generalization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15647","snapshot_observed_at":"2026-08-16T04:12:36.387945Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.387945Z"},"links":{"cited_paper":"/paper/2409.15647","citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:662f2ecdc9f620e4962ddeeb59233de0e5eb915f7db75363aa3444a5d0fac274","observation_id":"0f7f533e-c6a0-4330-876e-f23935ea085e","resolution":{"observed_at":"2026-08-16T04:12:36.387945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-08-15T00:53:48.099058Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05171","snapshot_observed_at":"2026-08-16T04:12:36.394330Z","title":"Bartoldson, Bhavya Kailkhura, Abhinav Bhatele, and Tom Goldstein.Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.394330Z"},"links":{"cited_paper":"/paper/2502.05171","citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:3e040b8b262f11abaac7d51a1984a45097e6979df7cbe7b7a13308b11f494fec","observation_id":"303aaed1-9f4c-4b57-b6ad-7d9bd5573bbb","resolution":{"observed_at":"2026-08-16T04:12:36.394330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:12:36.819381Z","title":"Longshort-termmemory","venue":null,"work_id":"00491ac7-b041-44a6-9ba9-4c68a97bddd1","year":1997},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.400546Z"},"links":{"citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:6befca336cab7f341aab985e0e6cac934fc63a4e4fd5e19c49dab8ba4809118b","observation_id":"f8491164-26e3-4e15-ae0a-a04d60463797","resolution":{"observed_at":"2026-08-16T04:12:36.824619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T04:12:36.405588Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.405588Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:909c59737fd4af1e66790bc8db889bce8497d87cce87635ee1c97bbac22f6385","observation_id":"0398b6c7-4092-46b7-8c71-64dfe241238d","resolution":{"observed_at":"2026-08-16T04:12:36.405588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:12:36.800553Z","title":"Lan- guage Models are Unsupervised Multitask Learners","venue":null,"work_id":"4ee57092-b6f3-426d-8751-62edb2c82728","year":2019},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.410752Z"},"links":{"citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:0c638a5a417f2108e4485198045bf7e9139c54a59eeddf2d1ce0eba0fac19ecc","observation_id":"d41e9df3-e36b-482b-8fac-fa0751b70b33","resolution":{"observed_at":"2026-08-16T04:12:36.806495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T04:12:36.415621Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.415621Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:a06ea6239ea997c33a4dd45a7d75bafe59e5b4620833c45612273d72fa8f2ec5","observation_id":"9bd32c0f-b4c7-41db-8958-50c47f2a6c80","resolution":{"observed_at":"2026-08-16T04:12:36.415621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08593","last_updated":"2019-09-11T16:26:37Z","snapshot_observed_at":"2026-08-18T12:44:48.193735Z","submitted_at":"2019-08-21T04:27:38Z","title":"Revealing the Dark Secrets of BERT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08593","snapshot_observed_at":"2026-08-16T04:12:36.421397Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.421397Z"},"links":{"cited_paper":"/paper/1908.08593","citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:f3f92228e79fb74988dbfdf79632cce8c2d30215925dabcc193ca82972cd359b","observation_id":"83f82706-ccc6-44b8-a1d9-7b99ee9393ae","resolution":{"observed_at":"2026-08-16T04:12:36.421397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:12:36.783155Z","title":"Interpreting GPT: The Logit Lens","venue":null,"work_id":"1e7ff177-e490-4056-80e4-29c1aba24a35","year":2020},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.426813Z"},"links":{"citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:3d81d484d15cc069ed18972fd47c946b571edf4f7b8ac937c596463fc779fa59","observation_id":"0ce47652-879a-4a71-a231-ef3d072e594d","resolution":{"observed_at":"2026-08-16T04:12:36.788514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-20T16:41:47.138179Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-16T04:12:36.432391Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.432391Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:bfa28c8284b0413bd75558d98ce9267c0e5aa53d2440aa9fb27938a3f34f3503","observation_id":"386d908e-aba7-434c-b06b-941389143c0a","resolution":{"observed_at":"2026-08-16T04:12:36.432391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:12:36.764483Z","title":null,"venue":null,"work_id":"f051b592-fd4f-4285-9576-7a34e67dab32","year":null},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.438489Z"},"links":{"citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:d3417f5551335031d3014511f0cdaeb47361c42f7500c5185f9a4cfd7697252e","observation_id":"c8a0b64a-9052-4ead-9a31-388d13306ebe","resolution":{"observed_at":"2026-08-16T04:12:36.771444Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-17T06:56:20.644738Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-16T04:12:36.449702Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.449702Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:ff47c18f7a245dab7a82ef2710a80c97aef53bbc98850ea409c93563f04d0447","observation_id":"2848ffd2-5aa2-4180-a268-0ce3fe7ab71a","resolution":{"observed_at":"2026-08-16T04:12:36.449702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-16T04:12:36.454931Z","title":"Smith, and Mike Lewis.Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.454931Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:2d53e2d51b4d84eda8c78164904ff38cada71edbb4b6564a15918196c9952e22","observation_id":"8e66d75b-9b58-4270-b52f-2d456d75093a","resolution":{"observed_at":"2026-08-16T04:12:36.454931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-21T02:12:10.329412Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-16T04:12:36.460382Z","title":"Training Compute-Optimal Large Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.460382Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:9814d1719bb12ad00f57a3e81e413583c51aab1dc94ba27db867708abfeee61b","observation_id":"e1634db2-5f44-4a16-b554-c8d24da1ffae","resolution":{"observed_at":"2026-08-16T04:12:36.460382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19466","last_updated":"2023-11-06T19:48:10Z","snapshot_observed_at":"2026-08-21T14:02:47.528539Z","submitted_at":"2023-05-31T00:29:55Z","title":"The Impact of Positional Encoding on Length Generalization in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19466","snapshot_observed_at":"2026-08-16T04:12:36.443778Z","title":"url: https://arxiv.org/abs/2305.19466","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:36.443778Z"},"links":{"cited_paper":"/paper/2305.19466","citing_paper":"/paper/2505.01855"},"observation_digest":"sha256:3c7661a5d62a2eecc1c95fb2c2754da1c4ceff9a447bd2d3142a90384c3ae683","observation_id":"48ce3fd7-76b5-4b1b-995d-8d6f441ce078","resolution":{"observed_at":"2026-08-16T04:12:36.443778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.01855","last_updated":"2025-05-23T19:19:41Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-20T02:02:02.007595Z","submitted_at":"2025-05-03T16:16:55Z","title":"Intra-Layer Recurrence in Transformers for Language Modeling"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2505.01855."}