{"as_of":"2026-08-05T08:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:092cb24836311124ea60be65e8432b1856a32b6d89f1b53fba2d00360cd26f55","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T19:36:13.559393Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.26797/citation-record","integrity":"/paper/2605.26797/integrity","json":"/paper/2605.26797/citation-record.json","paper":"/paper/2605.26797"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:36:13.559393Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:306eb1625f1f69ebc6e78428669a0bd4e3328cfcf405b50070bef69b9ce14bdc","observation_id":"6bdb8679-bbd1-4df7-b8e6-e25b92d6532a","resolution":{"observed_at":"2026-06-29T19:36:13.559393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:12f2183e5a6c36d04212ae349d0e680fd491b1718510168a2d7e81fe7d5f8efe","observation_id":"2efbb355-3685-403c-8cb5-003ce1c758cb","resolution":{"observed_at":"2026-06-29T19:43:54.937865Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09402","last_updated":"2021-01-25T13:12:00Z","snapshot_observed_at":"2026-07-06T08:59:10.497764Z","submitted_at":"2020-02-21T16:37:57Z","title":"Addressing Some Limitations of Transformers with Feedback Memory","version":3},"cited_work":{"arxiv_id":"2002.09402","doi":"10.48550/arxiv.2002.09402","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.09402","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2002.09402 , year =","venue":"arXiv (Cornell University)","work_id":"1dbc9f56-eb91-4e98-9b0d-b20fa13ddecd","year":2002},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2002.09402","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:534acde01f63cc5c3c88a4f40ec2ebfcaf161baf78cdf9accef1aac94c3665ac","observation_id":"99c4b0bc-06bf-42fb-8651-5f97cf7b9336","resolution":{"observed_at":"2026-06-29T19:43:54.933744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14052","last_updated":"2023-04-29T03:18:40Z","snapshot_observed_at":"2026-07-06T14:35:37.368351Z","submitted_at":"2022-12-28T17:56:03Z","title":"Hungry Hungry Hippos: Towards Language Modeling with State Space Models","version":3},"cited_work":{"arxiv_id":"2212.14052","doi":"10.48550/arxiv.2212.14052","metadata_source":"pith","pith_arxiv_id":"2212.14052","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hungry hungry hippos: To- wards language modeling with state space models","venue":"cs.LG","work_id":"d5653b0c-f12c-4141-9343-d65df1fb4214","year":2022},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2212.14052","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:c055e3230056837bcf45014ba85066a9dcb6a0f30b98b8c2bafbcdd7f1367694","observation_id":"dab136e2-21ca-4c32-a2b2-f48ea4cd2812","resolution":{"observed_at":"2026-06-29T19:43:54.934978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:36:13.559393Z","title":"Think before you speak: Training language models with pause tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:9d59236da91b0af4228e841d4cb150d5d3435f11ab5f861ae6f6c0259d0b30c2","observation_id":"8a7b088d-d4cd-41b9-a7d4-4cfea3c4b9c8","resolution":{"observed_at":"2026-06-29T19:36:13.559393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":"2312.00752","doi":"10.48550/arxiv.2312.00752","metadata_source":"pith","pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":"cs.LG","work_id":"4ee75248-1199-492c-a52f-6661e0f4adff","year":2023},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:88d826c6fddfafe8bcd16d39cef295e0bbecb80996083d075aa5a57cf15002d4","observation_id":"f6801829-3569-41c0-9877-f7a91b56e039","resolution":{"observed_at":"2026-06-29T19:43:54.980929Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":"2412.06769","doi":"10.48550/arxiv.2412.06769","metadata_source":"pith","pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","venue":"cs.CL","work_id":"3ddd0fd2-c176-408f-9b58-0666c2707f2d","year":2024},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:c5d187358082e39c36349f5cd74c2da8cc6494e57c8b405532e1545cab831cef","observation_id":"ff661fe8-d849-4d21-ba1d-b9ee4cbe9c2f","resolution":{"observed_at":"2026-06-29T19:43:54.969758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08644","last_updated":"2024-05-14T14:21:43Z","snapshot_observed_at":"2026-07-06T18:14:12.170084Z","submitted_at":"2024-05-14T14:21:43Z","title":"Thinking Tokens for Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.08644","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08644","snapshot_observed_at":"2026-07-03T20:38:56.107501Z","title":"Herel and T","venue":null,"work_id":"d49f0f0f-0846-41f4-bac7-ee9b58501251","year":2024},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2405.08644","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:ed8c4bddf705749623bbe4bb21db1026d5dd6f4790408023d935dfe2575717f3","observation_id":"cc9c82eb-31f1-4a78-b661-ab6fa781d8fa","resolution":{"observed_at":"2026-06-29T19:43:54.967076Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09173","last_updated":"2024-05-07T13:23:46Z","snapshot_observed_at":"2026-07-06T17:59:55.100798Z","submitted_at":"2024-04-14T07:43:45Z","title":"TransformerFAM: Feedback attention is working memory","version":3},"cited_work":{"arxiv_id":"2404.09173","doi":"10.48550/arxiv.2404.09173","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09173","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformerfam: Feedback attention is working memory","venue":"arXiv (Cornell University)","work_id":"0f0c95eb-36c8-4be1-a219-fc58f36ee7c4","year":2024},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2404.09173","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:191f8bcff762d977822701c89093681afaabc96cc7996c8067aa7e917ce6d72f","observation_id":"8f438508-705f-47b5-9e66-0fe83f8cde05","resolution":{"observed_at":"2026-06-29T19:43:54.961412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:36:13.559393Z","title":"Muon: An optimizer for hidden layers in neural networks, 2024.URL https://kellerjordan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:9fa024b02fb250f45861c21114f048cb44d8d2f1c80ea6f76828e11052fd208f","observation_id":"788d6530-a7dd-4091-af6d-179219879769","resolution":{"observed_at":"2026-06-29T19:36:13.559393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":"2403.19887","doi":"10.48550/arxiv.2403.19887","metadata_source":"pith","pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","venue":"cs.CL","work_id":"129df0fe-8a66-4077-8991-3557cfa38274","year":2024},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:d84ed4e3aa323156729ac7dd24177b03595f82dfc9a361453c2d08978a57ad3c","observation_id":"7a1b5163-bc86-4017-b0ac-ae3dd66d0c2e","resolution":{"observed_at":"2026-06-29T19:43:54.983792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:36:13.559393Z","title":"Fineweb-edu: the finest collection of educational content, 2024.URL https://huggingface","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:2dba3e5d32e1690c81653d99720c471771644b5b330d15ee37565b782d794e0d","observation_id":"1d46141e-98e7-48cb-a689-2edde5adce72","resolution":{"observed_at":"2026-06-29T19:36:13.559393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16300","last_updated":"2023-11-20T01:16:17Z","snapshot_observed_at":"2026-08-04T15:01:39.394740Z","submitted_at":"2023-05-25T17:53:42Z","title":"Landmark Attention: Random-Access Infinite Context Length for Transformers","version":2},"cited_work":{"arxiv_id":"2305.16300","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16300","snapshot_observed_at":"2026-07-10T01:36:44.202075Z","title":"Landmark attention: Random-access infinite context length for transformers","venue":"cs.CL","work_id":"80514bca-23b2-4088-a560-960c42f74ff5","year":2023},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2305.16300","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:ef6837ff9bf02742df62faa50d134bf976d11add3dc81679425f104431dcd436","observation_id":"b602e78d-e8f5-434d-aa23-e7433373862a","resolution":{"observed_at":"2026-06-29T19:43:54.977792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-02T14:27:24.212588Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"cited_work":{"arxiv_id":"2404.07143","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.07143","snapshot_observed_at":"2026-07-10T01:36:44.083287Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","venue":"cs.CL","work_id":"aecc8f73-1fd7-4a39-8ae7-a172b6a435b6","year":2024},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2404.07143","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:d5093ddb0819bdf53814148f82268083b6d7163f8416fbec9490b25599d35ee9","observation_id":"16341c4e-7eed-455c-a832-a1231670ebf2","resolution":{"observed_at":"2026-06-29T19:43:54.969393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":"2305.13048","doi":"10.48550/arxiv.2305.13048","metadata_source":"pith","pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RWKV: Reinventing RNNs for the Transformer Era","venue":"cs.CL","work_id":"524dc80d-f4ef-4f89-bf1a-9a8c1e4b6a81","year":2023},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:6ce866aa0e3578ed82e350d53b1227c3350c15f8dca0e3de48d3bd6f7c1346d3","observation_id":"5d043d28-2feb-4069-a115-80f40c889473","resolution":{"observed_at":"2026-06-29T19:43:54.971790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15758","last_updated":"2024-04-24T09:30:00Z","snapshot_observed_at":"2026-07-06T18:04:54.726338Z","submitted_at":"2024-04-24T09:30:00Z","title":"Let's Think Dot by Dot: Hidden Computation in Transformer Language Models","version":1},"cited_work":{"arxiv_id":"2404.15758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.15758","snapshot_observed_at":"2026-07-03T20:58:58.552877Z","title":"Let’s think dot by dot: Hidden computation in transformer language models.arXiv preprint arXiv:2404.15758","venue":null,"work_id":"745f12c5-dbd0-4b89-a2aa-e78d08e61bf1","year":2024},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2404.15758","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:739e6b59ee3b9a35932db1d5b78d49ad1378a9a47869f0fc193558f3798b3a72","observation_id":"efb1b40d-02f1-405a-85e2-3ba3052b2561","resolution":{"observed_at":"2026-06-29T19:43:54.963801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:e06b5546379ebe4e2d1e75ff46bbaf9fe5ba7ad27ebded99280ccccc731b90b2","observation_id":"eb9e9bd5-3a79-4c8d-9263-11c7c44f33b2","resolution":{"observed_at":"2026-06-29T19:43:54.972100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04933","last_updated":"2023-03-03T18:35:28Z","snapshot_observed_at":"2026-07-06T13:40:19.948018Z","submitted_at":"2022-08-09T17:57:43Z","title":"Simplified State Space Layers for Sequence Modeling","version":3},"cited_work":{"arxiv_id":"2208.04933","doi":"10.48550/arxiv.2208.04933","metadata_source":"pith","pith_arxiv_id":"2208.04933","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Simplified State Space Layers for Sequence Modeling","venue":"cs.LG","work_id":"d4f90830-6ceb-4c9e-b206-eb32ac063f45","year":2022},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2208.04933","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:9c3a72b721078ac7b515c7a60bfb9a881dd213565fc18ff34f1fdef00704c382","observation_id":"e95820fa-5fb5-4599-9941-b201aaeb1536","resolution":{"observed_at":"2026-06-29T19:43:54.974514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04620","last_updated":"2025-08-31T18:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T16:23:20Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","version":4},"cited_work":{"arxiv_id":"2407.04620","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.04620","snapshot_observed_at":"2026-07-09T18:46:26.563289Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","venue":"cs.LG","work_id":"c682430c-e7a2-4699-b82d-55287448dbba","year":2024},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2407.04620","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:93e9bbb9806eadaaf9b5c0539d72da6b2c016784cd5533eb58553d0814d4fddf","observation_id":"f1089c86-5ba0-421b-8a27-89a4c9df6810","resolution":{"observed_at":"2026-06-29T19:43:54.986638Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":"2307.08621","doi":"10.48550/arxiv.2307.08621","metadata_source":"pith","pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","venue":"cs.CL","work_id":"5b0449ac-92b0-41f2-8b4f-586c2b5a08b6","year":2023},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:fafd0c751ac4728d70d8665462ff0167ae12314d4f1423da248c051e73b86b29","observation_id":"0b0f7268-8c3f-4441-8b75-20e48d214f03","resolution":{"observed_at":"2026-06-29T19:43:54.948230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":"2408.00118","doi":"10.48550/arxiv.2408.00118","metadata_source":"pith","pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","venue":"cs.CL","work_id":"4dd94e2f-2b27-4cbf-88a0-4910f0772a57","year":2024},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:a68aed9c571ad9e04d24efbd99eace8620e3b564eca12a94eb42a7a2004636d2","observation_id":"4dd94e11-ba68-4b2f-a850-a88bbdcf7c16","resolution":{"observed_at":"2026-06-29T19:43:54.951166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-07-06T12:48:46.626926Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:c17171d864adad062b43e24b5745fdbef96435d9f04763e22abf023631771bc2","observation_id":"3f0b871a-b078-46b8-92de-780ac6053677","resolution":{"observed_at":"2026-06-29T19:43:54.966815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09629","last_updated":"2024-03-18T07:56:48Z","snapshot_observed_at":"2026-07-31T09:25:34.205362Z","submitted_at":"2024-03-14T17:58:16Z","title":"Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking","version":2},"cited_work":{"arxiv_id":"2403.09629","doi":"10.48550/arxiv.2403.09629","metadata_source":"pith","pith_arxiv_id":"2403.09629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking","venue":"cs.CL","work_id":"cd82874a-9e9d-46cb-9716-a06d454a9c7e","year":2024},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2403.09629","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:b4b3aad3397881fa6e780287f6eb2f1f11620f04b476c1a4ec256d210aef66ad","observation_id":"f52560f1-2bb2-4c67-a37e-0bd395dd25f4","resolution":{"observed_at":"2026-06-29T19:43:54.977708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:36:13.559393Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:de337c3f908bb6a75f453dd3bb6a5034cfaa8d9ffb76ff3cffb1b6b6092b5f71","observation_id":"9b03380b-245f-4a4c-86cf-9f83cd2b7cf3","resolution":{"observed_at":"2026-06-29T19:36:13.559393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:36:13.559393Z","title":"The final shard is held out as validation and the remaining shards are used for training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:1a3b6bf2d6836fee1609dcf9800487eaf96f6e8f553f6c8504d1634c62b5a0da","observation_id":"6060a32c-504e-448a-9b92-adc50a8054ea","resolution":{"observed_at":"2026-06-29T19:36:13.559393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:36:13.559393Z","title":"WithC= 256, the recurrent signal becomes too sparse and the result is nearly identical to the baseline","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:e956f5c46199e6b4f7422d8127b8705135d097f50adb9d436d61808de7c50549","observation_id":"2519ddef-6310-46c1-8f96-81a4c414cbed","resolution":{"observed_at":"2026-06-29T19:36:13.559393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:36:13.559393Z","title":"IncreasingScreates a longer sparse refinement chain, but does not improve BPB in this setting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:3c93b28f85870ebf4df072245cb30c209b26a70535da99b65328db4080349bba","observation_id":"89b9ffb8-b897-42dc-b563-6ec85fa23f8c","resolution":{"observed_at":"2026-06-29T19:36:13.559393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":8,"verified_exact":18,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2605.26797."}