{"as_of":"2026-08-23T01:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e70d2ea68a2341796972c0d5def0c128bd018fbe1ecd6938841658b6194e5aed","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:37:37.866614Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.00929/citation-record","integrity":"/paper/2505.00929/integrity","json":"/paper/2505.00929/citation-record.json","paper":"/paper/2505.00929"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T04:37:37.685804Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.685804Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:6bd36a41c32f1de9f9fe335ef2c5d9302a7fc693aa1807bcbdddb70c192c6392","observation_id":"c6d7c577-1df7-445c-a746-2c507efd525d","resolution":{"observed_at":"2026-08-16T04:37:37.685804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.526396Z","title":"A neural probabilistic language model","venue":null,"work_id":"20825e38-f2b4-4bac-80f0-eade30201765","year":2000},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.691635Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:62b1440a8c3b43cd449b99c7694ba632c4f3deab71b76444a72b680dba708bcb","observation_id":"81e97b5f-8173-4a13-8788-658ac7da6022","resolution":{"observed_at":"2026-08-16T04:37:38.532210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.508764Z","title":"Is space-time attention all you need for video understanding? In ICML, page 4, 2021","venue":null,"work_id":"3b3fcff7-40ee-41c7-9f0b-85f8a7d51ba6","year":2021},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.696649Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:06a48d4112ad5028ff2b1e270e503b00245a438996b4888de45b537855e7d88c","observation_id":"81bea73b-1759-45d5-9da9-2c288f1cad24","resolution":{"observed_at":"2026-08-16T04:37:38.514394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.492578Z","title":"Recur- rent memory transformer","venue":null,"work_id":"9bc4aeb0-7377-4ba8-a138-555a03663132","year":2022},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.701591Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:5ad1318ba2d8e0b0537372cf042f692463895caf87b467bfa6b00a903df41527","observation_id":"f57ba19a-dfd3-46ad-85b4-9495ba0574fa","resolution":{"observed_at":"2026-08-16T04:37:38.497637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11527","last_updated":"2021-02-16T08:06:47Z","snapshot_observed_at":"2026-08-15T00:24:04.749279Z","submitted_at":"2020-06-20T09:06:27Z","title":"Memory Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11527","snapshot_observed_at":"2026-08-16T04:37:37.706521Z","title":"Memory transformer","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.706521Z"},"links":{"cited_paper":"/paper/2006.11527","citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:14f4f42f093e3a38b2766f0844c883b587f738de09dec03fbcf83e55866cf6c1","observation_id":"bce8443b-d492-483b-bd9f-30726f9173dd","resolution":{"observed_at":"2026-08-16T04:37:37.706521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.1078","last_updated":"2014-09-03T00:25:02Z","snapshot_observed_at":"2026-08-15T13:36:27.756066Z","submitted_at":"2014-06-03T17:47:08Z","title":"Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.1078","snapshot_observed_at":"2026-08-16T04:37:37.712887Z","title":"Learning phrase representations using rnn encoder-decoder for statistical machine translation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.712887Z"},"links":{"cited_paper":"/paper/1406.1078","citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:0a83c0f13ab08adbdfdc1367d7fd693f4e33f8f672af479342ec906ba4639b97","observation_id":"79de16fc-7e94-4ef2-a39e-b35532c20b4a","resolution":{"observed_at":"2026-08-16T04:37:37.712887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.475068Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":"7bb5a959-f218-44c6-b4c3-24da2a60c8f5","year":2023},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.719011Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:e4c67ee2441bd61e85a14b3f01d6e238ace8f55f268d9c3f61f61ed8dd36318b","observation_id":"c70c22a6-447b-4c32-94e0-c3b91b20e01e","resolution":{"observed_at":"2026-08-16T04:37:38.480617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02860","last_updated":"2019-06-02T21:21:48Z","snapshot_observed_at":"2026-08-16T17:45:52.864524Z","submitted_at":"2019-01-09T18:28:19Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.02860","snapshot_observed_at":"2026-08-16T04:37:37.725286Z","title":"Transformer-xl: Attentive language models beyond a fixed-length context","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.725286Z"},"links":{"cited_paper":"/paper/1901.02860","citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:95a23fadd4274ac114c5a8ca007c7ca3f4f2f2add483dab690ed31b6ae045910","observation_id":"f3a60ef5-f204-488b-96f9-eb4d8fe47299","resolution":{"observed_at":"2026-08-16T04:37:37.725286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.458703Z","title":"Toyota smarthome: Real-world activities of daily living","venue":null,"work_id":"5434d94a-8a99-4766-a783-9c54699fa6a1","year":2019},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.730528Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:191cf51d35406f7bfe743bcfe200069636da3e79ab352cbc88a682bf2313c30f","observation_id":"86eeaa6b-8210-4e3b-becd-fbf92fd8b1d9","resolution":{"observed_at":"2026-08-16T04:37:38.463616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T04:37:37.735641Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.735641Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:7513087b4af91ffb20126a78274e0c64667ac3d04e082350d1c365a54d49ef96","observation_id":"e189047d-8baf-4972-8673-7b9c4730f5be","resolution":{"observed_at":"2026-08-16T04:37:37.735641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-16T04:37:37.741031Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.741031Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:f1d829f04853181ef5baadb54c668173cccd77e4bc7c157ae39c684d20073261","observation_id":"5e6fd6b6-51b2-4ceb-a845-6551d63f9ad7","resolution":{"observed_at":"2026-08-16T04:37:37.741031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.439913Z","title":"A theoretically grounded application of dropout in recurrent neural networks","venue":null,"work_id":"ac6a1ea3-7c66-48b3-b405-038ccd894ed2","year":2016},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.745795Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:f99b112901da086fe20901a166e5c1cb8b7f50c9bc2936e121bc6a3ce0cad786","observation_id":"efc0fb7b-95e6-4088-9b8b-6e4131d0d936","resolution":{"observed_at":"2026-08-16T04:37:38.446360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04309","last_updated":"2017-06-19T16:33:04Z","snapshot_observed_at":"2026-08-14T21:39:52.788731Z","submitted_at":"2016-09-14T15:15:08Z","title":"Efficient softmax approximation for GPUs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04309","snapshot_observed_at":"2026-08-16T04:37:37.750598Z","title":"Ef- ficient softmax approximation for gpus","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.750598Z"},"links":{"cited_paper":"/paper/1609.04309","citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:21635cd397a1788662bc5eac98aa14ee8eecb96bb998d56b9ce9fdff94dd2737","observation_id":"71d7dc72-5eb1-4311-adf1-dace1d38bc93","resolution":{"observed_at":"2026-08-16T04:37:37.750598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.423633Z","title":"Eigenvalue normalized recur- rent neural networks for short term memory","venue":null,"work_id":"f919416d-1287-4f06-b19a-341905ea57b0","year":2020},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.756181Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:6f5e0f8bf54e145804d07e1e42a3520345c5c2748699beec893067b2e2370f6d","observation_id":"a33cef38-2e20-4cd2-8656-b698d53864ff","resolution":{"observed_at":"2026-08-16T04:37:38.428830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.405530Z","title":"Orthogo- nal recurrent neural networks with scaled cayley transform","venue":null,"work_id":"755c8efe-d7f3-42c5-b6e5-bf3c00427d08","year":1969},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.760811Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:1923c717216793b9dac46a1f3dc8492e3e317accd7c8ed9a40716a3407b94e4b","observation_id":"de195bcd-715c-4e47-9645-fbccd75211be","resolution":{"observed_at":"2026-08-16T04:37:38.412064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.387662Z","title":"Long short-term memory","venue":null,"work_id":"08b87877-c0b6-4b55-94da-e52c79805b26","year":1997},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.765846Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:c13b22c5f83833f8ee8b30607d96d1a5d59115463a86a4fb6739645190479ab6","observation_id":"dc65799f-13b0-41ca-84e4-25014fcd9110","resolution":{"observed_at":"2026-08-16T04:37:38.392867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.369869Z","title":"Neural networks and physical systems with emergent collective computational abilities","venue":null,"work_id":"c7604262-5c23-4d91-b285-b4f8b457fb5a","year":1982},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.770787Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:c03fdfc78bcee6e610ac417dc27e76240f5ca5fef36cf619b9fb31741460dc51","observation_id":"fea36498-0254-49c3-aeb8-e527106d84ef","resolution":{"observed_at":"2026-08-16T04:37:38.375515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.353226Z","title":"Block-recurrent transformers","venue":null,"work_id":"01145cb8-5562-4160-91b9-c83ee95b30e9","year":2022},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.775621Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:9bd464078bea42a47af1b25b829ea47d528af42685d40f9556429ba6179d45e3","observation_id":"5c8c8455-b761-4d10-bca7-432e9a261d85","resolution":{"observed_at":"2026-08-16T04:37:38.358676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14795","last_updated":"2022-03-15T22:37:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-30T17:53:34Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14795","snapshot_observed_at":"2026-08-16T04:37:37.780641Z","title":"Perceiver io: A general architecture for structured inputs & outputs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.780641Z"},"links":{"cited_paper":"/paper/2107.14795","citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:0e2757d85c09a3e7d43b6081988e4905bb8479ad213f5d2ba61647280d9f33c5","observation_id":"d566c541-0d5a-438a-bb61-822d4bbff6cb","resolution":{"observed_at":"2026-08-16T04:37:37.780641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.335182Z","title":"Gated orthog- onal recurrent units: On learning to forget","venue":null,"work_id":"f2978cdb-68d1-4e27-888b-f696c1d23fc4","year":2019},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.785716Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:bb9c3ab386cba506c2f4421c8b83fa8bd36683d0ad62b8d744e5124fa1edbf60","observation_id":"becfab31-65f5-48a8-b2c9-e53f9e96c841","resolution":{"observed_at":"2026-08-16T04:37:38.341429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.316892Z","title":"Cheap orthogonal constraints in neural networks: A simple parametrization of the orthogonal and unitary group","venue":null,"work_id":"1387c4bb-4b62-454c-a50a-b5eb9a6f440d","year":2019},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.790512Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:33ad487c22cac830867edc8d6a16de10630effc21529a4b59b81d26057297ec9","observation_id":"a54810b4-58ac-4266-90df-68255081b1ec","resolution":{"observed_at":"2026-08-16T04:37:38.323219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.298894Z","title":"Complex unitary recurrent neural networks using scaled cayley transform","venue":null,"work_id":"5600c039-d721-4e09-a072-32af2a9edf2f","year":2019},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.795592Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:b7347ce439b042760082e22842b4f038619910ac4b96d33ae3c46efb3c2b3bd2","observation_id":"67b58d7b-73f1-4f1c-b487-275bdf33748d","resolution":{"observed_at":"2026-08-16T04:37:38.304419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.281975Z","title":"Building a large annotated corpus of english: The penn treebank","venue":null,"work_id":"6865900b-2e9b-47f7-b23d-ea84936ed0b7","year":1993},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.800369Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:451b3fda78e323e35ca2d985ac27ca76013c4aeaf31dcce896612d0342098d1d","observation_id":"833e22c9-ee60-42e6-9ffb-b442871a7610","resolution":{"observed_at":"2026-08-16T04:37:38.287486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-08-17T01:46:43.513643Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-16T04:37:37.804967Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.804967Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:669b4a1b723926abcc4e93c84f3a4cff8021614f5ea3fea1639e617b7ab48dea","observation_id":"ba501b30-2e94-443e-81ef-259b022db71f","resolution":{"observed_at":"2026-08-16T04:37:37.804967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.265594Z","title":"Hellicar, Ashfaqur Rahman, and James Bailey","venue":null,"work_id":"2da9d6fa-bb0e-4d69-9b85-a6f21b3d222e","year":2017},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.810847Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:39b39f3b419f262e45f10dccbba3294f72f5e4618e336abec437778021e5c350","observation_id":"41dd4914-2ef7-42c6-b529-b3d9a8ac9634","resolution":{"observed_at":"2026-08-16T04:37:38.270811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.248873Z","title":"Recurrent neural network based language model","venue":null,"work_id":"49c918b0-263d-4936-9a2e-985929b30840","year":2010},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.815442Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:b7f2b5432d092a8b9fc568b721f5a4ebc01214c593282fdbb9430a6a5654a09b","observation_id":"15d64f17-8775-447a-8a12-f9c5790fab25","resolution":{"observed_at":"2026-08-16T04:37:38.254003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06496","last_updated":"2022-08-12T20:50:09Z","snapshot_observed_at":"2026-08-19T22:39:59.585567Z","submitted_at":"2022-08-12T20:50:09Z","title":"Orthogonal Gated Recurrent Unit with Neumann-Cayley Transformation","version":1},"cited_work":{"arxiv_id":"2208.06496","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06496","snapshot_observed_at":"2026-08-16T04:37:37.948561Z","title":"Orthogonal Gated Recurrent Unit with Neumann-Cayley Transformation","venue":"cs.LG","work_id":"c893d66e-bb2e-49f3-96d9-136ed9867d93","year":2022},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.820198Z"},"links":{"cited_paper":"/paper/2208.06496","citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:49cf9ae2d3f364d400bec595b43b4be9211961cfa1e46c77b9b57d8d23fcdc98","observation_id":"5e76e901-709c-4ae0-b1cc-501e9f12b529","resolution":{"observed_at":"2026-08-16T04:37:37.956554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.231938Z","title":"Improving language understanding by gen- erative pre-training","venue":null,"work_id":"5a83685e-e60e-4f6d-a469-b66e5c37053c","year":2018},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.825162Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:e98a59de595ed2fc858f3eca9bff484567808f7f919424a3928c9c0d868c966e","observation_id":"ff1e0e41-b46d-4e9e-a633-6fd51abcbb7c","resolution":{"observed_at":"2026-08-16T04:37:38.237284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:37.830261Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.830261Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:e3f655057f7bc3bcfe40140f8231439fb81c4d936011a2135cb8c6f91db68bc0","observation_id":"4528334c-9fff-4bb3-8f56-4cea9d48a122","resolution":{"observed_at":"2026-08-16T04:37:37.830261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.201013Z","title":"Just add?! pose induced video transformers for understanding activities of daily liv- ing","venue":null,"work_id":"19dede00-136e-431e-9599-7fc253b9b2e8","year":null},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.835743Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:467037aab55c2986bb9592856609ecc5353deee52182195d6332ad6ce199bd06","observation_id":"90793bec-067f-431d-8728-1b2ef0ee7468","resolution":{"observed_at":"2026-08-16T04:37:38.207544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.184579Z","title":"Learning internal representations by error propagation,","venue":null,"work_id":"f560455b-a17a-4d92-97f9-45578e5b2c75","year":null},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.841924Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:d1e0d2bb17fb9823550d371a32afa69cdd57aa0a1610e51991b34a342c0c9cfb","observation_id":"d332eb6b-50c3-4795-8ffa-ce29d6c33339","resolution":{"observed_at":"2026-08-16T04:37:38.189991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-16T04:37:37.846660Z","title":"Lamda: Language models for dialog applications","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.846660Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:45a71bf48ddbbf7d726b3e11cd61b8bba05f8d918c594e55be7ca16b3db82f3f","observation_id":"728ca5bf-0c68-4ab7-9047-ad0bae88d03d","resolution":{"observed_at":"2026-08-16T04:37:37.846660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.168205Z","title":"Attention is all you need","venue":null,"work_id":"3d4cf270-6532-4c25-a40e-ff52fa92eb8e","year":2017},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.852101Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:d9f96deed7d4e783864d58b5c45b9dd83f54909cebc8127f883c9d7e0a368f33","observation_id":"d162f896-872f-46c6-bb28-f296429daeb4","resolution":{"observed_at":"2026-08-16T04:37:38.173480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05572","last_updated":"2019-07-12T04:01:57Z","snapshot_observed_at":"2026-08-18T11:54:47.129509Z","submitted_at":"2019-07-12T04:01:57Z","title":"R-Transformer: Recurrent Neural Network Enhanced Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05572","snapshot_observed_at":"2026-08-16T04:37:37.857059Z","title":"R- transformer: Recurrent neural network enhanced trans- former","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.857059Z"},"links":{"cited_paper":"/paper/1907.05572","citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:d6a80c60bd8c7e6222c472e3e108aaf98d6302afed4dd4195c7fd72cbb00f2d3","observation_id":"79834780-cbc7-4db3-ae49-f830593c22ca","resolution":{"observed_at":"2026-08-16T04:37:37.857059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.150336Z","title":"Full-capacity unitary recurrent neu- ral networks","venue":null,"work_id":"d6d8e85d-610c-4bf5-b82f-0d154551805f","year":2016},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.862064Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:58165df87695f53df65b380399ddafe47d96be773d0a3bfffa07e5478d4d4986","observation_id":"2fcbe037-7abe-40d7-acfb-af6090c3adf2","resolution":{"observed_at":"2026-08-16T04:37:38.156229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:38.132801Z","title":"Memformer: The memory-augmented transformer","venue":null,"work_id":"6a93df27-4870-456a-b2fc-0b19004a62c1","year":2020},"citing_paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:37.866614Z"},"links":{"citing_paper":"/paper/2505.00929"},"observation_digest":"sha256:2cf8fd87df7ac64d305862ba4adf33c3448eecd6af229863bef6b285b32ea2db","observation_id":"3ba706a9-90f9-439e-b17e-32cda2ca3f55","resolution":{"observed_at":"2026-08-16T04:37:38.138088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.00929","last_updated":"2025-05-02T00:11:44Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T04:29:09.609806Z","submitted_at":"2025-05-02T00:11:44Z","title":"Compact Recurrent Transformer with Persistent Memory"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":1,"verified_fuzzy":23},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2505.00929."}