{"as_of":"2026-08-04T18:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6bafed9a7d3ba76272c58fb664a6679c331db67ffe9af93e4c6a34052c3b6f24","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T01:44:40.722957Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T01:45:50.815719Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"cited_work":{"arxiv_id":"2507.09025","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.09025","snapshot_observed_at":"2026-07-09T01:45:50.815719Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","venue":"cs.CL","work_id":"33933867-6666-4655-8ac1-ff265f1b6c4b","year":2025},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2507.09025","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:ff2e6f00edc1661279cb96366c4c8593ab71bf124d0a1624cf85fea91c536f41","observation_id":"bc89b400-019d-4c57-9abc-5255a367504f","resolution":{"observed_at":"2026-07-09T01:45:50.816968Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.09025/citation-record","integrity":"/paper/2507.09025/integrity","json":"/paper/2507.09025/citation-record.json","paper":"/paper/2507.09025"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:fb24633eb9b854cf3bb71757e18c6787a6fe3f8df2d2ba9c9c8918368b78251d","observation_id":"2cbcf536-b811-4eb8-88c5-443e2c5ff575","resolution":{"observed_at":"2026-05-19T04:42:04.594270Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18668","last_updated":"2025-03-07T18:57:52Z","snapshot_observed_at":"2026-07-06T17:37:05.339368Z","submitted_at":"2024-02-28T19:28:27Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","version":2},"cited_work":{"arxiv_id":"2402.18668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.18668","snapshot_observed_at":"2026-07-09T12:46:14.690167Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","venue":"cs.CL","work_id":"c542bc4f-de21-42d2-812b-b46f5fa9b434","year":2024},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2402.18668","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:b59dac9bfc4a2aaeb8e933aba6a88e48cf2cd8cbdd337f5e0164daf7a0768e63","observation_id":"feee02e8-4167-4086-b813-553c338deed0","resolution":{"observed_at":"2026-05-19T04:42:04.615556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:af129f191b87dd0b65604c09109bc0a3de7baf4a867dfa566d1cf02032a48027","observation_id":"e4969b06-8f7d-4939-9e3d-6eecfc63c05a","resolution":{"observed_at":"2026-05-19T04:42:04.606340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":"2307.08691","doi":"10.48550/arxiv.2307.08691","metadata_source":"pith","pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-07-10T20:07:33.508131Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","venue":"cs.LG","work_id":"fff3953b-5efb-4753-bee4-002f59995810","year":2023},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:f0e5ccf0033149bfb498d500d29c65f04b2588bec0786eb86a9b203562ae869b","observation_id":"86a92dd1-ae79-4569-bca6-6c8feda35b2d","resolution":{"observed_at":"2026-05-19T04:42:04.519962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":"2405.21060","doi":"10.48550/arxiv.2405.21060","metadata_source":"pith","pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-07-10T21:57:38.573725Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","venue":"cs.LG","work_id":"d8eba076-0449-4f6a-aae1-5a7260677f0f","year":2024},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:22712615c59faab21c8caedffbc2154257800835a877c5fe834012159d0bd6eb","observation_id":"3c99f5ce-0817-4179-97d9-bfbed795147e","resolution":{"observed_at":"2026-05-19T04:42:04.585923Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:31b6aead7e98c017c1980b84d850189d886d017dd458e14cdbddf59220296b82","observation_id":"ad621e97-2937-4b58-bf06-027b3959d7c1","resolution":{"observed_at":"2026-05-19T04:42:04.534710Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1260860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:47:14.558044Z","title":"He, B., Yin, L., Zhen, H.-L., Liu, S., Wu, H., Zhang, X., Yuan, M., and Ma, C","venue":null,"work_id":"e7e9d443-273d-4722-8ec7-59adb893de0e","year":2024},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:595703e23a24fdd7017a37be101d2e8eba1bea20e7388e0c16f673cd3993c607","observation_id":"1190704a-829e-47b7-ba17-f7ca479d2fb3","resolution":{"observed_at":"2026-05-19T04:42:04.525610Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:c90c37694433350f9e241a702d20d82c920bc3e7fb359ed70a879b04c94eb41c","observation_id":"00cab715-d72d-4f6c-a5ee-ca660bfe96e9","resolution":{"observed_at":"2026-05-19T04:42:04.577626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":"2312.00752","doi":"10.48550/arxiv.2312.00752","metadata_source":"pith","pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-07-10T20:07:33.480124Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":"cs.LG","work_id":"4ee75248-1199-492c-a52f-6661e0f4adff","year":2023},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:4d0eee21108a6665057833d4f01ab949dabe7925fb17d88d5d25da78ab2016ee","observation_id":"28017c77-9f03-413e-a8e2-06210ba48d0f","resolution":{"observed_at":"2026-05-19T04:42:04.529897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-11T01:37:42.666395Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:5e11637bbcd66b01b090969c040de524869215cca5eae757357130e6d7fc1e3b","observation_id":"256a55ea-9b62-47a0-88df-08cd6124b1d1","resolution":{"observed_at":"2026-05-19T04:42:04.539139Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":"2310.06825","doi":"10.48550/arxiv.2310.06825","metadata_source":"pith","pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-07-10T14:47:14.537301Z","title":"Mistral 7B","venue":"cs.CL","work_id":"eb5e1305-ad11-4875-ad8d-ad8b8f697599","year":2023},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:2b0aa5b39766057683a11c46cd6ceff73ba668379be96fdc15b1cfd3f0aa6546","observation_id":"60692ec2-31f5-4fc1-8e86-1a497bccf65c","resolution":{"observed_at":"2026-05-19T04:42:04.619077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-07-06T17:11:55.112404Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:0fdd5566426266f5dcb2ac6ad9507b46e7942715a5a52d642051d7b774d61f5e","observation_id":"2acfbd89-7815-46b2-8aaa-613e3183c044","resolution":{"observed_at":"2026-05-19T04:42:04.568701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":"2005.14165","doi":"10.1145/1926385.1926423","metadata_source":"pith","pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Language Models are Few-Shot Learners","venue":"cs.CL","work_id":"214732c0-2edd-44a0-af9e-28184a2b8279","year":2020},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:bf818af3ad087b37a0e2321a09b11774b28fd45cf80d868dfd1a2666c351a1a4","observation_id":"ff7dfa6d-c425-4cf7-84c4-78d789e2a2c0","resolution":{"observed_at":"2026-05-19T04:42:04.543954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06640","last_updated":"2024-05-10T17:59:08Z","snapshot_observed_at":"2026-07-06T18:12:43.301678Z","submitted_at":"2024-05-10T17:59:08Z","title":"Linearizing Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.06640","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.06640","snapshot_observed_at":"2026-07-09T01:45:50.807991Z","title":"Let’s verify step by step","venue":"cs.CL","work_id":"87cc9178-d804-46fe-8128-c9074077dd04","year":2024},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2405.06640","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:e7fd8b8d76ce94a895a2c7684fc4898a940a2f52bc6363306c2c3423b227b83b","observation_id":"5fe8ba5c-a0d7-4951-bd21-36aa440d4d47","resolution":{"observed_at":"2026-05-19T04:42:04.573598Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-02T14:27:24.212588Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"cited_work":{"arxiv_id":"2404.07143","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.07143","snapshot_observed_at":"2026-07-10T01:36:44.083287Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","venue":"cs.CL","work_id":"aecc8f73-1fd7-4a39-8ae7-a172b6a435b6","year":2024},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2404.07143","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:04162ff34c6e4d63e0a00cfdf4bf3e53c49324da7b040275b2b5f439f50a0490","observation_id":"6f655a4b-3844-4cbf-aba8-ac4ba30cdf1b","resolution":{"observed_at":"2026-05-21T18:17:00.308428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":"2305.13048","doi":"10.48550/arxiv.2305.13048","metadata_source":"pith","pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"RWKV: Reinventing RNNs for the Transformer Era","venue":"cs.CL","work_id":"524dc80d-f4ef-4f89-bf1a-9a8c1e4b6a81","year":2023},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:b58beeb8351b894818fd9e4a674c5bef4aa84ee7b4be2fc194136959f4abec18","observation_id":"d9fe5a8c-793d-475d-8289-2abd405f6836","resolution":{"observed_at":"2026-05-19T04:42:04.176977Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14995","last_updated":"2024-01-19T07:47:01Z","snapshot_observed_at":"2026-08-01T19:55:19.898676Z","submitted_at":"2023-07-27T16:45:33Z","title":"TransNormerLLM: A Faster and Better Large Language Model with Improved TransNormer","version":2},"cited_work":{"arxiv_id":"2307.14995","doi":"10.48550/arxiv.2307.14995","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.14995","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"org/abs/2307.14995","venue":null,"work_id":"99fe9fb2-bb01-4407-b04b-44fc5dfcebca","year":2024},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2307.14995","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:c44aced642c485bc0558d903c207d363d1dc1a1f6111dcfbf73b0c3a891c0c6f","observation_id":"bc6c667a-1a6c-476c-84e7-a206061178b5","resolution":{"observed_at":"2026-05-19T04:42:04.610884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:ed2c605e87237f2b6173dafddb1f944ec4903ede62e703772e57e669099a4b5e","observation_id":"53024a91-b089-4b6d-bcca-e7e02eb2a968","resolution":{"observed_at":"2026-05-19T04:42:04.602214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":"2406.07887","doi":"10.48550/arxiv.2406.07887","metadata_source":"pith","pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"An Empirical Study of Mamba-based Language Models","venue":"cs.LG","work_id":"7a48323c-5291-43c0-93ea-ac7a32dd7fef","year":2024},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:f461c969fed44a629a08b4314ebb95764bd4ed4b14e00e05644379a0c2a2eb90","observation_id":"16387a6d-68c8-4751-a9c6-541c162cb208","resolution":{"observed_at":"2026-05-19T04:42:04.581966Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":"2006.04768","doi":"10.48550/arxiv.2006.04768","metadata_source":"pith","pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Linformer: Self-Attention with Linear Complexity","venue":"cs.LG","work_id":"4b717b51-6098-45d0-8e9e-b69bef651bc3","year":2020},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:f5803ea8434db6cb5ff081664da86cf59d3bddafcca989c77800984392e5976a","observation_id":"23ddb5e6-5329-4607-8922-b68f9245a007","resolution":{"observed_at":"2026-05-19T04:42:04.557120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":"2309.17453","doi":"10.48550/arxiv.2309.17453","metadata_source":"pith","pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":"cs.CL","work_id":"a8d25452-c237-48c9-88a4-682717c3979a","year":2023},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:04e90ad7467b4668277bee96a121033d347955db2add327b012af5f96e8207bb","observation_id":"96df8805-ed18-46bc-b81d-df2b446bc4c6","resolution":{"observed_at":"2026-05-19T04:42:04.598288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":"2312.06635","doi":"10.48550/arxiv.2312.06635","metadata_source":"pith","pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","venue":"cs.LG","work_id":"65a18a30-6e80-4b64-a026-bb0368e38872","year":2023},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:f67fa972fd822f080550ecd5415415693652b7ba7d49aee447d555987b7acf76","observation_id":"9ab14263-c418-4485-af53-8e6b2ea0a725","resolution":{"observed_at":"2026-05-19T04:42:04.552847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04347","last_updated":"2024-02-06T19:31:26Z","snapshot_observed_at":"2026-07-06T17:26:27.288834Z","submitted_at":"2024-02-06T19:31:26Z","title":"The Hedgehog & the Porcupine: Expressive Linear Attentions with Softmax Mimicry","version":1},"cited_work":{"arxiv_id":"2402.04347","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.04347","snapshot_observed_at":"2026-07-09T01:45:50.823193Z","title":"org/P19-1472","venue":"cs.LG","work_id":"677d5107-6308-4640-bd1a-47e49d1ec496","year":2024},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2402.04347","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:195baf7a4c811e10fed9f0d64217d684a3e70c53ec6337bf825c19bfa335589b","observation_id":"aff46cfe-5900-4f81-8eca-6fad1a22eacd","resolution":{"observed_at":"2026-05-19T04:42:04.590335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":"2304.11277","doi":"10.48550/arxiv.2304.11277","metadata_source":"pith","pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","venue":"cs.DC","work_id":"bee7755e-b855-401d-813a-06ae9451d768","year":2023},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:28d181229af9e9edc6632c853bc0af771eb45875dbb89aa2ba6fc50a43ec06d7","observation_id":"8e3887bc-3eb4-4155-85eb-603d11156688","resolution":{"observed_at":"2026-05-19T04:42:04.548123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"First, Lizard still relies on a strong pretrained backbone to achieve high quality","venue":null,"work_id":"75e4dd2f-3c6c-4792-b69d-001ff55d19e4","year":2048},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:efd2ae26e8b40ea336bf93ce47352c2350ec04bbb1ebb3c63491348589df3cec","observation_id":"7b330d2e-396b-44d8-8fb1-da469e6b038b","resolution":{"observed_at":"2026-05-19T04:42:59.936049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7daa39df-a19b-4442-809a-92c25985dc39","year":2048},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:8897d0d8253c40192f47178882fe6d9dc708bd7bb5065a510015c5d972f53c3c","observation_id":"c5ef7aa2-6db0-451b-abdc-c882af4952e2","resolution":{"observed_at":"2026-05-19T04:42:59.930321Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chungus Among Us","venue":null,"work_id":"f6a5fb97-b36d-4f4b-bd45-ff68784ad483","year":2024},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:90c281908e6741388df506f3061e2ecc8b1e75f2e59345d8feab2e1bc40bee12","observation_id":"6f7f6a6c-f927-4d6b-b2aa-9a3f11edb6f6","resolution":{"observed_at":"2026-05-19T04:42:59.932979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T21:55:59.757729Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":1,"verified_exact":20,"verified_fuzzy":2},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 1 inbound Pith citation observation for arXiv:2507.09025."}