{"as_of":"2026-08-21T15:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee8b765081280c50bbaf888cff2eac139a462df1bbe2668864f6a01c2a8eae0e","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:40:49.339784Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.01506/citation-record","integrity":"/paper/2508.01506/integrity","json":"/paper/2508.01506/citation-record.json","paper":"/paper/2508.01506"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:40:51.379353Z","title":"Chang, W.-C","venue":null,"work_id":"ca39807b-7de6-43f6-8b66-589bff997525","year":2025},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:46.406532Z"},"links":{"citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:bc370f8514c2e6b9a480924a067f4b95a788baf5fb0c70daaab0f5cb340004e7","observation_id":"02a2d03c-8b93-430a-8e3c-929950cd6abf","resolution":{"observed_at":"2026-08-06T05:40:51.382691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-06T05:40:46.524655Z","title":"Flashattention:Fastandmemory-efficientexactattention with io-awareness.arXiv preprint, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:46.524655Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:2230d0a821cb75367366cc713ad3db09559cc1fa5b7d09abe3075278921cb2f2","observation_id":"12b7e2a0-0fa2-41d1-af57-7845b222685e","resolution":{"observed_at":"2026-08-06T05:40:46.524655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-06T05:40:46.650824Z","title":"Flashattention-2:Fasterattentionwithbetterparallelism and work partitioning.arXiv preprint, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:46.650824Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:4cdca681e045c7623d95efaee97e6254d5dbca20bb9228139d9554a22bf50261","observation_id":"ac6995a2-594c-4b5c-8f74-29c1b6306a04","resolution":{"observed_at":"2026-08-06T05:40:46.650824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-08-20T16:10:20.713555Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-06T05:40:46.791518Z","title":"Dettmers, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:46.791518Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:4329baf81d4a5f440ae4c40c3565aa08afe14c0453ea00348a44dccac96feb1b","observation_id":"cb48aa86-83d4-4a31-ae1f-b0b52fbcd233","resolution":{"observed_at":"2026-08-06T05:40:46.791518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:40:51.370583Z","title":"Devlin, M.-W","venue":null,"work_id":"86a85fe9-3224-4c72-b1bf-ce01d815f1bc","year":2019},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:46.941855Z"},"links":{"citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:ff15873b9b9b93d7e0671499ad7d01d1b695f9abeae10f7887c51492e16c0641","observation_id":"3f2cea1c-7ece-4b4f-a12e-fbac5f37f672","resolution":{"observed_at":"2026-08-06T05:40:51.373721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:40:51.361261Z","title":"Theapproximationofonematrixbyanotheroflowerrank","venue":null,"work_id":"3fb56738-5db7-4d30-adbf-3a2749a9e747","year":1936},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:47.083537Z"},"links":{"citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:db2dd877a3c63259b05cb21e6631d24a469582dbcd5ed74feda506f9cf710e54","observation_id":"6a9ead9c-ae27-4054-b095-2b270f11c45b","resolution":{"observed_at":"2026-08-06T05:40:51.363956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.06798","last_updated":"2018-04-17T19:07:21Z","snapshot_observed_at":"2026-08-15T23:28:18.026945Z","submitted_at":"2017-11-18T02:33:39Z","title":"MorphNet: Fast & Simple Resource-Constrained Structure Learning of Deep Networks","version":3},"cited_work":{"arxiv_id":"1711.06798","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.06798","snapshot_observed_at":"2026-08-06T05:40:49.928935Z","title":"MorphNet: Fast & Simple Resource-Constrained Structure Learning of Deep Networks","venue":"cs.LG","work_id":"0804385d-3c13-4d21-b34c-dd772983a24c","year":2017},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:47.172004Z"},"links":{"cited_paper":"/paper/1711.06798","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:463c840ac9ae64166c5d81e34057ac810541c0a90341784f88f23eb404b3c94d","observation_id":"87868ae5-c470-4989-9cb1-0fa42813b9fb","resolution":{"observed_at":"2026-08-06T05:40:50.020452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.00149","last_updated":"2016-02-15T06:25:40Z","snapshot_observed_at":"2026-08-04T16:59:47.843960Z","submitted_at":"2015-10-01T09:03:44Z","title":"Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.00149","snapshot_observed_at":"2026-08-06T05:40:47.324327Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:47.324327Z"},"links":{"cited_paper":"/paper/1510.00149","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:5ba5800c23d994c26a033f69e35c1796c22b8c210b366a76e513e745bebe40eb","observation_id":"c2b9f613-7930-42f5-b2ce-5827759955f6","resolution":{"observed_at":"2026-08-06T05:40:47.324327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:40:51.330563Z","title":null,"venue":null,"work_id":"4abf191b-42db-40bc-b026-af4556208ae7","year":2017},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:47.417020Z"},"links":{"citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:26eaecdc26e63ce2ef095c2fcb7dec7abba89b13426631089ded261ecf9b076e","observation_id":"f36365dd-9df5-4447-86ac-798ca56512a3","resolution":{"observed_at":"2026-08-06T05:40:51.355346Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00112","last_updated":"2022-06-30T21:57:07Z","snapshot_observed_at":"2026-08-18T15:54:54.765131Z","submitted_at":"2022-06-30T21:57:07Z","title":"Language model compression with weighted low-rank factorization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00112","snapshot_observed_at":"2026-08-06T05:40:47.501518Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:47.501518Z"},"links":{"cited_paper":"/paper/2207.00112","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:6d7f8c4ba246c675a8c02b4ef601c27905d3f505507fdda70f88274cd03dc514","observation_id":"bb1e7e88-02f2-4590-9ec6-ab79e78161e2","resolution":{"observed_at":"2026-08-06T05:40:47.501518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T05:40:47.559961Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:47.559961Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:3185fbebb058fe3ac3bee4c375bad8ec9854894a21fb94efccad08c3db0e2997","observation_id":"9e5c1f0a-2a34-431a-9e76-ca71f6863a0d","resolution":{"observed_at":"2026-08-06T05:40:47.559961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05877","last_updated":"2017-12-15T23:56:52Z","snapshot_observed_at":"2026-08-14T20:03:06.929797Z","submitted_at":"2017-12-15T23:56:52Z","title":"Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05877","snapshot_observed_at":"2026-08-06T05:40:47.644420Z","title":"Quantization and training of neural networks for efficient integer-arithmetic-only inference","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:47.644420Z"},"links":{"cited_paper":"/paper/1712.05877","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:a3b8eef0cc20a3896a3b3b8ac9be2ee6e860d37ce33bb1938bafd4a28f31743d","observation_id":"167e7114-f44c-444d-9923-7a8080a07728","resolution":{"observed_at":"2026-08-06T05:40:47.644420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.08710","last_updated":"2017-03-10T17:57:56Z","snapshot_observed_at":"2026-08-20T02:05:14.188305Z","submitted_at":"2016-08-31T02:29:59Z","title":"Pruning Filters for Efficient ConvNets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.08710","snapshot_observed_at":"2026-08-06T05:40:47.741507Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:47.741507Z"},"links":{"cited_paper":"/paper/1608.08710","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:dfe876be934db45ff872579de24499bee26eb4483ae18a8e5dbf7a3d13b8d218","observation_id":"27a60a9a-c4d9-4de3-98ba-65c7d7dbc28e","resolution":{"observed_at":"2026-08-06T05:40:47.741507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:40:51.251318Z","title":"Lin and Colleagues","venue":null,"work_id":"2f64953b-c266-4934-97b5-5ba76ecadf40","year":2024},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:47.785776Z"},"links":{"citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:386e5ef70de4f092384c88ab3bbe300df38051d53b2d1c1957583b283a9695b8","observation_id":"c0536e03-c946-41fc-b1b8-42cd38adebcf","resolution":{"observed_at":"2026-08-06T05:40:51.322437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.07827","last_updated":"2019-03-22T01:29:58Z","snapshot_observed_at":"2026-08-14T17:27:09.010883Z","submitted_at":"2019-01-23T11:29:39Z","title":"Towards Compact ConvNets via Structure-Sparsity Regularized Filter Pruning","version":2},"cited_work":{"arxiv_id":"1901.07827","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.07827","snapshot_observed_at":"2026-08-06T05:40:49.638481Z","title":"Towards Compact ConvNets via Structure-Sparsity Regularized Filter Pruning","venue":"cs.CV","work_id":"4867dd1b-1bb9-41e6-a868-be1135809852","year":2019},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:47.886142Z"},"links":{"cited_paper":"/paper/1901.07827","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:89ac767e74a7443761575869c17c7041ec2948a7d31f2b748006eb8b93a6a4ed","observation_id":"a5e7bd7e-5369-4753-a220-fc18924e8d53","resolution":{"observed_at":"2026-08-06T05:40:49.713172Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17116","last_updated":"2025-05-30T00:36:37Z","snapshot_observed_at":"2026-08-18T23:55:01.247258Z","submitted_at":"2024-11-26T05:10:04Z","title":"Star Attention: Efficient LLM Inference over Long Sequences","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17116","snapshot_observed_at":"2026-08-06T05:40:47.963422Z","title":"Liu and N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:47.963422Z"},"links":{"cited_paper":"/paper/2411.17116","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:c56d2fda89b40cd9a362b6eba05590164f72cd91fd9d9a17d493b38465935ea2","observation_id":"1cfa2c0e-7705-4dd1-9ec3-16a67d9e115a","resolution":{"observed_at":"2026-08-06T05:40:47.963422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-06T05:40:48.111295Z","title":null,"venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:48.111295Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:5d80dd48ce95cedf3abde09e087f377a001adc466332c36f757749bc1f01e3b8","observation_id":"e970d6f5-f3ab-49c5-bdf1-470b616bc3d0","resolution":{"observed_at":"2026-08-06T05:40:48.111295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05791","last_updated":"2017-06-19T05:29:29Z","snapshot_observed_at":"2026-08-18T19:59:15.445331Z","submitted_at":"2017-06-19T05:29:29Z","title":"An Entropy-based Pruning Method for CNN Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05791","snapshot_observed_at":"2026-08-06T05:40:48.179747Z","title":"Luo and J","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:48.179747Z"},"links":{"cited_paper":"/paper/1706.05791","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:c36ad8d6b1db7686c717fca9e960fb53f547a9057ecf49d900d76cf0ba294fd7","observation_id":"2387da24-0e47-44d9-b467-581819e55b25","resolution":{"observed_at":"2026-08-06T05:40:48.179747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06342","last_updated":"2017-07-20T02:16:16Z","snapshot_observed_at":"2026-08-14T20:46:29.269113Z","submitted_at":"2017-07-20T02:16:16Z","title":"ThiNet: A Filter Level Pruning Method for Deep Neural Network Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06342","snapshot_observed_at":"2026-08-06T05:40:48.270944Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:48.270944Z"},"links":{"cited_paper":"/paper/1707.06342","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:ce5a80e68a83259619e6dba6784870c520e227e79e1726be15142c66ba79e3f7","observation_id":"abcc3029-9469-431f-99cb-34bace7a357c","resolution":{"observed_at":"2026-08-06T05:40:48.270944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:40:51.091485Z","title":null,"venue":null,"work_id":"d1e179aa-1383-4dc0-8430-c38fdd09c9df","year":2023},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:48.341204Z"},"links":{"citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:0049a23b5a68c48183b8d9d4dc545e31e22fa907476e33d34db3d279418e9663","observation_id":"f16036ae-f65c-4c4f-9de8-b912414712ff","resolution":{"observed_at":"2026-08-06T05:40:51.175906Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:40:50.909466Z","title":null,"venue":null,"work_id":"931a6271-55bc-47d7-af7a-aac62bede708","year":2024},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:48.419107Z"},"links":{"citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:91f0963528c486713e5717ec4a1f9824599b1c66855ce548b37f0fbba072b0b4","observation_id":"bda61b5f-d27c-4f1b-8437-137c8858ae69","resolution":{"observed_at":"2026-08-06T05:40:51.000642Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:40:50.654780Z","title":"Shi and Team","venue":null,"work_id":"a28e2e30-4bae-44b4-98a6-88da3bebe298","year":null},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:48.456722Z"},"links":{"citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:5b3478d0da2ab3823b948714ae99a0befa1895b4af0a166db0359ce87204618e","observation_id":"b221776f-d390-4df0-a0c5-ed8e677a54b6","resolution":{"observed_at":"2026-08-06T05:40:50.787293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-06T05:40:48.546549Z","title":"Shoeybi, M","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:48.546549Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:ac9105d1451a3bf69d5cbfd148c240f392844bfa29b7863f9c4e70c1980763f7","observation_id":"a4fac312-3ee2-4ee4-bc9b-51d8b7f754c5","resolution":{"observed_at":"2026-08-06T05:40:48.546549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T05:40:48.636130Z","title":"Llama:Openandefficientfoundationlanguagemodels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:48.636130Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:18b6a82f6c1435eb97ebe63a0d7708dec4a9833513c28e2fc727636ae6518f1e","observation_id":"65c5ff95-ec2e-4041-9c48-308848f3356f","resolution":{"observed_at":"2026-08-06T05:40:48.636130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-08-16T09:50:11.319379Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-06T05:40:48.697248Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:48.697248Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:073d57436d76006728a544a465ae075271b3a9cc9537cb9a602f9049fd5253e9","observation_id":"eecf0104-23ac-4a8d-af97-6a19508b4fb2","resolution":{"observed_at":"2026-08-06T05:40:48.697248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:40:50.352886Z","title":null,"venue":null,"work_id":"82e2ef34-10d5-457d-be10-1f6f796ea5a1","year":2025},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:48.789902Z"},"links":{"citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:fd7253ab3db5591dcac971c24debbed0eb26c9e36b5e488740629b4af601baec","observation_id":"e14407b0-92ae-4892-ac3d-5e423cd16e21","resolution":{"observed_at":"2026-08-06T05:40:50.466047Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07378","last_updated":"2025-03-16T03:27:33Z","snapshot_observed_at":"2026-08-18T15:56:23.038008Z","submitted_at":"2024-03-12T07:31:18Z","title":"SVD-LLM: Truncation-aware Singular Value Decomposition for Large Language Model Compression","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07378","snapshot_observed_at":"2026-08-06T05:40:48.880739Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:48.880739Z"},"links":{"cited_paper":"/paper/2403.07378","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:b210de4d49d8e4ef7f470ad1d09e9207e52d472bfedf919bd6886995705532d4","observation_id":"e9a7622b-e1e6-48bd-87af-b33efc4df0f4","resolution":{"observed_at":"2026-08-06T05:40:48.880739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12340","last_updated":"2025-03-16T03:27:12Z","snapshot_observed_at":"2026-08-19T05:47:54.570538Z","submitted_at":"2025-03-16T03:27:12Z","title":"SVD-LLM V2: Optimizing Singular Value Truncation for Large Language Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12340","snapshot_observed_at":"2026-08-06T05:40:48.949595Z","title":"Svd-llmv2:Optimizingsingularvaluetruncationfor large language model compression.arXiv preprint arXiv:2503.12340, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:48.949595Z"},"links":{"cited_paper":"/paper/2503.12340","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:232c53a2be4fbfcbe3a4718358aa435a68c690a77b2f5a1dbf255efa22038b24","observation_id":"5fc6813c-c647-47b9-908e-3d9cfb59dd32","resolution":{"observed_at":"2026-08-06T05:40:48.949595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09602","last_updated":"2020-04-20T19:59:22Z","snapshot_observed_at":"2026-08-14T00:25:24.218417Z","submitted_at":"2020-04-20T19:59:22Z","title":"Integer Quantization for Deep Learning Inference: Principles and Empirical Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09602","snapshot_observed_at":"2026-08-06T05:40:49.038808Z","title":"Integerquantizationfordeeplearninginference: Principles and empirical evaluation.arXiv preprint arXiv:2004.09602, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:49.038808Z"},"links":{"cited_paper":"/paper/2004.09602","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:7c0d3b5577a71356ec5861374600cae33eea6c44533b9db10f69b6d156e03f70","observation_id":"45840cbb-72ee-4c4f-8e37-e9f5d9e50cfb","resolution":{"observed_at":"2026-08-06T05:40:49.038808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:40:49.101917Z","title":"Yuan and Others","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:49.101917Z"},"links":{"citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:23e827d65751183fb4ad7754b7d69b752c99d4bb0b1cab2a99d1e2743bdd66d3","observation_id":"34e39958-89bc-4ddd-9793-a74cf1c8f4f7","resolution":{"observed_at":"2026-08-06T05:40:49.101917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:40:50.194682Z","title":"Zhang, Y","venue":null,"work_id":"8c780a6e-c77a-4314-a96e-35346d65988d","year":2024},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:49.205494Z"},"links":{"citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:8f2f940262b5956158e6fc1f0a5ad94d57cc7ce7b59db80b50b87c05f7704810","observation_id":"0564b6f0-695a-4df4-a83a-9f47494ca087","resolution":{"observed_at":"2026-08-06T05:40:50.277503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-06T05:40:49.339784Z","title":"Zhang, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T05:40:49.339784Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2508.01506"},"observation_digest":"sha256:ccde39dfd17e82308f087f116ea8967cfc715cf2c705834e105ba44c893c474e","observation_id":"55795cd0-504f-4703-848e-50bc2f9c2627","resolution":{"observed_at":"2026-08-06T05:40:49.339784Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.01506","last_updated":"2025-08-02T22:06:46Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T12:32:12.006795Z","submitted_at":"2025-08-02T22:06:46Z","title":"FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2508.01506."}