{"as_of":"2026-08-08T18:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6f93a21ac6c595846cbdea4cfd981b7de51c0c00aec66d1be3405252e9ed656","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T13:39:53.206470Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.28573/citation-record","integrity":"/paper/2605.28573/integrity","json":"/paper/2605.28573/citation-record.json","paper":"/paper/2605.28573"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Princeton University Press, 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:c1fb2e6021615c66087f7278642e336b049c0046c6175f18896f808fba0e6bb5","observation_id":"803ca0db-dfff-419d-a183-a4fb9dd8a4d4","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"GQA: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:26b9128b897062e2a6b0ded6017bbd5a51d226ea0dad46bab04c170a455bf8ad","observation_id":"eb999300-a5e4-4e24-8c8d-c2217c04322f","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Unitary evolution recurrent neural networks, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:1556e77c3b5d903fd26e2e83abd1e9478034390d0402a7c4528a15e98db0d3ab","observation_id":"99b47e68-0876-4c50-be0d-b28ea703478d","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Can we gain more from orthogonality regularizations in training deep cnns?, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:fd25c895dec2ab7d8310745a8fde6d28c447f925dcd680b3d57d22eee47ac9aa","observation_id":"cc58cfc9-086b-4e95-a96e-02da620e13d7","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Cambridge University Press, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:31822acd97319118072069f16739b65bca511419c5f912d5ef0f20120bdce359","observation_id":"33d73fa0-0af7-48be-a9c3-3c6ae314c3eb","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:02e13362312936892d3d214f9f8af5fc6fcf0a4a6bb8aa72509a3a5005e8ec40","observation_id":"ba6164c2-f849-4d16-aa4f-a427d06134b3","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":null,"venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:2075cc68d480c9043b09f74d3ac3f1915cdc36bc9dd4f0b48c1e9f3e5a741683","observation_id":"4a6ca715-2088-4ab3-a9d6-8df46e5a36c8","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Reducing overfitting in deep networks by decorrelating representations, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:b3a69844ca154bf6029bfc801c00be7c4908af210d84a783b9f2d4b4d2aff542","observation_id":"611fa5f3-172d-4acb-a452-19547ff7e3f0","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"IOS Press, October 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:d0db8e00f7be1bc997041b370c684201c74898c44f80a3ccc6fc175d84475b2e","observation_id":"8d66f8d9-5628-406e-a03b-55ab48ecf332","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Documenting large webtext corpora: A case study on the colossal clean crawled corpus, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:293c3fe1dc95207927ef4b65e3e49a6755469fc624e4816de64ac19650987ae3","observation_id":"b3cefa28-6997-4de1-979c-4220b5cc62b4","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:e8688003aa944e9b20f358957d82883c9b224ae18700d8f439c5cb9eb46c40a0","observation_id":"a2551fa4-5e2b-4dd5-8c8a-9dd6b84f3f37","resolution":{"observed_at":"2026-06-29T13:43:28.727141Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"The approximation of one matrix by another of lower rank","venue":null,"work_id":null,"year":1936},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:36dfcd738d7d2baa1ea86fc448cc873dbc4629dc21a21e25eecc4365bdac6162","observation_id":"71be59f2-fb3a-44fb-8de5-47c194ac368b","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Arias, and Steven T","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:23fd0e51b4ca4e26b2ac8c351637045f62b2bd0c2768b7e1025743b1cdfaf8b0","observation_id":"4888d7ca-8ad8-431e-938a-937d7a7f5710","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Full-rank no more: Low-rank weight training for modern speech recognition models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:08122d79e30d162406cc845ef15a540d8f8da62a6ff46e5bdb48136ba9afb8d6","observation_id":"fcd53eef-4ceb-4e08-9487-bd379e41b4e2","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Deep feedforward networks.Deep learning, 1:161–217, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:ec56ffd7ad0dc5d739d0400a776ffa9fb5daf52833eb7fe04cb4cd4b541c9fa3","observation_id":"813dba24-c7c6-4b33-8aeb-6b60d7b52e69","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"From gpt to llama: Tracing the growth of large language models.Theoretical and Natural Science, 142:144–155, 11 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:c4257ce59ad9bc19dbd1b6e6b5efb1fb8330e95069d77f32eb06a292ee601f79","observation_id":"46786ee7-0e73-4c67-aad8-4297ab996ab7","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Sltrain: a sparse plus low-rank approach for parameter and memory efficient pretraining, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:8a3aa22c69fba48d108f5304525b9c73438f524c07204deaaa2849db82c25899","observation_id":"c9514802-bbac-4a32-9529-7845407417e0","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Rae, Oriol Vinyals, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:f8b8aa6663a7121b823c991c537acbe1ba1c35d9794dec993fa6b4cd125cc256","observation_id":"8de2ee8c-5454-41af-a9e5-0f048087185b","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:481d09de18064a222cc54801991b478f2a2156d55aac8e225481917079363fd6","observation_id":"0da1ecbc-3590-4db9-b3ba-f30a79bdd00a","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:c4b3d6b4788910e60d7119a13b471cced64e74bae6f3078ffb7093e9810aeb17","observation_id":"880813a3-cbb5-4af9-a3a7-62de6314e3d9","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:b709991679b28aa853aba2d1d63499b7f1915d41bc4b14a7fde6b383ce10e56b","observation_id":"71870e05-89b7-4237-a8a1-79d0fc10ab72","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Initialization and regular- ization of factorized neural layers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:b47761327c81f71f817ad7cf8143594815bbfa33247ac1b065b931cc45a24a74","observation_id":"9df9d7a1-5758-4e84-9db4-2f7221b41631","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Initialization and regular- ization of factorized neural layers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:5178d641a7edb748bf094ee6bdc4381635ad1cc582d4327133edc0ffd727b897","observation_id":"c958fc24-c032-4584-bc87-a468cc2d1af2","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Lost: Low-rank and sparse pre-training for large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:2d4cbee6f6fafd9c129c143cac3d89fbc44c0a240a8a1de6edc8c4c518a15354","observation_id":"56d8b64a-c1f2-4d7a-8ec5-512369ef81fc","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Relora: High- rank training through low-rank updates, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:2b8f6eabdc3d50f094f7267d79f2628fefe7cc516c5a561b0619b262ab7821b7","observation_id":"ea4f1aee-409b-404d-b0c6-989b44cf5229","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Cola: Compute-efficient pre-training of llms via low-rank activation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:e84bf5c4c449f46025110e5b19bd461fab594ca432388c785402a0aabaf27d07","observation_id":"ffb52c38-215f-4810-af53-aa8909c67714","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Large language models: A survey, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:75bd1d408606c2523a868f372adc5154371e6cd0ea4862cf3019785619eeff6c","observation_id":"583e94d8-c514-4a0b-8f1d-d813c34878f7","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Parameter and memory efficient pretraining via low-rank riemannian optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:4b34086bf12e5b8f35a516f3f81e3026207873ed07e9a30ca58d59f490358805","observation_id":"22064a8e-f43f-43f4-a44b-3d622b4420e8","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-07T08:18:31.274999Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":"2512.13961","doi":"10.1007/s13755-026-00428-z","metadata_source":"pith","pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Olmo 3","venue":"cs.CL","work_id":"74de5f5e-0a69-4f73-862d-e5705fa9f4bb","year":2025},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:7a4a17548a702207a84ad576efebf71f542462927cc06d14afa6db09526c6a2d","observation_id":"73748c87-332c-4023-8d3f-228568de0478","resolution":{"observed_at":"2026-06-29T13:43:28.744541Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":"1910.10683","doi":"10.18653/v1/2020.acl-main.259","metadata_source":"pith","pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","venue":"cs.LG","work_id":"50e3b368-0243-4726-8186-233869802ad1","year":2019},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:b27360bc1f41c96370b22e4282b06c780a5faf0c53ed10de8e1ecdc4b92bb4a9","observation_id":"05b2e6af-98d9-4ff0-9121-53322f2be3f7","resolution":{"observed_at":"2026-06-29T13:43:28.731874Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Robust low-rank training via approximate orthonormal constraints, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:e64392b10ff747d509c1f51b83e1852497f4d75d40dee13e439a58b2011774ca","observation_id":"151ff332-23a2-4de5-96af-322218e385bc","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Low-rank lottery tickets: finding efficient low-rank neural networks via matrix differential equations, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:c092d5d2c3f9c00ea9a6d98b99fee3526625767edd3729a41ad32cf328ede1f6","observation_id":"0b38f402-96f7-4b3e-96f6-1da574865883","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Compact: Compressed activations for memory-efficient llm training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:5da830ee6ec1dbe2e43d15d7567d82ed7013e056db8d4ab47027ef73dab206ef","observation_id":"c7d54399-7dba-4ffe-b6c2-0192317e9479","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02538","last_updated":"2023-05-05T16:18:28Z","snapshot_observed_at":"2026-07-06T15:23:02.639337Z","submitted_at":"2023-05-04T04:20:20Z","title":"Cuttlefish: Low-Rank Model Training without All the Tuning","version":2},"cited_work":{"arxiv_id":"2305.02538","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02538","snapshot_observed_at":"2026-06-29T13:43:28.735378Z","title":"Cuttlefish: Low-rank model training without all the tuning.arXiv preprint arXiv:2305.02538, 2023","venue":null,"work_id":"674abc97-bb38-4ab1-aba3-e49e1fabb8b5","year":2023},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"cited_paper":"/paper/2305.02538","citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:21cf225adaf3fb409ae99451cc1f73eeb1163570f2f8673be0ff4b9cb1cefd44","observation_id":"63391c11-29bf-44e0-a151-124d2792ff23","resolution":{"observed_at":"2026-06-29T13:43:28.736773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.08625","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:43:28.736867Z","title":"Dynamic rank adjustment for accurate and efficient neural network training.arXiv preprint arXiv:2508.08625, 2025","venue":null,"work_id":"e74ffa52-1bb2-4da8-94cc-699ea51ff7a6","year":2025},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:9b64b3122a5ea233aad2eacf3c7fff015a382b8eed8dd2ea25e5df3b2b3c6a83","observation_id":"60b0ab53-a955-47f1-85d7-e9ed03adf229","resolution":{"observed_at":"2026-06-29T13:43:28.738320Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Elrt: Efficient low-rank training for compact convolutional neural networks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:52ae0899277bd6105d094115dbb07f537c90fff8b8ae33344268426b8bf0c8ff","observation_id":"2abeaca3-03fd-43da-b0ce-a732d94e8a36","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Llama: Open and efficient foundation language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:15e7f8bcdd12c4bcbdf87de3a8d16e2334a17aa8512852b706c875efa6cd94f5","observation_id":"790e8e70-9ee6-484f-bc15-3ead2327b3be","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:44a0b83ce019e07ae93b3725acd17e0546dea7e326725b41407dd31b06903a54","observation_id":"23a9d67c-b4c8-44ae-af57-8144981f721b","resolution":{"observed_at":"2026-06-29T13:43:28.729620Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.12131","last_updated":"2026-05-11T19:05:27Z","snapshot_observed_at":"2026-08-02T10:02:28.902022Z","submitted_at":"2025-12-13T01:50:18Z","title":"BOOST: BOttleneck-Optimized Scalable Training Framework for Low-Rank Large Language Models","version":2},"cited_work":{"arxiv_id":"2512.12131","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.12131","snapshot_observed_at":"2026-06-29T13:43:28.732993Z","title":"BOOST: BOttleneck-Optimized Scalable Training Framework for Low-Rank Large Language Models","venue":"cs.LG","work_id":"3106d026-774d-4b46-a665-f5c65e18fdb4","year":2025},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"cited_paper":"/paper/2512.12131","citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:2538cfe4d05477513c2b18a6d00b7e767c6744a705d1a92966cd9427249163b5","observation_id":"1f155ceb-2721-4cd2-a698-aceedf5e7b84","resolution":{"observed_at":"2026-06-29T13:43:28.734144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Investigating low-rank training in transformer language models: Efficiency and scaling analysis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:cfc1c6b214b892c9455e04ddca1bb656da4c27f176f12e0a039bcbee977f1f59","observation_id":"c4922ffc-7840-41ad-bfa1-9a3c4f178240","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Transformers: State-of-the-art natural language processing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:ab17f2900674e40bbd67b8fbf28f476dcc947a45d091ff4efb53991eb23f59dd","observation_id":"f8ba27e5-d6b7-4ddb-8ddd-7ee8a7e031ca","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Learning low-rank deep neural networks via singular vector orthogonality regularization and singular value sparsification, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:9776d64bf44a9174d1f774eb6d58f4c0ee62e415245e85e0be6b1d2312e154f0","observation_id":"5342ad7d-e7ae-4b99-be1f-0251853b6497","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11250","last_updated":"2024-01-01T03:43:41Z","snapshot_observed_at":"2026-08-06T13:53:33.999451Z","submitted_at":"2023-06-20T03:03:04Z","title":"InRank: Incremental Low-Rank Learning","version":2},"cited_work":{"arxiv_id":"2306.11250","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.11250","snapshot_observed_at":"2026-06-29T13:43:28.739717Z","title":"Inrank: Incremental low-rank learning","venue":null,"work_id":"c188f194-5584-4202-a035-7901b32dac6c","year":2023},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"cited_paper":"/paper/2306.11250","citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:c53bc30a99538ee3d13509f6389a06d7b1ca5210c58224d6b3ea24ec781d50af","observation_id":"ea414b5f-f6cc-46e0-9436-fbf34691dc6f","resolution":{"observed_at":"2026-06-29T13:43:28.741721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Galore: Memory-efficient llm training by gradient low-rank projection, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:44d8f02b8da27cba0ecbc5724baa760b1f613dbf25382209116366868d9721c5","observation_id":"e1e5c323-c1c1-42e6-8c8d-901080d194ed","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"A survey of large language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:320ecddc2df9f4796fb3cd0961c9e175a73bc8cd224cc763eeb11202aca38fa3","observation_id":"56fa5527-1306-4c1f-a86c-3bbd767502ba","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Hence the forward operator norm is controlled exactly byσ max","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:6013bc0f9b616a2f7e24b0f2f5b26db3ea7dc3e52c530c0a2c2d991a3ab5230b","observation_id":"2649f54a-9539-4b9a-bdf8-7d6532208ee3","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Hence the backward operator norm is controlled by the same quantity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:59ae9fd8751ec728549c8fcf92b7330f475853498c81986187c876815c32d4c2","observation_id":"fac4b32b-a6ed-4524-b5c2-c69b443f8280","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Likewise, ifδlies in the represented output subspacespan(U), then σmin√r ∥δ∥2 ≤ ∥W ⊤δ∥2 ≤ σmax√r ∥δ∥2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:0f74acee4eb52b08ac406f4d8eb08909e88748450b6ea871b6151696ecc2316a","observation_id":"80cd6486-57d4-4de3-aeb7-5e3cb76b4c21","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"If ui and vi denote the i-th columns of UandV, then W= 1√r rX i=1 σiuiv⊤ i , ∂L ∂σi = 1√r u⊤ i Gvi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:199eaa85ba784a6e854489d9ce40d722118d09b349c7c67ca33145e9f3437221","observation_id":"55bc3c9b-b5f1-4372-b960-4aad0885c27a","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:0032a0e20c0f33694226980a02e78f14044223125bfc46d93800bcf8ec6481fa","observation_id":"eea9d66c-12e0-4a25-8437-458ef6f9f0e5","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:53c86fab982388fd10861d800e6793f33d91e8eb235269aeaa8bc555d00a2238","observation_id":"6bd55ed0-fcae-4ba4-8119-e0d6361c1273","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":"Orthonormality does not remove this fundamental low-rank bottleneck, but it does prevent additional instability caused by badly scaled basis factors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:1760116cba22bce371f902ad9724ba5be4e46fd6baad7015b0b624429c36037c","observation_id":"205b66b8-5fff-461d-8e1e-577004d1e6f5","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:018b10d11209350659ae24047890350a3b871daf7d2cf821f8a058cc7f255c69","observation_id":"e642d319-2108-4ce2-bbd2-e2cbca30cb20","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:7dfb423fc9ffc2f6d8d40eeabba34b901bc40e861a837f6a3eb9187951243f6b","observation_id":"dab857e3-bf4c-43e2-a22c-c7b94da8d6c4","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:2a2b0182c2f616e99bbe68d4b17b07a85f20063fb18587a2e3b64220f1beddcf","observation_id":"bbc9a5c2-7d97-4b38-b1c8-f6dd55d208a8","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:39:53.206470Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:53.206470Z"},"links":{"citing_paper":"/paper/2605.28573"},"observation_digest":"sha256:8e2d31f8083b7e1bcc25489fb5d971076052416390b97f86b3e6cf67efbb7383","observation_id":"2a62f5f2-1ac0-42e2-8e5b-16376d31b118","resolution":{"observed_at":"2026-06-29T13:39:53.206470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.28573","last_updated":"2026-05-27T14:57:49Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T01:52:12.419182Z","submitted_at":"2026-05-27T14:57:49Z","title":"Efficient Pre-Training of LLMs through Truncated SVD Layers"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":8,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2605.28573."}