{"as_of":"2026-08-11T18:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:98b769f558d3289d2e51a5ccc840b7bfbe90506767889f41646e6fce75ef02c0","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:26:11.262338Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T18:10:34.962717Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"cited_work":{"arxiv_id":"2501.09767","doi":"10.48550/arxiv.2501.09767","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"{JENGA}: Enhancing{LLM}{Long-Context}fine-tuning with contextual token sparsity","venue":"ArXiv.org","work_id":"4d0150d0-6fed-4583-9be1-147688624b67","year":2025},"citing_paper":{"arxiv_id":"2604.10060","last_updated":"2026-04-11T06:54:56Z","snapshot_observed_at":"2026-08-10T21:22:44.566409Z","submitted_at":"2026-04-11T06:54:56Z","title":"Mosaic: Cross-Modal Clustering for Efficient Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:36.133404Z"},"links":{"cited_paper":"/paper/2501.09767","citing_paper":"/paper/2604.10060"},"observation_digest":"sha256:d556b5df6bbcd7c36bafe54fe6342f2b5a6ef164b096a9a5cb2bd75ef62884ab","observation_id":"62e7ebb7-962d-4e6f-9c07-98ae118e8088","resolution":{"observed_at":"2026-05-10T16:10:34.385586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"cited_work":{"arxiv_id":"2501.09767","doi":"10.48550/arxiv.2501.09767","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"{JENGA}: Enhancing{LLM}{Long-Context}fine-tuning with contextual token sparsity","venue":"ArXiv.org","work_id":"4d0150d0-6fed-4583-9be1-147688624b67","year":2025},"citing_paper":{"arxiv_id":"2606.08476","last_updated":"2026-06-07T06:45:15Z","snapshot_observed_at":"2026-08-01T22:16:48.770899Z","submitted_at":"2026-06-07T06:45:15Z","title":"FlashCP: Load-Balanced Communication-Efficient Context Parallelism for LLM Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T18:10:34.962717Z"},"links":{"cited_paper":"/paper/2501.09767","citing_paper":"/paper/2606.08476"},"observation_digest":"sha256:5262d74849ce61ea2e8dfd4209c47a19add1d98cafaaa597b04e6205b4baf4f7","observation_id":"6d9ddb73-e592-499c-b4d7-8abdbdb4e6ae","resolution":{"observed_at":"2026-07-02T23:27:28.009685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.09767/citation-record","integrity":"/paper/2501.09767/integrity","json":"/paper/2501.09767/citation-record.json","paper":"/paper/2501.09767"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T20:26:10.950938Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:10.950938Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:568acb9ed7839a352818e54c3a7836014802218b218983584b72ed75fb24c65c","observation_id":"851ec133-aaff-4e64-9ce3-60bd6a6deef9","resolution":{"observed_at":"2026-08-10T20:26:10.950938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.08375","last_updated":"2026-04-14T12:21:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-22T14:30:17Z","title":"Deep Learning using Rectified Linear Units (ReLU)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.08375","snapshot_observed_at":"2026-08-10T20:26:10.956084Z","title":"Deep learning using rectified linear units (relu)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:10.956084Z"},"links":{"cited_paper":"/paper/1803.08375","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:92cd71c9e4aa7f2353f3ab70a1e84ddced7e418054b74664cb37bf6ee87a8ccf","observation_id":"054de09c-8099-48e3-a31f-cb7398398c06","resolution":{"observed_at":"2026-08-10T20:26:10.956084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:10.960391Z","title":"Jiang, Jia Deng, Stella Biderman, and Sean Welleck","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:10.960391Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:e79c1699f476dacfd8692c06d598533b4292a18a05fc139eeb4a14e90a1c7eeb","observation_id":"93b6cdab-ac08-4d22-969a-53dac9da15a7","resolution":{"observed_at":"2026-08-10T20:26:10.960391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:12.250512Z","title":"LongAlign: A recipe for long context alignment of large language mod- els","venue":null,"work_id":"fde9fedc-7a7b-4e4e-9067-34d811602d42","year":2024},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:10.964660Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:47ca282ae5cc535f41f03c00dede60a3f1f00ae09bbf2e8c812a409463a2475b","observation_id":"d30c4b63-484e-4af6-8034-2c46b7e019bd","resolution":{"observed_at":"2026-08-10T20:26:12.254729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-10T20:26:10.968875Z","title":"Longbench: A bilingual, multi- task benchmark for long context understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:10.968875Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:69b185f66c2744ebf02fb53df0a213aa3702b8d5a53bdbc1f8427e96445be6cf","observation_id":"1a9cd77d-c593-48e5-8f45-9e06db62cc67","resolution":{"observed_at":"2026-08-10T20:26:10.968875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-10T20:26:10.973275Z","title":"Long- former: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:10.973275Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:eeee78b65d57dd1d0d2dc2822f04985db8cb834d800fdc07b955cfcff96e313d","observation_id":"0b9984e0-c1da-4af4-adfb-6f3bf43c7018","resolution":{"observed_at":"2026-08-10T20:26:10.973275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-10T20:26:10.978056Z","title":"Token merging: Your vit but faster","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:10.978056Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:d3d69dfa3be1895fa0358c5bb8106aebdf05217a177329e0b65cda43783904eb","observation_id":"af628428-9aa9-4ab6-91cf-b558c5299e9b","resolution":{"observed_at":"2026-08-10T20:26:10.978056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:10.982279Z","title":"Language models are few-shot learn- ers","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:10.982279Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:730962f20012878b177fb9c126e39dce913cb30df2fce8b1703dccadf9154fd9","observation_id":"e7b3b43f-8a37-418f-9055-758c9e6f5fc2","resolution":{"observed_at":"2026-08-10T20:26:10.982279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:12.230150Z","title":"Actnn: Reducing training memory footprint via 2-bit activation compressed training","venue":null,"work_id":"45fd9d05-37b9-4ea3-aff4-ce980b7be1d9","year":2021},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:10.986179Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:984c353c47becfe2cf7c756f452f4e9013924373a8e7b5b7fcc90320dfaeba70","observation_id":"31d3fe7d-fc79-4646-bf82-0ba9741086bb","resolution":{"observed_at":"2026-08-10T20:26:12.234393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-10T20:26:10.990216Z","title":"Extending context window of large language models via positional interpolation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:10.990216Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:1ac29b4d270f0a54bcb819167b9a5595ca0343cedc0745adcbb1da720901b46e","observation_id":"9027ca35-4776-48b1-9300-c11d7d683c64","resolution":{"observed_at":"2026-08-10T20:26:10.990216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-08T09:03:25.135475Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-10T20:26:10.994580Z","title":"Training deep nets with sublinear memory cost","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:10.994580Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:adec2201fea7da972a84718279bb2368c50e7e7816ee13d1f276d3e567273d66","observation_id":"231dbfc4-5389-4d96-97cf-279a5c5ae6ea","resolution":{"observed_at":"2026-08-10T20:26:10.994580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12307","last_updated":"2024-03-08T15:26:38Z","snapshot_observed_at":"2026-08-10T18:05:01.074940Z","submitted_at":"2023-09-21T17:59:11Z","title":"LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12307","snapshot_observed_at":"2026-08-10T20:26:10.998829Z","title":"Longlora: Effi- cient fine-tuning of long-context large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:10.998829Z"},"links":{"cited_paper":"/paper/2309.12307","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:cc225348403212937eff73ca46bf8b4bdd66f1b9cfa73229bff732a121ecf8d5","observation_id":"9a9264af-afb4-451f-a246-a5d25b41dad7","resolution":{"observed_at":"2026-08-10T20:26:10.998829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14924","last_updated":"2023-06-23T20:57:32Z","snapshot_observed_at":"2026-08-07T22:03:54.164128Z","submitted_at":"2023-06-23T20:57:32Z","title":"LLM-Assisted Content Analysis: Using Large Language Models to Support Deductive Coding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14924","snapshot_observed_at":"2026-08-10T20:26:11.002710Z","title":"Llm-assisted content anal- ysis: Using large language models to support deductive coding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.002710Z"},"links":{"cited_paper":"/paper/2306.14924","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:4e6e759763d14c006c05d0351e8cf4d163b44f1291282ca6da01d55cbfe3a246","observation_id":"60f6b67c-f391-4783-85e0-5c38eb55b192","resolution":{"observed_at":"2026-08-10T20:26:11.002710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.006637Z","title":"Redpajama: an open dataset for training large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.006637Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:b4d9fd8037c3101a00f4dcb06a4e27f10eb54bcecdb87273884a173941cb7029","observation_id":"924cdf81-b10e-4c76-8d96-7860b3556ae9","resolution":{"observed_at":"2026-08-10T20:26:11.006637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:12.208844Z","title":"FlashAttention-2: Faster attention with bet- ter parallelism and work partitioning","venue":null,"work_id":"a41aefff-b0dd-46b6-8bb0-eacd713dd740","year":2024},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.010336Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:af526f94050cb4912c6c98e4325bdd3e0ba26dd6e98250b1f32298bbe9750c9c","observation_id":"bb39a3c1-8d48-485f-bac8-9f8c35b0ce6c","resolution":{"observed_at":"2026-08-10T20:26:12.213246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.013925Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.013925Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:601c2a6125d9590c5be061e3ba7799ebb2d1e0b1039b9bfc21498cbed18008d1","observation_id":"dcfde5a7-0614-4e4d-ad1f-766a8d63f473","resolution":{"observed_at":"2026-08-10T20:26:11.013925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02690","last_updated":"2025-02-12T14:32:46Z","snapshot_observed_at":"2026-08-09T12:41:39.057624Z","submitted_at":"2024-04-03T12:37:34Z","title":"How Sparse Attention Approximates Exact Attention? Your Attention is Naturally $n^C$-Sparse","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02690","snapshot_observed_at":"2026-08-10T20:26:11.017792Z","title":"Attention is naturally sparse with gaussian distributed input","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.017792Z"},"links":{"cited_paper":"/paper/2404.02690","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:d313672de2fc23c2171b4a83d092ff12bb757291f5b8202005e01ba11bdaec7c","observation_id":"5f031627-7f06-4564-8166-0c1a0750901d","resolution":{"observed_at":"2026-08-10T20:26:11.017792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13753","last_updated":"2024-02-21T12:30:33Z","snapshot_observed_at":"2026-08-02T12:47:57.325302Z","submitted_at":"2024-02-21T12:30:33Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13753","snapshot_observed_at":"2026-08-10T20:26:11.022416Z","title":"Longrope: Extending llm context window beyond 2 million tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.022416Z"},"links":{"cited_paper":"/paper/2402.13753","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:ab178e0543c026880c08337bab9c79806bde061ddc3bb5a355470acb932f70c6","observation_id":"ce8ee582-57fc-4566-832b-9bcb6c3a72cc","resolution":{"observed_at":"2026-08-10T20:26:11.022416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T20:26:11.026449Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.026449Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:ead11a89551df5d15971c8965d4f871573cbf7788b67bae6cbdeec07d0cd8301","observation_id":"fd8b6a42-01b7-40ba-b7c4-50f1cdc8486b","resolution":{"observed_at":"2026-08-10T20:26:11.026449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.030033Z","title":"Sigmoid- weighted linear units for neural network function ap- proximation in reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.030033Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:80a1d7bbe57956c909f4e7bc3ecc0895f3e8d8bb5164bcad0a849714559ca461","observation_id":"ee6c6603-ab9f-46ff-ad3c-cb72b6dbad6b","resolution":{"observed_at":"2026-08-10T20:26:11.030033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:12.179785Z","title":"Ac-gc: Lossy activation compression with guaranteed convergence","venue":null,"work_id":"f03a5a1d-f114-4789-a0dd-51ba017a5941","year":2021},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.033716Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:bd9a1dde6e77868bbeacb10a4b6e263ed9af422b6af31e5b3c2ad759dba92b61","observation_id":"f84c0df8-cd33-4efc-9c26-4414006873d2","resolution":{"observed_at":"2026-08-10T20:26:12.184441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-08-10T20:26:11.037617Z","title":"Data en- gineering for scaling language models to 128k context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.037617Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:590404a1531d77746638bfdc7d206f83de24e5bc4f9e7e6622779cb38059b013","observation_id":"40692e94-7979-4435-a261-3ab6b0f2b15f","resolution":{"observed_at":"2026-08-10T20:26:11.037617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01956","last_updated":"2025-06-27T17:15:09Z","snapshot_observed_at":"2026-08-10T22:12:17.906537Z","submitted_at":"2025-01-03T18:59:23Z","title":"Metadata Conditioning Accelerates Language Model Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01956","snapshot_observed_at":"2026-08-10T20:26:11.041642Z","title":"Metadata condi- tioning accelerates language model pre-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.041642Z"},"links":{"cited_paper":"/paper/2501.01956","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:d1623446dfe4310a426bfd29e60573a51470753efaffd4153cadc144366b0b2b","observation_id":"072c4230-16ef-4de8-86b3-f5342db38498","resolution":{"observed_at":"2026-08-10T20:26:11.041642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13276","last_updated":"2025-02-17T02:24:47Z","snapshot_observed_at":"2026-08-05T05:19:17.395325Z","submitted_at":"2024-10-17T07:07:09Z","title":"SeerAttention: Learning Intrinsic Sparse Attention in Your LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13276","snapshot_observed_at":"2026-08-10T20:26:11.045710Z","title":"Seerattention: Learning intrinsic sparse attention in your llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.045710Z"},"links":{"cited_paper":"/paper/2410.13276","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:8feec5fce2756f76baa21f420c9e39d6a9fe02cde5055ff1cf76c9f16d27fe20","observation_id":"ff755549-e753-46ec-a8f5-c7441ae408c9","resolution":{"observed_at":"2026-08-10T20:26:11.045710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:12.166325Z","title":"Power-bert: Accelerating bert inference via progressive word-vector elimination","venue":null,"work_id":"c17a5ba6-230d-4fff-bb0a-444f3e26270e","year":null},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.050249Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:fc1c78e3edc6ff8619de8b67433a49043c6168d30aa45b6b79349c5ac1080b14","observation_id":"1817ea73-afa3-47a1-a539-c11d45690576","resolution":{"observed_at":"2026-08-10T20:26:12.170676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:12.153429Z","title":"Autotm: Automatic tensor movement in heterogeneous memory systems using integer linear programming","venue":null,"work_id":"21d7c852-a79f-40d1-a3cc-981fa73b3d6c","year":2020},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.054862Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:be2e7080c3c68170aa96446b496b21d6ded0b55818aba5ac599e52b6c2834fd7","observation_id":"89cd592a-adde-4c9e-859a-ab01075e841b","resolution":{"observed_at":"2026-08-10T20:26:12.157648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:12.140553Z","title":"Parameter- efficient transfer learning for nlp","venue":null,"work_id":"fefe09d3-4b1e-4807-9956-df8133c6d07e","year":2019},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.058545Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:e647f8e282033b467ce7f5d68a38a6aa78c4b4031f14ca85cb17ff731d997f8a","observation_id":"938e2910-d0f3-413b-b89a-18b5220916e6","resolution":{"observed_at":"2026-08-10T20:26:12.144717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T20:26:11.062218Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.062218Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:375caab0739bb71bfcf0db8e972c1d6594dca681d7374f4cce4a846cf67102d1","observation_id":"fc8f8f45-c715-4666-b1f0-e9528eed40bf","resolution":{"observed_at":"2026-08-10T20:26:11.062218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:12.127956Z","title":"Swapad- visor: Pushing deep learning beyond the gpu memory limit via smart swapping","venue":null,"work_id":"e5ff3ee8-5402-4651-aabb-cae0a617dc87","year":2020},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.066086Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:054f263cbecd846b1af86de950924c80bf199f477d7f6b151a490457f1226f1e","observation_id":"fa60a42f-f0d8-4a1d-b34f-c72206549036","resolution":{"observed_at":"2026-08-10T20:26:12.132182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T20:26:11.069792Z","title":"Mistral 7b.arXiv preprint arXiv:2310.06825, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.069792Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:ee90d0132148394700babea954c3719c3484e6b7dc37e064c30b049cf8a86018","observation_id":"223f3f7b-84fd-44a3-96a8-943bee97cbb8","resolution":{"observed_at":"2026-08-10T20:26:11.069792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05736","last_updated":"2023-12-06T17:02:25Z","snapshot_observed_at":"2026-08-06T08:38:21.368130Z","submitted_at":"2023-10-09T14:10:21Z","title":"LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05736","snapshot_observed_at":"2026-08-10T20:26:11.074196Z","title":"Llmlingua: Compressing prompts for accelerated inference of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.074196Z"},"links":{"cited_paper":"/paper/2310.05736","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:76d767c5208dd3f1002b6d1f7d503a37f9e11c21458ab23f76ce2b9e6b08b072","observation_id":"d5a994b4-e873-4a42-8700-6d5efc7ef278","resolution":{"observed_at":"2026-08-10T20:26:11.074196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07003","last_updated":"2021-06-11T20:00:20Z","snapshot_observed_at":"2026-08-11T03:22:35.219403Z","submitted_at":"2020-10-14T12:28:08Z","title":"Length-Adaptive Transformer: Train Once with Length Drop, Use Anytime with Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07003","snapshot_observed_at":"2026-08-10T20:26:11.078250Z","title":"Length-adaptive transformer: Train once with length drop, use anytime with search","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.078250Z"},"links":{"cited_paper":"/paper/2010.07003","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:5193fd9909aa59b3b43d6dc8a3f5c531706e19718fb76bce58e3fe9848da4af7","observation_id":"445024fd-61e8-42c4-ace2-145a0aff9d15","resolution":{"observed_at":"2026-08-10T20:26:11.078250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:12.115413Z","title":"Learned token pruning for transformers","venue":null,"work_id":"a15bbae3-5764-40ae-95e7-4137176cae3c","year":2022},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.082334Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:c677bb58b23bfd73fad9d03cce2d4f4b8b7c0be2bc82873d23dc88cb2944adbc","observation_id":"7590bd44-e8f6-44f2-b0cd-5dbdc891de8a","resolution":{"observed_at":"2026-08-10T20:26:12.119540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.086558Z","title":"Reducing activation re- computation in large transformer models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.086558Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:f27fd60a20fc3ce3240b073a57a399cd591de9b132197477333caeece0b7b3c2","observation_id":"d148c266-9332-4bc4-a1b9-e421453d89e2","resolution":{"observed_at":"2026-08-10T20:26:11.086558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:12.094295Z","title":"Efficient rematerialization for deep networks","venue":null,"work_id":"20856115-0eb5-4930-918f-447266fd63cd","year":2019},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.090141Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:c0be3ab85a8f1659ad5215e560cc998044573e80ee7fc382d0c58ebdc34ed0de","observation_id":"4acb7566-b619-4011-a876-103193a91fe5","resolution":{"observed_at":"2026-08-10T20:26:12.098707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:12.081565Z","title":"Inducing and exploiting activation sparsity for fast inference on deep neural networks","venue":null,"work_id":"af5f79bf-d367-4bc7-9e3c-fb9744a22dfe","year":2020},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.093953Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:f442abf9039bc4848770e348bb572eea7496a7b6952ad4e44245666c7881b1fd","observation_id":"11b05235-5565-414f-8f5c-2d4dd018afd6","resolution":{"observed_at":"2026-08-10T20:26:12.085860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.097732Z","title":"{InfiniGen}: Efficient generative inference of large language models with dynamic {KV} cache manage- ment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.097732Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:920f72db8418d0325f191b22b215c2e55c6d69470b78c84e7a029015341399a2","observation_id":"906291c4-72ef-4be2-b1bb-451e0293b6c0","resolution":{"observed_at":"2026-08-10T20:26:11.097732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-07-06T10:29:18.734092Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-10T20:26:11.101484Z","title":"Prefix-tuning: Optimiz- ing continuous prompts for generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.101484Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:2550e33738388964bd08d1ecc2a386c171d09456c15e3de37b7aee7e2a4a13cf","observation_id":"55612791-d811-4a54-b45c-cf950dfa3c00","resolution":{"observed_at":"2026-08-10T20:26:11.101484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06201","last_updated":"2023-10-09T23:03:24Z","snapshot_observed_at":"2026-08-10T18:51:02.549808Z","submitted_at":"2023-10-09T23:03:24Z","title":"Compressing Context to Enhance Inference Efficiency of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06201","snapshot_observed_at":"2026-08-10T20:26:11.104966Z","title":"Compressing context to enhance inference efficiency of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.104966Z"},"links":{"cited_paper":"/paper/2310.06201","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:69ad3340a5e6e92138b0c2eee057bda3dc6d58c50da1eb287e444fe204bc02e4","observation_id":"e762300c-56cb-470c-8ddd-0dfcd0074f16","resolution":{"observed_at":"2026-08-10T20:26:11.104966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06313","last_updated":"2023-06-09T21:53:43Z","snapshot_observed_at":"2026-08-09T19:21:20.628465Z","submitted_at":"2022-10-12T15:25:19Z","title":"The Lazy Neuron Phenomenon: On Emergence of Activation Sparsity in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06313","snapshot_observed_at":"2026-08-10T20:26:11.108797Z","title":"The lazy neuron phenomenon: On emergence of activation sparsity in transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.108797Z"},"links":{"cited_paper":"/paper/2210.06313","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:eafc9bcd960ac65bdeadcd239c3aeea67b3ba4b81a1f520c00bda5e5315a0245","observation_id":"4e4f57c0-1c42-4a96-8795-75d9ee719c5d","resolution":{"observed_at":"2026-08-10T20:26:11.108797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-08-07T09:13:28.333702Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-10T20:26:11.113018Z","title":"Retrievalattention: Accel- erating long-context llm inference via vector retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.113018Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:8c68933db3994f5f0de990662c5a8100c6cd4d6d1df3cc7de9c3106884e42120","observation_id":"152b91c8-f4e8-42e8-b2fe-6f81fb6f155d","resolution":{"observed_at":"2026-08-10T20:26:11.113018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05209","last_updated":"2024-03-13T08:14:47Z","snapshot_observed_at":"2026-08-03T21:56:31.751173Z","submitted_at":"2023-10-08T15:50:36Z","title":"Scaling Laws of RoPE-based Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05209","snapshot_observed_at":"2026-08-10T20:26:11.117611Z","title":"Scaling laws of rope-based extrapolation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.117611Z"},"links":{"cited_paper":"/paper/2310.05209","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:2cbc6d4467e12d8818246792f9359357736483a891fec442dad7a2928e0f0c5a","observation_id":"6615e221-b4f3-461c-999a-09eb1c494aa1","resolution":{"observed_at":"2026-08-10T20:26:11.117611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.121745Z","title":"Gact: Activation com- pressed training for generic network architectures","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.121745Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:56e4288a3480f38ff57719eccd14fcd62b4ddd14af4dd7f28dbe112adeef1191","observation_id":"43785205-c3b2-4146-9e98-5b91f58a5835","resolution":{"observed_at":"2026-08-10T20:26:11.121745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.125563Z","title":"Deja vu: Con- textual sparsity for efficient llms at inference time","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.125563Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:242bab83203bc08791dac2a2adb64d63e247ae5a72653648625846ab037932e9","observation_id":"3ea5d150-5b41-4d46-8dd4-db1f91727819","resolution":{"observed_at":"2026-08-10T20:26:11.125563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T20:26:11.129295Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.129295Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:4624f3cb54fd1ceeabeb23d8fd06175b9a5b4221430acd75fb9338956798d35c","observation_id":"8336a961-98ff-41d4-a5ce-4f596669a0fe","resolution":{"observed_at":"2026-08-10T20:26:11.129295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-10T20:26:11.132870Z","title":"Mixed precision training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.132870Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:b73db569cae6cc85de5b984f1831c0ddf7c4762a451afcbba1f330fec95e5ba2","observation_id":"94755501-882d-4d4d-aecb-32e096930cee","resolution":{"observed_at":"2026-08-10T20:26:11.132870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04564","last_updated":"2023-10-06T20:01:33Z","snapshot_observed_at":"2026-08-05T22:58:03.938093Z","submitted_at":"2023-10-06T20:01:33Z","title":"ReLU Strikes Back: Exploiting Activation Sparsity in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04564","snapshot_observed_at":"2026-08-10T20:26:11.137218Z","title":"Relu strikes back: Exploiting activation sparsity in large lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.137218Z"},"links":{"cited_paper":"/paper/2310.04564","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:096fc92c1afa7a3930f2167a5cca2f11d70f1af55dcfb40408538cc6fa8c8c22","observation_id":"05130558-5c78-404f-8a57-111db30c7baa","resolution":{"observed_at":"2026-08-10T20:26:11.137218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08991","last_updated":"2022-03-16T23:41:38Z","snapshot_observed_at":"2026-07-06T12:48:53.542296Z","submitted_at":"2022-03-16T23:41:38Z","title":"AdapLeR: Speeding up Inference by Adaptive Length Reduction","version":1},"cited_work":{"arxiv_id":"2203.08991","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08991","snapshot_observed_at":"2026-08-10T20:26:11.558299Z","title":"AdapLeR: Speeding up Inference by Adaptive Length Reduction","venue":"cs.CL","work_id":"2526fbc5-db9d-4f59-8012-7e9849f07851","year":2022},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.141546Z"},"links":{"cited_paper":"/paper/2203.08991","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:f1bb0c914be13a0371a9f7313bf2d4a63584dc7fe66f41254914b7abe898cbaf","observation_id":"76179c4a-55b9-4d51-b47f-7766b500cc5f","resolution":{"observed_at":"2026-08-10T20:26:11.565784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-02T14:27:24.212588Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07143","snapshot_observed_at":"2026-08-10T20:26:11.145253Z","title":"Leave no context behind: Efficient infinite con- text transformers with infini-attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.145253Z"},"links":{"cited_paper":"/paper/2404.07143","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:7e0f2939de0ce49468b69a22f8d9d4c9f1e28f42668988f5bcbe18137d5a7434","observation_id":"fe6791f9-e865-40be-af24-d5a2362939b0","resolution":{"observed_at":"2026-08-10T20:26:11.145253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.149509Z","title":"Using an llm to help with code understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.149509Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:966b226c0fdd6b2de26384a4f1f9f6b072de9f56eb9b7f576ed2c97db967cbbb","observation_id":"7656382f-331a-4cd0-981f-6b114a423729","resolution":{"observed_at":"2026-08-10T20:26:11.149509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:12.036290Z","title":"ChatGPT: Get instant answers, find creative inspiration, learn something new","venue":null,"work_id":"bfd662bf-c8cb-4cd4-aca4-2533ada90732","year":2022},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.153054Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:a19dd219d9f5cb84e4976535e8d308eed31e031f115517cd17cbe907e008fad5","observation_id":"f6c7b050-78d2-4d36-b44f-ad0b54a7130e","resolution":{"observed_at":"2026-08-10T20:26:12.040671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-10T20:26:11.156872Z","title":"Yarn: Efficient context window ex- tension of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.156872Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:3b3703c831620125e151be07cb2f148612e3d4c41887880d2a8dd900b7bca3db","observation_id":"fb869894-ce15-41a6-8c18-4c63e20ee246","resolution":{"observed_at":"2026-08-10T20:26:11.156872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:12.022978Z","title":"Ca- puchin: Tensor-based gpu memory management for deep learning","venue":null,"work_id":"61bdf269-7c39-43e0-acbd-f60c705a3861","year":2020},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.160832Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:0fd40fa6f70e9abac8b048d111e66e7dbe7fea6d7a72a667b6a6406de600eca8","observation_id":"967fa4dc-5f6b-42f7-8624-1d2c7c5c41c2","resolution":{"observed_at":"2026-08-10T20:26:12.027868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05645","last_updated":"2020-06-05T03:00:26Z","snapshot_observed_at":"2026-08-10T06:01:21.912084Z","submitted_at":"2020-02-13T17:29:47Z","title":"Training Large Neural Networks with Constant Memory using a New Execution Algorithm","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05645","snapshot_observed_at":"2026-08-10T20:26:11.164356Z","title":"Training large neural networks with constant memory using a new execution algorithm","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.164356Z"},"links":{"cited_paper":"/paper/2002.05645","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:c40e55e1d9f7bef010d0d33329005dd42ab15e74d1cc25428f9cdc7713617a6e","observation_id":"70facd1a-ac54-43b1-9e5b-4a0de24fdb7d","resolution":{"observed_at":"2026-08-10T20:26:11.164356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-08-10T02:15:37.272323Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-10T20:26:11.168318Z","title":"Compressive transformers for long-range sequence modelling","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.168318Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:842355f0c5f2f4f9815595ac4e7807cda2242c3d620dbc6a7cd00db6c26c72dc","observation_id":"0ec55c59-44b4-4c4e-936d-a439dee3e291","resolution":{"observed_at":"2026-08-10T20:26:11.168318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:12.009693Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification","venue":null,"work_id":"dca21c63-43a0-4d71-aa9f-a182ee57575e","year":2021},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.172409Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:9318301cbc73df5257e0e93c29daa0c3aa77e999d0ec3166da6e1214c7de1912","observation_id":"43e77af5-07e2-47c7-90e5-a639b3f3209d","resolution":{"observed_at":"2026-08-10T20:26:12.014444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-10T20:26:11.176056Z","title":"Code llama: Open foundation models for code","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.176056Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:5f81f94bf5702f26c4df8c706b4178a494abdace5e5b1eeb0b54007fcd051737","observation_id":"50572819-c1bc-459a-b4ab-ee31a7ba646e","resolution":{"observed_at":"2026-08-10T20:26:11.176056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.996975Z","title":"Prediction and entropy of printed english","venue":null,"work_id":"635eee22-bbec-45a9-bc87-e5c9ed7dbce3","year":1951},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.180254Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:f5036ac4e75a333f1cfe7821c7e162450530a44e1d565aef17c8706518bf6d17","observation_id":"bb0a5660-daa8-4e73-8efc-b0c2a0b7a126","resolution":{"observed_at":"2026-08-10T20:26:12.001214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.184181Z","title":"Flexgen: High-throughput generative inference of large language models with a single gpu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.184181Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:03a2a286703a03a703dae245846c1b759bb928a28ff130e0163def9870756dcd","observation_id":"dfa99d78-b80f-4565-b1d3-3726e44b5db6","resolution":{"observed_at":"2026-08-10T20:26:11.184181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.187869Z","title":"Powerinfer: Fast large language model serving with a consumer-grade gpu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.187869Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:1ae402b7e2186b6db13c5eeab007fba6663e545e6e798e33791f833b90e34a3b","observation_id":"85bf39fa-5113-44d0-8f04-d594c101dd02","resolution":{"observed_at":"2026-08-10T20:26:11.187869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-10T20:26:11.191528Z","title":"Quest: Query-aware sparsity for efficient long-context llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.191528Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:e3216865aa7780146cf307c652ecb41873e13d8653a6f1c3668d34edadd9d863","observation_id":"1f30f780-53fa-4119-b263-3bcee9e2b033","resolution":{"observed_at":"2026-08-10T20:26:11.191528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T20:26:11.195431Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.195431Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:2080be46d794626175c70d8dab0b40ad20c077d8ac65df17e6f72c06bd971626","observation_id":"cb4919d3-4155-4e30-a233-284ed559b790","resolution":{"observed_at":"2026-08-10T20:26:11.195431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T20:26:11.199500Z","title":"15 Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.199500Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:86cbd08a331c73b39f1cfe8248b6c212568edffe765fcb2334923ffd3e566d54","observation_id":"5578f35d-4331-49cf-954a-b5ab99935994","resolution":{"observed_at":"2026-08-10T20:26:11.199500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.968579Z","title":"Focused transformer: Contrastive training for context scaling","venue":null,"work_id":"dca9719c-4d59-46e1-b836-f43fea47a65f","year":2024},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.203117Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:fa134646ca2885cebc114e23a6d287811f5b127582d90a0d99f1c65009e51c93","observation_id":"d6ce8941-d25b-4f28-9069-34e9f2e57a51","resolution":{"observed_at":"2026-08-10T20:26:11.972849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.955278Z","title":"Long expo- sure: Accelerating parameter-efficient fine-tuning for llms under shadowy sparsity","venue":null,"work_id":"c1cd2ca4-bfc0-4a6b-b98a-a87518c719e3","year":2024},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.206896Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:8a52b82524596e90d21f25f67e797937db89d6d60ae88f5e26d89a137c9684f1","observation_id":"f13fc7c1-d3f6-4980-b627-4716e50ebaa3","resolution":{"observed_at":"2026-08-10T20:26:11.960009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.941588Z","title":"What is linguistic redun- dancy","venue":null,"work_id":"b11eb375-1120-4bc9-928e-7201f5f51c05","year":1999},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.210933Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:5fdec03b9a34875e7d322b8f86b785a8b68149d40ccd2f63ed1172308da55e29","observation_id":"6f824cd3-98ab-4954-abc1-d3f0b6510234","resolution":{"observed_at":"2026-08-10T20:26:11.946622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.928165Z","title":"Infllm: Training-free long-context extrap- olation for llms with an efficient context memory","venue":null,"work_id":"071779f1-c108-418f-a035-ab4befce7e27","year":2024},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.214875Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:ecb7e85b6447659c19eaade05dfa976770f44281b2ddec7e2cc650a26ce0d649","observation_id":"8fa498f5-b732-4338-b48f-cd774f0b0e3e","resolution":{"observed_at":"2026-08-10T20:26:11.932796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-10T13:57:05.071602Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-10T20:26:11.222878Z","title":"Effective long-context scaling of foundation mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.222878Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:e8c0033d92d3e2ff734e8df4b83faecccfa362aed09c20f46fa5edcdcbbee05f","observation_id":"10708ca0-81be-4672-8a61-9026eb398019","resolution":{"observed_at":"2026-08-10T20:26:11.222878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.11618","last_updated":"2021-05-25T02:28:51Z","snapshot_observed_at":"2026-08-09T07:00:29.796573Z","submitted_at":"2021-05-25T02:28:51Z","title":"TR-BERT: Dynamic Token Reduction for Accelerating BERT Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.11618","snapshot_observed_at":"2026-08-10T20:26:11.226605Z","title":"Tr-bert: Dynamic token reduction for accelerating bert inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.226605Z"},"links":{"cited_paper":"/paper/2105.11618","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:45f19a8c53c64e8f3b0cb8550d85d0777f34dba7e397f605ec10c4a68ebfb56a","observation_id":"0469d326-ba42-4ee6-85a8-07dbd66cd639","resolution":{"observed_at":"2026-08-10T20:26:11.226605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18013","last_updated":"2025-08-15T03:28:39Z","snapshot_observed_at":"2026-08-08T02:24:48.712537Z","submitted_at":"2024-02-28T03:16:44Z","title":"A Survey on Recent Advances in LLM-Based Multi-turn Dialogue Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18013","snapshot_observed_at":"2026-08-10T20:26:11.230662Z","title":"A survey on recent advances in llm-based multi-turn dialogue systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.230662Z"},"links":{"cited_paper":"/paper/2402.18013","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:6c4d262f375f39c8483fada89e8deb949c171cecc47324205720b79cbdae0e99","observation_id":"c15bff2e-7098-473d-8df8-36190e3fe026","resolution":{"observed_at":"2026-08-10T20:26:11.230662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.235500Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.235500Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:fb7a4764d638c3618b0aa017cf9796fcde685deb6649913b2f48517efec240d8","observation_id":"d1240f1f-0db7-4ab8-a83c-596e143f2bdd","resolution":{"observed_at":"2026-08-10T20:26:11.235500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.239150Z","title":"Bitfit: Simple parameter-efficient fine-tuning for transformer-based masked language-models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.239150Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:6ccc3029216615123d9c9907898ca324ee00b55d645e9ce9cd51a8b8795f151e","observation_id":"f1677465-8242-45d7-bd5a-8eb7fef72866","resolution":{"observed_at":"2026-08-10T20:26:11.239150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03303","last_updated":"2026-05-09T05:30:15Z","snapshot_observed_at":"2026-08-08T14:14:26.000056Z","submitted_at":"2023-08-07T05:12:27Z","title":"LoRA-FA: Efficient and Effective Low Rank Representation Fine-tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03303","snapshot_observed_at":"2026-08-10T20:26:11.243027Z","title":"Lora-fa: Memory-efficient low-rank adaptation for large language models fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.243027Z"},"links":{"cited_paper":"/paper/2308.03303","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:bb9ff6af355eb79e04d82ce1dbf9aaca034fda83114fb8ddbb0dd935b7b29cb2","observation_id":"563cc2d6-bbed-48de-888f-94e29d3af971","resolution":{"observed_at":"2026-08-10T20:26:11.243027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03462","last_updated":"2024-10-11T02:18:24Z","snapshot_observed_at":"2026-08-05T14:53:23.650244Z","submitted_at":"2024-01-07T11:57:40Z","title":"Long Context Compression with Activation Beacon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03462","snapshot_observed_at":"2026-08-10T20:26:11.247162Z","title":"Long context com- pression with activation beacon","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.247162Z"},"links":{"cited_paper":"/paper/2401.03462","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:d61dc7095c5dcb1f007a29a7feab2e9ea07ec887420cc1b1b4763199a91fd6f9","observation_id":"8f9ebaf4-9d52-4950-9189-6e6084f5e157","resolution":{"observed_at":"2026-08-10T20:26:11.247162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-10T20:26:11.251072Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.251072Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:ca461803488a848b15f090a2d1a434e34adad2d9e240ebb7be9f685c95fbd9ce","observation_id":"0dae989e-10de-4f5a-9638-2c19449cf7e8","resolution":{"observed_at":"2026-08-10T20:26:11.251072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.254956Z","title":"H2o: Heavy- hitter oracle for efficient generative inference of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.254956Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:af72fc3ab8e76deb8ef61b02ac2d0ad95cf2c099fe90a123d6d6405542ec80d2","observation_id":"11ce8898-0102-4870-9d91-13d8a1862b47","resolution":{"observed_at":"2026-08-10T20:26:11.254956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:26:11.899855Z","title":"In- former: Beyond efficient transformer for long sequence time-series forecasting","venue":null,"work_id":"52924041-ea5a-4b8b-95be-a998bf877204","year":2021},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.258735Z"},"links":{"citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:e51438ad2515745f609fb33fe33930b477e3a21df0e123cdd063fa4ba6b244a3","observation_id":"061d15c4-420a-4693-a9c4-a0baea27e259","resolution":{"observed_at":"2026-08-10T20:26:11.904373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10400","last_updated":"2024-02-21T13:37:07Z","snapshot_observed_at":"2026-08-09T09:59:16.551591Z","submitted_at":"2023-09-19T08:03:38Z","title":"PoSE: Efficient Context Window Extension of LLMs via Positional Skip-wise Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10400","snapshot_observed_at":"2026-08-10T20:26:11.262338Z","title":"Pose: Efficient context window extension of llms via positional skip-wise train- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.262338Z"},"links":{"cited_paper":"/paper/2309.10400","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:3cafc5873b0172bf527f29f4faa8389e834a0cf342b513cc5d6779c03dcb27c9","observation_id":"213b9b6b-249c-4179-8afb-ad4e6a8a3371","resolution":{"observed_at":"2026-08-10T20:26:11.262338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T16:31:10.641403Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 2 inbound Pith citation observations for arXiv:2501.09767."}