{"as_of":"2026-08-09T17:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d793bcf258f90622b7a6092a02cda644e5af1c6c528544d8ff28a13a497b211","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:08:04.051135Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:17:38.653512Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T06:55:59.880351Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17134","snapshot_observed_at":"2026-08-06T12:17:38.653512Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21929","last_updated":"2025-07-29T15:45:50Z","snapshot_observed_at":"2026-08-09T14:01:50.797496Z","submitted_at":"2025-07-29T15:45:50Z","title":"Libra: Large Chinese-based Safeguard for AI Content","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:17:38.653512Z"},"links":{"cited_paper":"/paper/2505.17134","citing_paper":"/paper/2507.21929"},"observation_digest":"sha256:cb99487ad0d8585510545200657ed12454aa3a2fccbdba5fb9ac61b77c6bba9e","observation_id":"4bc8e66d-7568-4640-bbb0-a56f2761026b","resolution":{"observed_at":"2026-08-06T12:17:38.653512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"cited_work":{"arxiv_id":"2505.17134","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17134","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longmagpie: A self-synthesis method for generating large-scale long-context instructions.arXiv preprint arXiv:2505.17134, 2025a","venue":null,"work_id":"15611a16-a157-44d3-a31d-eb5e366599e9","year":null},"citing_paper":{"arxiv_id":"2604.07809","last_updated":"2026-04-09T05:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T05:07:57Z","title":"PolicyLong: Towards On-Policy Context Extension","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T17:23:28.939977Z"},"links":{"cited_paper":"/paper/2505.17134","citing_paper":"/paper/2604.07809"},"observation_digest":"sha256:aeb3d6bdec320a4cbe817e54901d0c6d5e51676ee3b2fcc9ad66aa008281999c","observation_id":"08d6ee09-9f0b-4997-adf9-dd7c549db227","resolution":{"observed_at":"2026-05-11T06:55:59.889276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.17134/citation-record","integrity":"/paper/2505.17134/integrity","json":"/paper/2505.17134/citation-record.json","paper":"/paper/2505.17134"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:07:59.025858Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:59.025858Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:12da8edb9532966e08a22dd0067fe8278b87311ae787b3034ec33a1538ad8e5a","observation_id":"f71f7928-87e9-420b-920b-a4cd1d8178fd","resolution":{"observed_at":"2026-08-07T15:07:59.025858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-07T15:07:59.276138Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:59.276138Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:f2f669454796087911e73fc480320b5cb8eb5395680e2c72c95179df5c70df06","observation_id":"cf300691-52ca-4c7f-b8b3-9169b5129640","resolution":{"observed_at":"2026-08-07T15:07:59.276138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18058","last_updated":"2024-01-31T18:29:39Z","snapshot_observed_at":"2026-08-08T23:35:36.736017Z","submitted_at":"2024-01-31T18:29:39Z","title":"LongAlign: A Recipe for Long Context Alignment of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18058","snapshot_observed_at":"2026-08-07T15:07:59.399446Z","title":"Longalign: A recipe for long context alignment of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:59.399446Z"},"links":{"cited_paper":"/paper/2401.18058","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:b1ee6cd92aab945cd501e8f9b484dfeb483112f5ec83a77d363d58a124e231aa","observation_id":"f0bbac7c-ad94-457c-843d-9bca92b33172","resolution":{"observed_at":"2026-08-07T15:07:59.399446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12307","last_updated":"2024-03-08T15:26:38Z","snapshot_observed_at":"2026-07-06T16:21:57.649550Z","submitted_at":"2023-09-21T17:59:11Z","title":"LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12307","snapshot_observed_at":"2026-08-07T15:07:59.511437Z","title":"Extending context window of large language models via positional interpolation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:59.511437Z"},"links":{"cited_paper":"/paper/2309.12307","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:7752397a638ad2d93df950016731e659199317bc24ef89ef62188e394c4f2f05","observation_id":"489e40cc-41b3-4ad0-bcfa-be93f2e790ce","resolution":{"observed_at":"2026-08-07T15:07:59.511437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-07T15:07:59.737679Z","title":"Ultrachat: A large-scale auto-generated data for diverse conversations with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:59.737679Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:551def6afc06473d9807f5c319c2edc02c630708368792185feb8b38c2a546b7","observation_id":"1ad9d8cd-c9ed-4d31-a520-a98cd211c749","resolution":{"observed_at":"2026-08-07T15:07:59.737679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-07T08:32:00.916309Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-07T15:07:59.827943Z","title":"Rlhf workflow: From reward modeling to online rlhf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:59.827943Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:1b26fea71672db475a78ca4fd41c121f0157c1695835692947efb114172adbe8","observation_id":"d6c2b3b6-863e-48c9-ace2-3d795997c769","resolution":{"observed_at":"2026-08-07T15:07:59.827943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19846","last_updated":"2025-02-11T06:22:30Z","snapshot_observed_at":"2026-08-05T14:29:30.027974Z","submitted_at":"2024-05-30T08:50:55Z","title":"Quest: Query-centric Data Synthesis Approach for Long-context Scaling of Large Language Model","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19846","snapshot_observed_at":"2026-08-07T15:08:00.101399Z","title":"Quest: Query-centric data synthesis approach for long-context scaling of large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:00.101399Z"},"links":{"cited_paper":"/paper/2405.19846","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:ca9bd1d294b1c5cdae22d90040aa1699e992d6dfae2c3c579d63c6ae8ed1aaac","observation_id":"cebd21a9-06ed-4db2-a8cb-c6812fe52fcd","resolution":{"observed_at":"2026-08-07T15:08:00.101399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:08:06.682810Z","title":"Gemini model updates: March 2025, March","venue":null,"work_id":"cd5d4445-5daa-4b33-95cd-0f269ad343a7","year":2025},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:00.372240Z"},"links":{"citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:24cbc5eb222bb01af95d9574de1e4672033d81991c2b60fda1e3d461384a8ca5","observation_id":"7bb5f909-fea2-481e-a1e7-ece5f5305121","resolution":{"observed_at":"2026-08-07T15:08:06.786446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:08:00.483718Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:00.483718Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:3fa6ec8f4f7b2f1766ac7567adf0a583814c094d99dee0667e3687ea31cae787","observation_id":"7a96c6d3-822e-475c-a321-5b4359d37928","resolution":{"observed_at":"2026-08-07T15:08:00.483718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08909","last_updated":"2020-02-10T18:40:59Z","snapshot_observed_at":"2026-08-02T17:52:27.326803Z","submitted_at":"2020-02-10T18:40:59Z","title":"REALM: Retrieval-Augmented Language Model Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08909","snapshot_observed_at":"2026-08-07T15:08:00.617096Z","title":"Retrieval augmented language model pre-training","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:00.617096Z"},"links":{"cited_paper":"/paper/2002.08909","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:22b0f714aa67d22215be9b6c12e21ae39f6d90ee0ccebe5ebc4f978029684e27","observation_id":"3b20cd10-0e0f-4b04-b89a-8fe3b37a8af4","resolution":{"observed_at":"2026-08-07T15:08:00.617096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09689","last_updated":"2022-12-19T18:21:00Z","snapshot_observed_at":"2026-07-06T14:32:33.541029Z","submitted_at":"2022-12-19T18:21:00Z","title":"Unnatural Instructions: Tuning Language Models with (Almost) No Human Labor","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09689","snapshot_observed_at":"2026-08-07T15:08:00.924421Z","title":"Unnatural instructions: Tuning language models with (almost) no human labor","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:00.924421Z"},"links":{"cited_paper":"/paper/2212.09689","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:9105dff3fbf4fb7476cde627183d746014c391cb4d77567eb1d0b90a71d797c1","observation_id":"ea7da8c3-7085-4eef-a330-5cbaefed4778","resolution":{"observed_at":"2026-08-07T15:08:00.924421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08233","last_updated":"2024-03-13T04:24:26Z","snapshot_observed_at":"2026-07-06T17:43:44.153710Z","submitted_at":"2024-03-13T04:24:26Z","title":"A Parallel Beam Splitting Based on Gradient Metasurface: Preparation and Fusion of Quantum Entanglement","version":1},"cited_work":{"arxiv_id":"2403.08233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.08233","snapshot_observed_at":"2026-08-07T15:08:05.453824Z","title":"A Parallel Beam Splitting Based on Gradient Metasurface: Preparation and Fusion of Quantum Entanglement","venue":"physics.optics","work_id":"da28d1ee-7875-4061-9990-3243192be6e8","year":2024},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:01.145091Z"},"links":{"cited_paper":"/paper/2403.08233","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:8beb5bf7d36b57b7dfe1641823a2c6e21b9acb693168eb91158ac82c6fa31afd","observation_id":"eec80e6f-0a15-4253-a048-0271898c3806","resolution":{"observed_at":"2026-08-07T15:08:05.544478Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:08:06.405348Z","title":"Longform: Optimizing instruction tuning for long text generation with corpus extraction","venue":null,"work_id":"01e224d5-f6c0-4a47-a9ac-fca17c03c5b7","year":2024},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:01.234052Z"},"links":{"citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:a78c3f65d41f6247c324f41d3151eda09b02a957f4bd06564b96d17ab904d868","observation_id":"564c4f55-6158-44a5-93b9-a4b773fcee3f","resolution":{"observed_at":"2026-08-07T15:08:06.513417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T15:08:01.313369Z","title":"T \\\" ulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:01.313369Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:d59e2619156ee769f2b1b098941047b4af6157fc2185d3fba3121de57fd0d1d7","observation_id":"17493b2b-a5a4-43ba-96aa-e052761674ab","resolution":{"observed_at":"2026-08-07T15:08:01.313369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13064","last_updated":"2024-02-20T15:00:35Z","snapshot_observed_at":"2026-08-06T08:24:00.729497Z","submitted_at":"2024-02-20T15:00:35Z","title":"Synthetic Data (Almost) from Scratch: Generalized Instruction Tuning for Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13064","snapshot_observed_at":"2026-08-07T15:08:01.395403Z","title":"Synthetic data (almost) from scratch: Generalized instruction tuning for language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:01.395403Z"},"links":{"cited_paper":"/paper/2402.13064","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:e7b8818fdab24a561efa44bf83f98fa0abb9d822cf7cfb3341dd631db0665f33","observation_id":"ec0fa2b8-00f5-47c1-92a2-f2e344fc4838","resolution":{"observed_at":"2026-08-07T15:08:01.395403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06259","last_updated":"2024-03-12T05:22:46Z","snapshot_observed_at":"2026-07-06T16:05:23.421896Z","submitted_at":"2023-08-11T17:47:54Z","title":"Self-Alignment with Instruction Backtranslation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06259","snapshot_observed_at":"2026-08-07T15:08:01.577328Z","title":"Self-alignment with instruction backtranslation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:01.577328Z"},"links":{"cited_paper":"/paper/2308.06259","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:45b39c96684d85a94442b6678b060ed4e34b1585f7206e7944076031063b081e","observation_id":"155e01d0-5e6c-4a54-baa5-985dfba1aee5","resolution":{"observed_at":"2026-08-07T15:08:01.577328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T15:08:01.647091Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:01.647091Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:4f6188727c9c49bf624bf6deaa6182cb4b001c4510a39c57df47cd2ffa6c50e0","observation_id":"76c88992-f3d3-4f82-91b1-133488080fb0","resolution":{"observed_at":"2026-08-07T15:08:01.647091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T15:08:01.725198Z","title":"Chatqa: Building gpt-4 level conversational qa models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:01.725198Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:f8d456b13755875db0a4ea20181245845d49c8d9204e357248b8423d98365082","observation_id":"1f304799-d110-47a1-8936-78a49adc4a8f","resolution":{"observed_at":"2026-08-07T15:08:01.725198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-08-05T16:27:22.031013Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-08-07T15:08:01.824164Z","title":"The lambada dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:01.824164Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:18fc0662b6d557af3fcf0f8bfa39b8ea8305824797e4e9c078bf268a8b7d876d","observation_id":"9222cb3a-45bd-40ee-90c2-72cef8244d6a","resolution":{"observed_at":"2026-08-07T15:08:01.824164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-07T15:08:02.094426Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:02.094426Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:8fe8670107279ba8d1de5b62f332c20a056fd6990ee86bb88c1c82f56dbd129c","observation_id":"1a9d113a-dbdd-43c3-a74b-37f3a68e9f5c","resolution":{"observed_at":"2026-08-07T15:08:02.094426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-07T15:08:02.251463Z","title":"Code llama: Open foundation models for code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:02.251463Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:1349a169fedeb6190b71fa72a796fc9cdf2a871c8fe555dc2a0a8d084de0dce2","observation_id":"7b3cd697-fc6e-4203-a892-7895a819b213","resolution":{"observed_at":"2026-08-07T15:08:02.251463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10638","last_updated":"2024-06-24T06:28:42Z","snapshot_observed_at":"2026-07-06T16:34:04.003157Z","submitted_at":"2023-10-16T17:57:12Z","title":"In-context Pretraining: Language Modeling Beyond Document Boundaries","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10638","snapshot_observed_at":"2026-08-07T15:08:02.498031Z","title":"In-context pretraining: Language modeling beyond document boundaries","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:02.498031Z"},"links":{"cited_paper":"/paper/2310.10638","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:871b5e44866436834ed3426320b2626e4451f3a6f9c6dfd979be1f4eec632194","observation_id":"9e06abd8-7c70-49a0-a9d6-7203803adab8","resolution":{"observed_at":"2026-08-07T15:08:02.498031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.15633","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:08:04.997568Z","title":"Gateau: Selecting influential sample for long context alignment","venue":null,"work_id":"536bb6ee-99fb-4aca-8177-f231a7b14245","year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:02.698559Z"},"links":{"citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:edeec100f4b5c91a93d990e2a1126363724ba4a7ec0c7cb192225fe999018df8","observation_id":"0531e2ea-058e-4b93-bb2b-3f3e08ba9218","resolution":{"observed_at":"2026-08-07T15:08:05.075764Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10173","last_updated":"2024-09-19T11:21:24Z","snapshot_observed_at":"2026-07-06T19:15:56.947205Z","submitted_at":"2024-09-16T11:10:29Z","title":"jina-embeddings-v3: Multilingual Embeddings With Task LoRA","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10173","snapshot_observed_at":"2026-08-07T15:08:02.801408Z","title":"Rui Sun, Zhiwei Sun, Yang Li, Yi Ren, and Wei Bi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:02.801408Z"},"links":{"cited_paper":"/paper/2409.10173","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:bb01bebf43416eb89de4751b05702d2cc9063853a4f8ddebab211a9312b38662","observation_id":"f479fa4b-ba0c-47ba-9006-a594b6f468fa","resolution":{"observed_at":"2026-08-07T15:08:02.801408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18533","last_updated":"2024-10-24T08:27:26Z","snapshot_observed_at":"2026-08-08T11:39:16.517326Z","submitted_at":"2024-10-24T08:27:26Z","title":"LOGO -- Long cOntext aliGnment via efficient preference Optimization","version":1},"cited_work":{"arxiv_id":"2410.18533","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.18533","snapshot_observed_at":"2026-08-07T15:08:04.708299Z","title":"LOGO -- Long cOntext aliGnment via efficient preference Optimization","venue":"cs.CL","work_id":"d1be1eea-eac6-4ebc-a41c-f32fbe50d43b","year":2024},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:02.955264Z"},"links":{"cited_paper":"/paper/2410.18533","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:042f0a0776195b64841ec6acf626f89dfb20f8f6d3da63db914d2da27100febd","observation_id":"79d35bba-8f2c-4e60-86ea-f926bffb6ac9","resolution":{"observed_at":"2026-08-07T15:08:04.773496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-07T15:08:03.107205Z","title":"Hashimoto","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:03.107205Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:9774a1f76201ce8d645c6cf8de85f37c95b543cc70c8cd27e4d11bc80b4eefc6","observation_id":"a773283f-6251-4832-814c-90e047c3932f","resolution":{"observed_at":"2026-08-07T15:08:03.107205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08456","last_updated":"2024-06-03T04:43:51Z","snapshot_observed_at":"2026-07-06T18:14:03.830337Z","submitted_at":"2024-05-14T09:26:36Z","title":"A quantum spectrometer using a pair of phase-controlled spatial light modulators for superresolution in quantum sensing","version":2},"cited_work":{"arxiv_id":"2405.08456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.08456","snapshot_observed_at":"2026-08-07T15:08:04.563187Z","title":"A quantum spectrometer using a pair of phase-controlled spatial light modulators for superresolution in quantum sensing","venue":"quant-ph","work_id":"db9115e0-1acd-48f3-a8a6-10ad5c85922c","year":2024},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:03.248513Z"},"links":{"cited_paper":"/paper/2405.08456","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:0cc04b09b8946c98591c90de182751cfeff134434a75cd69e2e5b879c6524109","observation_id":"d71414f3-aa4e-485c-8d16-c4001856f554","resolution":{"observed_at":"2026-08-07T15:08:04.606830Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-07T15:08:03.507597Z","title":"Self-instruct: Aligning language models with self-generated instructions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:03.507597Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:5ad46db02532da422bce28e724a3bb8a47ab48fc2d9a282d509b8ce137c569ea","observation_id":"851b06f4-b59c-495d-9f46-2a190db517d2","resolution":{"observed_at":"2026-08-07T15:08:03.507597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-07-06T16:24:38.375055Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-07T15:08:03.619535Z","title":"Effective long-context scaling of foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:03.619535Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:2b2787e381b9584b312aef05430856ace4ffc7c46ce801dd2508253365165b7e","observation_id":"ac372b97-7aa7-4b73-a546-883bb3bd8fc3","resolution":{"observed_at":"2026-08-07T15:08:03.619535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-07T15:08:03.764893Z","title":"Wizardlm: Empowering large language models to follow complex instructions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:03.764893Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:eef920743ab36de5a60410e7a667b8f41e7af05406a6a5bce261f0dbf750e5e3","observation_id":"0d1bbac9-71b9-436d-85da-038b4b192d36","resolution":{"observed_at":"2026-08-07T15:08:03.764893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18696","last_updated":"2024-05-29T02:14:05Z","snapshot_observed_at":"2026-07-06T18:21:44.232687Z","submitted_at":"2024-05-29T02:14:05Z","title":"Letter frequency vs factor frequency in pure morphic words","version":1},"cited_work":{"arxiv_id":"2405.18696","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.18696","snapshot_observed_at":"2026-08-07T15:08:04.276183Z","title":"Letter frequency vs factor frequency in pure morphic words","venue":"math.CO","work_id":"d8a96a8f-21b2-4cf8-86f6-2a42a3a927ea","year":2024},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:03.822006Z"},"links":{"cited_paper":"/paper/2405.18696","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:888012b8689f4007531608c875103862714bf72c4b1ee4868fa797c2de261dc7","observation_id":"dccbf8eb-8590-4c6e-aa21-f4f08098a747","resolution":{"observed_at":"2026-08-07T15:08:04.357585Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:08:06.240358Z","title":"Metamath: Bootstrap your own mathematical questions for large language models","venue":null,"work_id":"8ca7823d-ecc6-488f-9aa4-e09f0f6a3d42","year":2024},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:03.878127Z"},"links":{"citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:6bbd50bfc6506cf910a8cc745011216f7b4a51de5d98efd9faec91fdd8168741","observation_id":"6f83538e-8430-42d7-962a-c728b2d92ff8","resolution":{"observed_at":"2026-08-07T15:08:06.312017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-07T15:08:03.923132Z","title":"Hellaswag: Can a machine really finish your sentence? arXiv preprint arXiv:1905.07830,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:03.923132Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:0b0382be33061721901699e2bac3804788cc8b312d1ed12a5b7726cb346bdeb2","observation_id":"0b49eabd-5ba3-467a-bb45-44a2496d6970","resolution":{"observed_at":"2026-08-07T15:08:03.923132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15592","last_updated":"2025-02-21T17:02:40Z","snapshot_observed_at":"2026-08-07T17:58:03.327645Z","submitted_at":"2025-02-21T17:02:40Z","title":"Generalizing From Short to Long: Effective Data Synthesis for Long-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15592","snapshot_observed_at":"2026-08-07T15:08:04.051135Z","title":"Effective data synthesis for long-context instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:04.051135Z"},"links":{"cited_paper":"/paper/2502.15592","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:8d0da84f5a60871f8d887d4dfb36cd0ec0ecc8744a9a46c07256f123651e2ff4","observation_id":"97ea1a5c-cf8a-4790-8a2d-04c3a4548379","resolution":{"observed_at":"2026-08-07T15:08:04.051135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18860","last_updated":"2025-03-19T02:46:34Z","snapshot_observed_at":"2026-07-06T20:13:08.414377Z","submitted_at":"2024-12-25T10:08:54Z","title":"Bootstrap Your Own Context Length","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18860","snapshot_observed_at":"2026-08-07T15:08:03.360245Z","title":"Bootstrap your own context length","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:03.360245Z"},"links":{"cited_paper":"/paper/2412.18860","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:c5180a32ab76abb9a9ca602ada1e93e5af5b57c95dab5b1adf6f6d7c5aab9d41","observation_id":"c6d444ee-b520-44d2-b464-e353955d9d3d","resolution":{"observed_at":"2026-08-07T15:08:03.360245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-07T15:08:01.908334Z","title":"Yarn: Efficient context window extension of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:01.908334Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:c8ecf7a5f7029fd35631d2c2277947c94b3b196f9305d41d5e776c976172a046","observation_id":"112b6c32-88b7-47dc-8b90-09639993ebb8","resolution":{"observed_at":"2026-08-07T15:08:01.908334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T15:07:59.601749Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:59.601749Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:715b05217f6ac17bf628cb5f0932eb2c0790917f3d7f615c27899c0f3e0aef1d","observation_id":"c1cb0440-14d2-4524-b2cc-08e77daff6f8","resolution":{"observed_at":"2026-08-07T15:07:59.601749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01697","last_updated":"2025-05-21T17:50:43Z","snapshot_observed_at":"2026-08-09T17:01:54.948269Z","submitted_at":"2025-02-03T00:12:40Z","title":"BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01697","snapshot_observed_at":"2026-08-07T15:08:04.002985Z","title":"Davis, Lingjiao Chen, Boris Hanin, Ion Stoica, Joseph E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:04.002985Z"},"links":{"cited_paper":"/paper/2502.01697","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:b374513b8c163e51fac4638129d403a220e4cfbefd489eae416003f2f0396e6f","observation_id":"5eac65fc-499a-4ab9-ae64-4d2af8ab00bd","resolution":{"observed_at":"2026-08-07T15:08:04.002985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16137","last_updated":"2024-06-24T21:22:00Z","snapshot_observed_at":"2026-08-07T16:57:45.872655Z","submitted_at":"2023-08-30T16:47:51Z","title":"LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16137","snapshot_observed_at":"2026-08-07T15:08:00.761662Z","title":"Lm- infinite: Simple on-the-fly length generalization for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:00.761662Z"},"links":{"cited_paper":"/paper/2308.16137","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:4277736813d6b12664b0d3727d081052646547f63b469757de310f56f980d258","observation_id":"6e66b81e-5b21-47ef-8472-476c2beb32cb","resolution":{"observed_at":"2026-08-07T15:08:00.761662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08207","last_updated":"2022-03-17T17:53:01Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T17:08:57Z","title":"Multitask Prompted Training Enables Zero-Shot Task Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08207","snapshot_observed_at":"2026-08-07T15:08:02.338617Z","title":"Multitask prompted training enables zero-shot task generalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:02.338617Z"},"links":{"cited_paper":"/paper/2110.08207","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:5b611918932d4a887e3586ee459c6799f886f4a9df525247bdb17de245ece634","observation_id":"0135ac66-aaa4-45bb-95e7-08c1eb7893d3","resolution":{"observed_at":"2026-08-07T15:08:02.338617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17781","last_updated":"2024-12-19T14:26:15Z","snapshot_observed_at":"2026-07-06T18:21:01.419111Z","submitted_at":"2024-05-28T03:25:31Z","title":"Dissipation-induced bound states as a two-level system","version":2},"cited_work":{"arxiv_id":"2405.17781","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.17781","snapshot_observed_at":"2026-08-07T15:08:05.660463Z","title":"Dissipation-induced bound states as a two-level system","venue":"quant-ph","work_id":"c919eaec-1276-4936-9dd0-c98b10d2c396","year":2024},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:01.022006Z"},"links":{"cited_paper":"/paper/2405.17781","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:07edaf0115bdb231e717f045468e00ec178932898a75875ec2d066654cbe6597","observation_id":"1d4f57b4-a98e-469c-a870-bfb3f475cbdf","resolution":{"observed_at":"2026-08-07T15:08:05.718581Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12036","last_updated":"2023-11-22T00:02:49Z","snapshot_observed_at":"2026-08-09T07:24:36.881438Z","submitted_at":"2023-10-18T15:21:28Z","title":"A General Theoretical Paradigm to Understand Learning from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12036","snapshot_observed_at":"2026-08-07T15:07:59.145850Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:59.145850Z"},"links":{"cited_paper":"/paper/2310.12036","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:d11eb50ac073d38e89f31d3f6ee705f038b8cd25274b4b58bccf0d56e5341372","observation_id":"b3153567-2340-453f-ad62-cc1375bc3e29","resolution":{"observed_at":"2026-08-07T15:07:59.145850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-08-07T15:07:59.981503Z","title":"Data engineering for scaling language models to 128k context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:59.981503Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:d0b972d99626ce919d391d96f2d945282e972dec67d3bc89a647859fbf94f6fe","observation_id":"d0d416bc-4c4c-4280-851d-1d139362df12","resolution":{"observed_at":"2026-08-07T15:07:59.981503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-07T15:08:00.243978Z","title":"How to train long-context lan- guage models (effectively)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:00.243978Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:b2b0969f07171dfdd1d58df3ccfc5d5e800501c4b4c039bcebb0ec0fcde72f77","observation_id":"38bdb07a-3abf-427a-803a-b4f111dec60e","resolution":{"observed_at":"2026-08-07T15:08:00.243978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":3},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 2 inbound Pith citation observations for arXiv:2505.17134."}