{"as_of":"2026-08-18T14:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd88dc7e9eccbe240dbd132e22f9ee8bf23b8508e7fff43ade39a67b167aa8a7","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:30:12.291887Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T14:50:11.769103Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:27:30.482602Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"cited_work":{"arxiv_id":"2504.12637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.12637","snapshot_observed_at":"2026-07-03T01:27:30.482602Z","title":"Scaling instruction-tuned llms to million-token contexts via hierarchical synthetic data generation","venue":null,"work_id":"e11e11d4-39ae-4088-aef2-20d5bac97acd","year":2025},"citing_paper":{"arxiv_id":"2606.09659","last_updated":"2026-06-08T15:43:16Z","snapshot_observed_at":"2026-08-12T15:15:53.592161Z","submitted_at":"2026-06-08T15:43:16Z","title":"End-to-End Context Compression at Scale","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-27T16:36:54.699174Z"},"links":{"cited_paper":"/paper/2504.12637","citing_paper":"/paper/2606.09659"},"observation_digest":"sha256:b0766faca612d3aa6087cf7b2678804fba979d315706bb5470a6b5bb11856770","observation_id":"f6bf2c44-25a1-4e93-a3b0-b714e01912ae","resolution":{"observed_at":"2026-07-03T01:27:30.484693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12637","snapshot_observed_at":"2026-08-02T14:50:11.769103Z","title":"Scaling instruction-tuned llms to million-token contexts via hierarchical synthetic data generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16204","last_updated":"2026-05-07T00:40:32Z","snapshot_observed_at":"2026-08-16T04:08:05.621437Z","submitted_at":"2026-05-07T00:40:32Z","title":"Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T14:50:11.769103Z"},"links":{"cited_paper":"/paper/2504.12637","citing_paper":"/paper/2607.16204"},"observation_digest":"sha256:9587abccdf3a6f25a74080e93fefec43f180f6292d7c398d97ee4df68db69f1a","observation_id":"e2c9851c-511c-40bc-881c-442b23af3354","resolution":{"observed_at":"2026-08-02T14:50:11.769103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.12637/citation-record","integrity":"/paper/2504.12637/integrity","json":"/paper/2504.12637/citation-record.json","paper":"/paper/2504.12637"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:30:12.150200Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.150200Z"},"links":{"citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:cb2152d590086c309cdcc8b6f21a77ea4c15a0348c0a6ed2b906e4c87c4d4d13","observation_id":"40dfbd24-c728-4250-b123-33fab9d6694e","resolution":{"observed_at":"2026-08-16T12:30:12.150200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:30:12.155450Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.155450Z"},"links":{"citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:5ffb5f8db4a2d3afefbbc89d8eb60ce3a5e39e6fcf3b407db51834c255708e1b","observation_id":"fc653956-f292-4a35-96a7-3a852ed1ee62","resolution":{"observed_at":"2026-08-16T12:30:12.155450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:30:12.160119Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.160119Z"},"links":{"citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:74ba2b0297ec2f1cdce2a97df1b09fa2a2a813ee358fad78cda25b6495b965af","observation_id":"1c5ac33f-72c3-444a-bdaf-d49dbe413880","resolution":{"observed_at":"2026-08-16T12:30:12.160119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:30:12.751614Z","title":"ִ|z !|؆l- b)<v kڰ2<WנXy<PG OV< /|4; 'K","venue":null,"work_id":"95a032b1-6cbd-482a-a3fa-b47548e7d3e1","year":1999},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.164186Z"},"links":{"citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:c4d40b211677c73ed10a2fadee23b51a7720930e5ab6052d5167bf8c583375e3","observation_id":"28b75337-ae1e-4265-87ef-d470219cee63","resolution":{"observed_at":"2026-08-16T12:30:12.758054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-16T12:30:12.170794Z","title":"Dai, Orhan Firat, Melvin Johnson, Dmitry Lepikhin, Alexandre Passos, Siamak Shakeri, Emanuel Taropa, Paige Bailey, Zhifeng Chen, Eric Chu, Jonathan H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.170794Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:b487dcfbb9f49cd83634a82f957bd9c530ffa16da695d73b9002f51a3173489f","observation_id":"4be106fb-9499-462d-bd94-45ab909651c8","resolution":{"observed_at":"2026-08-16T12:30:12.170794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-16T12:30:12.175136Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.175136Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:edf2d4162dd44659d25a138f727bd05b77f1f51ef1efdc403ef18fa6c1d306f2","observation_id":"65c20c11-b30d-4110-b654-964d3c0e3bfa","resolution":{"observed_at":"2026-08-16T12:30:12.175136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-16T12:30:12.178847Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.178847Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:408367b4efae93bd3f1bc02f06f42dfbebb228ede070f6b072a88398dcd32a0b","observation_id":"b770a7ad-3e15-4808-be22-6955ff2d5f5c","resolution":{"observed_at":"2026-08-16T12:30:12.178847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-08-16T11:24:28.964729Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-16T12:30:12.183156Z","title":"Extending context window of large language models via positional interpolation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.183156Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:78bd682ca713e086c1b15595c5acef1033b9c0ce64e6e404b38c105eef721865","observation_id":"ca2dff60-a409-45d7-ba62-a821d7cceba7","resolution":{"observed_at":"2026-08-16T12:30:12.183156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12307","last_updated":"2024-03-08T15:26:38Z","snapshot_observed_at":"2026-08-16T14:58:40.364858Z","submitted_at":"2023-09-21T17:59:11Z","title":"LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12307","snapshot_observed_at":"2026-08-16T12:30:12.187339Z","title":"Longlora: Efficient fine-tuning of long-context large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.187339Z"},"links":{"cited_paper":"/paper/2309.12307","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:69e451e1c9e3ef2931f1e6391518972f2aaebd3789da4daa9512b23d86394b9f","observation_id":"c7feb1de-4c17-4800-bcbc-6757c9e7786a","resolution":{"observed_at":"2026-08-16T12:30:12.187339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-16T12:30:12.192206Z","title":"Mamba: Linear-time sequence modeling with selective state spaces, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.192206Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:622c9141fd2ec32993decf5d1adbd0f4cba8466bd0adf32bd580031556dcbfb9","observation_id":"9cb6629a-8cdf-435f-a247-355ab967c0d7","resolution":{"observed_at":"2026-08-16T12:30:12.192206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07916","last_updated":"2022-05-03T14:19:03Z","snapshot_observed_at":"2026-08-16T17:34:32.194098Z","submitted_at":"2021-12-15T06:35:29Z","title":"LongT5: Efficient Text-To-Text Transformer for Long Sequences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.07916","snapshot_observed_at":"2026-08-16T12:30:12.196540Z","title":"Longt5: Efficient text-to-text transformer for long sequences, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.196540Z"},"links":{"cited_paper":"/paper/2112.07916","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:e4ae04d5d4294b247ad5e04f6d4277ddc440bd14ae9e3ad6794d997ea3c3b838","observation_id":"55cc07b1-a787-4f99-82f0-3facb73adc7b","resolution":{"observed_at":"2026-08-16T12:30:12.196540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-16T12:30:12.201018Z","title":"Measuring massive multitask language understanding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.201018Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:3f1dfe8e35521f6bdc2d80f2fca3548ee0a3ac9dfafb368fd5b08acd748c0782","observation_id":"e3215a79-317e-4d62-8711-c0a4865f0929","resolution":{"observed_at":"2026-08-16T12:30:12.201018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02657","last_updated":"2024-11-01T08:52:18Z","snapshot_observed_at":"2026-08-16T13:46:10.773701Z","submitted_at":"2024-06-04T17:45:26Z","title":"Block Transformer: Global-to-Local Language Modeling for Fast Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02657","snapshot_observed_at":"2026-08-16T12:30:12.206076Z","title":"Block transformer: Global-to-local language modeling for fast inference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.206076Z"},"links":{"cited_paper":"/paper/2406.02657","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:fc39325f90e6b25b36c5345f7fd6d1d9760224ff40dc207664d55283b8b26ef2","observation_id":"2700ea7c-64a2-4ed5-bc6f-ff2ddc8af910","resolution":{"observed_at":"2026-08-16T12:30:12.206076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-15T18:01:46.669862Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-16T12:30:12.210387Z","title":"Ruler: What's the real context size of your long-context language models?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.210387Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:37c99fe52dfa441a5468203b82bd7109b31b4136e0335726ce04d82509364f3e","observation_id":"ba4d1b4c-109d-4729-950a-4aee0ad25191","resolution":{"observed_at":"2026-08-16T12:30:12.210387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-16T12:30:12.214583Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.214583Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:f95385c95aca523158efc0335823ff14916bd2510adbfe45a2559c4e6166f30b","observation_id":"9a7dc352-99b1-41b7-b37b-0432fd1dc54a","resolution":{"observed_at":"2026-08-16T12:30:12.214583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-18T00:51:28.727325Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-16T12:30:12.219021Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.219021Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:4324fe00765afe81960b6850b22ccb3ea97a58e4072d4d946b3d83cf43916f60","observation_id":"95629d72-ec16-4dd7-b1b0-4c5a3effe215","resolution":{"observed_at":"2026-08-16T12:30:12.219021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04939","last_updated":"2024-09-06T05:06:51Z","snapshot_observed_at":"2026-08-16T14:45:06.045654Z","submitted_at":"2023-11-08T01:45:37Z","title":"LooGLE: Can Long-Context Language Models Understand Long Contexts?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04939","snapshot_observed_at":"2026-08-16T12:30:12.222810Z","title":"Loogle: Can long-context language models understand long contexts?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.222810Z"},"links":{"cited_paper":"/paper/2311.04939","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:92557c3d9648ccf90285ca8005f3766084c8963f0148f43d0f1ff928279488b9","observation_id":"fe453335-108f-427f-b395-34bcb87b5a62","resolution":{"observed_at":"2026-08-16T12:30:12.222810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03172","last_updated":"2023-11-20T23:09:34Z","snapshot_observed_at":"2026-07-06T15:51:12.179086Z","submitted_at":"2023-07-06T17:54:11Z","title":"Lost in the Middle: How Language Models Use Long Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03172","snapshot_observed_at":"2026-08-16T12:30:12.226750Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.226750Z"},"links":{"cited_paper":"/paper/2307.03172","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:98bbc7fb76a854971f274095fb6b142595f51c44e5e0dc61682c2b485aaaebfe","observation_id":"c5c416b8-a4a8-4e45-87e7-3c2ce628a7c1","resolution":{"observed_at":"2026-08-16T12:30:12.226750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14591","last_updated":"2024-05-23T14:03:31Z","snapshot_observed_at":"2026-08-16T13:50:11.559449Z","submitted_at":"2024-05-23T14:03:31Z","title":"Base of RoPE Bounds Context Length","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14591","snapshot_observed_at":"2026-08-16T12:30:12.231091Z","title":"Base of rope bounds context length, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.231091Z"},"links":{"cited_paper":"/paper/2405.14591","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:e17d787c3026e21866405f191b96ff98620dd3c369f42184681f60ab102d7ace","observation_id":"0327cd07-774e-4a42-ba42-e2d0b215e45b","resolution":{"observed_at":"2026-08-16T12:30:12.231091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.05262","last_updated":"2023-01-13T15:16:16Z","snapshot_observed_at":"2026-08-15T12:28:05.800155Z","submitted_at":"2022-02-10T18:59:54Z","title":"Locating and Editing Factual Associations in GPT","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.05262","snapshot_observed_at":"2026-08-16T12:30:12.235253Z","title":"Locating and editing factual associations in gpt, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.235253Z"},"links":{"cited_paper":"/paper/2202.05262","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:291f58410b34506fb246e467ad453483595419c34f88dadbc631124ba5bc6022","observation_id":"67bbbb5e-8c53-4759-999c-59beec1d9351","resolution":{"observed_at":"2026-08-16T12:30:12.235253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-17T19:41:15.885170Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07143","snapshot_observed_at":"2026-08-16T12:30:12.239614Z","title":"Leave no context behind: Efficient infinite context transformers with infini-attention, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.239614Z"},"links":{"cited_paper":"/paper/2404.07143","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:dc64757ef72a637591f6b54e4428bc323ae65b220188b53f2044cea34e38acf1","observation_id":"c6e2309f-070b-4a47-b9d4-d94c6d5855d4","resolution":{"observed_at":"2026-08-16T12:30:12.239614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-18T09:44:25.224559Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-16T12:30:12.243291Z","title":"Yarn: Efficient context window extension of large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.243291Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:b38b81c35d3977a48f6f1617808ccf897db59db372554ca1c801befaf2792843","observation_id":"069dff6d-6bb5-45a7-ba4c-044d64d03f47","resolution":{"observed_at":"2026-08-16T12:30:12.243291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-16T12:30:12.247025Z","title":"Smith, and Mike Lewis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.247025Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:24ce5e01c79814c7e5466bee05c0050562305897db55e3818e4bae850c0e7efb","observation_id":"465d91b4-4a7c-42e1-a835-ba4d24730da9","resolution":{"observed_at":"2026-08-16T12:30:12.247025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-17T06:56:20.644738Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-16T12:30:12.250564Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.250564Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:49f3f493eeecf1d5e1fb94debb56545b4599388307d65c7272f621b6c5c0bec1","observation_id":"ab0f40c1-7985-4cca-890f-c3651e37eddd","resolution":{"observed_at":"2026-08-16T12:30:12.250564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10554","last_updated":"2022-12-20T18:56:20Z","snapshot_observed_at":"2026-08-16T16:07:11.256874Z","submitted_at":"2022-12-20T18:56:20Z","title":"A Length-Extrapolatable Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10554","snapshot_observed_at":"2026-08-16T12:30:12.254689Z","title":"A length-extrapolatable transformer, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.254689Z"},"links":{"cited_paper":"/paper/2212.10554","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:82b7d5b7419fc8dc74726caf2f41c520e36eb93eea3a85af2ff6a2c49f375c7f","observation_id":"b77c7d5c-208c-4b9f-b803-9c620c6b5c02","resolution":{"observed_at":"2026-08-16T12:30:12.254689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T12:30:12.258310Z","title":"Llama: Open and efficient foundation language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.258310Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:83dfdca406c14f8d81440630cffa05edeb5c89c9e0a2647fe862c007d2b57f02","observation_id":"9b093f22-26e6-4919-8281-750cef53fceb","resolution":{"observed_at":"2026-08-16T12:30:12.258310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-08-17T06:16:40.579073Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-16T12:30:12.261784Z","title":"Smith, Daniel Khashabi, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.261784Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:1372c93e17e5f5eb938fdfb224873b37acbc383d5212dae2573b3300e0aa2f96","observation_id":"3ec5b2a2-62f5-48e7-beaf-f5a32d6031c0","resolution":{"observed_at":"2026-08-16T12:30:12.261784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-17T00:14:01.413100Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-16T12:30:12.265736Z","title":"Chi, Tatsunori Hashimoto, Oriol Vinyals, Percy Liang, Jeff Dean, and William Fedus","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.265736Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:c672932b281633dd48fc5b24d1c1efafdc13c89a26d60f82221e1fa6385b79be","observation_id":"822263e8-a98b-474b-8222-f4e7d085b9c7","resolution":{"observed_at":"2026-08-16T12:30:12.265736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-08-14T12:54:48.492396Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17564","snapshot_observed_at":"2026-08-16T12:30:12.270024Z","title":"Bloomberggpt: A large language model for finance, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.270024Z"},"links":{"cited_paper":"/paper/2303.17564","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:4506081ee1b321781606976f2be2aa15bc5046408ed86706e8e14aae0d2186ca","observation_id":"89e7d83b-9427-42b3-a8b0-b454b915da9b","resolution":{"observed_at":"2026-08-16T12:30:12.270024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-16T12:30:12.274120Z","title":"Effective long-context scaling of foundation models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.274120Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:0c53d15c4080141ef778b68dc6d85f147df69d7229977df33230dfa1cf1b1ea5","observation_id":"7317f681-6c9b-44a3-bc55-2703162eaa23","resolution":{"observed_at":"2026-08-16T12:30:12.274120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-08-13T02:06:18.586697Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-16T12:30:12.278242Z","title":"Wizardlm: Empowering large language models to follow complex instructions, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.278242Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:31c6e001d7d9392c6e0eae704a74449122d6e04d9057679fd69693124329b099","observation_id":"b9ff6388-87f4-4f68-bdc9-f9231cdb7c3c","resolution":{"observed_at":"2026-08-16T12:30:12.278242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00770","last_updated":"2024-06-02T15:09:00Z","snapshot_observed_at":"2026-08-16T13:47:00.205665Z","submitted_at":"2024-06-02T15:09:00Z","title":"Automatic Instruction Evolving for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00770","snapshot_observed_at":"2026-08-16T12:30:12.282172Z","title":"Automatic instruction evolving for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.282172Z"},"links":{"cited_paper":"/paper/2406.00770","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:a9d76aacaf7525a17f5e2e8a14bc3eee467e471103444f9ab8a67076513280b4","observation_id":"542447ae-9462-432e-b850-6ff43a07fcf5","resolution":{"observed_at":"2026-08-16T12:30:12.282172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13718","last_updated":"2024-02-24T15:07:55Z","snapshot_observed_at":"2026-08-16T14:16:38.556803Z","submitted_at":"2024-02-21T11:30:29Z","title":"$\\infty$Bench: Extending Long Context Evaluation Beyond 100K Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13718","snapshot_observed_at":"2026-08-16T12:30:12.286706Z","title":"bench: Extending long context evaluation beyond 100k tokens, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.286706Z"},"links":{"cited_paper":"/paper/2402.13718","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:79e1a7c3737d452841beca5d8f7e4897d76347718e5dbfd1df636899c85fd962","observation_id":"ea604e59-3892-4460-9c12-06a5e4637459","resolution":{"observed_at":"2026-08-16T12:30:12.286706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00605","last_updated":"2024-06-02T03:34:41Z","snapshot_observed_at":"2026-08-16T13:47:04.780725Z","submitted_at":"2024-06-02T03:34:41Z","title":"LongSkywork: A Training Recipe for Efficiently Extending Context Length in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00605","snapshot_observed_at":"2026-08-16T12:30:12.291887Z","title":"Longskywork: A training recipe for efficiently extending context length in large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.291887Z"},"links":{"cited_paper":"/paper/2406.00605","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:bf602729d44224b84e59d588b8969a22c2872d35bf592f774a86de08eb1a1270","observation_id":"741d1b85-0554-466f-87f8-51f6d9194daa","resolution":{"observed_at":"2026-08-16T12:30:12.291887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 2 inbound Pith citation observations for arXiv:2504.12637."}