{"as_of":"2026-08-16T10:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bf86d647bb611b7e6f059327ba339964bbcbcba38e153d065ec614ac08202448","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:11:39.748585Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.12465/citation-record","integrity":"/paper/2412.12465/integrity","json":"/paper/2412.12465/citation-record.json","paper":"/paper/2412.12465"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:40.100786Z","title":"Same as demonstrated in existing methods (Beltagy et al., 2020; Xiao et al., 2024b)","venue":null,"work_id":"17ee5970-b4c4-4934-9d90-8d2c58dc9d17","year":2020},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.731601Z"},"links":{"citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:bcb5f83d9c26e06ed5c4a905e2445617a7fe6ff844efb3735d207d4ca7081702","observation_id":"f7a503cc-f96d-407b-9d26-69efd1364aca","resolution":{"observed_at":"2026-08-11T14:11:40.105767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-11T14:11:39.602020Z","title":"Extending context window of large language models via positional interpolation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.602020Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:eacb91e6cc2b8b6b45b660e669ee4ea0104e675aaf6163c1b1cf93b1148da2aa","observation_id":"b396aef2-ebad-4247-940c-1fdd7b936e8a","resolution":{"observed_at":"2026-08-11T14:11:39.602020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03555","last_updated":"2020-10-01T00:41:49Z","snapshot_observed_at":"2026-08-14T17:43:11.894850Z","submitted_at":"2020-06-05T17:09:16Z","title":"Masked Language Modeling for Proteins via Linearly Scalable Long-Context Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03555","snapshot_observed_at":"2026-08-11T14:11:39.611527Z","title":"Masked language modeling for proteins via linearly scalable long-context transformers","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.611527Z"},"links":{"cited_paper":"/paper/2006.03555","citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:be873a5bb35be6c732eacd6dbbb3a6f9c9a2f9e6740083511fc2704101aba7f0","observation_id":"f6846c3a-590f-4ab2-be44-6dd2f6cead4c","resolution":{"observed_at":"2026-08-11T14:11:39.611527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-15T03:29:22.305477Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-11T14:11:39.616699Z","title":"Longnet: Scaling transformers to 1,000,000,000 tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.616699Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:bb180d79814c321366e1597fd6c748ce5fdcc9c5150c72cdeb37e5cfb4920755","observation_id":"2d528daf-9b2b-4e23-8339-e90b4599b224","resolution":{"observed_at":"2026-08-11T14:11:39.616699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-13T04:18:06.044656Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-08-11T14:11:39.622030Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.622030Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:7bcdbf01c589bc26ba98bd4b6fe49806ae078f008d3523cc91588f17defb12a4","observation_id":"f06184fe-5287-4e72-8eca-abde9a2d60e2","resolution":{"observed_at":"2026-08-11T14:11:39.622030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-11T14:11:39.626849Z","title":"Deepseek-r1: In- centivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.626849Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:f825a9b825ec6342e9f15d7d26229c9cb08b799081d2eefcd54ac80fef47c374","observation_id":"5aa06aaf-5711-4cca-85b1-fdfbe526fe3f","resolution":{"observed_at":"2026-08-11T14:11:39.626849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:40.063816Z","title":"s 256 512 1024 2048 4096 PPL ↓ 2.98 2.92 2.86 2.79 2.73 Latency ↓ (ms) 457.4 460.1 461.4 462.8 473.1 Effect of Different Updating Strategies","venue":null,"work_id":"557ed110-f70c-42ff-bfd4-9cb8ae80dab0","year":null},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.743922Z"},"links":{"citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:2e93c518a2469f53644f0219818ce34cf8b7e84892952a1c13b5513015773bb2","observation_id":"64ff5deb-44bb-45a3-beb8-45b7e5b24b31","resolution":{"observed_at":"2026-08-11T14:11:40.070137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:40.243910Z","title":null,"venue":null,"work_id":"5df0f20e-c381-441a-a2f6-275467cda69c","year":2023},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.650230Z"},"links":{"citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:f96a104292287c6682d5abba1edddf118e4e9c1294ca01e45698d45e48932133","observation_id":"c2fed794-ad54-46dc-85a7-6ccf3308cfd2","resolution":{"observed_at":"2026-08-11T14:11:40.248786Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T14:11:39.654390Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.654390Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:0e5706da376e6219964a6db2938d121ac21a9f88f77af7ba5204ea076134027e","observation_id":"1601e86a-3514-4c59-8df0-9c6a8056f98f","resolution":{"observed_at":"2026-08-11T14:11:39.654390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T14:11:39.668374Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.668374Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:6489c634a75cbb0d8c1fcc165d506ba368c18abe3077ffbeebb3688ac473a0b8","observation_id":"5ff27d7e-ce5e-4b83-9e6b-e3a11d3f3680","resolution":{"observed_at":"2026-08-11T14:11:39.668374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-11T14:11:39.673740Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.673740Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:cec24142be830249f068137988b830b4fb7a9a5718452af3e2d8129f292b7b04","observation_id":"3935e5ac-b689-4170-93a0-c63a56593019","resolution":{"observed_at":"2026-08-11T14:11:39.673740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:40.227918Z","title":"The MMLU benchmark spans 57 diverse subjects, ranging from elementary mathematics to professional law","venue":null,"work_id":"5051352e-a4b9-4717-8da7-4ac659bacb78","year":2021},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.687129Z"},"links":{"citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:b7ba3cc0d26cdf8121337ae7bea8d2902a9c4c0b4901f439dc828da866822576","observation_id":"a55eb01a-948a-456f-8c96-6ffa2b6848ba","resolution":{"observed_at":"2026-08-11T14:11:40.232662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:40.210449Z","title":"base frequency","venue":null,"work_id":"adf4c51b-c4ef-4bc0-9df7-1e6015072215","year":2024},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.691363Z"},"links":{"citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:b4fd6145eca2c1bfaae35b3f3802a46d308c18e1c466fe372a55041e1665721a","observation_id":"d37893a3-37fc-46b9-acb0-76cc17b11a98","resolution":{"observed_at":"2026-08-11T14:11:40.216143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:40.191423Z","title":"This enables us to integrate our CCA-Attention as a standalone, cache-friendly operator, effectively eliminating redundant computations","venue":null,"work_id":"7945d0bd-964c-4259-9a54-e61a547ed64d","year":2023},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.697066Z"},"links":{"citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:426a2acf7b3fcf781f016abe0c6bf91cc4b0314aedb4512662485a0400a39ed0","observation_id":"064f819b-70ea-4a43-9ac2-460d48dc0ec2","resolution":{"observed_at":"2026-08-11T14:11:40.198829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:40.164617Z","title":"Our experiments are based on the LLaMA-2 7B model fine-tuned on sequences of length 32K and 80K (Fu et al., 2024)","venue":null,"work_id":"20f65c68-efa4-46e3-912a-f976888cd89e","year":2024},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.706475Z"},"links":{"citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:48f567b8486a3e3306ef2dcf0d92b5e01cbca16dfc31799386bc35f256e4ea52","observation_id":"3518ab91-f9e6-4a8b-9662-049c403156cb","resolution":{"observed_at":"2026-08-11T14:11:40.173335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:40.133872Z","title":"16 Core Context Aware Transformers for Long Context Language Modeling C","venue":null,"work_id":"1c469644-2854-43e6-a436-8b4481dc1325","year":2024},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.719498Z"},"links":{"citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:4e1409d7df93461c8c30a38d3d2a6c344f5368d0de3f6972158c216a59d4cf03","observation_id":"da97c928-c70e-4f82-b2f3-acba2bf192c7","resolution":{"observed_at":"2026-08-11T14:11:40.138276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:40.117492Z","title":null,"venue":null,"work_id":"6aa4869f-92fa-4fd7-a2f1-c58ea8286c54","year":2024},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.725236Z"},"links":{"citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:dcd058326c016fed520dedbfdb352093253be229fee0a5722165443710a31da3","observation_id":"f413f8ae-88d1-4e42-88b5-ddf611e7213e","resolution":{"observed_at":"2026-08-11T14:11:40.122478Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:40.082280Z","title":"Strategy Mean Pooling Max Pooling CCA-Attention (Ours) PPL ↓ 2.99 2.99 2.85 Effect of Group Size g","venue":null,"work_id":"dfea34f8-99a8-494d-8acf-5b2f2c380e75","year":null},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.738189Z"},"links":{"citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:8d5e7727f124289fd5b434aaf27eb188b35285705a78d62b71acf08e5f6b78d5","observation_id":"f7b4178f-21bc-4802-9862-1a136bc3393e","resolution":{"observed_at":"2026-08-11T14:11:40.087172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:40.039581Z","title":"The perplexity rapidly converges within approximately the first 100 iterations and remains stable over 1,000 iterations","venue":null,"work_id":"2e1e420c-f819-480f-b15d-e07e248ae3e0","year":2024},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.748585Z"},"links":{"citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:93e59558c50f4d007e34c9e72ed722aec637e8c9dc3d31142c253f2427f55c79","observation_id":"ed662da6-82bc-4bd2-8177-f90118a375c6","resolution":{"observed_at":"2026-08-11T14:11:40.051901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:40.147911Z","title":null,"venue":null,"work_id":"5a54d507-39e7-46a3-9eab-bac0e18b9870","year":2023},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.715353Z"},"links":{"citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:829b8bdb1ccc9da5cd2c7d590d542c67304259006e694c273815e224ccf87820","observation_id":"0e2e3f84-3068-4f03-9a30-9a7649d6668a","resolution":{"observed_at":"2026-08-11T14:11:40.152196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-11T14:11:39.644086Z","title":"Deepseek- v3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.644086Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:8eaabcd807367cce4c4c41a2fd5b350fec9b97aad5f6e23dd81b6daab8426758","observation_id":"23c79c42-8f28-4294-b24e-edb9a870f05a","resolution":{"observed_at":"2026-08-11T14:11:39.644086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-11T14:11:39.663274Z","title":"Retentive network: A successor to transformer for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.663274Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:6bd1cf644ff0373db357f8d87babd5b7f5a611c4480e12289d871565ae9f32b9","observation_id":"c43a855a-abd8-40e3-a063-3ab388aad145","resolution":{"observed_at":"2026-08-11T14:11:39.663274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-15T18:01:46.669862Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-11T14:11:39.638818Z","title":"Ruler: What’s the real context size of your long-context language models? arXiv preprint arXiv:2404.06654,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.638818Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:f235a6cac1c269fc3942fda0c40a580054836657695d0748168a8a2b8b6a148f","observation_id":"970488b0-c9e3-4845-b982-5811d154f108","resolution":{"observed_at":"2026-08-11T14:11:39.638818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-11T14:11:39.585247Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.585247Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:5d311c562ad8d96a22d1d4be1f7db8bcf02f12a1cfcfcb50bddb4ee886b9106f","observation_id":"6c96ee85-bc28-43e9-b57d-72b3dbe75c84","resolution":{"observed_at":"2026-08-11T14:11:39.585247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-11T14:11:39.590791Z","title":"E., and Cohan, A","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.590791Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:e2232a014ca822fb6e25067c40f92b9d7cf8a2eb2e50935eb7252d535c5b4412","observation_id":"8e5a5456-13cc-4b3b-a090-19c543b30e14","resolution":{"observed_at":"2026-08-11T14:11:39.590791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:40.261044Z","title":"Chang, Y ., Wang, X., Wang, J., Wu, Y ., Yang, L., Zhu, K., Chen, H., Yi, X., Wang, C., Wang, Y ., Ye, W., Zhang, Y ., Chang, Y ., Yu, P","venue":null,"work_id":"3e80d96c-3c87-48c1-a842-268e0b202cd3","year":2025},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.596635Z"},"links":{"citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:39f2fcba431af54ecd051f08a966cb296416c5f75a74b8c0aadb17d0b102c10b","observation_id":"780698b2-f707-4bcb-a74d-c9aeed4745fe","resolution":{"observed_at":"2026-08-11T14:11:40.270750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16137","last_updated":"2024-06-24T21:22:00Z","snapshot_observed_at":"2026-08-13T10:24:04.166455Z","submitted_at":"2023-08-30T16:47:51Z","title":"LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16137","snapshot_observed_at":"2026-08-11T14:11:39.633204Z","title":"LM-infinite: Simple on-the-fly length generalization for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:39.633204Z"},"links":{"cited_paper":"/paper/2308.16137","citing_paper":"/paper/2412.12465"},"observation_digest":"sha256:7f42acbbf432b9418b4f96c67c41f187c10ca9502e12ae6fafa8be5ea46a38e3","observation_id":"81609661-bbeb-4667-b9fa-27153bd0abb3","resolution":{"observed_at":"2026-08-11T14:11:39.633204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.12465","last_updated":"2025-08-04T03:37:34Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T05:34:20.682968Z","submitted_at":"2024-12-17T01:54:08Z","title":"Core Context Aware Transformers for Long Context Language Modeling"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2412.12465."}