{"as_of":"2026-08-18T11:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d00e809567eea2b72152e2fce389fea2ebdec409da7be43980ab52af83eab94","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:37:13.242455Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.12419/citation-record","integrity":"/paper/2608.12419/integrity","json":"/paper/2608.12419/citation-record.json","paper":"/paper/2608.12419"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.01149","last_updated":"2023-11-10T06:28:48Z","snapshot_observed_at":"2026-08-16T14:46:35.287058Z","submitted_at":"2023-11-02T11:13:51Z","title":"ChineseWebText: Large-scale High-quality Chinese Web Text Extracted with Effective Evaluation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01149","snapshot_observed_at":"2026-08-16T00:37:13.103205Z","title":"Chen, J., Jian, P., Xi, T., Yi, D., Du, Q., Ding, C., Zhu, G., Zong, C., Wang, J., and Zhang, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.103205Z"},"links":{"cited_paper":"/paper/2311.01149","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:a2b25977732de7b4ba7b59a1d1a41d4ff277c5a6b950c3d30c5ffdcd5f33e28e","observation_id":"10ecf9ea-2e27-4767-99a6-8c3b2fde81fe","resolution":{"observed_at":"2026-08-16T00:37:13.103205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-16T00:37:13.124172Z","title":"Gen- erating long sequences with sparse transformers.arXiv preprint arXiv:1904.10509,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.124172Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:4cc438e26df19ebc35a8905b2645d3dfc5a774adfe0cf025c306cb665f31a918","observation_id":"0ffdd637-eb79-4e81-9bfe-41a66ce05bf8","resolution":{"observed_at":"2026-08-16T00:37:13.124172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10755","last_updated":"2023-09-15T09:52:14Z","snapshot_observed_at":"2026-08-17T13:54:00.101026Z","submitted_at":"2023-08-21T14:40:48Z","title":"WanJuan: A Comprehensive Multimodal Dataset for Advancing English and Chinese Large Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10755","snapshot_observed_at":"2026-08-16T00:37:13.139255Z","title":"Wanjuan: A comprehensive multimodal dataset for advancing english and chinese large models.arXiv preprint arXiv:2308.10755,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.139255Z"},"links":{"cited_paper":"/paper/2308.10755","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:c0c5405a34c1e09e9081530252f8a5ae48efa7438f3aabd7f2039d648a124508","observation_id":"d8e9b861-ffff-48dd-aa7c-c523e445bb0d","resolution":{"observed_at":"2026-08-16T00:37:13.139255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-16T00:37:13.149309Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.149309Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:f7a8453190b1e9093fa45b1d83dd70468fb5b937ea1c80546245af802f148173","observation_id":"b7c9018b-0724-4c60-876b-770efc6c2e16","resolution":{"observed_at":"2026-08-16T00:37:13.149309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06049","last_updated":"2025-02-09T22:11:42Z","snapshot_observed_at":"2026-08-14T05:29:30.543600Z","submitted_at":"2025-02-09T22:11:42Z","title":"LM2: Large Memory Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06049","snapshot_observed_at":"2026-08-16T00:37:13.154209Z","title":"J., Greenlee, F., Thomas, G., Purtorab, M., and Toulis, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.154209Z"},"links":{"cited_paper":"/paper/2502.06049","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:40ec28d4b7f6dc269d18f8bb4ac97f0b7fc718d3f64a21111593d8809e394073","observation_id":"f1277a8b-720f-455f-93c4-adf05d28d50b","resolution":{"observed_at":"2026-08-16T00:37:13.154209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:13.813899Z","title":"Cmmlu: Measuring massive multitask language understanding in chinese","venue":null,"work_id":"19a76218-6d83-4a9b-808a-6a997a08015a","year":2024},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.159388Z"},"links":{"citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:388ccb3794fb7289e23ac83040d9eb4b53bc8fd5132ef75a6e5ee891b5cbfa6e","observation_id":"a88d323c-1b27-44f5-9edc-13d59e00b0c0","resolution":{"observed_at":"2026-08-16T00:37:13.819645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-16T00:37:13.164298Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.164298Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:b76912d8eed902ede2522c2945995400ee1ac7a3716051022afec8bdebcf748e","observation_id":"d4f6923e-5c28-47b0-88b4-46c00825abb2","resolution":{"observed_at":"2026-08-16T00:37:13.164298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14862","last_updated":"2023-12-22T17:34:47Z","snapshot_observed_at":"2026-08-16T14:32:08.201033Z","submitted_at":"2023-12-22T17:34:47Z","title":"YAYI 2: Multilingual Open-Source Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14862","snapshot_observed_at":"2026-08-16T00:37:13.168892Z","title":"Llm360: Towards fully transparent open-source llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.168892Z"},"links":{"cited_paper":"/paper/2312.14862","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:4b8a6596a10ef5f6c988afcfb22852677e0043ae647c690c0208e27116b81fbb","observation_id":"d674f108-fe07-4546-b148-6356289e6d4f","resolution":{"observed_at":"2026-08-16T00:37:13.168892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:13.173742Z","title":"and Lin, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.173742Z"},"links":{"citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:a7a90c3b1f71d592890645d43fc53ccfeadb188447d14fe5a676023ed19959db","observation_id":"5bbb0316-3e14-4ae9-b64f-1085d797167f","resolution":{"observed_at":"2026-08-16T00:37:13.173742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:13.797147Z","title":"D., Man, H., Ngo, N","venue":null,"work_id":"7b3591ff-e6ca-49ff-a562-0f9fd25ee18c","year":2024},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.178158Z"},"links":{"citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:1d054f3809223d3045336264c5a829b40715808522e0c334720c8560bb4aa3dc","observation_id":"fbefe8db-0d73-4a7d-bc6c-a1a9659ed2ef","resolution":{"observed_at":"2026-08-16T00:37:13.801749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T00:37:13.183149Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.183149Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:7394b967838238c7a0b0dd4d0ad39b6153c2567334d5e55c2b5e2b039c2b0a9d","observation_id":"3972f525-b459-4225-aedb-07acd82cc0a9","resolution":{"observed_at":"2026-08-16T00:37:13.183149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08560","last_updated":"2024-02-12T18:59:46Z","snapshot_observed_at":"2026-08-15T11:39:49.280087Z","submitted_at":"2023-10-12T17:51:32Z","title":"MemGPT: Towards LLMs as Operating Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08560","snapshot_observed_at":"2026-08-16T00:37:13.188096Z","title":"G., Stoica, I., and Gonzalez, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.188096Z"},"links":{"cited_paper":"/paper/2310.08560","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:5c7288bf59dbd85a716a74eb2006af86cd34daea41289aa3af34bec751cfd98b","observation_id":"083e52af-51bf-4f5d-9672-fc0c05802e3e","resolution":{"observed_at":"2026-08-16T00:37:13.188096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05567","last_updated":"2024-04-08T14:39:49Z","snapshot_observed_at":"2026-08-16T14:02:42.190282Z","submitted_at":"2024-04-08T14:39:49Z","title":"Dense Training, Sparse Inference: Rethinking Training of Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05567","snapshot_observed_at":"2026-08-16T00:37:13.192754Z","title":"Dense training, sparse infer- ence: Rethinking training of mixture-of-experts language models.arXiv preprint arXiv:2404.05567,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.192754Z"},"links":{"cited_paper":"/paper/2404.05567","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:f31f8a4a981a17d75fca9e1862cb1c68f8aa61b10738ae70a0853b4bcf0bfcb8","observation_id":"f5c7008d-2b31-435d-bf08-e1f8ea2e907f","resolution":{"observed_at":"2026-08-16T00:37:13.192754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02265","last_updated":"2024-11-06T09:15:27Z","snapshot_observed_at":"2026-08-16T13:03:06.425740Z","submitted_at":"2024-11-04T16:56:26Z","title":"Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02265","snapshot_observed_at":"2026-08-16T00:37:13.197652Z","title":"Hunyuan-large: An open-source moe model with 52 billion activated pa- rameters by tencent.arXiv preprint arXiv:2411.02265,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.197652Z"},"links":{"cited_paper":"/paper/2411.02265","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:c3fb00f9ab9bc071318812879f3705430e1d49091b7409e116cd517b1d23d281","observation_id":"1e57663f-f5c3-4323-8c67-1a5822d3e045","resolution":{"observed_at":"2026-08-16T00:37:13.197652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-16T00:37:13.202478Z","title":"I., Burnell, R., Bai, L., Gulati, A., Tanzer, G., Vincent, D., Pan, Z., Wang, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.202478Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:fbf29e49d5c38da22fdbcea1589b8d114a845c80eb1881c7806ad3b4287893fb","observation_id":"a1af0f49-2fba-435d-94f6-2d4a7a6c8f49","resolution":{"observed_at":"2026-08-16T00:37:13.202478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19341","last_updated":"2023-10-30T08:31:47Z","snapshot_observed_at":"2026-08-16T14:47:44.314161Z","submitted_at":"2023-10-30T08:31:47Z","title":"Skywork: A More Open Bilingual Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19341","snapshot_observed_at":"2026-08-16T00:37:13.207202Z","title":"Skywork: A more open bilingual foundation model.arXiv preprint arXiv:2310.19341,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.207202Z"},"links":{"cited_paper":"/paper/2310.19341","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:9ba2e4666e14fbe16ab9578f3e82075750127193c778c1b4bb278e70258e6771","observation_id":"bc1feda2-20a5-42ac-9a25-f641f915325e","resolution":{"observed_at":"2026-08-16T00:37:13.207202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06563","last_updated":"2024-06-03T03:58:41Z","snapshot_observed_at":"2026-08-16T13:46:54.450188Z","submitted_at":"2024-06-03T03:58:41Z","title":"Skywork-MoE: A Deep Dive into Training Techniques for Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06563","snapshot_observed_at":"2026-08-16T00:37:13.211915Z","title":"Skywork-moe: A deep dive into training techniques for mixture-of-experts language models.arXiv preprint arXiv:2406.06563,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.211915Z"},"links":{"cited_paper":"/paper/2406.06563","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:65e44652990becad1139ae7f8e672590bfd30772ba09f0d6300fef7415695d31","observation_id":"7e3d6708-b9fc-4208-b9f9-f5e2fda05e47","resolution":{"observed_at":"2026-08-16T00:37:13.211915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-16T00:37:13.216593Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.216593Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:e31b7794d7f7ebce45013f460834a0d2365bbc30ffbf44837513701ff34f9e23","observation_id":"9c22f5d8-e225-45e1-ba7e-79e2b7b284ce","resolution":{"observed_at":"2026-08-16T00:37:13.216593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19327","last_updated":"2024-07-10T16:55:47Z","snapshot_observed_at":"2026-08-16T13:48:04.075163Z","submitted_at":"2024-05-29T17:57:16Z","title":"MAP-Neo: Highly Capable and Transparent Bilingual Large Language Model Series","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19327","snapshot_observed_at":"2026-08-16T00:37:13.221795Z","title":"L., Pan, D., Cheng, E., Liu, J., Lin, Q., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.221795Z"},"links":{"cited_paper":"/paper/2405.19327","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:d6337d8b4f1f39243a313b568eeb18368f419a175eb67261dafa24df5b33643e","observation_id":"825b28e8-4f0f-47bc-b8b7-d613da9a8ad1","resolution":{"observed_at":"2026-08-16T00:37:13.221795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:13.766730Z","title":null,"venue":null,"work_id":"4e4df887-d21f-426c-a482-a5e0ae991128","year":2024},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.232419Z"},"links":{"citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:e93bf03da2afdc000f5fb72d202291f44c91a9e689351c1409e94519ad13a632","observation_id":"7d9df4fd-26f9-4f69-aff4-d974594451fb","resolution":{"observed_at":"2026-08-16T00:37:13.771403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:13.749481Z","title":"It contains 7,473 training and 1,319 hand-written test questions, each requiring two to eight sequential reasoning steps","venue":null,"work_id":"e5b9b673-ecdf-48df-892e-a9f5b6f5aa7d","year":2021},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.237384Z"},"links":{"citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:e187312dbb08687c56f354cbab042e050116f4bca4e04c4b5b6ab612338b0752","observation_id":"a366ad2c-0efd-4a46-9fbb-8d00dbd114e0","resolution":{"observed_at":"2026-08-16T00:37:13.755433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:13.732994Z","title":"Newton,” “Calculus,","venue":null,"work_id":"f05d9038-389a-4736-95dc-8842de51352f","year":2026},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.242455Z"},"links":{"citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:3214d5374612bde5ad37c63441cfc62e5a6814ae8b006407010628794862ccfd","observation_id":"caef4196-23c6-4ca0-a02d-71256b7aca81","resolution":{"observed_at":"2026-08-16T00:37:13.738655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-16T00:37:13.134132Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.134132Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:22284d369a9c2d2b2abd10253236a1c89570ed0d5332d75ae0963ff9280efd41","observation_id":"6953884a-d2cc-4c52-8824-39dea6a68f0a","resolution":{"observed_at":"2026-08-16T00:37:13.134132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-16T00:37:13.129282Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.129282Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:7e4ff8b21e265864631b79b0b02316c5da0de43a873d2b76f3e063e9aa05d5e7","observation_id":"1a5b64e7-082e-4341-af5e-da75f2a443b5","resolution":{"observed_at":"2026-08-16T00:37:13.129282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-16T00:37:13.097937Z","title":"Internlm2 technical report.arXiv preprint arXiv:2403.17297,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.097937Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:f62a3a90a223f572ca47b869e8f585c3b32c780ddb343b416bb3d855beb79a8d","observation_id":"220ca2b1-b40f-44bf-a4fb-4d2a54465cd1","resolution":{"observed_at":"2026-08-16T00:37:13.097937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03901","last_updated":"2023-06-07T17:22:22Z","snapshot_observed_at":"2026-08-16T15:26:05.023432Z","submitted_at":"2023-06-06T17:58:24Z","title":"ChatDB: Augmenting LLMs with Databases as Their Symbolic Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03901","snapshot_observed_at":"2026-08-16T00:37:13.144294Z","title":"Chatdb: Augmenting llms with databases as their sym- bolic memory.arXiv preprint arXiv:2306.03901,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.144294Z"},"links":{"cited_paper":"/paper/2306.03901","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:84a6fc38705f95ddd64db04035a6e56011a9029fed5de941310feac294f14402","observation_id":"94cda244-ea9a-499e-a5a3-27ddf39a7204","resolution":{"observed_at":"2026-08-16T00:37:13.144294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:13.782117Z","title":"We organize our supplementary as follows","venue":null,"work_id":"17cd1cfb-b2c1-4c66-9a7a-1908db37118b","year":2024},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.226816Z"},"links":{"citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:16cea48c63d5fca6353568bff173242a2bdf5567ef54b6e9032b32d927c95831","observation_id":"af8ef260-a15d-4e14-91de-e2b3839592e9","resolution":{"observed_at":"2026-08-16T00:37:13.786856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-16T00:37:13.108617Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.108617Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:0719872e98c074db0446985456bd3fc3cbd544f95e110795132939e8f1af7878","observation_id":"84fed58e-b464-4c71-8c58-4dac96563597","resolution":{"observed_at":"2026-08-16T00:37:13.108617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-16T00:37:13.091654Z","title":"anthropic.com/news/claude-3-5-sonnet","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.091654Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:b240d92ea28a69972ee07305342091d0226e5275bd064f626a2dbca2c973d245","observation_id":"8a340e0f-f967-49f9-b52a-5820bd73ee6e","resolution":{"observed_at":"2026-08-16T00:37:13.091654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.07372","last_updated":"2026-07-12T07:41:31Z","snapshot_observed_at":"2026-08-15T16:31:19.460938Z","submitted_at":"2026-01-12T09:54:49Z","title":"Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.07372","snapshot_observed_at":"2026-08-16T00:37:13.113611Z","title":"Conditional memory via scalable lookup: A new axis of sparsity for large language models.arXiv preprint arXiv:2601.07372,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.113611Z"},"links":{"cited_paper":"/paper/2601.07372","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:db2e9c5c8d35bcfeec01fa8d57f6d7e73300142039cfaa6872d758c29abf136c","observation_id":"40db4f9e-3cbf-42d5-a60e-9c119a3c28d1","resolution":{"observed_at":"2026-08-16T00:37:13.113611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19413","last_updated":"2025-04-28T01:46:35Z","snapshot_observed_at":"2026-08-14T23:23:31.683130Z","submitted_at":"2025-04-28T01:46:35Z","title":"Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19413","snapshot_observed_at":"2026-08-16T00:37:13.118951Z","title":"Mem0: Building production-ready ai agents with scalable long-term memory.arXiv preprint arXiv:2504.19413,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:13.118951Z"},"links":{"cited_paper":"/paper/2504.19413","citing_paper":"/paper/2608.12419"},"observation_digest":"sha256:59705eef539bc7ac0a7cc7595f1e95c61b55b390081a768171a87e19e748f1aa","observation_id":"6ff30059-21b8-4350-8253-f25a27c34997","resolution":{"observed_at":"2026-08-16T00:37:13.118951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.12419","last_updated":"2026-08-12T07:45:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T06:31:44.555877Z","submitted_at":"2026-08-12T07:45:11Z","title":"LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2608.12419."}