{"as_of":"2026-08-10T21:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:71d07d0e5bdb5efc32db29f08349368e45c364d5b2f76d84137f22974857a2c6","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:19:11.474503Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:55:09.763377Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T20:40:36.526819Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05767","snapshot_observed_at":"2026-08-05T21:55:09.763377Z","title":"dots.llm1 Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07785","last_updated":"2025-08-11T09:15:36Z","snapshot_observed_at":"2026-08-09T17:03:23.397293Z","submitted_at":"2025-08-11T09:15:36Z","title":"Grove MoE: Towards Efficient and Superior MoE LLMs with Adjugate Experts","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T21:55:09.763377Z"},"links":{"cited_paper":"/paper/2506.05767","citing_paper":"/paper/2508.07785"},"observation_digest":"sha256:7c017a1b148d4f44c74e928e95abee0fa3679af16b0002aad772f970b24dd434","observation_id":"7a2fae88-c8b7-441e-a300-6c77883d71e3","resolution":{"observed_at":"2026-08-05T21:55:09.763377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05767","snapshot_observed_at":"2026-08-05T16:17:42.004470Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-09T07:25:17.981291Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.004470Z"},"links":{"cited_paper":"/paper/2506.05767","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:6e803e7c9fff791430b0bf5110fb3afbf9673dcb01b9552235e36353310a0887","observation_id":"f339dd7c-1b5f-4c73-b747-c9875d60c6f5","resolution":{"observed_at":"2026-08-05T16:17:42.004470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"cited_work":{"arxiv_id":"2506.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05767","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benoit Jacob, Skirmantas Kligys, Bo Chen, Menglong Zhu, Matthew Tang, Andrew Howard, Hartwig Adam, and Dmitry Kalenichenko","venue":null,"work_id":"88476f71-1255-473c-a9bd-0d0b3b6e4cbd","year":null},"citing_paper":{"arxiv_id":"2510.08008","last_updated":"2026-05-15T08:53:04Z","snapshot_observed_at":"2026-08-03T22:05:31.756040Z","submitted_at":"2025-10-09T09:45:45Z","title":"Beyond Sunk Costs: Boosting LLM Pre-training Efficiency via Orthogonal Growth of Mixture-of-Experts","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T20:36:22.974054Z"},"links":{"cited_paper":"/paper/2506.05767","citing_paper":"/paper/2510.08008"},"observation_digest":"sha256:4c675263f6a86a63bbf1752b944a477b4ff459ac76f4f4d6e4fca62acd13d352","observation_id":"7e67ca73-fa02-476a-bdb4-53b3e93a009e","resolution":{"observed_at":"2026-05-21T20:40:36.529155Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"cited_work":{"arxiv_id":"2506.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05767","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benoit Jacob, Skirmantas Kligys, Bo Chen, Menglong Zhu, Matthew Tang, Andrew Howard, Hartwig Adam, and Dmitry Kalenichenko","venue":null,"work_id":"88476f71-1255-473c-a9bd-0d0b3b6e4cbd","year":null},"citing_paper":{"arxiv_id":"2604.07809","last_updated":"2026-04-09T05:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T05:07:57Z","title":"PolicyLong: Towards On-Policy Context Extension","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T17:23:28.939977Z"},"links":{"cited_paper":"/paper/2506.05767","citing_paper":"/paper/2604.07809"},"observation_digest":"sha256:6c6dfd1c2caef3532c8c48cc35c4017989cd8c58b689cd9380e98c1809731541","observation_id":"475a8df5-5fba-425a-be89-411437f1e31e","resolution":{"observed_at":"2026-05-11T06:55:59.972876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05767","snapshot_observed_at":"2026-08-02T09:40:03.534751Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22662","last_updated":"2026-06-29T03:25:36Z","snapshot_observed_at":"2026-08-09T17:03:22.325884Z","submitted_at":"2026-06-29T03:25:36Z","title":"CuraWeb: Joint Optimization of Quality, Redundancy, and Diversity for Web-Scale Pretraining Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T09:40:03.534751Z"},"links":{"cited_paper":"/paper/2506.05767","citing_paper":"/paper/2607.22662"},"observation_digest":"sha256:06a0cd34f22fa3f2fc9238a63d4c8020dec21f29d4ba9ee912d9e9ce1961092e","observation_id":"1dc3dcc8-afca-4cf8-a372-b9febde852be","resolution":{"observed_at":"2026-08-02T09:40:03.534751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05767/citation-record","integrity":"/paper/2506.05767/integrity","json":"/paper/2506.05767/citation-record.json","paper":"/paper/2506.05767"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-07T10:19:05.944665Z","title":"Llama 3 model card, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:05.944665Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:ffc9058ec94d298c58b7cd2be3dcf9280d66b9c090791c182b36f9b0b29d6285","observation_id":"ef6c8e10-a1ae-4d1c-96dd-93af39aa0d70","resolution":{"observed_at":"2026-08-07T10:19:05.944665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T10:19:06.505142Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:06.505142Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:b58069d6e9c545a3bcb4966c43190a24ba966a54bafe2194f86e329b9c576631","observation_id":"874c6d55-412e-44e8-837b-22792e1024e3","resolution":{"observed_at":"2026-08-07T10:19:06.505142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T10:19:06.589140Z","title":"Think you have solved question answering? Try ARC, the AI2 reasoning challenge.CoRR, abs/1803.05457,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:06.589140Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:07ad78797f1f51a742ede6920c653f145e341e7e6aaed55101198b75ab8af2e8","observation_id":"a929a264-7db0-4d92-973b-318edfa6424a","resolution":{"observed_at":"2026-08-07T10:19:06.589140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-07T10:19:06.770176Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:06.770176Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:953d6a5b598d577b025a708ed0bf8220cf558a10a82cb73fbc987737c5b563d2","observation_id":"4de6955d-0759-439f-88d1-fa8474b325bf","resolution":{"observed_at":"2026-08-07T10:19:06.770176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-07T10:19:06.869670Z","title":"DeepSeek-AI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:06.869670Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:2bf1ce612931c3a6587c99437c93815851f9f389c0a54b7b124535dd02dc977d","observation_id":"7dda731e-f33b-44d3-8d76-0bfb6f1de269","resolution":{"observed_at":"2026-08-07T10:19:06.869670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-10T17:02:50.054809Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T10:19:06.966756Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:06.966756Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:c0a1533ace4ad0ba2a9f10d613700bdf7cb35a2c12b4f01a648aa62a3ad137ef","observation_id":"466d1906-528a-4036-a4db-93f0a6e31ad2","resolution":{"observed_at":"2026-08-07T10:19:06.966756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-07T10:19:07.247635Z","title":"Length-controlled alpacaeval: A simple way to debias automatic evaluators.arXiv preprint arXiv:2404.04475,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:07.247635Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:6437234867311b935c06a9c7e0741473ab56683bb3f7cfb3d223efb77eed0cb0","observation_id":"70df57b9-3c64-48b7-86be-03d5b1a13380","resolution":{"observed_at":"2026-08-07T10:19:07.247635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04127","last_updated":"2025-01-10T14:31:21Z","snapshot_observed_at":"2026-08-10T20:57:23.920989Z","submitted_at":"2024-06-06T14:49:06Z","title":"Are We Done with MMLU?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04127","snapshot_observed_at":"2026-08-07T10:19:07.465034Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:07.465034Z"},"links":{"cited_paper":"/paper/2406.04127","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:1eb67e9ab7ae2574ca247dfe2c48d1ad29bcf769130902bba365f360d27cde87","observation_id":"2b325499-623b-42c7-a976-6ef01c17d7ee","resolution":{"observed_at":"2026-08-07T10:19:07.465034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05783","last_updated":"2024-03-11T09:49:04Z","snapshot_observed_at":"2026-07-06T15:40:39.214427Z","submitted_at":"2023-06-09T09:52:05Z","title":"Xiezhi: An Ever-Updating Benchmark for Holistic Domain Knowledge Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05783","snapshot_observed_at":"2026-08-07T10:19:07.566146Z","title":"Yancheng He, Shilong Li, Jiaheng Liu, Yingshui Tan, Weixun Wang, Hui Huang, Xingyuan Bu, Hangyu Guo, Chengwei Hu, Boren Zheng, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:07.566146Z"},"links":{"cited_paper":"/paper/2306.05783","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:1115d0d00eac0c4b392b6903ff7dc196f3106d603077aec0f1d5b0575461be31","observation_id":"9fdb3c03-4061-4d7a-9a7e-936015379f53","resolution":{"observed_at":"2026-08-07T10:19:07.566146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-10T09:20:57.804343Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-07T10:19:07.663478Z","title":"Dan Hendrycks, Collin Burns, Steven Basart, Andy Zou, Mantas Mazeika, Dawn Song, and Jacob Steinhardt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:07.663478Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:f06bda824e7095c82bf6b225ba2dabcb7390ce773225b8f9767c489ad95755b6","observation_id":"a16ed031-f900-4199-8887-d64ba2551741","resolution":{"observed_at":"2026-08-07T10:19:07.663478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-07T10:19:07.787573Z","title":"MiniCPM: Unveiling the potential of small language models with scalable training strategies.CoRR, abs/2404.06395,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:07.787573Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:eb7f92d4fa3d462cdb5b0072ac9bbd840058dd6cb2b2f0ccb4b81467796a071a","observation_id":"3fd57e70-35bd-4eca-a815-f60b6b26379c","resolution":{"observed_at":"2026-08-07T10:19:07.787573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-10T03:07:35.408836Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T10:19:07.880725Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code.arXiv preprint arXiv:2403.07974,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:07.880725Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:5eb7f966151499819f49040d719fb83eac3f011f606fcae3947c6a9fe360d2e1","observation_id":"2d0cfd26-094f-4b46-89d4-b83703665267","resolution":{"observed_at":"2026-08-07T10:19:07.880725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03637","last_updated":"2024-10-28T01:29:04Z","snapshot_observed_at":"2026-07-06T18:26:10.408035Z","submitted_at":"2024-06-05T22:17:47Z","title":"Style Mixture of Experts for Expressive Text-To-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03637","snapshot_observed_at":"2026-08-07T10:19:07.960917Z","title":"Style mixture of experts for expressive text-to-speech synthesis.arXiv preprint arXiv:2406.03637,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:07.960917Z"},"links":{"cited_paper":"/paper/2406.03637","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:3274bbcf3779b0b84b5ec94da181e86c49afcfc04263468e09753f8fb2526db3","observation_id":"4698fee8-303f-49a7-8c53-e933f36d40fe","resolution":{"observed_at":"2026-08-07T10:19:07.960917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-07T10:19:08.097824Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:08.097824Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:2ed9be0b9f7208ea33e3df28efc6e6769782fd778fcf045562aacd9506eb2923","observation_id":"f86bd160-19ff-4530-b1d6-2534e72d62a6","resolution":{"observed_at":"2026-08-07T10:19:08.097824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:08.319176Z","title":"URLhttps://doi.org/10.1162/tacl a 00276","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:08.319176Z"},"links":{"citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:5b74e27dd6312894eb903f1ed0549b1ce2cdc6ae0d7f4e0f83bb6510a5143b08","observation_id":"5a3de6e9-767f-451e-a3a5-718ee58beeb3","resolution":{"observed_at":"2026-08-07T10:19:08.319176Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-08-04T18:52:19.083847Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-08-07T10:19:08.400230Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese.CoRR, abs/2306.09212,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:08.400230Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:001027b0e8e79561973e36f7cbcc13209e1afee9fd0e5883cddf83769f656be6","observation_id":"2c9352a6-200d-43b2-8bf1-6ccd7310f589","resolution":{"observed_at":"2026-08-07T10:19:08.400230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-07T10:19:08.514551Z","title":"From crowdsourced data to high-quality benchmarks: Arena-hard and benchbuilder pipeline.arXiv preprint arXiv:2406.11939,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:08.514551Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:43332b9cef7fe709d3b57d74510faa04926913feae9666af9e65f85b072c77bd","observation_id":"ea5670b8-aafe-413c-89de-390a86bd6947","resolution":{"observed_at":"2026-08-07T10:19:08.514551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:14.269760Z","title":"A coordinated tiling and batching framework for efficient GEMM on gpus","venue":null,"work_id":"045ae9d3-d5a2-4d75-9599-ed78f59aadf8","year":2019},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:08.637720Z"},"links":{"citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:2d7ec3958a0547ba6459e557a138ac2fd9cb0585ab5d86511eb23226d79642f5","observation_id":"b125ddbb-6f4d-44d5-8f15-a1a3eb7d7ef8","resolution":{"observed_at":"2026-08-07T10:19:14.410380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:08.722169Z","title":"URLhttps://doi.org/10.1145/3293883.3295734","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:08.722169Z"},"links":{"citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:267a9d4bc0ef011c27cb5b55384858e140eeaa5d16b2056aeb9058f3c3b3a7c1","observation_id":"15cae609-7370-44d3-b397-353c30ac1352","resolution":{"observed_at":"2026-08-07T10:19:08.722169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06450","last_updated":"2024-08-12T18:59:13Z","snapshot_observed_at":"2026-08-07T08:27:28.863794Z","submitted_at":"2024-08-12T18:59:13Z","title":"Evaluating Language Models for Efficient Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06450","snapshot_observed_at":"2026-08-07T10:19:08.859635Z","title":"Evaluating language models for efficient code generation.arXiv preprint arXiv:2408.06450, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:08.859635Z"},"links":{"cited_paper":"/paper/2408.06450","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:9bb75581a96236ce2e2f459846595b93839af92ffd0c98f01579796676a724c0","observation_id":"8527008f-023f-43a9-bbdc-fe0330356534","resolution":{"observed_at":"2026-08-07T10:19:08.859635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:13.974589Z","title":"American invitational mathematics examination - aime","venue":null,"work_id":"a9302107-fa49-4bd9-b756-16e568a145b0","year":2024},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:08.996594Z"},"links":{"citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:0e5041c8379d18859812127b0c4d07dea1c3a99cd0c2ef84419ff9cb46ad930b","observation_id":"9a816d02-a227-46da-b469-98334aa45ca4","resolution":{"observed_at":"2026-08-07T10:19:14.138644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-07T10:19:09.100923Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:09.100923Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:31d77b9478896387447ad8aa9f0eb02e2558a8863f74b28f3ba80dc2153dbe40","observation_id":"de4206f7-58c5-4b9b-881c-f4cbb172ddd2","resolution":{"observed_at":"2026-08-07T10:19:09.100923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:13.669263Z","title":null,"venue":null,"work_id":"b3d15f39-d8bf-40ca-a1a7-0ebb69364a95","year":2016},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:09.191769Z"},"links":{"citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:e05fe741483e3087f7c2a07eeec630b21d89978261115436071485a7962a902f","observation_id":"2c1639d7-5a84-4d64-984c-650507aab5d5","resolution":{"observed_at":"2026-08-07T10:19:13.844193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-07T10:19:09.404970Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:09.404970Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:8fc2cbda2498d077e02c836d2db39919b1e4bd3706573f1abc8dbf4be243d2fe","observation_id":"199f002f-1d8a-42ba-ad1c-186077619a80","resolution":{"observed_at":"2026-08-07T10:19:09.404970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-07T10:19:09.508961Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:09.508961Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:d8f2c491c8f8d955231c6e5e6a201eb850be4d039683d268d270689408900b31","observation_id":"08225807-ecd9-41ec-ac8d-8bc2997c788b","resolution":{"observed_at":"2026-08-07T10:19:09.508961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-07T10:19:09.613113Z","title":"Glu variants improve transformer.arXiv preprint arXiv:2002.05202,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:09.613113Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:236b6e9a4b4a3008620fc89db3358a396ebe8006ce7c9d36af629f469829e10a","observation_id":"22c20e23-6217-4f49-9916-af3bbdd70b5e","resolution":{"observed_at":"2026-08-07T10:19:09.613113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16040","last_updated":"2025-02-27T05:38:14Z","snapshot_observed_at":"2026-08-10T08:51:58.823427Z","submitted_at":"2024-09-24T12:42:18Z","title":"Time-MoE: Billion-Scale Time Series Foundation Models with Mixture of Experts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16040","snapshot_observed_at":"2026-08-07T10:19:09.708715Z","title":"Time-moe: Billion-scale time series foundation models with mixture of experts.arXiv preprint arXiv:2409.16040,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:09.708715Z"},"links":{"cited_paper":"/paper/2409.16040","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:c5cb7bb807ede9ac50ba26e83903f57e7262eda58799fa595848fc1525071185","observation_id":"8e802fe5-4bee-4ec8-8294-0adb838c78f0","resolution":{"observed_at":"2026-08-07T10:19:09.708715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14739","last_updated":"2025-03-28T15:21:44Z","snapshot_observed_at":"2026-07-29T21:41:16.650188Z","submitted_at":"2025-02-20T17:05:58Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14739","snapshot_observed_at":"2026-08-07T10:19:09.796174Z","title":"Junfeng Tian, Rui Wang, Cong Li, Yudong Zhou, Jun Liu, and Jun Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:09.796174Z"},"links":{"cited_paper":"/paper/2502.14739","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:c17e0826cf716c2400c5665eb7ae5317bfceaba9105b6755f57af292ea36b1de","observation_id":"bf8e0a40-cfe6-4325-a704-9ce7aabcf641","resolution":{"observed_at":"2026-08-07T10:19:09.796174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15664","last_updated":"2024-08-28T09:31:09Z","snapshot_observed_at":"2026-08-03T02:22:36.564849Z","submitted_at":"2024-08-28T09:31:09Z","title":"Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15664","snapshot_observed_at":"2026-08-07T10:19:09.918457Z","title":"Auxiliary-loss-free load balancing strategy for mixture-of-experts.CoRR, abs/2408.15664, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:09.918457Z"},"links":{"cited_paper":"/paper/2408.15664","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:0633ff8c714856d5270811f0363f7700a6841eba820313b627764c7ec9159102","observation_id":"55ab1894-7d2e-4258-b98e-5c51dfda6149","resolution":{"observed_at":"2026-08-07T10:19:09.918457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14322","last_updated":"2023-10-16T18:43:25Z","snapshot_observed_at":"2026-08-09T17:02:30.910087Z","submitted_at":"2023-09-25T17:48:51Z","title":"Small-scale proxies for large-scale Transformer training instabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14322","snapshot_observed_at":"2026-08-07T10:19:10.005263Z","title":"Small-scale proxies for large-scale transformer training instabilities.arXiv preprint arXiv:2309.14322,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:10.005263Z"},"links":{"cited_paper":"/paper/2309.14322","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:94b04b98faf2f904dca86f21fc8bc65ff5f0af9c59ff06af73c48afd55671a2a","observation_id":"7e91f080-f5b3-4684-b3c8-6d239717794d","resolution":{"observed_at":"2026-08-07T10:19:10.005263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:13.428688Z","title":null,"venue":null,"work_id":"3c28b462-80b4-4acd-837e-e7b66d2d2e33","year":2020},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:10.133246Z"},"links":{"citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:5b8123ba2ca43461bbad3cb376b4e5c095a2571754ad4830d98768a96ea42230","observation_id":"f6f260a1-5374-492f-8e19-a98e7802c536","resolution":{"observed_at":"2026-08-07T10:19:13.557576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T10:19:10.230548Z","title":"URL https://doi.org/10.18653/v1/2020.coling-main.419","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:10.230548Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:ee1a92cebfee6403064f4f3a550805a83ccefd81b254086d911e53d02cb34f7a","observation_id":"4b98e07d-91b7-4e71-9c15-9aaaa0bc664a","resolution":{"observed_at":"2026-08-07T10:19:10.230548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-07T10:19:10.371013Z","title":"Gated linear attention transformers with hardware-efficient training.arXiv preprint arXiv:2312.06635,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:10.371013Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:67708efc6aa48e0f320d052639f01d903f1cc7809a7d969b3f2114cebd759072","observation_id":"b12a93e3-f33a-4404-8e35-4a89b11d0ae5","resolution":{"observed_at":"2026-08-07T10:19:10.371013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11227-022-04336-3","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"URL https://doi.org/10.1 007/s11227-022-04336-3","venue":"The Journal of Supercomputing","work_id":"18d11d4a-088e-45ca-827a-475e10f622ae","year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:10.501473Z"},"links":{"citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:427986b2c04c702f25e697f66e880c43d1ec1b6fb061b507b18534fa492c1184","observation_id":"a7fda504-eadb-42b7-8e76-ddf51d6378c0","resolution":{"observed_at":"2026-08-07T10:19:11.727351Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:10.610267Z","title":"URLhttps://doi.org/10.18653/v1/p19-1472","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:10.610267Z"},"links":{"citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:28abec4c743c6bde2228ea93d736710b7b242d7010cdabb14ddf16d6ba1715ca","observation_id":"331151e7-c28b-4bb6-8c64-409cd28eb5db","resolution":{"observed_at":"2026-08-07T10:19:10.610267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:10.726181Z","title":"URL https://doi.org/10.110 9/HPCC-DSS-SmartCity-DependSys57074.2022.00143","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:10.726181Z"},"links":{"citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:7ce7c5a96211a1c6bc0c878f94a208bf3fa139d91f21d36381029f0253870ad4","observation_id":"d32dcfcc-79c2-42d9-be34-be6939a940d3","resolution":{"observed_at":"2026-08-07T10:19:10.726181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-07T10:19:10.836071Z","title":"URL https://doi.org/10.48550/arXiv.2304","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:10.836071Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:e2905041833a81f46d4166531aa6b2f0d744ec757d359918bc2d148163bbbb74","observation_id":"075b5f16-5f97-4571-9558-5dd63cd38c43","resolution":{"observed_at":"2026-08-07T10:19:10.836071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-07-31T19:00:59.311189Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-08-07T10:19:10.967462Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:10.967462Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:68c134dbd077c7beec43936a23278194e1368c7674817bb8dbb7dc3ea665b58f","observation_id":"36f3b8fb-9001-4088-a469-8b4a76f468b4","resolution":{"observed_at":"2026-08-07T10:19:10.967462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:13.136197Z","title":null,"venue":null,"work_id":"ad468860-e66f-4043-9dca-0955f681cf0d","year":2016},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:11.114730Z"},"links":{"citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:3dc42e1b791e93f4853b987b1a1c591c61c0c29388c762ba031eac37cbb98ea6","observation_id":"9949bfc3-4dfc-4637-8b6a-808984fff756","resolution":{"observed_at":"2026-08-07T10:19:13.259574Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:12.789147Z","title":null,"venue":null,"work_id":"2ac8e385-9c51-4736-8716-f7644a05a154","year":2021},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:11.233108Z"},"links":{"citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:71f6800fed80491246721c084898a808c65b087c9719c4a1131533f319ebb6fc","observation_id":"875f7de0-8f14-4d20-bc44-a8f2e8d682d7","resolution":{"observed_at":"2026-08-07T10:19:12.948136Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:12.532969Z","title":"The process involves the following steps: First, we apply the same text standardization as in the Identity Removal step","venue":null,"work_id":"56e4d1db-a93d-41c9-8a15-d32fba5e98cb","year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:11.339416Z"},"links":{"citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:6e37009b2d38efc5641e6c34ce07ed7eaa2603c3153b3102a4b511efe86e3276","observation_id":"4d45c2e5-1bde-4045-b290-efc0c8da941a","resolution":{"observed_at":"2026-08-07T10:19:12.633492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:12.276583Z","title":"Quality ModelThe quality model performs comprehensive multidimensional analysis to evaluate and score training samples (Qwen, 2024a; Penedo et al., 2024)","venue":null,"work_id":"e030ff9f-2874-49e1-bedf-046b60b29ca0","year":2024},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:11.474503Z"},"links":{"citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:4fa964304c33972fb8709f5b0522852d3ce5caeb6a059314552c2143b1d738ce","observation_id":"c14e087c-596b-4339-8e96-85cebb7c55f8","resolution":{"observed_at":"2026-08-07T10:19:12.411623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-07T10:19:09.316387Z","title":"URL https://doi.org/10.1 8653/v1/p16-1144","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:09.316387Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:e0175b4214c7bf5f24d9edbca2dc969c80d0a83b05841e67374c4ca75917b870","observation_id":"d0d39a29-5d2a-4235-a516-9c5f3ff028cd","resolution":{"observed_at":"2026-08-07T10:19:09.316387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03651","last_updated":"2016-12-12T12:51:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-12-12T12:51:03Z","title":"FastText.zip: Compressing text classification models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03651","snapshot_observed_at":"2026-08-07T10:19:08.184227Z","title":"doi: 10.18653/v1/P17-1147","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:08.184227Z"},"links":{"cited_paper":"/paper/1612.03651","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:61ff02de136722565c1ad9bb8958c95d42a0251f5ed36fb2e876575ce457308b","observation_id":"07f4b476-928e-4ab7-affc-42a1d274c0a0","resolution":{"observed_at":"2026-08-07T10:19:08.184227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T10:19:06.683520Z","title":"Training verifiers to solve math word problems.CoRR, abs/2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:06.683520Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:ccfd848f5ab440ce192d212448ffa0aa047f6d2e57d8798c4ddca411ca2aede5","observation_id":"229d4982-e67f-457b-ad3a-b22830717b8a","resolution":{"observed_at":"2026-08-07T10:19:06.683520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T10:19:07.140808Z","title":"URL https://doi.org/10.18653/v1/ n19-1246","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:07.140808Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:036c6ed2ca608115bedf8c7990b0421e80d33b7fe4e7f079d8534b91575b328c","observation_id":"4d21e61d-1cd5-4a46-a56e-4df876624cdc","resolution":{"observed_at":"2026-08-07T10:19:07.140808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:06.257959Z","title":"URL https://doi.org/10.1609/aaai.v34i05.6239","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:06.257959Z"},"links":{"citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:4b077590fe644c504fba5dc503b8870ff08e13b6dca461dc20745eb9dea91d99","observation_id":"7e046010-1d3e-4fb3-9e18-9fc4de538bc2","resolution":{"observed_at":"2026-08-07T10:19:06.257959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:14.875274Z","title":"Yonatan Bisk, Rowan Zellers, Ronan Le Bras, Jianfeng Gao, and Yejin Choi","venue":null,"work_id":"8f8df1b8-bc28-432a-9417-ab3ae682c041","year":2021},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:06.151625Z"},"links":{"citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:3a31fbe7c6beac9c0b2da4632775c6e42ec33a11df25a40d732488e40e362a5d","observation_id":"9968483b-4e90-42a4-b346-dbdfc6958140","resolution":{"observed_at":"2026-08-07T10:19:15.045180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04127","last_updated":"2025-01-10T14:31:21Z","snapshot_observed_at":"2026-08-10T20:57:23.920989Z","submitted_at":"2024-06-06T14:49:06Z","title":"Are We Done with MMLU?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04127","snapshot_observed_at":"2026-08-07T10:19:07.351743Z","title":"Are we done with mmlu?CoRR, abs/2406.04127,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:07.351743Z"},"links":{"cited_paper":"/paper/2406.04127","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:fd3dfd5ed11488998d5b34ced9570b5333b6b5600be9a2b35964787eb40f6b3c","observation_id":"694b8fdb-094f-4618-9cf5-ffb90a1578b4","resolution":{"observed_at":"2026-08-07T10:19:07.351743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:14.606232Z","title":"DROP: A reading comprehension benchmark requiring discrete reasoning over paragraphs","venue":null,"work_id":"159a50b6-7390-4dbe-bc49-08ab70ab73c7","year":2019},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:07.077446Z"},"links":{"citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:d7f0f74cd750c752ba959ea8379c1018f0c7b8579f64bfdf6bcab510ae6a2481","observation_id":"014d4ab6-34bd-4b6c-bb88-9cc54102f850","resolution":{"observed_at":"2026-08-07T10:19:14.739804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07436","last_updated":"2024-06-11T16:45:17Z","snapshot_observed_at":"2026-07-06T18:29:00.001236Z","submitted_at":"2024-06-11T16:45:17Z","title":"McEval: Massively Multilingual Code Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07436","snapshot_observed_at":"2026-08-07T10:19:06.377805Z","title":"Jianlv Chen, Shitao Xiao, Peitian Zhang, Kun Luo, Defu Lian, and Zheng Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:06.377805Z"},"links":{"cited_paper":"/paper/2406.07436","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:f2595e3921ef8bd99224a7554420404337eac41e6e04e26a1c57bdd0014e60d8","observation_id":"d6f1e018-cf6d-4687-a980-ffa9bfeed1e7","resolution":{"observed_at":"2026-08-07T10:19:06.377805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T10:19:06.055006Z","title":"Jacob Austin, Augustus Odena, Maxwell I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:06.055006Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.05767"},"observation_digest":"sha256:9a5b436cd2c16b70425fe98f61c3be1e94451fb2a4d2c6fc93865d401071994d","observation_id":"3381bbcd-06f1-4942-a951-f60497195e1f","resolution":{"observed_at":"2026-08-07T10:19:06.055006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T10:11:06.565253Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":1,"verified_fuzzy":6},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 5 inbound Pith citation observations for arXiv:2506.05767."}