{"as_of":"2026-08-13T03:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:62815d7513a9e9254034ddf75295a6d98d04ab22c17473aa8fb36a98089d0777","coverage":[{"denominator":150,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T05:36:26.207359Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":431,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:10:00.206774Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":5,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:58fdc14556856bde824c37cb66ee40efa069da433cd7d355fb01c56c24a96922","observation_id":"69f45e0c-e93f-4ca0-aed9-cb4c9eee727c","resolution":{"observed_at":"2026-05-19T20:28:39.459444Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-07-29T20:40:25.374189Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"reference_index":162,"source":"pdf_text","source_observed_at":"2026-05-13T20:18:06.304134Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2406.00515"},"observation_digest":"sha256:0b404890f909120504a01fe17116995eeb3c9351ac50d3a1db8a4c26caf8363c","observation_id":"30c646c2-6f98-4096-9bad-108a9a0e0ec9","resolution":{"observed_at":"2026-05-13T20:18:06.399220Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2406.19314","last_updated":"2025-04-18T19:36:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-27T16:47:42Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T04:48:26.303240Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2406.19314"},"observation_digest":"sha256:dd3373240e3253f4dca2cd9855faea96d5e1a48f9168aff5687c4028e5cee637","observation_id":"7f6a0545-5e4a-4332-8917-2727ccc89313","resolution":{"observed_at":"2026-05-15T04:48:26.465022Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-07-06T18:44:53.587276Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T19:45:36.337956Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2407.08608"},"observation_digest":"sha256:d2b0a8ec4ed780097b2f0f5f6f77778940ffe5757feef30c99ee849c21aca255","observation_id":"f4246301-8160-4800-bc2b-65b7431f475e","resolution":{"observed_at":"2026-05-20T19:45:36.386458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T04:42:23.297389Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2407.21787"},"observation_digest":"sha256:92630d96093127f364527e4d272134f53f6c32137e112148b572e60a60c51728","observation_id":"005f53ae-eaf7-4265-a08f-0735f7ea5834","resolution":{"observed_at":"2026-05-12T04:42:23.429350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2408.15664","last_updated":"2024-08-28T09:31:09Z","snapshot_observed_at":"2026-08-12T02:06:47.218918Z","submitted_at":"2024-08-28T09:31:09Z","title":"Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-15T12:55:26.013002Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2408.15664"},"observation_digest":"sha256:2362bf46ed9925ea5efbf0ac412225e8f62cfb0f0f988524b26031e15722591c","observation_id":"819a5a45-b23b-49e7-bcb3-582b54e075c8","resolution":{"observed_at":"2026-05-15T12:55:26.068326Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:7b4fefece94c2cc3a7897eb0970bacc57577d982cf4b0b95b13b35cac8adc826","observation_id":"29fc9b2b-188c-4ba0-b630-2c8f205a7ad6","resolution":{"observed_at":"2026-05-23T20:45:48.854973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T20:10:00.206774Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.206774Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:96d5e179891203a10ac42c7f8b07c21b90b1e1218f2428f3cac3b7a664609e00","observation_id":"7f798d6e-bf4f-47ca-b80d-96dc7b51556f","resolution":{"observed_at":"2026-08-12T20:10:00.206774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T19:43:01.833269Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-12T19:34:46.917829Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.833269Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:3a749490e8284c0d41f1ea17c119d886cd355a867f6d7738cc766c5622b3de14","observation_id":"476a60c7-8422-4d96-af61-7dabfc07b7ce","resolution":{"observed_at":"2026-08-12T19:43:01.833269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T18:51:32.185399Z","title":"Deepseek-v2: A strong, economical, and ef- ficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.185399Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:cda9a4637202bf64518bb36ff6008a6ee6c083b9caaced34589de07a8021e837","observation_id":"64169dcd-7543-40cd-b53a-7a7859339e53","resolution":{"observed_at":"2026-08-12T18:51:32.185399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T18:29:12.676620Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11532","last_updated":"2024-12-20T11:25:59Z","snapshot_observed_at":"2026-08-12T18:22:03.915425Z","submitted_at":"2024-11-18T12:41:16Z","title":"CKGFuzzer: LLM-Based Fuzz Driver Generation Enhanced By Code Knowledge Graph","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:12.676620Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.11532"},"observation_digest":"sha256:96e2366104c1d318a7616a1b25239b7a1b313e5aeb8b566766cd9fa08d27f814","observation_id":"d66f7588-e108-4fb3-babe-5fc137180918","resolution":{"observed_at":"2026-08-12T18:29:12.676620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T18:48:16.372571Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11916","last_updated":"2024-11-18T02:58:37Z","snapshot_observed_at":"2026-08-12T23:07:50.168981Z","submitted_at":"2024-11-18T02:58:37Z","title":"From Words to Structured Visuals: A Benchmark and Framework for Text-to-Diagram Generation and Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T18:48:16.372571Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.11916"},"observation_digest":"sha256:e74b0ded2fc03f2a3fc6baccb74ef8658620af62068ab3792515a8581a6abbdb","observation_id":"83969801-c87c-4964-b61e-f202f0979f00","resolution":{"observed_at":"2026-08-12T18:48:16.372571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T17:40:11.807604Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-12T17:34:16.560480Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.807604Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:fd6abf39b5331af0e535e7bcfe61c361bc113599860ae9c0b43a018032cc69b8","observation_id":"7b815b85-e9ab-4701-9624-96aa1d4dbaf3","resolution":{"observed_at":"2026-08-12T17:40:11.807604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T15:58:48.071378Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13820","last_updated":"2025-07-14T02:22:43Z","snapshot_observed_at":"2026-08-12T15:48:15.716052Z","submitted_at":"2024-11-21T03:52:41Z","title":"InstCache: A Predictive Cache for LLM Serving","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:58:48.071378Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.13820"},"observation_digest":"sha256:a71316deec01bcccb3ffbb7d237fcd07fcd9a89e2517331033f17ac3d52b6003","observation_id":"c1e4f6b5-10d6-4f12-8071-c0bb3b1d3877","resolution":{"observed_at":"2026-08-12T15:58:48.071378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T15:23:21.613312Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14299","last_updated":"2025-03-23T15:39:58Z","snapshot_observed_at":"2026-08-12T15:17:34.696891Z","submitted_at":"2024-11-21T16:50:11Z","title":"Masala-CHAI: A Large-Scale SPICE Netlist Dataset for Analog Circuits by Harnessing AI","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:23:21.613312Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.14299"},"observation_digest":"sha256:98abdc7827d0d70df6dddfd846984bd5accac437d19c5f988738a05286a4fd78","observation_id":"5e2aa33b-0680-4a83-b178-c13104739de5","resolution":{"observed_at":"2026-08-12T15:23:21.613312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T15:24:14.314647Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14519","last_updated":"2025-04-01T17:59:17Z","snapshot_observed_at":"2026-08-13T00:41:37.897865Z","submitted_at":"2024-11-21T16:45:43Z","title":"Tra-MoE: Learning Trajectory Prediction Model from Multiple Domains for Adaptive Policy Conditioning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:24:14.314647Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.14519"},"observation_digest":"sha256:937e398c73e160910282c5154a9018779fcd1b0a5b616a03ddfb619057203a77","observation_id":"1830ac7e-5fec-42f3-aa80-44318e9a7f4e","resolution":{"observed_at":"2026-08-12T15:24:14.314647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T14:16:47.407167Z","title":"arXiv e-prints arXiv:2405.04434 (May 2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15491","last_updated":"2024-11-23T08:24:15Z","snapshot_observed_at":"2026-08-12T14:11:47.532876Z","submitted_at":"2024-11-23T08:24:15Z","title":"Traditional Chinese Medicine Case Analysis System for High-Level Semantic Abstraction: Optimized with Prompt and RAG","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:16:47.407167Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.15491"},"observation_digest":"sha256:63a37b11ee43c55b5e5ea51f304776003638bd0513c0032ecd6ee94b8ad5bb8a","observation_id":"fc9b9737-2fcb-4270-85f3-f079faa7112e","resolution":{"observed_at":"2026-08-12T14:16:47.407167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T14:02:38.854212Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15708","last_updated":"2024-11-24T04:26:04Z","snapshot_observed_at":"2026-08-12T13:57:13.449673Z","submitted_at":"2024-11-24T04:26:04Z","title":"LLaMA-MoE v2: Exploring Sparsity of LLaMA from Perspective of Mixture-of-Experts with Post-Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T14:02:38.854212Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.15708"},"observation_digest":"sha256:8ca9b16242eb0446d8c4496ba87b728f27ae6d977029f9c980565e172ba45068","observation_id":"dcda7819-e101-42bc-a016-a0a466e36dce","resolution":{"observed_at":"2026-08-12T14:02:38.854212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T13:53:07.360731Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15871","last_updated":"2024-11-24T15:15:46Z","snapshot_observed_at":"2026-08-12T13:45:17.347725Z","submitted_at":"2024-11-24T15:15:46Z","title":"Hiding Communication Cost in Distributed LLM Training via Micro-batch Co-execution","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:07.360731Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.15871"},"observation_digest":"sha256:aa0ce76dfe99569e2c8443ea15cf7ab637ad9a7ca3e2eee2f4de0e648f65e8d5","observation_id":"be961e9a-07a7-40ec-8c96-0e20a6df2852","resolution":{"observed_at":"2026-08-12T13:53:07.360731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T13:49:22.443566Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15891","last_updated":"2024-11-24T15:57:53Z","snapshot_observed_at":"2026-08-12T13:44:15.959040Z","submitted_at":"2024-11-24T15:57:53Z","title":"From Laws to Motivation: Guiding Exploration through Law-Based Reasoning and Rewards","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T13:49:22.443566Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.15891"},"observation_digest":"sha256:c67401f37c9e580fe491a697f2c48a1e761b53929a5a00b11662989d5de34b09","observation_id":"936a3f44-63da-45ab-8f05-074f56abeed3","resolution":{"observed_at":"2026-08-12T13:49:22.443566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T13:36:43.906039Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16102","last_updated":"2026-06-05T23:07:54Z","snapshot_observed_at":"2026-08-12T13:30:40.765063Z","submitted_at":"2024-11-25T05:24:53Z","title":"BlendServe: Optimizing Offline Inference for Auto-regressive Large Models with Resource-aware Batching","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:43.906039Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.16102"},"observation_digest":"sha256:945c0f3da386b0f779bf3899dd7b421edbc2259bc7e034b482f664ce3ffbd4f0","observation_id":"8eb31719-7604-4112-aecb-66e81e67e924","resolution":{"observed_at":"2026-08-12T13:36:43.906039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T13:19:49.548111Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16341","last_updated":"2024-11-25T12:37:07Z","snapshot_observed_at":"2026-08-12T15:39:47.794835Z","submitted_at":"2024-11-25T12:37:07Z","title":"From CISC to RISC: language-model guided assembly transpilation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-12T13:19:49.548111Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.16341"},"observation_digest":"sha256:23f3f15af53e62cf8347e4f45e13547af28e81a40d6a9f4c406de65b18320979","observation_id":"9fe4c1fb-76cf-435f-b423-bab0dc224dc5","resolution":{"observed_at":"2026-08-12T13:19:49.548111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T13:16:38.284845Z","title":") Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16365","last_updated":"2025-05-23T14:05:39Z","snapshot_observed_at":"2026-08-12T19:40:15.663490Z","submitted_at":"2024-11-25T13:20:19Z","title":"Multi-modal Retrieval Augmented Multi-modal Generation: Datasets, Evaluation Metrics and Strong Baselines","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T13:16:38.284845Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.16365"},"observation_digest":"sha256:d7d05500c03433a58efe9587eaa53e5c44ebf22e10faa2cf55cc40f665fdb3b7","observation_id":"5de252b6-756c-4638-89d1-0ed458182e27","resolution":{"observed_at":"2026-08-12T13:16:38.284845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T12:13:55.179499Z","title":"48550/arXiv.2405.04434","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-12T23:27:49.741019Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.179499Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:6d506ea304a6832cbf4fa3f896703e094bcffed635b3d1f448b9ea50283404a7","observation_id":"ced3d7ac-354d-4ae5-8102-0cd4742e08dd","resolution":{"observed_at":"2026-08-12T12:13:55.179499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T12:13:55.243241Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-12T23:27:49.741019Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.243241Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:ec518f59b9edb965be6d5f529fd26e76e8b501907f5ec18c1c3a9482a77cfc60","observation_id":"ed97d7b7-c440-456b-8930-945c2dd856c0","resolution":{"observed_at":"2026-08-12T12:13:55.243241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T14:53:26.080230Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17732","last_updated":"2025-02-27T16:05:40Z","snapshot_observed_at":"2026-08-12T21:00:19.709493Z","submitted_at":"2024-11-22T11:18:26Z","title":"CheckMate: LLM-Powered Approximate Intermittent Computing","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:53:26.080230Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.17732"},"observation_digest":"sha256:804a4fb0acc5c2fe9435e98afde84f59491094c1288875f3968188f8da98b8d1","observation_id":"c4e34c8c-0d60-4e6d-be5b-a520734ca693","resolution":{"observed_at":"2026-08-12T14:53:26.080230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T10:57:22.845501Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18797","last_updated":"2025-06-30T17:45:54Z","snapshot_observed_at":"2026-08-12T12:17:05.839919Z","submitted_at":"2024-11-27T22:46:08Z","title":"SEUF: Is Unlearning One Expert Enough for Mixture-of-Experts LLMs?","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T10:57:22.845501Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.18797"},"observation_digest":"sha256:14d010c455f36af80870bda8224e67078c9bfdcebb64190a52537c181d51255e","observation_id":"593b19d8-e4eb-4572-9463-5f4c6b4afb31","resolution":{"observed_at":"2026-08-12T10:57:22.845501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T11:05:46.868872Z","title":"ISBN 978-1-939133-34-2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00099","last_updated":"2025-06-24T09:27:46Z","snapshot_observed_at":"2026-08-12T10:57:38.977146Z","submitted_at":"2024-11-27T18:59:48Z","title":"Mixture of Cache-Conditional Experts for Efficient Mobile Device Inference","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T11:05:46.868872Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.00099"},"observation_digest":"sha256:e3eb5baf8dacc1d805f73bc2f6cca8fef362f03c14c56225a2a4062688f3795b","observation_id":"f38e194c-d62f-41c8-a5a4-215fa8e5eac0","resolution":{"observed_at":"2026-08-12T11:05:46.868872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T05:09:47.733693Z","title":"Zhang, Hanwei Xu, Hao Yang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00722","last_updated":"2024-12-01T08:10:04Z","snapshot_observed_at":"2026-08-12T22:44:31.954757Z","submitted_at":"2024-12-01T08:10:04Z","title":"Towards Adaptive Mechanism Activation in Language Agent","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T05:09:47.733693Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.00722"},"observation_digest":"sha256:1aded75bb2c64b75d431a16762f43e2f8aaf1dacccd24deee57d9fed92d36777","observation_id":"ae8baa3f-74bd-410d-84d2-f59578610929","resolution":{"observed_at":"2026-08-12T05:09:47.733693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T04:34:12.075538Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of- experts language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01253","last_updated":"2025-01-22T15:09:58Z","snapshot_observed_at":"2026-08-12T16:05:49.469455Z","submitted_at":"2024-12-02T08:22:56Z","title":"Yi-Lightning Technical Report","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:34:12.075538Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.01253"},"observation_digest":"sha256:3c42563d0bab7622af4f7eb8203222f339689833087f48a7069c7e12954fabc6","observation_id":"836485a9-f86c-4bb0-894b-ede0812430d5","resolution":{"observed_at":"2026-08-12T04:34:12.075538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T04:24:48.807586Z","title":"Zhang, Hanwei Xu, Hao Yang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01523","last_updated":"2025-02-11T07:31:03Z","snapshot_observed_at":"2026-08-12T04:15:35.789939Z","submitted_at":"2024-12-02T14:16:03Z","title":"FlexSP: Accelerating Large Language Model Training via Flexible Sequence Parallelism","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:24:48.807586Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.01523"},"observation_digest":"sha256:41befd99fe05475863a01a59b3b03e070c0960b8045429c3a63dc8c0f244c4c2","observation_id":"97adbfeb-aef9-4d28-973e-33d255b53012","resolution":{"observed_at":"2026-08-12T04:24:48.807586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T23:46:02.050262Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.050262Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:5b2b0d48b5ebc145b5e2effcdf2c6eb11c99170e726bf3bd8889b372de0f5580","observation_id":"f33968a4-7f52-4a65-8c53-7783935bb369","resolution":{"observed_at":"2026-08-11T23:46:02.050262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T22:51:12.138949Z","title":"Deepseek-v2: A strong, economical, and effi- cient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03131","last_updated":"2025-08-30T09:35:22Z","snapshot_observed_at":"2026-08-13T01:41:56.495059Z","submitted_at":"2024-12-04T08:51:23Z","title":"DiffKV: Differentiated Memory Management for Large Language Models with Parallel KV Compaction","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:12.138949Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.03131"},"observation_digest":"sha256:44a408f12fa3ba3f78ac496a6341b9d1bdcc93dc8c2c00b06135c7af3b2a382b","observation_id":"839629ed-f3af-48db-93f0-345442fd0851","resolution":{"observed_at":"2026-08-11T22:51:12.138949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T22:48:22.404833Z","title":"DeepSeek-V2 : A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-12T06:33:00.047253Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.404833Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:f127a510a170e6e70e1cc45723089e412ea6ac797cdfb268d222b4ca9284f523","observation_id":"e92aa4d9-474d-4f0c-9bc9-6f4ec3430183","resolution":{"observed_at":"2026-08-11T22:48:22.404833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T21:56:12.064452Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04003","last_updated":"2024-12-05T09:26:58Z","snapshot_observed_at":"2026-08-12T12:12:51.576056Z","submitted_at":"2024-12-05T09:26:58Z","title":"Marco-LLM: Bridging Languages via Massive Multilingual Training for Cross-Lingual Enhancement","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T21:56:12.064452Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.04003"},"observation_digest":"sha256:8a9673e72a1be6b690cbb7ae4119b852a808e041444fc1a6555e5424b48357c1","observation_id":"116d738e-abe0-4088-a56b-ba41f9d8362d","resolution":{"observed_at":"2026-08-11T21:56:12.064452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T21:16:05.172128Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04856","last_updated":"2024-12-06T08:48:49Z","snapshot_observed_at":"2026-08-11T21:10:26.988149Z","submitted_at":"2024-12-06T08:48:49Z","title":"Can Large Language Models Effectively Process and Execute Financial Trading Instructions?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:16:05.172128Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.04856"},"observation_digest":"sha256:f0e7283a314652d103c0a6475a8d0050f8e9ebe7443f78c98f55113f4b0c76e7","observation_id":"9e65f076-5237-4001-b76d-4f6aa739ba71","resolution":{"observed_at":"2026-08-11T21:16:05.172128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T21:11:39.158881Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04964","last_updated":"2024-12-11T13:27:00Z","snapshot_observed_at":"2026-08-12T17:43:09.512024Z","submitted_at":"2024-12-06T11:29:32Z","title":"Flash Communication: Reducing Tensor Parallelization Bottleneck for Fast Large Language Model Inference","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T21:11:39.158881Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.04964"},"observation_digest":"sha256:64592813a68ebaafebb2fb7d3971517564cce61696f5f2ac526f048a36a36fe5","observation_id":"b5d7a32c-1d43-4e5a-bc5c-31496e5db9f8","resolution":{"observed_at":"2026-08-11T21:11:39.158881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T20:32:31.609654Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05679","last_updated":"2024-12-10T02:23:30Z","snapshot_observed_at":"2026-08-12T05:19:12.753205Z","submitted_at":"2024-12-07T15:11:21Z","title":"RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of Experts","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T20:32:31.609654Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.05679"},"observation_digest":"sha256:a18dfc72321960b87a74587f812713407131fabc1542701229d03bf2b6659981","observation_id":"cfd63bb6-096a-47a6-903f-f137a0032516","resolution":{"observed_at":"2026-08-11T20:32:31.609654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T19:11:06.149976Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07171","last_updated":"2024-12-10T04:09:29Z","snapshot_observed_at":"2026-08-13T03:06:27.932223Z","submitted_at":"2024-12-10T04:09:29Z","title":"Breaking the Stage Barrier: A Novel Single-Stage Approach to Long Context Extension for Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T19:11:06.149976Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.07171"},"observation_digest":"sha256:ce7beb325b48de0f9b8f036d8c3070b5efdf9cc556a902a9a455c030129c3abd","observation_id":"0df3854e-ffd8-4a08-8f13-9f1bd4153b3c","resolution":{"observed_at":"2026-08-11T19:11:06.149976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T18:20:55.793098Z","title":"arXiv:2405.04434","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08054","last_updated":"2024-12-11T03:00:24Z","snapshot_observed_at":"2026-08-11T18:13:56.952484Z","submitted_at":"2024-12-11T03:00:24Z","title":"Federated In-Context LLM Agent Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T18:20:55.793098Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.08054"},"observation_digest":"sha256:0fb4c9c8283d1ddd4be6b6745959a32bdad73fe331dfd999bd59ae926c7eb9aa","observation_id":"6aecb592-5ef2-4213-ad46-45b5c9a348e5","resolution":{"observed_at":"2026-08-11T18:20:55.793098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T18:19:43.718312Z","title":"Deepseek-v2: A strong, economical, and efficient mixture- of-experts language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08069","last_updated":"2024-12-11T03:31:36Z","snapshot_observed_at":"2026-08-13T02:35:06.079396Z","submitted_at":"2024-12-11T03:31:36Z","title":"DialogAgent: An Auto-engagement Agent for Code Question Answering Data Production","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T18:19:43.718312Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.08069"},"observation_digest":"sha256:6ac8abec2ced031395e54422f577cb07a4947399d655ef0eecfb7230d40a1389","observation_id":"238a6e9d-fc4a-49c8-a83d-c40f645908ab","resolution":{"observed_at":"2026-08-11T18:19:43.718312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T17:25:31.416649Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09041","last_updated":"2025-06-20T10:28:15Z","snapshot_observed_at":"2026-08-12T20:39:15.426812Z","submitted_at":"2024-12-12T08:07:26Z","title":"Towards Wireless Native Big AI Model: The Mission and Approach Differ From Large Language Model","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.416649Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.09041"},"observation_digest":"sha256:70f9148b31a3d220892a5897593e4c0039d057ffbf09140eeaec39128751cdba","observation_id":"a72d15b6-fd72-471e-a51d-cf82ec857e32","resolution":{"observed_at":"2026-08-11T17:25:31.416649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-11T10:09:21.542356Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.10302"},"observation_digest":"sha256:14d245d4b14f5b8ce1da2a74285810ab62cade5bc41b234e20307ebaa85d7c51","observation_id":"4e555fa4-3e94-4e0a-aedf-7c0794b6d997","resolution":{"observed_at":"2026-05-11T10:09:24.100402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T16:14:05.889712Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-11T15:55:28.350866Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.889712Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:211dac6047fc132f09fdb8fa6216f8980254f86ba8ce55e0823d81b9a951cf71","observation_id":"c225df22-e0e7-48de-b586-3e2de20edeba","resolution":{"observed_at":"2026-08-11T16:14:05.889712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T15:47:21.261517Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10675","last_updated":"2024-12-14T04:23:14Z","snapshot_observed_at":"2026-08-12T17:09:21.532255Z","submitted_at":"2024-12-14T04:23:14Z","title":"Chasing Progress, Not Perfection: Revisiting Strategies for End-to-End LLM Plan Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T15:47:21.261517Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.10675"},"observation_digest":"sha256:4e36efa710f1d13424e6031115e900f32775425f9d6979b57d7f6cf425ac3b5d","observation_id":"e4ea3613-51e5-455d-a2ae-f5df95c7c7f1","resolution":{"observed_at":"2026-08-11T15:47:21.261517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T15:22:54.486451Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11068","last_updated":"2024-12-15T05:57:36Z","snapshot_observed_at":"2026-08-11T15:17:43.918984Z","submitted_at":"2024-12-15T05:57:36Z","title":"RecSys Arena: Pair-wise Recommender System Evaluation with Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:22:54.486451Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.11068"},"observation_digest":"sha256:e9ff402ea5b00bb9dee1c3632ccecea480fadfccbffeb8ecf081769f38af914b","observation_id":"4a1cdf2d-9a12-4467-a7eb-c2723f1a61f5","resolution":{"observed_at":"2026-08-11T15:22:54.486451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T00:03:53.674982Z","title":"Zhang, Hanwei Xu, Hao Yang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12121","last_updated":"2024-12-02T22:10:38Z","snapshot_observed_at":"2026-08-12T11:59:38.796745Z","submitted_at":"2024-12-02T22:10:38Z","title":"NLLG Quarterly arXiv Report 09/24: What are the most influential current AI Papers?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:03:53.674982Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.12121"},"observation_digest":"sha256:0920c06fd14b0a440bbdc17ac07cf7a040374ba9ecadc6306661374b2000f266","observation_id":"13349e22-1b1b-41c2-bf16-26644b466d81","resolution":{"observed_at":"2026-08-12T00:03:53.674982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T13:52:48.727805Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12706","last_updated":"2025-02-20T12:14:49Z","snapshot_observed_at":"2026-08-11T13:47:03.201260Z","submitted_at":"2024-12-17T09:20:31Z","title":"More Tokens, Lower Precision: Towards the Optimal Token-Precision Trade-off in KV Cache Compression","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:48.727805Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.12706"},"observation_digest":"sha256:946ea90bc2ee1b9d15d0f55022c1603404b79f208d9bb9aaebf4d09134e161f4","observation_id":"47f656c3-4bbf-4ead-b092-3adb7a000df4","resolution":{"observed_at":"2026-08-11T13:52:48.727805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T12:56:04.296341Z","title":"Liu et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13693","last_updated":"2025-02-05T09:11:45Z","snapshot_observed_at":"2026-08-12T01:49:31.560394Z","submitted_at":"2024-12-18T10:33:55Z","title":"UITrans: Seamless UI Translation from Android to HarmonyOS","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T12:56:04.296341Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.13693"},"observation_digest":"sha256:9dc3196ef38ea3c8589427c59259e2999fe3e0a6d2642ecbbb425db8ea1e3057","observation_id":"d3b4ac8c-239c-47d9-9d40-2a17a8fa8cc8","resolution":{"observed_at":"2026-08-11T12:56:04.296341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T14:36:49.580244Z","title":"Pass\" (if all the requirements of the instruction are met) or","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.14203","last_updated":"2024-12-16T14:34:02Z","snapshot_observed_at":"2026-08-11T14:30:40.335911Z","submitted_at":"2024-12-16T14:34:02Z","title":"BlenderLLM: Training Large Language Models for Computer-Aided Design with Self-improvement","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:49.580244Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.14203"},"observation_digest":"sha256:395afcf1a8d76eab457ecda76e2f3d5ae536b7830876f2f0b0a801b972093d58","observation_id":"136fcb09-72cc-46bb-addc-de82990e8d10","resolution":{"observed_at":"2026-08-11T14:36:49.580244Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T11:40:52.519401Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15151","last_updated":"2025-02-13T11:37:45Z","snapshot_observed_at":"2026-08-11T11:32:35.459573Z","submitted_at":"2024-12-19T18:28:41Z","title":"Language Models as Continuous Self-Evolving Data Engineers","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:52.519401Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.15151"},"observation_digest":"sha256:2ab1bd12e310e5ae522978160664f91226c7ce2e6787866ae737d0c079984449","observation_id":"e4a18125-189f-4c47-ae75-7b88649711c7","resolution":{"observed_at":"2026-08-11T11:40:52.519401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T05:39:29.897006Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17315","last_updated":"2024-12-23T06:17:11Z","snapshot_observed_at":"2026-08-13T01:39:48.155951Z","submitted_at":"2024-12-23T06:17:11Z","title":"CodeV: Issue Resolving with Visual Data","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T05:39:29.897006Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.17315"},"observation_digest":"sha256:1cebd6f5be9d62e0d7b9a9fc74efad3fd87624a917637f8a8b945f2352557200","observation_id":"172557b3-2085-4393-afdb-a81242135a36","resolution":{"observed_at":"2026-08-11T05:39:29.897006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T05:32:29.407130Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17483","last_updated":"2024-12-23T11:24:04Z","snapshot_observed_at":"2026-08-11T05:24:53.793874Z","submitted_at":"2024-12-23T11:24:04Z","title":"A Silver Bullet or a Compromise for Full Attention? A Comprehensive Study of Gist Token-based Context Compression","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:29.407130Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.17483"},"observation_digest":"sha256:dbea7de25b40629b36d48e3717694a9d31d77a7c72f6e463ecee87f1d113e163","observation_id":"6b76e7ab-593f-46ea-a41d-0730763377ac","resolution":{"observed_at":"2026-08-11T05:32:29.407130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T05:17:55.563036Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-12T12:17:10.115397Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.563036Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:0c5096d54a4f8142fdf45616554576952d8b2bac340cc40853a56616a4d0b6cf","observation_id":"bc5c1223-b083-41f4-94d7-3c48f1089703","resolution":{"observed_at":"2026-08-11T05:17:55.563036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T05:13:07.193694Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17758","last_updated":"2024-12-23T18:14:36Z","snapshot_observed_at":"2026-08-11T05:07:23.606679Z","submitted_at":"2024-12-23T18:14:36Z","title":"In Case You Missed It: ARC 'Challenge' Is Not That Challenging","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T05:13:07.193694Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.17758"},"observation_digest":"sha256:49191735caf33625d4dbf2fda487c86bef134d5f626feac38c1f27df668f4a3f","observation_id":"7c3a3da0-9b7e-444b-9ea7-9e5134f53ad8","resolution":{"observed_at":"2026-08-11T05:13:07.193694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T00:55:03.802359Z","title":"Zhang, Hanwei Xu, Hao Yang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.802359Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:9a5bc80e76c803a1000481e4824e9aecfed1853beb554fabd419a876547aba80","observation_id":"db60e678-aaca-40c2-8c99-d91446af1d55","resolution":{"observed_at":"2026-08-11T00:55:03.802359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T00:38:46.341796Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-11T00:33:34.388194Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T00:38:46.341796Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.19442"},"observation_digest":"sha256:8c21ae577c313f356fbcc73aabae446bfd4a8c4f6344ee05c6559c392b50e7e4","observation_id":"73a20849-83dc-4539-b7f4-56290923b57d","resolution":{"observed_at":"2026-08-11T00:38:46.341796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T23:42:30.572122Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20024","last_updated":"2025-01-06T04:34:16Z","snapshot_observed_at":"2026-08-10T23:36:23.613263Z","submitted_at":"2024-12-28T05:01:26Z","title":"BaiJia: A Large-Scale Role-Playing Agent Corpus of Chinese Historical Characters","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:42:30.572122Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.20024"},"observation_digest":"sha256:5166dba759ada920ac39a3ed255177c3de93b1d6f82c915e91c55c1574c61dfb","observation_id":"f8202b31-bbbc-4914-9ae9-4795852d7478","resolution":{"observed_at":"2026-08-10T23:42:30.572122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T23:19:23.028493Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.028493Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:00a519db7afb2ccd1b314b0480e70d840f24e0a3f6b6ff3896902244194f20ec","observation_id":"a489ebb9-8328-4c56-8ea7-5a33c9091de7","resolution":{"observed_at":"2026-08-10T23:19:23.028493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T23:13:15.096585Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20787","last_updated":"2025-01-06T07:22:50Z","snapshot_observed_at":"2026-08-10T23:08:48.164917Z","submitted_at":"2024-12-30T08:11:54Z","title":"SecBench: A Comprehensive Multi-Dimensional Benchmarking Dataset for LLMs in Cybersecurity","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:13:15.096585Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.20787"},"observation_digest":"sha256:e86446e81da85d5888a2d80fee1a3caa88eac14da3006ef5bcd3443b794d6ec3","observation_id":"86ee5653-5959-45a3-898e-d4776ea430f0","resolution":{"observed_at":"2026-08-10T23:13:15.096585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T23:08:26.514375Z","title":"Zhang, Hanwei Xu, Hao Yang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-11T07:44:02.683840Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:26.514375Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:1b327220936099617ccd2b2a24831ea14b0b78648d367471d748c0f36b6911a4","observation_id":"4b30ab26-4207-4482-920c-93f59be5f71e","resolution":{"observed_at":"2026-08-10T23:08:26.514375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T23:21:37.704255Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21199","last_updated":"2024-12-31T08:20:42Z","snapshot_observed_at":"2026-08-12T23:35:38.017550Z","submitted_at":"2024-12-30T18:58:58Z","title":"HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:37.704255Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.21199"},"observation_digest":"sha256:f94aca732d94cbff40c1b2783729ce4ee9f3836c507c32169fe99d4730bebb6d","observation_id":"2c5be030-5340-4c47-aee8-273f73006960","resolution":{"observed_at":"2026-08-10T23:21:37.704255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T23:04:43.035562Z","title":"& Others","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00135","last_updated":"2025-02-14T04:00:08Z","snapshot_observed_at":"2026-08-12T21:47:25.391178Z","submitted_at":"2024-12-30T20:23:10Z","title":"GroverGPT: A Large Language Model with 8 Billion Parameters for Quantum Searching","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:43.035562Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.00135"},"observation_digest":"sha256:d9ffa804484156e423da3349e20a0792e3eed6c92662369e4350858191467ec2","observation_id":"99ab6639-1f2e-4950-8bb6-cc8afdd71ba8","resolution":{"observed_at":"2026-08-10T23:04:43.035562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T22:57:16.886242Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00363","last_updated":"2025-03-21T12:52:57Z","snapshot_observed_at":"2026-08-12T13:39:29.272604Z","submitted_at":"2024-12-31T09:29:38Z","title":"SPDZCoder: Combining Expert Knowledge with LLMs for Generating Privacy-Computing Code","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:16.886242Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.00363"},"observation_digest":"sha256:389d50a5c88c73d4251a1fe72da9633bbd5c56307999de75832ae880b83b7200","observation_id":"5bcd55fe-8caf-4238-a58d-eb4da5729f18","resolution":{"observed_at":"2026-08-10T22:57:16.886242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T22:37:58.458249Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-10T22:29:13.931954Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.458249Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:0491f0f1178bcbbc4be3bb1c24a990431a196e651bee16adaa1d9bc53495f7ba","observation_id":"c23b738d-afc2-495b-97df-a64d1b3f2a41","resolution":{"observed_at":"2026-08-10T22:37:58.458249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T22:24:43.084676Z","title":"Deepseek-v2: A strong, economical, and efficient mixture- of-experts language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01702","last_updated":"2025-02-24T12:42:14Z","snapshot_observed_at":"2026-08-10T22:27:45.352221Z","submitted_at":"2025-01-03T08:55:19Z","title":"AgentRefine: Enhancing Agent Generalization through Refinement Tuning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:24:43.084676Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.01702"},"observation_digest":"sha256:5a944e62d9b38dcbe16a16eed74d0be97adddda39b3979b8b822c98bd6377918","observation_id":"ac5e5624-377a-4491-b372-b1577c3b36bb","resolution":{"observed_at":"2026-08-10T22:24:43.084676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T22:23:27.589782Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of- experts language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01834","last_updated":"2025-01-27T16:34:59Z","snapshot_observed_at":"2026-08-10T23:50:09.976570Z","submitted_at":"2025-01-03T14:38:01Z","title":"MoColl: Agent-Based Specific and General Model Collaboration for Image Captioning","version":3},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-10T22:23:27.589782Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.01834"},"observation_digest":"sha256:7422b225fbf74d913f6c691e166007b8590087aadb28b9a5650b451457fdf6f5","observation_id":"82e05187-17ee-4e58-b815-c572ab96726e","resolution":{"observed_at":"2026-08-10T22:23:27.589782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T00:08:55.809067Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01880","last_updated":"2024-12-27T14:34:37Z","snapshot_observed_at":"2026-08-10T23:57:24.296813Z","submitted_at":"2024-12-27T14:34:37Z","title":"Long Context vs. RAG for LLMs: An Evaluation and Revisits","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T00:08:55.809067Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.01880"},"observation_digest":"sha256:38740165d483937e28e8b6568e6e92c42ff5e227643643a970bf6191cc366219","observation_id":"df2668ec-012f-4a7c-a354-8112ef86a33f","resolution":{"observed_at":"2026-08-11T00:08:55.809067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T22:19:29.141016Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts 11 Instruction-Following Pruning for Large Language Models language model.arXiv preprint arXiv:2405.04434, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02086","last_updated":"2025-06-02T21:33:43Z","snapshot_observed_at":"2026-08-11T02:50:37.054387Z","submitted_at":"2025-01-03T20:19:14Z","title":"Instruction-Following Pruning for Large Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:29.141016Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.02086"},"observation_digest":"sha256:c426b0f97d3fe9fa52ec968858f81fe7bdae13636c3c073a2037ed7907eccdb9","observation_id":"c109257c-7a89-4c89-a680-499c5e8e0782","resolution":{"observed_at":"2026-08-10T22:19:29.141016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T22:18:51.167526Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02336","last_updated":"2025-01-04T17:01:30Z","snapshot_observed_at":"2026-08-11T03:27:50.986953Z","submitted_at":"2025-01-04T17:01:30Z","title":"AdaSkip: Adaptive Sublayer Skipping for Accelerating Long-Context LLM Inference","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:51.167526Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.02336"},"observation_digest":"sha256:31f70f3b0e1d2c92a20a1a3128ece25b5057da01f11cf217eeb15b700b0b3675","observation_id":"af31485e-0ef6-4a8c-a61f-2093a3400e0c","resolution":{"observed_at":"2026-08-10T22:18:51.167526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T22:10:38.414598Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02751","last_updated":"2025-01-06T03:58:31Z","snapshot_observed_at":"2026-08-10T22:03:27.105089Z","submitted_at":"2025-01-06T03:58:31Z","title":"Ultrasound-QBench: Can LLMs Aid in Quality Assessment of Ultrasound Imaging?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:38.414598Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.02751"},"observation_digest":"sha256:6f01660e5054d7d0828a307042e82222d5a744485049b7dd686b2495ec2cc771","observation_id":"37b81e57-e86d-4adc-b0ed-fe200c8079b9","resolution":{"observed_at":"2026-08-10T22:10:38.414598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T22:05:23.849608Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02863","last_updated":"2025-02-11T13:34:12Z","snapshot_observed_at":"2026-08-11T21:04:20.885205Z","submitted_at":"2025-01-06T09:10:11Z","title":"Beyond Pass or Fail: Multi-Dimensional Benchmarking of Foundation Models for Goal-based Mobile UI Navigation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:05:23.849608Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.02863"},"observation_digest":"sha256:59d6cb0538895c30ab0c8a81152c803cff19afe9a75736dc8fb7de75526d93a5","observation_id":"bb8a9ca5-6116-48e3-a3c7-ce21d45a457a","resolution":{"observed_at":"2026-08-10T22:05:23.849608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T21:49:18.983386Z","title":"Zhang, Hanwei Xu, Hao Yang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03905","last_updated":"2025-09-04T08:37:22Z","snapshot_observed_at":"2026-08-10T23:05:28.779696Z","submitted_at":"2025-01-07T16:19:40Z","title":"MixNet: A Runtime Reconfigurable Optical-Electrical Fabric for Distributed Mixture-of-Experts Training","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T21:49:18.983386Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.03905"},"observation_digest":"sha256:02d842cfe9b33fff3771914d634c82c452bafb9d173dd4de9317995e22f15a9e","observation_id":"7cfe15f4-f9c0-470e-b5f0-f969146b7861","resolution":{"observed_at":"2026-08-10T21:49:18.983386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T21:58:02.272146Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06220","last_updated":"2025-01-07T00:41:34Z","snapshot_observed_at":"2026-08-10T21:50:21.743686Z","submitted_at":"2025-01-07T00:41:34Z","title":"Powerful Design of Small Vision Transformer on CIFAR10","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:58:02.272146Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.06220"},"observation_digest":"sha256:da51bb78379f7341fbc1ee2e437936c73478419524e6cffb4dfbaceec671effd","observation_id":"cbc66737-a108-421f-a3be-43bd22820999","resolution":{"observed_at":"2026-08-10T21:58:02.272146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T20:54:02.240581Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-10T22:14:07.704280Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.240581Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:1f33fbd6237a4ac91a4240f80d1e1a7746d9f47eb9d0a914db39797a2dcdd218","observation_id":"e6119b63-645e-4fc5-aba1-bc75ed39954d","resolution":{"observed_at":"2026-08-10T20:54:02.240581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T20:33:20.559243Z","title":"DeepSeek - V2 : A Strong , Economical , and Efficient Mixture -of- Experts Language Model , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08197","last_updated":"2025-01-14T15:22:47Z","snapshot_observed_at":"2026-08-11T11:34:12.185332Z","submitted_at":"2025-01-14T15:22:47Z","title":"OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:20.559243Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.08197"},"observation_digest":"sha256:fa833374b38e47cf5749a6baa0ff5db94be4c2767920187977ffeeb471e0e4a8","observation_id":"7d8f7dc2-706e-425d-b3af-3c2f4f3db144","resolution":{"observed_at":"2026-08-10T20:33:20.559243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T19:35:21.002504Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09950","last_updated":"2025-01-17T04:26:13Z","snapshot_observed_at":"2026-08-11T02:21:26.962733Z","submitted_at":"2025-01-17T04:26:13Z","title":"Sympathy over Polarization: A Computational Discourse Analysis of Social Media Posts about the July 2024 Trump Assassination Attempt","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T19:35:21.002504Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.09950"},"observation_digest":"sha256:5b12988804b1527cd7798a8af8ad645aab205b4e82eff1337e4d3d9394782c8b","observation_id":"74bc134c-f68a-4b82-82ee-60932b2f7f89","resolution":{"observed_at":"2026-08-10T19:35:21.002504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T18:22:02.539124Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-10T18:14:26.500119Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.539124Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:6b99ea7695ea0153cc6c1a0a02d8662668ffd7641da6b2e6bf1f977d16af2563","observation_id":"d3775be2-59b5-40c0-89c5-ac32b53d0c83","resolution":{"observed_at":"2026-08-10T18:22:02.539124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T18:06:04.373098Z","title":"arXiv:2405.04434","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11599","last_updated":"2025-01-20T17:00:41Z","snapshot_observed_at":"2026-08-13T00:05:57.316054Z","submitted_at":"2025-01-20T17:00:41Z","title":"SR-FoT: A Syllogistic-Reasoning Framework of Thought for Large Language Models Tackling Knowledge-based Reasoning Tasks","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T18:06:04.373098Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.11599"},"observation_digest":"sha256:bee4beefd5c186ac501817ae69a4decc110a8504830dbbd05b00cf3831b8b133","observation_id":"d6a6b5af-4d9b-4ec7-8c9c-90751895dddf","resolution":{"observed_at":"2026-08-10T18:06:04.373098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T17:48:42.555717Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11900","last_updated":"2025-01-28T04:04:35Z","snapshot_observed_at":"2026-08-10T17:42:25.557242Z","submitted_at":"2025-01-21T05:30:20Z","title":"Panoramic Interests: Stylistic-Content Aware Personalized Headline Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T17:48:42.555717Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.11900"},"observation_digest":"sha256:c621877b3519cc1a7a0d5f9814d11fc8bdead1abd535417df51178c652127b80","observation_id":"cc3be2fc-d092-457e-a576-76e2976d1c2c","resolution":{"observed_at":"2026-08-10T17:48:42.555717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T15:42:43.981050Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13731","last_updated":"2025-01-23T15:04:22Z","snapshot_observed_at":"2026-08-11T04:10:47.517119Z","submitted_at":"2025-01-23T15:04:22Z","title":"Pseudocode-Injection Magic: Enabling LLMs to Tackle Graph Computational Tasks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:43.981050Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.13731"},"observation_digest":"sha256:dd9a7cd0ba8959a70fb0e1747bf3c87d408f4a933da06aba55697a2d46ddf2e9","observation_id":"950a6b8e-890d-4465-a941-3e9a104100a9","resolution":{"observed_at":"2026-08-10T15:42:43.981050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T18:56:37.575262Z","title":"DeepSeek-V2: A strong, economical,andefficientmixture-of-expertslanguagemodel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16352","last_updated":"2025-01-18T20:17:31Z","snapshot_observed_at":"2026-08-10T23:05:17.957362Z","submitted_at":"2025-01-18T20:17:31Z","title":"Mixture of Experts (MoE): A Big Data Perspective","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-10T18:56:37.575262Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.16352"},"observation_digest":"sha256:e2fddb01b834abd637de9e3d1a9c260b92dbec4e78b194d905e4fe9ff21aa3be","observation_id":"a76af209-837b-4033-9eb1-9254dcff67e5","resolution":{"observed_at":"2026-08-10T18:56:37.575262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T00:43:28.964120Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-11T23:20:55.965204Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.964120Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:1b2edf06203045ab826a87bdaeb31103d39e7c18bd0ec70f96841df1ae7058b6","observation_id":"9dffec26-ad04-42ff-8152-7cac27223013","resolution":{"observed_at":"2026-08-10T00:43:28.964120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-09T18:46:51.047168Z","title":"Zhang, Hanwei Xu, Hao Yang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00527","last_updated":"2026-06-05T09:55:33Z","snapshot_observed_at":"2026-08-09T18:37:46.718097Z","submitted_at":"2025-02-01T18:59:03Z","title":"PolarQuant: Leveraging Polar Transformation for Efficient Key Cache Quantization and Decoding Acceleration","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T18:46:51.047168Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.00527"},"observation_digest":"sha256:58c11c1f8103d452ce083420d099a56648866ee06ca7783a031e2b6c7cae5e19","observation_id":"d2f18128-890d-4c80-8908-13c4a6f87e8f","resolution":{"observed_at":"2026-08-09T18:46:51.047168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-09T16:10:24.931071Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01243","last_updated":"2025-02-03T11:04:51Z","snapshot_observed_at":"2026-08-13T01:27:40.549720Z","submitted_at":"2025-02-03T11:04:51Z","title":"OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T16:10:24.931071Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.01243"},"observation_digest":"sha256:04e3b7cf87b8bb23056edb571049eecc9da3677f4b49f49391c73fba1880f319","observation_id":"7071e68a-a6a1-400c-b327-0df162bf3b31","resolution":{"observed_at":"2026-08-09T16:10:24.931071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-09T18:19:21.016100Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:21.016100Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:add2a6eae1823e039f4daed34bb3ab4561f3c29c32ff3ea12a81f1d30b3260ec","observation_id":"377ae90a-b793-43db-9794-e3700844ad21","resolution":{"observed_at":"2026-08-09T18:19:21.016100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-09T11:01:27.638350Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02827","last_updated":"2025-02-05T02:08:51Z","snapshot_observed_at":"2026-08-10T20:20:35.770726Z","submitted_at":"2025-02-05T02:08:51Z","title":"COFFE: A Code Efficiency Benchmark for Code Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T11:01:27.638350Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.02827"},"observation_digest":"sha256:42d1a8f53f2d9eee35f188a0f7f8b07630766fba8771d18a3666854592e8684f","observation_id":"2558f0b6-7fca-402f-a2b0-af24642dc7cf","resolution":{"observed_at":"2026-08-09T11:01:27.638350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-09T00:48:08.500927Z","title":"Zhang, Hanwei Xu, Hao Yang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03784","last_updated":"2025-02-06T05:17:12Z","snapshot_observed_at":"2026-08-09T00:42:51.908739Z","submitted_at":"2025-02-06T05:17:12Z","title":"GistVis: Automatic Generation of Word-scale Visualizations from Data-rich Documents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T00:48:08.500927Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.03784"},"observation_digest":"sha256:e2cc8f1222edde0c6fd3d153487df6e6af34c7705bdd746fc14a4c8cb3beb3a3","observation_id":"8d1ce5d2-9612-4ef2-98cb-35b4a89334a5","resolution":{"observed_at":"2026-08-09T00:48:08.500927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-08T14:50:58.756577Z","title":"Zhang, Hanwei Xu, Hao Yang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06635","last_updated":"2025-02-13T07:31:55Z","snapshot_observed_at":"2026-08-09T03:32:09.083141Z","submitted_at":"2025-02-10T16:31:37Z","title":"Steel-LLM:From Scratch to Open Source -- A Personal Journey in Building a Chinese-Centric LLM","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T14:50:58.756577Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.06635"},"observation_digest":"sha256:7d4770a21244cbe2a124b93b09b91d95bea37d116c4dae0520a707fba191a4a5","observation_id":"e836b4a3-3e60-4d92-ba62-c69efb74df8a","resolution":{"observed_at":"2026-08-08T14:50:58.756577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-08T17:55:53.994050Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:53.994050Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:5603841f8783187993c4b541a0b3ab6d9b81fc84194341cf8814b2e1fdcafc19","observation_id":"3f1b0cd1-8d68-490a-884a-4d81a6bd0aa5","resolution":{"observed_at":"2026-08-08T17:55:53.994050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-08T13:11:51.555174Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07316","last_updated":"2025-05-21T13:38:27Z","snapshot_observed_at":"2026-08-10T03:48:50.081958Z","submitted_at":"2025-02-11T07:26:50Z","title":"CodeI/O: Condensing Reasoning Patterns via Code Input-Output Prediction","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T13:11:51.555174Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.07316"},"observation_digest":"sha256:170019eba2bde595dc5e4e7614452ba4d277cce900473cb909d055b9bbc64d7c","observation_id":"ae3c64e5-41b6-4ea1-b54c-9c533c2c8c2c","resolution":{"observed_at":"2026-08-08T13:11:51.555174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-08T12:59:38.687594Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of- experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07846","last_updated":"2025-02-11T09:51:25Z","snapshot_observed_at":"2026-08-08T12:49:23.882573Z","submitted_at":"2025-02-11T09:51:25Z","title":"Memory Analysis on the Training Course of DeepSeek Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T12:59:38.687594Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.07846"},"observation_digest":"sha256:4c5bfea706230299a59ec70579c2a18889ca689b775e2d1b0a52bb0d087d52fe","observation_id":"4c0eb8d3-4657-462d-9d52-f98af83a59b4","resolution":{"observed_at":"2026-08-08T12:59:38.687594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-08T11:48:01.162895Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07864","last_updated":"2025-06-12T11:45:57Z","snapshot_observed_at":"2026-08-10T11:58:20.177769Z","submitted_at":"2025-02-11T18:20:18Z","title":"TransMLA: Multi-Head Latent Attention Is All You Need","version":5},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T11:48:01.162895Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.07864"},"observation_digest":"sha256:87e7a982c56a83ddeebd292518466f7f706efe6599a127fd5cb72a9acec55e63","observation_id":"d8363b8c-7845-4cd3-a8ea-02c502c0c98e","resolution":{"observed_at":"2026-08-08T11:48:01.162895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-08T04:54:01.830167Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08507","last_updated":"2025-02-12T15:41:43Z","snapshot_observed_at":"2026-08-09T23:48:26.672324Z","submitted_at":"2025-02-12T15:41:43Z","title":"Explanation based In-Context Demonstrations Retrieval for Multilingual Grammatical Error Correction","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:01.830167Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.08507"},"observation_digest":"sha256:773ae81cb25e5531cfe08e9557a4fb2b1136d14d6629a007c218e2b9dd428461","observation_id":"80d2a90f-0307-4119-bded-4c4af08d5431","resolution":{"observed_at":"2026-08-08T04:54:01.830167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T23:48:00.855639Z","title":"Zhang, Hanwei Xu, Hao Yang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08773","last_updated":"2025-07-22T15:27:33Z","snapshot_observed_at":"2026-08-08T01:13:01.972942Z","submitted_at":"2025-02-12T20:30:28Z","title":"Universal Model Routing for Efficient LLM Inference","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T23:48:00.855639Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.08773"},"observation_digest":"sha256:423a4f51e02ece0f3a0505ce0edc3bfc6aced672b45c1f4e714c2ded1a06cfff","observation_id":"f315a9ca-f5f2-485d-a0d1-0ab920c721ea","resolution":{"observed_at":"2026-08-07T23:48:00.855639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T23:19:37.811005Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-10T09:14:28.107387Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.811005Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:fe27a84d7d12935ea777241209cd5929f0f103bab2168effdc2baf37a44e6c98","observation_id":"3545b50a-5b7b-4782-8228-be7689c494c1","resolution":{"observed_at":"2026-08-07T23:19:37.811005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T22:19:19.351787Z","title":"Zhang, Hanwei Xu, Hao Yang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-10T00:33:36.413668Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.351787Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:1018427a8183e0b5df852480b4a1392221590b03fdf11cee0c6902458d1e5da1","observation_id":"00e310b6-3e27-4074-b52c-906ae8674f8a","resolution":{"observed_at":"2026-08-07T22:19:19.351787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T20:15:14.070781Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09888","last_updated":"2025-08-28T01:40:30Z","snapshot_observed_at":"2026-08-07T20:07:17.154568Z","submitted_at":"2025-02-14T03:25:09Z","title":"Climber: Toward Efficient Scaling Laws for Large Recommendation Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T20:15:14.070781Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.09888"},"observation_digest":"sha256:24c093a47b549f26f3fd2707b397d8b05b42db6853b43e6dedd47b1e7404444e","observation_id":"fea2f38a-a783-4d78-96f7-373c093114c6","resolution":{"observed_at":"2026-08-07T20:15:14.070781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-07T14:17:15.942844Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-16T23:46:29.975858Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.11089"},"observation_digest":"sha256:eee96168b8e25fb52f059425820f00705eb96629eeacbc8fcd213f43ad9946fc","observation_id":"b8f2a7ec-b82b-440f-8e1d-3fed18c87108","resolution":{"observed_at":"2026-05-16T23:46:30.032182Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T22:34:08.058138Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.12170","last_updated":"2025-05-28T12:57:47Z","snapshot_observed_at":"2026-08-07T23:11:12.819339Z","submitted_at":"2025-02-13T10:26:27Z","title":"MUDDFormer: Breaking Residual Bottlenecks in Transformers via Multiway Dynamic Dense Connections","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T22:34:08.058138Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.12170"},"observation_digest":"sha256:f862ddc3cd8b4f2bfe6ff548b3b123a407e8e4eefc57977f52f57087369e7c40","observation_id":"85c2f796-d36f-44bb-8a1a-21c61db8f5e2","resolution":{"observed_at":"2026-08-07T22:34:08.058138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.04434/citation-record","integrity":"/paper/2405.04434/integrity","json":"/paper/2405.04434/citation-record.json","paper":"/paper/2405.04434"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama 3 model card","venue":null,"work_id":"008d23c2-07d0-4784-a704-56521d627c6b","year":2024},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:449c2eed424f9d27b40f7e6b8c6a544ca9fba77f38860180911e572a46966415","observation_id":"944e2709-9885-415d-a193-0c6e364518da","resolution":{"observed_at":"2026-05-11T05:36:27.279750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing Claude","venue":null,"work_id":"2fb5bf54-38ba-478b-b07c-a6aa36421caf","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:3a12c0d8a4f0da99d3268bc3c72b731783e08b17a228796be90efcd7fa88c41b","observation_id":"d24f057b-ebf7-44bd-92b2-c88a53efb6c3","resolution":{"observed_at":"2026-05-11T05:36:27.292283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:8aa47f68b81faa9b6e9af9c2ab3b4bb3cd6dfdc9aa871dbb6fa1b5c2dad792be","observation_id":"0b4d7b31-7be9-435f-bf76-02761533340a","resolution":{"observed_at":"2026-05-11T05:36:26.993658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-12T06:03:03.703202Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":"2401.06066","doi":"10.48550/arxiv.2401.06066","metadata_source":"pith","pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","venue":"cs.CL","work_id":"a9888d6d-bf47-4324-9834-7cc12ac3a78c","year":2024},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:9cb9021e10e7f9aa0b50b4dee5af74530b640ac75fd7e38a5ddbdefa74ae281d","observation_id":"4086f8d8-ed30-4bb6-a04f-b87b6be6a561","resolution":{"observed_at":"2026-05-11T22:50:20.439308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"571162b3-cda9-4125-b3d2-5904014985c1","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:ad02830208f7d2fa23b0470c70e35228f1aec795dde8ff93e19e433862fd8a26","observation_id":"344e9eae-3bdd-46b0-a244-ed55c48ddaa6","resolution":{"observed_at":"2026-05-11T05:36:27.300498Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-10T17:03:38.042994Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":"2401.02954","doi":"10.48550/arxiv.2401.02954","metadata_source":"pith","pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","venue":"cs.CL","work_id":"01b10587-025b-499d-8ba3-7a538d24c2d6","year":2024},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:e4cb51b094395fa7da5df281b0288ef9905f894929b412db62fc532c425c3f22","observation_id":"96908b73-98f0-492f-8f0c-6b23e1a08d19","resolution":{"observed_at":"2026-05-11T06:08:06.759074Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-08-11T09:09:15.043235Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":"2101.03961","doi":"10.1214/18-ejs1395","metadata_source":"pith","pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","venue":"cs.LG","work_id":"f43c4955-a965-4897-a11b-c4b25d2aeaa8","year":2021},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:9234e97298017a959f5ddaeeb24a9c1dd7aee5839cf0ce6adb1f139dc56ceb45","observation_id":"ef25b505-3aec-4e29-baae-758878d7d3e7","resolution":{"observed_at":"2026-05-12T23:57:11.134962Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":"2101.00027","doi":"10.1117/1.jmi.10.6.061104","metadata_source":"pith","pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","venue":"cs.CL","work_id":"9b10667a-da61-4358-aceb-10578234d45d","year":2020},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:f43057cc6da94222204a556d947c175428749921121190b09c19516f75ebadf3","observation_id":"3d03e31e-2a1c-4b25-9cb5-8ee700f0d844","resolution":{"observed_at":"2026-05-11T05:36:27.244210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing gemini: our largest and most capable ai model","venue":null,"work_id":"226f4f61-4974-4fee-9fc8-7ad2625f4ca7","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:8e46ded80a82090625d9523dfefc7c7eff6342bde034f390c1a1c1d629d6559d","observation_id":"d5e4d8bf-ae36-4be6-a637-36245066b918","resolution":{"observed_at":"2026-05-11T05:36:27.304949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9db4e057-14fb-48e0-8b0f-5e0fd24bd1ed","year":2024},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:89f53a4c0f5510949f72056297937d04ad8d68b3a64d3f0699dc59ef3ce596dd","observation_id":"dc3f1c97-9b26-467f-84f1-2c56e4027b7d","resolution":{"observed_at":"2026-05-11T05:36:27.309184Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hai-llm: 高效且轻量的大模型训练工具","venue":null,"work_id":"4e3e9f8c-771b-4ce3-b744-44f14ba88d2d","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:aaf17be611c99163102cee9320a606ba2436ce7dc105b872917fd8da4ceb1d63","observation_id":"bdeae05e-a0f6-4ad5-b841-d56d8c48998c","resolution":{"observed_at":"2026-05-11T05:36:27.313353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-11T15:28:56.572196Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:99314c6b3d0c76506200424ed98689e5a84e5bdd9f39f87ca7ca6e5e7ba71e8e","observation_id":"b6d19c84-6bc0-4145-8471-c17e03e40217","resolution":{"observed_at":"2026-05-11T05:36:26.480168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08322","last_updated":"2023-11-06T13:24:16Z","snapshot_observed_at":"2026-08-08T19:03:09.038168Z","submitted_at":"2023-05-15T03:20:19Z","title":"C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models","version":3},"cited_work":{"arxiv_id":"2305.08322","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.08322","snapshot_observed_at":"2026-07-03T20:48:56.200978Z","title":"C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models","venue":null,"work_id":"61dc95c3-d071-4ec6-9d31-ea0610192fde","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2305.08322","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:ecddb928f068390f89d1238c47fc6e24fa42093223261890cdf8c06dd5daa4b7","observation_id":"d2c283fc-0a17-4ec6-9904-b77b004536b1","resolution":{"observed_at":"2026-05-11T05:36:27.180015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1f316ec8-142d-4b38-80a2-1aeb5ff2b52e","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:3644aa58e9cdb5b9327aa24e4c7195ab67b64835cfd6b1c92f642fd5ae603a9a","observation_id":"a2cdc000-6e7d-4212-9592-b9a058011bda","resolution":{"observed_at":"2026-05-11T05:36:27.323385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lepikhin, H","venue":null,"work_id":"d610f251-a6e5-40a0-af1f-946e0e1cda49","year":2021},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:853956a659b3977388428cfc33e7b640107ab0114b2353417dc36eab3ad3d5cb","observation_id":"d3bd00e7-d85d-40f6-8ebf-5d92140d32d2","resolution":{"observed_at":"2026-05-11T05:36:27.330832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-08-04T18:52:19.083847Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":"2306.09212","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-06-29T19:43:55.030793Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","venue":"cs.CL","work_id":"30c9ec62-1af0-4f30-94b4-d1ef163eff71","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:4d45fed8ca3a691e62b727c29f2a70e714aaef252c882a680b7b7c02905bfa7b","observation_id":"04265ffe-e7a5-4734-8d3f-de4c5c7f9c34","resolution":{"observed_at":"2026-05-16T21:01:11.049549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4775641f-328a-443b-818d-6b026d796f21","year":2021},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:424f79a53a4140d3304335a30518dabdfb2d775d1d1f7d7d7d497d40fd72c1db","observation_id":"2d280c8b-1874-4aa5-b644-3ac0b629051c","resolution":{"observed_at":"2026-05-11T05:36:27.338391Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cheaper, better, faster, stronger: Continuing to push the frontier of ai and making it accessible to all","venue":null,"work_id":"f3743dbe-1656-4110-8390-72ba0141370d","year":2024},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:200527f10f547d9e39a7d4412c950d8def2d905230460d0354681c45240d85fc","observation_id":"53571ff3-e138-4594-b644-bb15a90a1bf4","resolution":{"observed_at":"2026-05-11T05:36:27.343169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing ChatGPT","venue":null,"work_id":"3c7a426a-9e81-4f33-b175-26805dd21297","year":2022},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:ff5d9b331dac98e4e5112d3c5ab0746350f86635c043d06ea6ed471bec23d05c","observation_id":"aeb3ac18-747d-46b9-b40e-790f1a9e076b","resolution":{"observed_at":"2026-05-11T05:36:27.347040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:4dc764bf0ca82f43aad350cc1e63ff69b4128c86da104a31f7d09b8c9bc9708b","observation_id":"49e6a07a-77a9-4260-8f4b-9ff7c384fd00","resolution":{"observed_at":"2026-05-11T05:36:27.001721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ouyang, J","venue":null,"work_id":"4e2488ce-c291-4ded-aac9-78d8bc82da71","year":2022},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:890c13a73e2ace8f82771ba02b71a86fec05d481b4aebd0688aedbfd12c81760","observation_id":"8f7baefc-2620-41dc-a4b0-bc34b81c9421","resolution":{"observed_at":"2026-05-11T05:36:27.351179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rajbhandari, J","venue":null,"work_id":"0bcf6e98-f6bc-4e1d-94b1-def7bab58d2a","year":2020},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:7d1359be22a719cf7f6184dd44a0200044b1dde413c6ef8d991cef6359e23fff","observation_id":"3d869ecb-9f7c-4d69-a960-5970ff095217","resolution":{"observed_at":"2026-05-11T05:36:27.358281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Riquelme, J","venue":null,"work_id":"f85e2d94-0ff7-4ec8-bbf7-e803c59f8870","year":2021},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:139597b67aa1f896c9dbdbdc1091ab0be5eb0dd461638f24464d6b6aeaffffef","observation_id":"479535a2-023f-4628-b1d3-0ff138afe6f2","resolution":{"observed_at":"2026-05-11T05:36:27.362583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sakaguchi, R","venue":null,"work_id":"3f2f4970-c8b7-4e4d-87e1-b310541b2d59","year":2019},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:6793ba3975e23655bf53748b3387840eb0218afba2aa7422de9821eccda77459","observation_id":"c86154ed-fd88-420d-a570-976f0aad53f1","resolution":{"observed_at":"2026-05-11T05:36:27.366755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":"1911.02150","doi":"10.48550/arxiv.1911.02150","metadata_source":"pith","pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","venue":"cs.NE","work_id":"160ea164-b1d4-4adb-8ccb-a4655d8a0bb4","year":2019},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:dde6b3172c9a959caa4784250073277e5406d9861a6d942b3f695d33f7ac70d1","observation_id":"4e883403-25c9-4fc8-a2af-19cb1add8cfa","resolution":{"observed_at":"2026-05-11T05:36:26.710392Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shazeer, A","venue":null,"work_id":"b849bc71-9c4f-4abb-a9a6-a71b43a62395","year":2017},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:4503cefdcde20d81ecbbe4a4bcd84b843a7e4c1be7d2a4de0297ff95b1d5036e","observation_id":"55539873-c0a8-4081-a92e-cdfc5685b185","resolution":{"observed_at":"2026-05-11T05:36:27.370849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:24:33.034867Z","title":null,"venue":null,"work_id":"40bedb13-7999-496e-8c6c-375d58d8f9a8","year":2024},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:0c58646c18ff8c444c6dc4d7cfcc556fedaa77b389e840da1d24a1be10043d29","observation_id":"4881d738-2bb2-439f-8aea-ab08d670a168","resolution":{"observed_at":"2026-05-11T05:36:27.374627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"322c2c93-5c2d-48ed-8ec5-726182fe2b81","year":2019},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:92f95e20d758fc0dc884531f0eca491d4e2571e70867838bfe628e5fdba5e381","observation_id":"478b12d8-2347-4e75-8b23-d8849a8419ab","resolution":{"observed_at":"2026-05-11T05:36:27.380630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vaswani, N","venue":null,"work_id":"1ba6e4b7-8434-4bc3-9f0b-d6b184f6ae24","year":2017},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:22cb4cfcaa192fc40b2170ecc7c39e1a444fa9d08e8efde9c22ab9a6181d99fb","observation_id":"88c45b90-055d-412a-ab31-cca9c7459dd7","resolution":{"observed_at":"2026-05-11T05:36:27.384763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"172b6929-d07a-4d97-bd0d-426563462b74","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:6dc7b9e6a6b4595a80d60dc8109e08dc2fded70848efcd869d593d01d3d0218d","observation_id":"18a412c8-19c2-4fae-9ea7-b980700f4f28","resolution":{"observed_at":"2026-05-11T05:36:27.393266Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19102","last_updated":"2024-04-16T06:08:05Z","snapshot_observed_at":"2026-08-10T12:47:07.125672Z","submitted_at":"2023-10-29T18:33:05Z","title":"Atom: Low-bit Quantization for Efficient and Accurate LLM Serving","version":3},"cited_work":{"arxiv_id":"2310.19102","doi":"10.48550/arxiv.2310.19102","metadata_source":"pith","pith_arxiv_id":"2310.19102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Atom: Low-bit quantization for efficient and accurate llm serving","venue":"cs.LG","work_id":"73affba1-cd5f-4b84-8ad9-911fddcb545a","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2310.19102","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:bf99f3d236cc50bd1072e459d40afb97886c45a8b68baba7cba8349ee4167a85","observation_id":"14b49881-a09e-490f-b4a6-f518a0782182","resolution":{"observed_at":"2026-05-11T05:36:26.468374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zheng, W.-L","venue":null,"work_id":"d4470da8-f16f-4b57-8f5a-9d159767eebe","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:5c39489d8df95fe57a20bbdfce085e6166b4e7e1256951c69f7f8fb79ef64b1e","observation_id":"41ebf1dd-bfee-4e1c-bd44-99e759ecc040","resolution":{"observed_at":"2026-05-11T05:36:27.397892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d4600be5-c059-4788-9334-ee845b8faa34","year":2024},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:32e7e5e6037a80de3f89285c5b4174a51f54b2f7195fb65854acd59461716ea8","observation_id":"682391b0-dffb-4868-9f4d-e9fca687ae1b","resolution":{"observed_at":"2026-05-11T05:36:27.405272Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10241","last_updated":"2023-11-30T10:40:34Z","snapshot_observed_at":"2026-08-11T01:03:03.533046Z","submitted_at":"2023-11-30T10:40:34Z","title":"Zero Bubble Pipeline Parallelism","version":1},"cited_work":{"arxiv_id":"2401.10241","doi":"10.48550/arxiv.2401.10241","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.10241","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2401.10241 , year=","venue":"arXiv (Cornell University)","work_id":"f195f5ef-7ae0-4a1a-9e39-50e9ed69094c","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2401.10241","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:d6cc329a2be34ddfad51de01978c2f2d6488eb329f6c003b01c090beda06f218","observation_id":"317e65dc-af55-41c5-8adf-0ae42109b8c3","resolution":{"observed_at":"2026-05-11T05:36:27.188875Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Eleventh International Conference on Learning Representations","venue":null,"work_id":"e199999e-6ab1-44f5-88d3-e18b2e35d83e","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:edc6b38c13d3eea84b387ba812659a642f0ed7aec90980e12691568a6dc2830d","observation_id":"8541ea1b-ba59-46a8-bb68-e671a41a5568","resolution":{"observed_at":"2026-05-11T05:36:27.409369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-10T03:07:35.408836Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:54b438972dfe1ec326d89fba06148981b5d16cda80dfc5109bf0f1b56500fbd6","observation_id":"b0c617b9-d3c9-4073-acef-6be678b541c4","resolution":{"observed_at":"2026-05-11T05:36:27.229249Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:08:01.568147Z","title":"Neurocomputing , volume=","venue":null,"work_id":"0cfd4ae7-837c-4c4f-bf6d-afc10f5a8ed1","year":2024},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:532b1acbfbbd6541a9c04af3956d496334c58964a76ba42439b1d3a336c4fa74","observation_id":"0618f57f-7314-4262-9980-4221ca783e0e","resolution":{"observed_at":"2026-05-11T05:36:27.412948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":"2305.13245","doi":"10.48550/arxiv.2305.13245","metadata_source":"pith","pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","venue":"cs.CL","work_id":"b73ad5b2-e553-4c71-b0c9-67e67ba7b158","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:377a35e6004d87fedd717c1253a402856bd8de1ff7be818cc26d05436f678504","observation_id":"d816655a-0995-4b58-abc9-dc07541da7b8","resolution":{"observed_at":"2026-05-11T06:53:59.644169Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoRR , volume =","venue":null,"work_id":"d701dec3-4364-4040-86b0-7e304c1d8ed1","year":2019},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:705c0ceb0f0b58a87537ba79f83f85758c16ae9103503b433e5e5500c6eabfe0","observation_id":"b290ead9-e843-4e39-98c3-86c0e2eac066","resolution":{"observed_at":"2026-05-11T05:36:27.416901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09583","last_updated":"2025-06-04T08:58:56Z","snapshot_observed_at":"2026-08-02T06:48:43.121988Z","submitted_at":"2023-08-18T14:23:21Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","version":3},"cited_work":{"arxiv_id":"2308.09583","doi":"10.48550/arxiv.2308.09583","metadata_source":"pith","pith_arxiv_id":"2308.09583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","venue":"cs.CL","work_id":"4fc3ba2f-b615-4eef-86e5-131dc8b98389","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2308.09583","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:2d2e7cbf7aa0ad2e4198b2f9f45b2fe0df99d3acc4e69d2dfcc80a30ef6d232c","observation_id":"40f89eac-28a2-4d20-ac97-dd7be0fff70a","resolution":{"observed_at":"2026-05-17T04:00:08.752459Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17452","last_updated":"2024-02-21T12:59:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:38Z","title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":"2309.17452","doi":"10.48550/arxiv.2309.17452","metadata_source":"pith","pith_arxiv_id":"2309.17452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","venue":"cs.CL","work_id":"8534cb5e-3749-4533-bc6f-1d85f32f41c8","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2309.17452","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:6e062a79278f2fa62386253bc19a35772ca7f7af3c09d911b8d5b07c03db372e","observation_id":"b88ca59e-5972-4a83-bbdc-f694e7b59ec4","resolution":{"observed_at":"2026-05-19T09:19:36.299641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":"2211.12588","doi":"10.48550/arxiv.2211.12588","metadata_source":"pith","pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","venue":"cs.CL","work_id":"618aa44c-a6c6-425c-abce-8aa8aa842921","year":2022},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:fd3683166cdbea0b3c067b0b848adcf02f2e39bc97fd829f9057dd35642f81f7","observation_id":"2fb7a04c-ed7e-4f65-b250-3d2f3cdec9f7","resolution":{"observed_at":"2026-05-12T16:48:28.215201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning","venue":null,"work_id":"54c3694c-0bf5-4235-9d45-64bf33848a53","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:20198edce45ffab5d51ad6c753fa8b3ff9cb5e2b4e89e5895b9e68a5996910c0","observation_id":"0675cc30-f698-4f7b-a43f-2a581f81869a","resolution":{"observed_at":"2026-05-11T05:36:27.420971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chi and Quoc V","venue":null,"work_id":"e5146dbc-54b0-40cd-a84c-3d72af59c83f","year":null},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:198e56160a834d612408483f27be0d9e5cce3d3731cf532f0d594d9830f3b2eb","observation_id":"db4ceee0-d641-48ae-a308-7ea2718ef87a","resolution":{"observed_at":"2026-05-11T05:36:27.425082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.emnlp-main.392","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mishra, M","venue":null,"work_id":"3a00ca17-b63e-41fc-a851-1efd0f68d966","year":2022},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:84cd12a0ed64e1e056bce2d1c3ace281bd73ebed2debf3774bd4b1102d77c107","observation_id":"9abd2411-db74-420d-b70e-8a7cf37729b6","resolution":{"observed_at":"2026-05-11T05:36:26.552637Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-20T08:52:33.275809+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T08:52:33.275809+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05653","last_updated":"2023-10-03T02:48:42Z","snapshot_observed_at":"2026-08-07T14:43:09.380195Z","submitted_at":"2023-09-11T17:47:22Z","title":"MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2309.05653","doi":"10.48550/arxiv.2309.05653","metadata_source":"pith","pith_arxiv_id":"2309.05653","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning","venue":"cs.CL","work_id":"e74feaec-ca8a-4bdb-945e-e747355406e7","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2309.05653","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:dc1e6b8510e00b507d76a27fd6216c6b428ff6976e54f78f9d28c4d2d8acbf8b","observation_id":"287bada5-97e4-42d6-b1d8-5923cb2fc32f","resolution":{"observed_at":"2026-05-17T23:46:39.773471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12284","last_updated":"2024-05-03T17:36:07Z","snapshot_observed_at":"2026-08-02T15:00:50.388422Z","submitted_at":"2023-09-21T17:45:42Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","version":4},"cited_work":{"arxiv_id":"2309.12284","doi":"10.48550/arxiv.2309.12284","metadata_source":"pith","pith_arxiv_id":"2309.12284","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","venue":"cs.CL","work_id":"e791a2f0-3b75-4c5b-84e1-d297d96e42f0","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2309.12284","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:ab93d754e573d1df401f793f759901e32c6800df5650c9dc605ce6cf64d07644","observation_id":"71829804-8eb5-4b3b-9223-07cee86e6432","resolution":{"observed_at":"2026-05-13T10:07:53.977132Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p17-1147","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:14.489252Z","title":"TriviaQA: A large scale distantly supervised challenge dataset for reading comprehension","venue":"Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","work_id":"d05a9c57-9d88-473a-aa65-efb13f9dee25","year":2017},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:8010ef3e0839e6cb072f11bcfcf59e940869a5a89be1b1c873d849a7e7394e89","observation_id":"7378c906-8c6d-4de9-af97-616a35bed4e6","resolution":{"observed_at":"2026-05-11T05:36:26.608683Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:04.800216+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:04.800216+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:46:18.257768Z","title":"2020 , eprint=","venue":null,"work_id":"fb5e1d20-8ee9-497d-9dd8-255ad1cdabfa","year":2020},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:14f3c98219626e3ddc554b4a8718dc46c084d571033abb3b5eb3944b3e0834f3","observation_id":"70261566-b80e-4fef-9726-02fff60a1959","resolution":{"observed_at":"2026-05-11T05:36:27.431126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:57:49.142954Z","title":"OpenAI blog , volume=","venue":null,"work_id":"31dc92c3-2fc3-432b-8d63-b7ee13f53a9c","year":null},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:cce43a4271f008c88ea9269441e822203c637bfbaaf974e794883c3dca15e75e","observation_id":"d038485d-2b1e-4b96-bc55-abd63089c28a","resolution":{"observed_at":"2026-05-11T05:36:27.437350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing","venue":null,"work_id":"4e58d6c9-559a-4520-a959-5e0307a6ce13","year":null},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:70a41d47d4ff1b47dee32a463f9f43636ccdde085acd5fe3bbf99781bed02b9f","observation_id":"c72bc13f-b6c3-4325-971c-e141227ab149","resolution":{"observed_at":"2026-05-11T05:36:27.442304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a26c3e36-962c-4873-9ec9-f12aec2fee96","year":null},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:da87c57d8c83c35982d92d5e7ea908642ace892cd0a9c14a4a547d8adce695e4","observation_id":"d65b098b-36cf-4be9-a699-d52f3c935b06","resolution":{"observed_at":"2026-05-11T05:36:27.459278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:66486588dbc64074bdc0f555f5e4ecbc60a79b8de4c5c0a910116a1a8d1bc2e1","observation_id":"cfb546d7-68fa-432f-9030-7f2b14d9efae","resolution":{"observed_at":"2026-05-11T05:36:27.124128Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the International Conference for High Performance Computing, Networking, Storage and Analysis , pages=","venue":null,"work_id":"c158bfaf-23cd-49bb-9144-994e4e3e28a5","year":null},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:fea840c7bf661c6030fb9a5ef410b79b51fa720617e9f5a03d0cb8f4127bdf65","observation_id":"0bf731f7-3398-4b15-ba9f-20fd34f092d2","resolution":{"observed_at":"2026-05-11T05:36:27.464047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:42:40.394002Z","title":"Proceedings of Machine Learning and Systems , volume=","venue":null,"work_id":"b81a5a71-f57e-42f0-9a44-77664125373e","year":null},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:0a7a7d0979f7e88fb1b0603332f0dc2053be2c318ab35b8ab5ddd8f3c1b0e762","observation_id":"50a8ca04-56a5-4bca-bf0a-2cce20ac9bf8","resolution":{"observed_at":"2026-05-11T05:36:27.468292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Ermon, Stefano and Rudra, Atri and R","venue":null,"work_id":"26b2e9b3-3881-4efb-8d42-91e7b2fa79ce","year":null},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:594571b07a8c0f2d776d45108b8f0241fe254c1fa857b1e500d592348bdb01d7","observation_id":"016667a2-f55c-4825-967d-6979cdeb5702","resolution":{"observed_at":"2026-05-11T05:36:27.478514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9219edb9-a168-4792-a7a4-c4aea871d571","year":null},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:54b26427d76703309baa7df337f6f9683a3b3ca5c11c49932d2bd0e532da3fcd","observation_id":"f90584fe-b2e4-48c4-ad81-4c6fdeead012","resolution":{"observed_at":"2026-05-11T05:36:27.483727Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:06:16.697681Z","title":"Proceedings of the ACM SIGOPS 29th Symposium on Operating Systems Principles , year=","venue":null,"work_id":"9a3c3fdb-ec54-4e64-9779-63c57fad506c","year":null},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:d22cbd18b9bd45ae89bea9d1c2f390817e08da69109a0664591f362ddeddb33b","observation_id":"eb2b3c49-41cb-48ec-92c3-be4426768c99","resolution":{"observed_at":"2026-05-11T05:36:27.487859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T19:57:34.236379Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"a1fd09f1-b62b-4aca-a5ef-dd2b50ad08b5","year":null},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:f44207c0c13706be9db3b67cc8acc99b582f7043f90bbda1a34a34df40e2e056","observation_id":"2061f0fa-9d4c-478f-a403-97d8d1191444","resolution":{"observed_at":"2026-05-11T05:36:27.492048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T07:00:49.372351Z","title":"SC20: International Conference for High Performance Computing, Networking, Storage and Analysis , pages=","venue":null,"work_id":"f62f435f-90be-45ec-bdea-343bdc2734f6","year":2020},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:736b9c68d81779973891bdf0c01a26ffcc07738886d6f6a407357fd77347b9f8","observation_id":"66be332c-e772-4902-a743-b39e6230d4a1","resolution":{"observed_at":"2026-05-11T05:36:27.496480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"2831fe48-9346-454c-a37a-c8e50c31c350","year":2021},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:5d10c830bd6b47b006e78ff6b7feff9dd237054be9cbd749ae4dc324c6810317","observation_id":"d5802070-3356-4ff9-b77c-aa4bed37ef0b","resolution":{"observed_at":"2026-05-11T05:36:27.500684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2018 , eprint=","venue":null,"work_id":"4029210f-e3ba-47e3-93bd-cc9a058e6bc9","year":2018},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:d70925a2a43be74e4f30ecb7930438a5843874a86e5749760dc2974cbaec6c2c","observation_id":"343fcf88-6488-4ebd-9047-1b3d4c35e1cd","resolution":{"observed_at":"2026-05-11T05:36:27.508794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing","venue":null,"work_id":"34c4f8fb-f5dd-4bf0-b12f-c81480f1e706","year":null},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:7953912e559dab693d2bbdc321e8b328bc10b5e87a4f09b25d071ae29dfdab55","observation_id":"0d981eb2-ce8b-4065-a9ef-13549d49b813","resolution":{"observed_at":"2026-05-11T05:36:27.513065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An important next step on our","venue":null,"work_id":"bdc28798-c7bf-45c4-b2c7-ee7fc9aa9215","year":null},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:ee2cd11d715c0ae3de183078d4c5c1d62527aa69f05e7e1e11170fbc9c8cdb01","observation_id":"5884b14c-0964-4e7f-9605-29c619d00924","resolution":{"observed_at":"2026-05-11T05:36:27.517786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"97affbc2-60a3-4d77-b283-79c62ad88a5d","year":null},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:4962fb5825fb2db9e22388ac50e0653b523795821d7125b1e2702549dd19a34f","observation_id":"a59c411c-670a-43d2-a3de-b717121bc5a3","resolution":{"observed_at":"2026-05-11T05:36:27.525441Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 , eprint=","venue":null,"work_id":"491d54cf-d9d3-4586-bc89-44b177286c74","year":2019},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:13e4199ecd2dd6a335ef0a88629d84077f2b269690926af1137d47e91e256f8d","observation_id":"ff9aa778-b593-4df1-99bd-699370e17c60","resolution":{"observed_at":"2026-05-11T05:36:27.534658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d19-1600","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Span-Extraction Dataset for C hinese Machine Reading Comprehension","venue":null,"work_id":"467e9014-a56c-4571-821d-d12f08d45d1b","year":2019},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:e9e3e6db26128ca3eee39dbba4504d753827c488ca98ffe936209109a9ad1552","observation_id":"5b33bbff-cd3b-4ecd-a311-da1d912aef9f","resolution":{"observed_at":"2026-05-11T05:36:26.545356Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T23:23:28.943326+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T23:23:28.943326+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:15.093055Z","title":"2019 , eprint=","venue":null,"work_id":"c41cea26-16b5-4220-87d3-aab3dd8559ae","year":2019},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:3c4af1351af3e3a0a2fbe206652328da899641f588aa82df3307b21912abfd51","observation_id":"36b982e0-225e-479a-a912-de07da21d81c","resolution":{"observed_at":"2026-05-11T05:36:27.542354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"4509c1fb-5867-4d3b-aa87-300b279ae3b3","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:de0ed933436c57666f72c6015f9b0673ae50735bf2d56662197d585113ebe56f","observation_id":"30f3c0be-83e5-4432-b9ca-c7e92ec8c983","resolution":{"observed_at":"2026-05-11T05:36:27.550893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:0814784605f7b58641f6f815ab1e4335a19eacfb3d040f3b6b757e9db292d412","observation_id":"714815ec-0d99-4943-97fc-56a4f3841319","resolution":{"observed_at":"2026-05-11T05:36:26.890165Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":"2210.09261","doi":"10.48550/arxiv.2210.09261","metadata_source":"pith","pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","venue":"cs.CL","work_id":"513eb205-04ca-4722-9a43-a74e8cbe7e85","year":2022},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:ac86998d1226f89122963a514d236d121342fe88147781a9e2b330d998e3c13b","observation_id":"63d22337-1b03-41f1-8275-a38837e26b52","resolution":{"observed_at":"2026-05-11T07:15:24.133279Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:f84c4c203285ddc0cd0f7e6ff1b5e5920f0ac81ea6c8a36d1cce928771634d4b","observation_id":"560c8b0a-cc5e-4f39-9449-66be3d97a4e8","resolution":{"observed_at":"2026-05-11T05:36:26.902671Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.coling-main.419","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the 28th International Conference on Computational Linguistics","venue":null,"work_id":"909d6037-8e29-4abf-9cdd-e71d88927b1d","year":2020},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:3b72eb2362661779490f04f670ee92c39c7001b259ef86af1ee2b0740fff9788","observation_id":"83b24957-e578-4956-a479-88c2cc0f0c24","resolution":{"observed_at":"2026-05-11T05:36:26.650969Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4ae50f56-52e1-4bca-bdde-b98475523cfd","year":null},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:156872ee40c22ad67049212b89a4ed935af0e35635de94ed9d3818cc654dccee","observation_id":"6de569d8-e0d9-4d1f-b3f2-75b1ad34495d","resolution":{"observed_at":"2026-05-11T05:36:27.555618Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p19-1075","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, M","venue":null,"work_id":"7a844802-6f32-4144-a7a6-d5f23288e8d3","year":2019},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:2e326703d9cbb1009637b541d16ba387131943a5c0fb6d0017289d041f03aebf","observation_id":"b12aa55f-1b87-41fc-aaf1-263fcb54acb7","resolution":{"observed_at":"2026-05-11T05:36:26.677247Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d17-1082","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.18653/v1/D17-1082","venue":null,"work_id":"4e65f57b-0562-4172-b6d3-b4ea2e5e62fb","year":2017},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:dd69ad56ad8b2622abd8e57edc285c068d025da469fcfbca64f16638a65c9bb0","observation_id":"e71b0ce6-83a9-4840-b899-ab8700b35df1","resolution":{"observed_at":"2026-05-11T05:36:26.685567Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:40.495585+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:40.495585+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n19-1246","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dua, D., Wang, Y ., Dasigi, P., Stanovsky, G., Singh, S., and Gardner, M","venue":null,"work_id":"56ac41e4-5078-4307-aa88-20a9d4e90afc","year":2019},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:95fab50ee6bae18f79a9188867854995b033b435b082070a3f1e0d7d86752d04","observation_id":"173666b5-53b4-4acc-a5ff-3bc3667c1f9f","resolution":{"observed_at":"2026-05-11T05:36:26.691153Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"48b7a45b-1eea-456b-80fa-9004afe02c67","year":null},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:a73c82b4d6cb7565b12ce6ad3c6e5c91b59ccb79df7ed378e9f3b091849e3a46","observation_id":"4dde6ff6-bee7-4187-acba-68c9901b5dd0","resolution":{"observed_at":"2026-05-11T05:36:27.559634Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:ac3c371f3beb1bb5252496365d13f29007f0bd95c5574430dd1e24e4a6520fef","observation_id":"1f294b04-f991-41c0-959f-36482aea156c","resolution":{"observed_at":"2026-05-11T05:36:26.967637Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:843c56fb2683ef7c96c90d803825aff394c311fe87a75e9df8664e0da19ab28d","observation_id":"2cbea312-c172-4b03-acfb-ae8e2a6284ac","resolution":{"observed_at":"2026-05-11T05:36:26.460929Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":"2308.12950","doi":"10.48550/arxiv.2308.12950","metadata_source":"pith","pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Code Llama: Open Foundation Models for Code","venue":"cs.CL","work_id":"e73bffa4-7620-47ac-9327-259a60db52ca","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:1cd57dde47c700e64e970058e42e5ed68a417f2b085a98a98380b71df69c436a","observation_id":"41f51c55-e9b0-453c-819f-70556e88f170","resolution":{"observed_at":"2026-05-11T05:36:26.977652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:2ca1d5f9763b93f253752aaa9b36ac6c9566d2fa055b5b5424d7f411b30a2dc1","observation_id":"8bfeaf28-b990-40db-8638-a9b485640951","resolution":{"observed_at":"2026-05-11T05:36:26.986981Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"06ed269a-9ddd-47df-9a07-2b0aad3d9f42","year":null},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:9cf151c0607c13afdf14d83d345e909b48f99b85ab996f6f9f3a6e23ccb390b0","observation_id":"c009aa65-c77a-48bb-963c-b7f2bdba031e","resolution":{"observed_at":"2026-05-11T05:36:27.564098Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:c82baae4875811dcfaa3cca415dd485188460c02c2f87a642828747863d8394a","observation_id":"82f29955-ba9e-46ba-a460-84dd8ebe4ddd","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating Large Language Models Trained on Code , journal =","venue":null,"work_id":"f5e2a1fd-88be-43b6-b6c9-25d3dbcc9c0f","year":2021},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:552ece554138302b9d5045595866b64ed782e33a2dd46fe0afb7e3ed4ac200ca","observation_id":"8c6e68b6-0da3-40fc-941c-a756565d1259","resolution":{"observed_at":"2026-05-11T05:36:27.570080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"dbbc7e6f-a906-47cf-9b09-a98062ca9fbe","year":2024},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:cd7d8b1c270f894d904e939e6531e3a6e68620bb3096cd4bf809331d8f7d44ab","observation_id":"5cee350f-6357-46eb-a740-da3cc5f9225e","resolution":{"observed_at":"2026-05-11T05:36:27.574281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"aa3c4496-fa1b-4ba1-b1be-256108dc3475","year":2022},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:d64ebbc44ae9d6f96781db98995eab0888182a22c06d078530df9ce1c5866838","observation_id":"b9e18150-3dbc-467a-b6f7-b3f8566afedb","resolution":{"observed_at":"2026-05-11T05:36:27.585467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p19-1472","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:07:03.406813Z","title":"URL https:// doi.org/10.18653/v1/p19-1472","venue":"Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics","work_id":"11bfc949-547c-40f3-a86d-953eb9b2154c","year":2019},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":117,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:760029eae1b1cd2857589544ff6c59c4d5f21d2e08f5ce125f237bfd6dce0623","observation_id":"2ee2c534-a257-4a97-a595-0a26587602f2","resolution":{"observed_at":"2026-05-11T05:36:26.514140Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:05.023254+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:05.023254+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v34i05.6239","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PIQA: Reasoning about physical commonsense in natural language","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"d1a9f293-b596-42e3-b48c-112b9f9a06df","year":2020},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:6ad1f051690403720e78a611e0098f346fa308c341e88e8a0e2e166184bc44d2","observation_id":"5ebd7204-1768-462b-9731-a755fba98c26","resolution":{"observed_at":"2026-05-11T05:36:26.597352Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:05.075041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:05.075041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":119,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:f7e6db1c47adf293b74eb986ab7a431f1ef7eb26ba3f5e825418cbffcdd8ce8d","observation_id":"4540ca4b-9026-40f7-9589-4477fc2bde87","resolution":{"observed_at":"2026-05-11T05:36:27.022721Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-08-12T21:45:41.485479Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":"1904.09728","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-07-08T01:44:26.198243Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","venue":"cs.CL","work_id":"3f93670e-0ae7-40e5-bed5-74c216638dd1","year":2019},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":120,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:961e430f812cb7d7f3015ebc4df8aeab46c5350bb75cc29848256785dc8071b0","observation_id":"9d1bf0d5-a516-43b2-8646-bdaa6c670afa","resolution":{"observed_at":"2026-05-13T12:22:26.192007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12474","last_updated":"2024-02-24T15:44:21Z","snapshot_observed_at":"2026-08-08T08:58:54.609425Z","submitted_at":"2023-05-21T14:39:28Z","title":"Evaluating the Performance of Large Language Models on GAOKAO Benchmark","version":3},"cited_work":{"arxiv_id":"2305.12474","doi":"10.48550/arxiv.2305.12474","metadata_source":"pith","pith_arxiv_id":"2305.12474","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating the Performance of Large Language Models on GAOKAO Benchmark","venue":"cs.CL","work_id":"2eacfa63-8867-4a90-9bcc-52f085f33cef","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2305.12474","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:a4dcc1ede41bbb58b973e9383c1177641592e8d262c58cd6f8c19655e92c8259","observation_id":"0ec704b1-b80c-474d-926c-be559c777325","resolution":{"observed_at":"2026-05-17T12:28:32.509177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":123,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:63199c9feae70930fc1ad062ded547cbc9ebccc07865bb891a7cee10b3496bf3","observation_id":"57181a17-8dd6-48ba-9a94-0796bc8b29b7","resolution":{"observed_at":"2026-05-11T05:36:27.038705Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":"2404.06395","doi":"10.48550/arxiv.2404.06395","metadata_source":"pith","pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","venue":"cs.CL","work_id":"f20a4304-bd39-414a-923b-d18322e29258","year":2024},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:4a1efb1408302127b453c4ca56cbb718e7bd36e629086f65fc6049d08007ecd3","observation_id":"3e712cad-c768-4d53-b35f-b976c2983262","resolution":{"observed_at":"2026-05-13T18:00:53.610624Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:9727fd1754c0a9b1ef0759b4d74bd6fac8d12c4b3b82e718445b4fb0185b3e60","observation_id":"f79f2252-dc25-436a-a8b5-d51dd22c6cd7","resolution":{"observed_at":"2026-05-11T05:36:27.063417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":"2404.04475","doi":"10.48550/arxiv.2404.04475","metadata_source":"pith","pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","venue":"cs.LG","work_id":"ef25adcf-addb-445e-b3b5-858eeb9883ca","year":2024},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:c81bd6bdd203c2975a20f29890276793c6ba95697453ad0783f02dc548bc0b40","observation_id":"a5fac8ce-eebf-46ca-abde-509c7ab266a4","resolution":{"observed_at":"2026-05-12T11:13:05.519270Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":"2206.07682","doi":"10.48550/arxiv.2206.07682","metadata_source":"pith","pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emergent Abilities of Large Language Models","venue":"cs.CL","work_id":"6ea3375b-837c-4640-a175-be7525aa3c6d","year":2022},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:c81bf1d1ae240133e7273308298e5cd517bbdcaced1bce8031452b49197d385d","observation_id":"580745d5-4f8f-4a21-96e6-2086f9addc52","resolution":{"observed_at":"2026-05-11T07:38:38.557341Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-07T00:09:07.34152+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T00:09:07.34152+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n19-1300","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"B ool Q : Exploring the Surprising Difficulty of Natural Yes/No Questions","venue":null,"work_id":"b0eff16f-bbcd-4d66-a41d-d89ff07a80e5","year":2019},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":128,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:195116621c28a339469ee68b4384f1bfe50e1be2cb40e399c2f1cc5ff8fa7841","observation_id":"55e99925-3917-4306-b191-06afaafa6fc8","resolution":{"observed_at":"2026-05-11T05:36:26.628157Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-12T15:19:26.94061+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T15:19:26.94061+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":129,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:86a5b3f8e051592d659b4878955f4dcc16b868f277512ae16fe10001cd7852bd","observation_id":"51399515-0086-42fc-9421-8fb0809ba3f8","resolution":{"observed_at":"2026-05-11T05:36:27.106762Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"83cfc672-4920-4faa-8e23-5c30b4777e6f","year":null},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":130,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:942c875aac91e918e69b11d3c847f0f1bee92ad567d76f22a520c2281009224f","observation_id":"ccdd5d03-3ad5-4a11-a816-c58e3d0188b8","resolution":{"observed_at":"2026-05-11T05:36:27.590264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","latest_version":5,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":20,"parse_uncertain":1,"unresolved":13,"verified_exact":27,"verified_fuzzy":39},"total_outbound_references":150},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 150 outbound references and 100 inbound Pith citation observations for arXiv:2405.04434."}