{"as_of":"2026-08-07T19:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c721dae677bfe2fc93ff373292bd2b7e30e1bbaf78086f7f3cc080c3efd5a3c9","coverage":[{"denominator":142,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:47:40.258067Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09955/citation-record","integrity":"/paper/2507.09955/integrity","json":"/paper/2507.09955/citation-record.json","paper":"/paper/2507.09955"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T17:47:39.866977Z","title":"Deepseek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.866977Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:337259f178b832a51a0a51635b368b7c216d9fb954dae01beb028b8e27e5b28f","observation_id":"92074b83-7e64-41e9-867f-3f7a37855124","resolution":{"observed_at":"2026-08-06T17:47:39.866977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:39.918113Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.918113Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:bbe3290bba0240b20be8b5e4d8d02e823ff8fc8b7317e8ed335a7646567a515d","observation_id":"f1dc8827-3bf3-4305-b6db-a38dfb845eae","resolution":{"observed_at":"2026-08-06T17:47:39.918113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:39.968566Z","title":"China’s cheap, open AI model DeepSeek thrills scientists,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.968566Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:aa913f6da2ff2b50c6277ac5ef4b8360ca51abe03c129ba5859a9ca6b7b36dd8","observation_id":"ddb35eec-f457-4a72-8535-cdc1633a5159","resolution":{"observed_at":"2026-08-06T17:47:39.968566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:39.971862Z","title":"What to know about DeepSeek and how it is up- ending A.I. - The New York Times,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.971862Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:6c138722e17a2104e72b61306a7f79fbca88900a8bfec6a312cf8cc4c40aee2d","observation_id":"1ca8a6d7-63cb-47bc-8eae-b139caf3a9f8","resolution":{"observed_at":"2026-08-06T17:47:39.971862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:39.975132Z","title":"What is DeepSeek, and why is it causing Nvidia and other stocks to slump? - CBS News,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.975132Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:48283c487859d52250f03592a3f53107a9d3b670f2b3afb63f72378794202871","observation_id":"ec9b6116-5b32-452f-8788-10c257fde08f","resolution":{"observed_at":"2026-08-06T17:47:39.975132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:39.978543Z","title":"A brief overview of ChatGPT: The history, status quo and potential future development,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.978543Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:7a98ef3a7029c0e75ba9bee54239a5a23ffeebb3b9098b2483c6bc5aa4b24273","observation_id":"6bf67c6e-1566-4bc2-9c5e-3db0bfb0f2a6","resolution":{"observed_at":"2026-08-06T17:47:39.978543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T17:47:39.981924Z","title":"BERT: Pre- training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.981924Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:fe5047f5982a7eabdaf660204a2946490193579c3279b8dbf476706e4a9e8b3a","observation_id":"eba4530e-881a-41f6-a531-b1552c9ea905","resolution":{"observed_at":"2026-08-06T17:47:39.981924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:39.985035Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.985035Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:715b3757b7db65bc5c44757fda86c6d0127864101506b7d2328319c41b24739d","observation_id":"2b61b4bd-a087-43a4-945e-ec269b2b1b24","resolution":{"observed_at":"2026-08-06T17:47:39.985035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:39.987912Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.987912Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:4d14ee513db4e2ee265dd7ae1ed6e2aa5fce7e4a474e51b60de3d235f7362121","observation_id":"508a59c2-21f9-4c20-a3fc-0d2b40398938","resolution":{"observed_at":"2026-08-06T17:47:39.987912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:39.990600Z","title":"Pre-trained language models for text generation: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.990600Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:e9b5b1a0a7a03a35798411600406a296969db5d4411faa7e6a41c7d063be4ab3","observation_id":"02ce712d-d8bf-4ceb-92d2-05a162d081c5","resolution":{"observed_at":"2026-08-06T17:47:39.990600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:39.993254Z","title":"Recent advances in natural language processing via large pre-trained language models: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.993254Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:296b3aaeba33ac3ace971a760a5061af3cbb0b3055da6a54899a2318f13147ed","observation_id":"83795e88-4990-4172-96bd-a827f183ac0c","resolution":{"observed_at":"2026-08-06T17:47:39.993254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:39.996069Z","title":"Large language models versus natural language under- standing and generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.996069Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:8f378bb34712800af58a85333abc9314ada0b967355db0ed7a2b830150340ac9","observation_id":"3a6f7e12-ce04-448d-8bcb-ff9005580b30","resolution":{"observed_at":"2026-08-06T17:47:39.996069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:39.999322Z","title":"Application of deep belief networks for natural language understanding,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.999322Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:ee64d6554545353a2e76132f7ce9323343e4a497c703e41c2e06bc79f645c88d","observation_id":"4c7cfa2c-1b45-4230-8687-4602466361a5","resolution":{"observed_at":"2026-08-06T17:47:39.999322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.002306Z","title":"PaLM: Scal- ing language modeling with pathways,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.002306Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:ce2bb70469426c21ff95da31e3186a011e119b3d8e70ab967efbcc636155c600","observation_id":"5fdae1a1-a2f1-450e-91af-3713ab1fccc5","resolution":{"observed_at":"2026-08-06T17:47:40.002306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.005510Z","title":"Vision-enabled large language and deep learning models for image-based emotion recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.005510Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:9f0bb2ccdf7efb3d4ebcbb28c08e39e72aa71475ff1f6fb17cc98fb54afc86d2","observation_id":"519e6f24-fb65-40e1-a2c4-2f61018178a5","resolution":{"observed_at":"2026-08-06T17:47:40.005510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.008318Z","title":"A survey on deep multimodal learning for computer vision: advances, trends, applications, and datasets,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.008318Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:ca4078648341ed20b7a00f1b4b435774c8f87ca3f2be0171a5109003b1573ace","observation_id":"d017a179-eb73-4246-886b-fdd7e7dd74e9","resolution":{"observed_at":"2026-08-06T17:47:40.008318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.011232Z","title":"Deep learning models for digital image processing: A review,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.011232Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:2696b729fcb836c46ae6e6b74b7c1f2413e82aedaa5b1c90d0d1a751293c8ae1","observation_id":"deda322d-2d2c-4541-8983-a349d4bf0ecc","resolution":{"observed_at":"2026-08-06T17:47:40.011232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.014079Z","title":"AI Action Summit (10 and 11 february 2025),","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.014079Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:c2e839756c5977e8e9cf6ca3c40de19234ef0a139ded6fc20ebe67c08187e427","observation_id":"2fc1e6c6-0333-4274-b3c4-e08a81bec49c","resolution":{"observed_at":"2026-08-06T17:47:40.014079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.017311Z","title":"Can ChatGPT replace traditional KBQA models? An in-depth analysis of the question answering performance of the GPT LLM family,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.017311Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:5a6f51c2fd4de868560eedfc6364b4a0a36bfd79ed7205a98fd32f86b82d900d","observation_id":"24109014-e54a-44fe-bf46-cc24a7a7ec99","resolution":{"observed_at":"2026-08-06T17:47:40.017311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.020675Z","title":"Reasoning with large language models for medical question answering,","venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.020675Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:f534869ca81c279acad683a25843c28347499b2ab60995643da08b62c036b596","observation_id":"1f0f5a32-f24b-4004-95da-f8f49d7e4160","resolution":{"observed_at":"2026-08-06T17:47:40.020675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.024306Z","title":"Proactive conversational agents in the post-ChatGPT world,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.024306Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:965b0cf67c519ed0082cfd7606888c7b4389ce51a007d0f12459adfb82f1e6ee","observation_id":"3dd5671d-8234-4873-9d1c-963414a8d4f3","resolution":{"observed_at":"2026-08-06T17:47:40.024306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.027453Z","title":"Unlock life with a chat GPT: Integrating conversational AI with large language models into everyday lives of autistic individuals,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.027453Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:2c2ae641c0c521da08aa896e0f8416d879f6405db00ce3d3fdc6afdbb084406c","observation_id":"7a795c53-071b-4131-864c-d5ba0da1af46","resolution":{"observed_at":"2026-08-06T17:47:40.027453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.030681Z","title":"A contemporary review on chatbots, AI-powered virtual conversational agents, ChatGPT: Applications, open challenges and future research directions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.030681Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:e4baa68eca55e831eec71cbaaaa9aab4e518d002148e1ddb0e86af351aa4fbdf","observation_id":"a81e4371-5062-4a89-9e24-9881f4d81f18","resolution":{"observed_at":"2026-08-06T17:47:40.030681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.033602Z","title":"Self-collaboration code gener- ation via ChatGPT,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.033602Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:8110a27d2e3872f3d807b7526d3c6a0eac4198dbf22b770958f8469e4b563d25","observation_id":"9f2fcb8d-761d-405e-b986-e18e73fc5598","resolution":{"observed_at":"2026-08-06T17:47:40.033602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.036683Z","title":"Is your code generated by ChatGPT really correct? rigorous evaluation of large language models for code generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.036683Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:e6292255c1e8d4ad0a94315a18f90b0e790ce7ed50fed34b834ef3eece74e1c0","observation_id":"a49b61a1-00f1-4f2d-838c-2dd4b6ac04c5","resolution":{"observed_at":"2026-08-06T17:47:40.036683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T17:47:40.039690Z","title":"Gem- ini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.039690Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:e6faa1dd63b93c8a94436d27e0ea9d502a40007c63b0142dd706286c8556736b","observation_id":"9aff0331-9273-4b15-96b8-cf5ad8a720cd","resolution":{"observed_at":"2026-08-06T17:47:40.039690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.042967Z","title":"Introducing Claude 2.1,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.042967Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:90622e11bd890cb64e3f58b73f1474db672c439c5178d0aa16ed31cf303fca98","observation_id":"bd157fda-7fea-47c5-acbb-68166b010aaa","resolution":{"observed_at":"2026-08-06T17:47:40.042967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.046496Z","title":"Introducing llama 3.1: Our most capable models to date,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.046496Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:302ac202477b8dd1a8a6b2ff20a834c9caa3edd96c9c0e75df7220689393d795","observation_id":"ecb943fa-ca36-4da2-a099-bf97c0efb468","resolution":{"observed_at":"2026-08-06T17:47:40.046496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T17:47:40.049924Z","title":"Mistral 7B,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.049924Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:40776685ea61375492248631cac7b14a5caa0c04edcb6fdf6a55cdbeb91b0613","observation_id":"3133a507-f0d3-4e44-b195-d0c8dcd64725","resolution":{"observed_at":"2026-08-06T17:47:40.049924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.053192Z","title":"A comprehensive survey on transfer learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.053192Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:4edb07032ecf0a923701d10de01a9475eb7dc42cd9407274871366ebdb058cd2","observation_id":"a54af932-c4a9-4673-bdd3-d6824d564078","resolution":{"observed_at":"2026-08-06T17:47:40.053192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.056373Z","title":"Multimodal learning with transform- ers: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.056373Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:26bfb45df0da474305c931b1b3dde56605889c178a8db32e03f248b65ee55ab9","observation_id":"00d1e4ec-8184-42e7-b560-b368e6e37033","resolution":{"observed_at":"2026-08-06T17:47:40.056373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T17:47:40.059461Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.059461Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:c029144106a06c437e816422c3d421904fba6c1b4f7349ff0cb7c7dc50c3ae59","observation_id":"f2dcf991-e4c8-47ed-adaa-c9243f38109f","resolution":{"observed_at":"2026-08-06T17:47:40.059461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.063226Z","title":"DALL·E 2,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.063226Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:a511bd3694362c9b25d5e86cdb569072a3ede1eb09aefce7f211d5c8b237332b","observation_id":"7e67bb5d-6465-4742-a8b4-71d3a9b07a48","resolution":{"observed_at":"2026-08-06T17:47:40.063226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-06T17:47:40.066287Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.066287Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:e2dc8b2f9338879fef106e6c6a663d18a911d4c8f34023c29f27a2a530c04f57","observation_id":"aca591a8-f1e8-48e4-9bba-79439d258f36","resolution":{"observed_at":"2026-08-06T17:47:40.066287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.069629Z","title":"Introducing OpenAI o1,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.069629Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:3337bea51462acd3e021112849fdcb33420dfe82bb9f25d0061e373a6ba8e5a2","observation_id":"9ce2e707-82b4-46d2-aa04-6ab53b787977","resolution":{"observed_at":"2026-08-06T17:47:40.069629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.073209Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.073209Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:96e3ee0059b652a5fb72b17863c80709eec361f4ad27b653d6203788d6cc3976","observation_id":"34f17dc2-7197-4a22-a9b8-fcc9569466b8","resolution":{"observed_at":"2026-08-06T17:47:40.073209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.076107Z","title":"Grok 3 beta — the age of reasoning agents,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.076107Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:1ad509986cabbc0b9f5337d17469230049c3d5bbf7246d50004ade5232c2c9c6","observation_id":"8f557111-f919-4bf4-9116-2a49950fd7e4","resolution":{"observed_at":"2026-08-06T17:47:40.076107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T17:47:40.078990Z","title":"Deepseek-V3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.078990Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:c09771c79aa89e9cd4d601fc7089396b4a0b4e1a675349db4d902dfea3c48413","observation_id":"b86e704d-e0c2-469c-adcc-37dedcda7723","resolution":{"observed_at":"2026-08-06T17:47:40.078990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-06T17:47:40.082238Z","title":"Deepseek LLM: Scaling open-source language models with longtermism,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.082238Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:c2484dae40bcecd15416a1d91eea4dc6566b3078672d2a1d10d4ee958a3df66b","observation_id":"9490a70d-5e07-44a4-ba95-d1bcb6814d45","resolution":{"observed_at":"2026-08-06T17:47:40.082238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-06T17:47:40.085404Z","title":"DeepseekMoE: Towards ultimate expert spe- cialization in mixture-of-experts language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.085404Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:92bbd520ba0e4da3127bb6edefa5ae0b0a763bf52a5adacd7f900ac31302f983","observation_id":"8a9a38f1-681d-44a5-aa31-c58902be3ce9","resolution":{"observed_at":"2026-08-06T17:47:40.085404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T17:47:40.088517Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.088517Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:2ba1223b539ad4cf2af9e9cdad6447183c580731915ea9d1313dc94678038d0c","observation_id":"3437fb8f-f996-46c8-be8c-ebfba3597bad","resolution":{"observed_at":"2026-08-06T17:47:40.088517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-06T17:47:40.091431Z","title":"Deepseek-V2: A strong, econom- ical, and efficient mixture-of-experts language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.091431Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:cb8d42b885da1dd274c56519b6585750903bd8ab0d2d9427d3d658f71ceba83c","observation_id":"b8baf641-84e4-4f4e-914a-b8451b77ace5","resolution":{"observed_at":"2026-08-06T17:47:40.091431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.094795Z","title":"Hidden markov models,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.094795Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:f3706221c9134442347b7ddc9cb210559358107a1f82f5ef42043ffbc964a729","observation_id":"7dd3a60f-51a4-4f0c-85d8-83b0ef82e23c","resolution":{"observed_at":"2026-08-06T17:47:40.094795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.097597Z","title":"Large language models in machine translation,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.097597Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:41b5ddccd2d52c9b885a70b5e7e088f32eb237f4a8d1bb7cea87d81da0f2f495","observation_id":"ce9febf7-f751-4191-bf72-4d7855790936","resolution":{"observed_at":"2026-08-06T17:47:40.097597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.100318Z","title":"Dis- tributed representations of words and phrases and their composition- ality,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.100318Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:bdb57746f33b46ada83fe1287ad18a5990fff5a41e2119539dcf07cc6f2314f4","observation_id":"adba33ed-a799-4310-91d1-7bb725631250","resolution":{"observed_at":"2026-08-06T17:47:40.100318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.103188Z","title":"Glove: Global vectors for word representation,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.103188Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:0b64e392389f7bd85316f1f391b84710ad69f6494b80151c373082ff15d9708d","observation_id":"7058d49c-513f-49dc-81db-d5a65068f3a9","resolution":{"observed_at":"2026-08-06T17:47:40.103188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.105871Z","title":"Fundamentals of recurrent neural network (RNN) and long short-term memory (LSTM) network,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.105871Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:c81d919de7317d22da7f792fba4e5f6b9a8cf85d887b8fe2d08a358c915da32a","observation_id":"8fee7647-9e6a-4695-aa7d-28f3e2eeb5cb","resolution":{"observed_at":"2026-08-06T17:47:40.105871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.108903Z","title":"Long short-term memory network for learning sentences similarity using deep contextual embeddings,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.108903Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:d09a484850b8736a0326e4e4203df003d66bbd33cb4999f9e165e821b732b99d","observation_id":"1e5f51cd-e2fd-4d0c-a7fe-f888b12f7b99","resolution":{"observed_at":"2026-08-06T17:47:40.108903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-06T17:47:40.111522Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.111522Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:9ab23ce2ccd3c1ef96bb0b23bc87b60671d7de09d6d0d5edf4159befe0ca03cc","observation_id":"f84e484a-0dce-4131-bab1-4678a40553af","resolution":{"observed_at":"2026-08-06T17:47:40.111522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-06T17:47:40.114788Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.114788Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:191d7d41f7f7ad1f888706a31bf625debd36fb6d1d4ef0e41d1217cc361cfcfd","observation_id":"66b9917d-d3e5-4c0d-8f3c-5288bb9da120","resolution":{"observed_at":"2026-08-06T17:47:40.114788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.117740Z","title":"BioBERT: a pre-trained biomedical language representation model for biomedical text mining,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.117740Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:dae9ab580b5a533bb1421880f5abe104aa2d0711c83f840d923340e74ff2572b","observation_id":"db441385-dba8-4447-9b2c-a49a203eb58e","resolution":{"observed_at":"2026-08-06T17:47:40.117740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-07-06T08:24:44.631342Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11942","snapshot_observed_at":"2026-08-06T17:47:40.120391Z","title":"ALBERT: A lite BERT for self-supervised learning of language representations,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.120391Z"},"links":{"cited_paper":"/paper/1909.11942","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:2f2409d2ed3d2116c7f770da00df8bc60396bf9a3f10e20a144c93f9f0449812","observation_id":"7fee2620-5985-46c4-be11-03b89ae19137","resolution":{"observed_at":"2026-08-06T17:47:40.120391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-06T17:47:40.123293Z","title":"A general language assistant as a laboratory for alignment,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.123293Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:37e10e79688bcb5a6f6f127274d93f833857d64d939989fb6465939f00a41429","observation_id":"b8082bd0-aa27-4449-a25a-26f29579803c","resolution":{"observed_at":"2026-08-06T17:47:40.123293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.02137","last_updated":"2021-07-05T16:54:59Z","snapshot_observed_at":"2026-07-06T11:26:04.679324Z","submitted_at":"2021-07-05T16:54:59Z","title":"ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.02137","snapshot_observed_at":"2026-08-06T17:47:40.126152Z","title":"Ernie 3.0: Large-scale knowledge enhanced pre-training for language understanding and generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.126152Z"},"links":{"cited_paper":"/paper/2107.02137","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:e884b6fd0e6b7255fea902c84837d41a3b114246a87d75c68a6aabe2b929c993","observation_id":"63014fb7-1378-4262-90f6-05ccfd027a62","resolution":{"observed_at":"2026-08-06T17:47:40.126152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08207","last_updated":"2022-03-17T17:53:01Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T17:08:57Z","title":"Multitask Prompted Training Enables Zero-Shot Task Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08207","snapshot_observed_at":"2026-08-06T17:47:40.129359Z","title":"Multitask prompted training enables zero-shot task generalization,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.129359Z"},"links":{"cited_paper":"/paper/2110.08207","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:fd858fc5302be0d6ac7ab9d3cc7ef0e38ba14cd3d5b4acc82779cd0d44623cf0","observation_id":"e52f074a-28cd-46c2-8629-c421bc329d4f","resolution":{"observed_at":"2026-08-06T17:47:40.129359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.132643Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.132643Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:d1fc56dd12733f2176c01c58cb859a9c3786bcf0255f7550bbd2f6b7ef97689d","observation_id":"6b3552a3-4045-4668-8fa4-655c3fc1d823","resolution":{"observed_at":"2026-08-06T17:47:40.132643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T17:47:40.135490Z","title":"Evaluating large language models trained on code,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.135490Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:e7908b7fa21547100595e41266169bb40d7a15067c0ec81fb08914f874309e6c","observation_id":"1f730cbd-470c-4678-a7a7-227779c2a3f1","resolution":{"observed_at":"2026-08-06T17:47:40.135490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.138212Z","title":"CodeGeeX: A pre-trained model for code generation with multilingual benchmarking on HumanEval-X,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.138212Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:2d24a3427fa586d0bacb08533d8500e1c9fa833590b44268bb16c85fb5931209","observation_id":"f4f5d346-a886-4313-a195-0061b974b6d9","resolution":{"observed_at":"2026-08-06T17:47:40.138212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.140738Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.140738Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:712c4d1652ddc1e744087744c2e19f8a2b1ae1fe7eb48dab7e96095709fd213b","observation_id":"6258d46d-85ec-4677-a4bb-953cb8ea637e","resolution":{"observed_at":"2026-08-06T17:47:40.140738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.143391Z","title":"Pythia: A suite for analyzing large language models across training and scaling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.143391Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:a505866c9e53cc5c3d01c99856c0a2a0e2bf039e01ad5ae21fd74e3c26465fca","observation_id":"b1ab39a1-a3df-475d-bb31-ef1909d9025a","resolution":{"observed_at":"2026-08-06T17:47:40.143391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T17:47:40.146017Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.146017Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:083c17cea919799e5fa251d8205e27c65dbfd0cea14315e1c8ff6ce4ab24d1c5","observation_id":"5eb97d9f-b6e5-4389-b8c8-40da58628730","resolution":{"observed_at":"2026-08-06T17:47:40.146017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.148792Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.148792Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:b0ee85ad12d375d08a36e3e4776aba5cf52a987dbe9d5f0ed9fb6b7c1daefd43","observation_id":"d38b566d-63f4-456f-b389-6a858cc0e2fa","resolution":{"observed_at":"2026-08-06T17:47:40.148792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-06T17:47:40.152032Z","title":"Scaling language models: Methods, analysis & insights from training gopher,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.152032Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:e8c448709f5bb659ac0b3f1d4ab0b0d849048772be38964bb3180103dff631ba","observation_id":"3fd0c0a3-47aa-403d-955c-eb5d81ec8ae7","resolution":{"observed_at":"2026-08-06T17:47:40.152032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-06T17:47:40.154938Z","title":"Bloom: A 176B- parameter open-access multilingual language model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.154938Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:13e45c0e3aef95c0148bccb6105c0f8804fc9a5ce1b68a10024b4c8a071eb650","observation_id":"0e49895d-b10f-489c-9cd3-e4eb4ba82d1c","resolution":{"observed_at":"2026-08-06T17:47:40.154938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T17:47:40.157903Z","title":"Training compute-optimal large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.157903Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:d3e44662a8d0bd83c01ba732f3792d14b0f45f742af35b6c9a5ceea57f21981b","observation_id":"f2786884-7275-4457-8eec-dd3161cefb43","resolution":{"observed_at":"2026-08-06T17:47:40.157903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.160712Z","title":"GLaM: Efficient scaling of lan- guage models with mixture-of-experts,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.160712Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:1a1b020ca01df09fa9793366c16ed8655ffaa2079767bf8abd67659f9c115b6b","observation_id":"671319ef-14ac-4f6f-b4be-2e9148ced7ff","resolution":{"observed_at":"2026-08-06T17:47:40.160712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-06T17:47:40.163443Z","title":"Lamda: Language models for dialog applications,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.163443Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:7070b8261632abf2c5dd1e2abf128dbdd7e119a8b3a2bc7992fcd0985adfee24","observation_id":"5ab8cee8-0eec-4f59-87b7-36e36fa06d30","resolution":{"observed_at":"2026-08-06T17:47:40.163443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-06T17:47:40.166161Z","title":"Using DeepSpeed and megatron to train megatron-turing NLG 530B, a large-scale generative language model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.166161Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:be1911424a3b941a0aff43509d76decfd59c258a2f66936893c28f6fbd970286","observation_id":"3dfbd059-797e-47a7-b746-58c67c178a86","resolution":{"observed_at":"2026-08-06T17:47:40.166161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-06T17:47:40.169086Z","title":"OPT: Open pre-trained transformer language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.169086Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:e6b303f687dd21ba9a62e7123f95d1e6aa8f7c5911fd9b140df75fdef61c14a6","observation_id":"4a830d00-7af0-4933-a88f-f9346d932b0b","resolution":{"observed_at":"2026-08-06T17:47:40.169086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17564","snapshot_observed_at":"2026-08-06T17:47:40.172271Z","title":"BloombergGPT: A large language model for finance,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.172271Z"},"links":{"cited_paper":"/paper/2303.17564","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:5d2f0b78022d394ef702daec705ed0cbafe4acea4b7e14ba6ca27ecc54d2b102","observation_id":"f8f6dc85-ec5c-42d2-8e92-ed43b30c1bb3","resolution":{"observed_at":"2026-08-06T17:47:40.172271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T17:47:40.175437Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.175437Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:6e78673844b0b47cb3dea3f1200a402c595755ba0a0fd875935d5b00141ed280","observation_id":"4b73b2ee-4a4f-44e4-b24c-edbc1ae19fc3","resolution":{"observed_at":"2026-08-06T17:47:40.175437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T17:47:40.178384Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.178384Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:e050c618b2b4b55b7b4efcbce5ba141f92f7b5537465674145ae2ebb58372f36","observation_id":"ee7a3292-c3d1-4a62-b7f8-9e5a2048d886","resolution":{"observed_at":"2026-08-06T17:47:40.178384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-06T17:47:40.180958Z","title":"ChatGLM: A family of large language models from GLM-130B to GLM-4 all tools,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.180958Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:8e89fbbe9dd043d8b6ca39117b36b8ff399f52fa31478fecc2bbe727c87152d1","observation_id":"ba90cc22-65af-40c1-9b83-523597597de8","resolution":{"observed_at":"2026-08-06T17:47:40.180958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T17:47:40.183987Z","title":"Kimi k1. 5: Scaling reinforcement learning with LLMs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.183987Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:9a9a4df0da6147a019a51d78a833b6341c7e7617130627cf4f248bea65c6ccc3","observation_id":"44c00772-270d-4177-8086-3de63693540f","resolution":{"observed_at":"2026-08-06T17:47:40.183987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-06T17:47:40.186821Z","title":"Gemma: Open models based on gemini research and technology,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.186821Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:5f10ac1cbf57b160675fd7980c42a349fb50e46359f04f8e4ad8cebf83f53bf3","observation_id":"e7603c62-fa59-4b2e-90e8-18c29d0c25b3","resolution":{"observed_at":"2026-08-06T17:47:40.186821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.189816Z","title":"Grok-2 beta release,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.189816Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:c87a8573e478f8925af7774ff3f79025f73c9238f33df64f7fd83880f78e42f3","observation_id":"44726ed4-049b-4ad1-9a96-def5fc077e9a","resolution":{"observed_at":"2026-08-06T17:47:40.189816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.192786Z","title":"Llama 3.1: An in-depth analysis of the next-generation large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.192786Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:720ddf381e236936b1cf01314ec7dd0431591df64455ec26aa93b600eb326d52","observation_id":"9379c27f-8ebb-419c-9e8f-8dc731e1414a","resolution":{"observed_at":"2026-08-06T17:47:40.192786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.195263Z","title":"PredRNN: A recurrent neural network for spatiotemporal predictive learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.195263Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:053aee1f631a8af91eeb48d5476680ba5140fe06560dd3c238f5752f6acbf0d1","observation_id":"862aef8b-caa3-41cf-a7fc-12cb91dbe380","resolution":{"observed_at":"2026-08-06T17:47:40.195263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.198436Z","title":"Efficient and effective training of sparse recurrent neural networks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.198436Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:bced7b74b839dae42521e9054ebce684db886860d2c478c0ee77ca0563f492e6","observation_id":"933fd5ff-37ab-463c-911c-e2a4a16dc593","resolution":{"observed_at":"2026-08-06T17:47:40.198436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.201057Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.201057Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:5139d33527b6213f44de0984b65e5cf502874e00097542b8a03ea088b42de26a","observation_id":"f254d36e-4046-4813-a601-19801a87718e","resolution":{"observed_at":"2026-08-06T17:47:40.201057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10867","last_updated":"2025-02-15T17:52:11Z","snapshot_observed_at":"2026-08-07T18:15:38.061902Z","submitted_at":"2025-02-15T17:52:11Z","title":"A Tutorial on LLM Reasoning: Relevant Methods behind ChatGPT o1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10867","snapshot_observed_at":"2026-08-06T17:47:40.204182Z","title":"A tutorial on LLM reasoning: Relevant methods behind ChatGPT o1,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.204182Z"},"links":{"cited_paper":"/paper/2502.10867","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:8a13433aad114193d683d5ccbf14704757594db55b6d3bac7f0330f3f78f1316","observation_id":"2db19066-3c93-40d1-9c73-2bf8d7a14b65","resolution":{"observed_at":"2026-08-06T17:47:40.204182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.206881Z","title":"Star: Bootstrapping reasoning with reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.206881Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:b153f9ad800049fa7c144ee2c2e23799af9036fc381e4b1a9b26db67654729cd","observation_id":"5dbc411f-0794-47ed-89ec-fbcfafba1714","resolution":{"observed_at":"2026-08-06T17:47:40.206881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-06T17:47:40.209380Z","title":"Alphazero-like tree-search can guide large language model decoding and training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.209380Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:922ab2f9a2d62b17ba9165e53d2127e3a80bde9f1ac95b7b3e81447b25b36a1f","observation_id":"60d6e2b2-8357-4380-9b77-2c4b9d9fc6b8","resolution":{"observed_at":"2026-08-06T17:47:40.209380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-06T17:47:40.212052Z","title":"Improve mathematical reasoning in lan- guage models by automated process supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.212052Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:0435f4aa85dc2ea1304ac18dbf18e245bca59dac67e3f345c5b80df58fd78ce1","observation_id":"c45363bb-1725-427c-95da-0c9a3ea2b716","resolution":{"observed_at":"2026-08-06T17:47:40.212052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02336","last_updated":"2023-05-24T04:08:08Z","snapshot_observed_at":"2026-07-06T13:17:41.206878Z","submitted_at":"2022-06-06T03:38:36Z","title":"Making Large Language Models Better Reasoners with Step-Aware Verifier","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.02336","snapshot_observed_at":"2026-08-06T17:47:40.214785Z","title":"Mak- ing large language models better reasoners with step-aware verifier,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.214785Z"},"links":{"cited_paper":"/paper/2206.02336","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:dc9fa45419c3ccd18e3cbd2097f1975dd716f8059f5bdf4f7dba73f22c262122","observation_id":"1352d2a4-96dc-40f8-b34c-4790bfb18015","resolution":{"observed_at":"2026-08-06T17:47:40.214785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.217670Z","title":"An empirical analysis of compute-optimal inference for problem-solving with language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.217670Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:fb344107544e2ae472aea340a32e570068ca61f8e856a08b0c49a0d3b4afacc1","observation_id":"02fd27ff-8c44-4c2b-ba6e-5bb016739e1d","resolution":{"observed_at":"2026-08-06T17:47:40.217670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-06T17:47:40.220308Z","title":"Scaling LLM test-time compute optimally can be more effective than scaling model parameters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.220308Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:8ee6e2f9a7d7e83d4af59ede75be18a67b55232169f1e8b9cd24527cefd448ce","observation_id":"e4b5ef6b-ffaa-40e9-8de9-4f232cb26193","resolution":{"observed_at":"2026-08-06T17:47:40.220308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.223250Z","title":"Dynamic programming and stochastic control processes,","venue":null,"work_id":null,"year":1958},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.223250Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:7472cd38f9bd78abb614e43dabbdc46815b209395dc5ee321db26b87574bf4e7","observation_id":"2cae8d5f-4135-4923-bc17-5d42cee0e4d3","resolution":{"observed_at":"2026-08-06T17:47:40.223250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.225928Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.225928Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:7398fc1a67779f043ccef2b4f6230914040e2aef2be2704854903bdb2fa3d1ea","observation_id":"f89b80f9-c662-4759-ae6b-f9a7c713db12","resolution":{"observed_at":"2026-08-06T17:47:40.225928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14878","last_updated":"2023-12-22T17:57:57Z","snapshot_observed_at":"2026-08-05T08:18:33.005550Z","submitted_at":"2023-12-22T17:57:57Z","title":"Pangu-Agent: A Fine-Tunable Generalist Agent with Structured Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14878","snapshot_observed_at":"2026-08-06T17:47:40.228486Z","title":"Pangu-agent: A fine-tunable generalist agent with structured reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.228486Z"},"links":{"cited_paper":"/paper/2312.14878","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:afc6000ee4f9cc4d972a1bb7b64c57749df6c848c56e6269d5d3f42f3235db4d","observation_id":"39672797-a393-4fc9-a70a-0f83732d6f1e","resolution":{"observed_at":"2026-08-06T17:47:40.228486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.231791Z","title":"Qwen2.5: A party of foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.231791Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:f4b2c6d717029e5038d69243fe3b056f7d5cd7f928021fde2a444da42f3182ed","observation_id":"a2ca418b-5482-445a-a33d-b10ff5ea8de7","resolution":{"observed_at":"2026-08-06T17:47:40.231791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-06T17:47:40.234718Z","title":"Deepseek-VL2: Mixture-of-experts vision- language models for advanced multimodal understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.234718Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:0c20b435e5788512252714ad24a0b66e45ea62f004b66fa8ecf9fb255cf8d260","observation_id":"ac06e6c2-2968-4c6c-9a9b-bb0660368604","resolution":{"observed_at":"2026-08-06T17:47:40.234718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.237901Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.237901Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:55ac09d84b199077b79ce347de15c211777aae94629ab76f3f442d4e3d0fafc5","observation_id":"531becb3-1767-4013-aa74-131cf861ce33","resolution":{"observed_at":"2026-08-06T17:47:40.237901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.240685Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.240685Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:793c98f59044d697a222ab4f2b80f13c70e54cc2a358c4d6865ac08eb0801b2b","observation_id":"6aa9439b-c1e3-48fc-a7f6-7d03c5e71df0","resolution":{"observed_at":"2026-08-06T17:47:40.240685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-06T17:47:40.243919Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.243919Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:9074352beea2546dfa3b2ba1b3c8d85b4a19aac17b7eb1c1af7bd64052ed37cc","observation_id":"2f52e35c-5f34-4937-bc79-1a0115ca072e","resolution":{"observed_at":"2026-08-06T17:47:40.243919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.246864Z","title":"Roformer: En- hanced transformer with rotary position embedding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.246864Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:9bf6685df1c6434224a49cb22fda3c5ec91ccba3320aebe83bf918be14968dd6","observation_id":"eb68c668-028c-4847-b115-9b70ec0b2552","resolution":{"observed_at":"2026-08-06T17:47:40.246864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.249549Z","title":"MHA-Net: Multipath hybrid attention network for building footprint extraction from high-resolution remote sensing im- agery,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.249549Z"},"links":{"citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:a494e7a5a0a6ac891d2af2de5b525821f87eb6cef59b950ad3bcc8e2573dd9a4","observation_id":"18f656ea-0aaf-4e33-936c-c30e23dae5ff","resolution":{"observed_at":"2026-08-06T17:47:40.249549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08553","last_updated":"2024-06-04T14:49:36Z","snapshot_observed_at":"2026-07-06T18:14:08.102261Z","submitted_at":"2024-05-14T12:41:11Z","title":"Improving Transformers with Dynamically Composable Multi-Head Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08553","snapshot_observed_at":"2026-08-06T17:47:40.252282Z","title":"Improving transformers with dynamically composable multi-head attention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.252282Z"},"links":{"cited_paper":"/paper/2405.08553","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:079e4c42c2dc541050be416f0a6f493e33a9c1de2bac18a1b1db055f0ab7af62","observation_id":"a1c15df1-44df-4760-8fd7-c7bc65460b6e","resolution":{"observed_at":"2026-08-06T17:47:40.252282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-07-06T18:51:49.871551Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-06T17:47:40.255004Z","title":"Keep the cost down: A review on methods to optimize LLM’s KV-cache consumption,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.255004Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:186287396eb9e4d1c106584cb1a298fc3b6ba54c485145313b07ac052dd1dc71","observation_id":"f37ec339-0b23-4a03-bf5b-9a5ccd011380","resolution":{"observed_at":"2026-08-06T17:47:40.255004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-06T17:47:40.258067Z","title":"Fast transformer decoding: One write-head is all you need,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.258067Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:21c8e3164440d4cb8acb026faea59d02074ea37dd50bccaa03dbbd1de1d0dc7e","observation_id":"a585dbb0-4ad6-4bb8-8d12-ddad2ac716d3","resolution":{"observed_at":"2026-08-06T17:47:40.258067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":142},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 142 outbound references and 0 inbound Pith citation observations for arXiv:2507.09955."}