{"as_of":"2026-08-10T13:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1dba86c001700649b16115622b62f4cc33b3d467a7d3815a47c870bbd915d4cb","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:19:21.084613Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.01677/citation-record","integrity":"/paper/2502.01677/integrity","json":"/paper/2502.01677/citation-record.json","paper":"/paper/2502.01677"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-09T18:19:20.874601Z","title":"A., Bach, N., Bahree, A., Bakhtiari, A., Bao, J., Behl, H., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.874601Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:d1a2d7a67167f7c9c2d0ae893216cb5c573b7c58a6f6cc3ac538847ea8fffb4f","observation_id":"3ef38a17-7e32-4a08-bd20-04c5231e5091","resolution":{"observed_at":"2026-08-09T18:19:20.874601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:19:21.754302Z","title":"Bert: Pre-training of deep bidirectional transformers for lan- guage understanding","venue":null,"work_id":"fc9d1da6-7dff-4c72-bdd1-155ca5022208","year":2019},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.920957Z"},"links":{"citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:97d9a0d6bc6fda47f4de630f2874574b40e1deb4d668ee2edde9459b5bea18ed","observation_id":"38d747c1-50d9-43d6-98fb-a73c7b5d59c0","resolution":{"observed_at":"2026-08-09T18:19:21.761430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-09T18:19:20.939550Z","title":"Gptq: Accurate post-training quantization for generative pre- trained transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.939550Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:1ab8cf8364473cb6416907e9c116361066de923236c4f22e8b005b39241ca0b5","observation_id":"2bacbac8-8723-4fe2-a504-c81632d13bb1","resolution":{"observed_at":"2026-08-09T18:19:20.939550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1510.00149","last_updated":"2016-02-15T06:25:40Z","snapshot_observed_at":"2026-08-04T16:59:47.843960Z","submitted_at":"2015-10-01T09:03:44Z","title":"Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.00149","snapshot_observed_at":"2026-08-09T18:19:20.952392Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.952392Z"},"links":{"cited_paper":"/paper/1510.00149","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:b9e72d7efad95b7066974e7efe302ace6b40bc4653e8ed6ff6b6de2cb3726e0b","observation_id":"ac3541a4-1752-453e-bf58-69a36938e927","resolution":{"observed_at":"2026-08-09T18:19:20.952392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-09T18:19:20.958325Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.958325Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:b26ef866381401bcec89298476b6d4eb4d412c9e6dc08e5e594f3d0310aade46","observation_id":"64b13aa8-9b47-4c80-bf7c-715f21dd0067","resolution":{"observed_at":"2026-08-09T18:19:20.958325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-09T18:19:20.971155Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.971155Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:fe9904fd7e557a251bdcc0d8135e009f68258f48cd5f76d2664825e4e7321b7c","observation_id":"29a3e7c6-1f50-453c-b517-917272a5fe9a","resolution":{"observed_at":"2026-08-09T18:19:20.971155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-09T18:19:20.977199Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.977199Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:0c26f71701be29b21bb484a4f545ed522de2cd3a4d9efbd6266da429ea68bb2e","observation_id":"25be5821-29d9-4f11-8314-212fdccb067e","resolution":{"observed_at":"2026-08-09T18:19:20.977199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:19:20.989996Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.989996Z"},"links":{"citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:1cb61617d24bfac8d4c9427064e2e776599bbe11dff38b40e3fc045f01782704","observation_id":"5d560141-60cb-4ab4-a62b-c65467e756af","resolution":{"observed_at":"2026-08-09T18:19:20.989996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-07-06T10:29:18.734092Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-09T18:19:21.004163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:21.004163Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:f27aa6af802eba13626eae7bcaf28827f6b00af5a14417685c7e5d9829405f12","observation_id":"06a253ca-fcb5-41ee-a8b5-37398ceccd27","resolution":{"observed_at":"2026-08-09T18:19:21.004163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-09T18:19:21.016100Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:21.016100Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:add2a6eae1823e039f4daed34bb3ab4561f3c29c32ff3ea12a81f1d30b3260ec","observation_id":"377ae90a-b793-43db-9794-e3700844ad21","resolution":{"observed_at":"2026-08-09T18:19:21.016100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.06440","last_updated":"2017-06-08T19:53:26Z","snapshot_observed_at":"2026-08-07T07:29:29.524604Z","submitted_at":"2016-11-19T22:48:30Z","title":"Pruning Convolutional Neural Networks for Resource Efficient Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.06440","snapshot_observed_at":"2026-08-09T18:19:21.021961Z","title":"Pruning convolutional neural networks for resource efficient inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:21.021961Z"},"links":{"cited_paper":"/paper/1611.06440","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:cf0855cd3190db5e1ef08c6eaf5e235ed982c146442e8c7b5f3243e3194caada","observation_id":"863380b9-935d-4b31-9411-9eb9c8e9256b","resolution":{"observed_at":"2026-08-09T18:19:21.021961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04437","last_updated":"2025-01-29T04:10:41Z","snapshot_observed_at":"2026-08-05T02:13:00.249260Z","submitted_at":"2024-05-07T16:00:32Z","title":"vAttention: Dynamic Memory Management for Serving LLMs without PagedAttention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04437","snapshot_observed_at":"2026-08-09T18:19:21.033324Z","title":"vattention: Dynamic memory management for serving llms without pagedattention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:21.033324Z"},"links":{"cited_paper":"/paper/2405.04437","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:20665138089534b6abd03b9b9a3e661a8f7cffe4a0e2c45f8cdc447551efa1c9","observation_id":"7ed2f0e2-9307-4a4f-a90d-0755c556733b","resolution":{"observed_at":"2026-08-09T18:19:21.033324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:19:21.720239Z","title":"N., Kingsbury, B., Sindhwani, V ., Arisoy, E., and Ramabhadran, B","venue":null,"work_id":"89ad99f2-bdb6-4de9-87d5-510ea7e32eba","year":2013},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:21.038953Z"},"links":{"citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:1dc0b7ce3ef2f45ea88a8570e33a72f660eb592eeec0d5d81e4ba14a7460626c","observation_id":"1a8b6b91-d9c0-415a-8502-86df283c6403","resolution":{"observed_at":"2026-08-09T18:19:21.726335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-09T18:19:21.044686Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:21.044686Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:722f51d4c2603a3283693af849a1d32b038a2f86bdb0214795b6a9ab80f51413","observation_id":"581e6e7c-22f6-47f3-bc3d-16255db61ef1","resolution":{"observed_at":"2026-08-09T18:19:21.044686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-09T18:19:21.051050Z","title":"Scaling llm test- time compute optimally can be more effective than scal- ing model parameters","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:21.051050Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:454329928dda09e1cd759ec9c0ca57efd86a1c957f02e2bd1c4f0ab9b72da84c","observation_id":"b3e598cc-fa12-42ae-a2d8-eb751f614ab1","resolution":{"observed_at":"2026-08-09T18:19:21.051050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-09T18:19:21.056758Z","title":"Llama 2: Open foundation and fine- tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:21.056758Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:289eec37dc93c257dd104c762b0835bf62bc14891ed181c571b2bf6f9cffc1d3","observation_id":"400f7717-c21e-4bfe-8bde-5fbae6450ba1","resolution":{"observed_at":"2026-08-09T18:19:21.056758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-09T18:19:21.062115Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:21.062115Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:c55afadc2fb9bd1e09b477802da7303a35d8920ae66fdc137133678710b68382","observation_id":"84d863f8-f5af-43bf-9c29-5701bb2beb3c","resolution":{"observed_at":"2026-08-09T18:19:21.062115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-09T18:19:21.067464Z","title":"Z., Khabsa, M., Fang, H., and Ma, H","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:21.067464Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:b54c55b90989c805cf7dbcd938f0c80f68d4bd6c20721b289239f380379c49de","observation_id":"15ecb65e-bba3-4d8a-9e94-f669345a0964","resolution":{"observed_at":"2026-08-09T18:19:21.067464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-09T18:19:21.072698Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:21.072698Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:e4a022891002725bf5e8ac7ee89063c30667da4bcc929ee6453a4ef03635a5b9","observation_id":"9dc540b7-a3dc-4cb0-a402-a5062d3d5b0a","resolution":{"observed_at":"2026-08-09T18:19:21.072698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02485","last_updated":"2024-02-17T05:27:56Z","snapshot_observed_at":"2026-08-02T22:53:12.613357Z","submitted_at":"2023-07-05T17:59:27Z","title":"Building Cooperative Embodied Agents Modularly with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02485","snapshot_observed_at":"2026-08-09T18:19:21.078764Z","title":"B., Shu, T., and Gan, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:21.078764Z"},"links":{"cited_paper":"/paper/2307.02485","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:4622124920898e080d0f1dd8c56762b28e4bafb80dc85e1fb2c49b1181a2c712","observation_id":"6eb3be5e-11d3-4841-81b2-118a23a91f86","resolution":{"observed_at":"2026-08-09T18:19:21.078764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:19:21.694097Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"7358c796-c4b4-445f-a240-01d8e00b7b11","year":2024},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:21.084613Z"},"links":{"citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:6fcc9f3038649a5aceed2bb9ad5733189d603830c95f2b060681aed327549c9e","observation_id":"0d150633-9484-4bdf-a423-7d4ff00c1141","resolution":{"observed_at":"2026-08-09T18:19:21.703431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-09T18:19:20.996636Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":1989,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.996636Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:ec86edada322a21e884f4c337adc955ea80b9e07e772cfbaf8a8202bfcf70e41","observation_id":"57aec9ad-3c28-42b5-adc6-24dd36243098","resolution":{"observed_at":"2026-08-09T18:19:20.996636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-09T18:19:20.983646Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":1994,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.983646Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:2d844b04929be97cde854eb8985a6c00002901dee2b084281261966b0c75d96f","observation_id":"bebd6bc2-70aa-4a84-9f5c-fa8055282e08","resolution":{"observed_at":"2026-08-09T18:19:20.983646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-09T18:19:20.946350Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.946350Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:78bdbed1ff24c12190fb778a928a3b2d05a46baf2a97870ac182cfee3b4702bb","observation_id":"2e95b3db-334a-4fad-ba9f-b8c6779a42da","resolution":{"observed_at":"2026-08-09T18:19:20.946350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-09T18:19:20.896363Z","title":"Deepseek llm: Scaling open-source language models with longtermism","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.896363Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:b77409897b21f66b4ed9c3f6b039dad6a96291dd1e03a52c96aea4db0672be1d","observation_id":"0664e562-cfce-45cc-b606-29bba954991a","resolution":{"observed_at":"2026-08-09T18:19:20.896363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:19:20.903249Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.903249Z"},"links":{"citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:bf7a8143eecd857c3476fa12b969b32c4e6ee3821fa09ba8c47d0ae160e5e68e","observation_id":"b929ace7-0282-4ccc-949c-08dcc83878a0","resolution":{"observed_at":"2026-08-09T18:19:20.903249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-09T18:19:20.964540Z","title":"J., Shen, Y ., Wallis, P., Allen-Zhu, Z., Li, Y ., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.964540Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:9a5baffa755defe24f49e05332db0970ead2efb7d7f719a67ae9fd6830d41266","observation_id":"de86a116-0904-45d5-88d3-b74cd333efb0","resolution":{"observed_at":"2026-08-09T18:19:20.964540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01786","last_updated":"2023-05-29T16:40:37Z","snapshot_observed_at":"2026-08-06T03:54:27.439090Z","submitted_at":"2022-11-03T13:19:32Z","title":"Crosslingual Generalization through Multitask Finetuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01786","snapshot_observed_at":"2026-08-09T18:19:21.027559Z","title":"L., Bari, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:21.027559Z"},"links":{"cited_paper":"/paper/2211.01786","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:6cee7d635a54d760e4b802c8da1aa86609813fa60347021e2beb753708062af3","observation_id":"2e5dc8eb-a371-49fb-980e-a8fc1a478bf4","resolution":{"observed_at":"2026-08-09T18:19:21.027559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-09T18:19:20.914751Z","title":"Deepseekmoe: Towards ultimate expert specialization in mixture-of-experts lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.914751Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:7820732ce9f23db5b22cd43ada3dbf2b04f6e16a2670e7bce11d9a61ad1c520b","observation_id":"d20ba0c3-02b2-4270-93d4-509ec297f707","resolution":{"observed_at":"2026-08-09T18:19:20.914751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07438","last_updated":"2023-09-14T05:43:36Z","snapshot_observed_at":"2026-07-06T16:18:17.458740Z","submitted_at":"2023-09-14T05:43:36Z","title":"Towards Artificial General Intelligence (AGI) in the Internet of Things (IoT): Opportunities and Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07438","snapshot_observed_at":"2026-08-09T18:19:20.927285Z","title":"Towards artificial general intelligence (agi) in the internet of things (iot): Opportu- nities and challenges","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.927285Z"},"links":{"cited_paper":"/paper/2309.07438","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:2134219b153765fb42eab635e0e686ca7a9903d95bac8679ece7979327389ea0","observation_id":"39505420-256b-4744-baff-f642fd6b4f3e","resolution":{"observed_at":"2026-08-09T18:19:20.927285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-09T18:19:20.908955Z","title":"Accelerating large language model decoding with speculative sampling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.908955Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:b51ef225eafc10c4ab56696c46b769e9e44de6fc984adaa1242d709edeb0f36a","observation_id":"c6bb4560-33b7-4d5e-ba11-cc98ec44644f","resolution":{"observed_at":"2026-08-09T18:19:20.908955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-09T18:19:21.010351Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:21.010351Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:5e9babffa36572a4a4cd6c85add6a26f6ad1727b0d79733d4c588b87ff401486","observation_id":"37b4c954-adb7-4c57-8e89-cc1ea506640b","resolution":{"observed_at":"2026-08-09T18:19:21.010351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.01667","last_updated":"2022-09-04T18:00:29Z","snapshot_observed_at":"2026-08-04T15:45:56.618823Z","submitted_at":"2022-09-04T18:00:29Z","title":"A Review of Sparse Expert Models in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.01667","snapshot_observed_at":"2026-08-09T18:19:20.933334Z","title":"A review of sparse expert models in deep learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.933334Z"},"links":{"cited_paper":"/paper/2209.01667","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:74db090631b8310303adfcceec732236ee261642d54dbd9adbf7be3cead9421f","observation_id":"0966d0a9-e78f-40b9-9156-fba11bb8aafa","resolution":{"observed_at":"2026-08-09T18:19:20.933334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:19:21.787967Z","title":"Gqa: Training generalized multi-query transformer models from multi-head check- points","venue":null,"work_id":"723a227c-2fe1-4b4a-8e6f-d8ee425b9e87","year":2023},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.890394Z"},"links":{"citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:c3631c6b39bff2aa514d3cb6a580ab02208225ee347e67e5a8beb598c33423b7","observation_id":"589ee48c-b617-4566-bd1b-7ac8a8ba98d7","resolution":{"observed_at":"2026-08-09T18:19:21.793717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T18:19:20.884222Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T18:19:20.884222Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.01677"},"observation_digest":"sha256:b4bd60310b5afd20855f5bddcc2cd03d2c13c167d29bb36af835a3987760f6b1","observation_id":"cc7e1a5b-f8b6-40d7-b1a2-d5f8edfdaad0","resolution":{"observed_at":"2026-08-09T18:19:20.884222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.01677","last_updated":"2025-05-13T04:47:13Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T18:13:47.164722Z","submitted_at":"2025-02-02T02:14:00Z","title":"Position: AI Scaling: From Up to Down and Out"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2502.01677."}