{"as_of":"2026-08-04T20:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a32d233866e1d076e95a374cbfce43d030835e74979af4617d6044dff5a9d685","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T05:30:11.389756Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.18245/citation-record","integrity":"/paper/2510.18245/integrity","json":"/paper/2510.18245/citation-record.json","paper":"/paper/2510.18245"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-02T08:41:10.128841Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":"2412.08905","doi":"10.48550/arxiv.2412.08905","metadata_source":"pith","pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-07-11T00:47:43.055842Z","title":"Phi-4 Technical Report","venue":"cs.CL","work_id":"b6274271-7af9-4ee8-993b-ba1ba4205ba8","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:9cc62fffbbb58f63e994bae471827e9427ad13da15b2f10a28781011ce337073","observation_id":"1da1a75f-503e-45d4-8765-a892a0188f69","resolution":{"observed_at":"2026-05-18T05:30:54.969870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:11.323957+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:11.323957+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":"2501.12370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-07-02T22:17:25.673360Z","title":"Parameters vs flops: Scaling laws for optimal sparsity for mixture-of-experts language models","venue":null,"work_id":"8172eae6-6287-423a-b283-a628cb2796d6","year":2025},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:805b89ed8785d264ca1b93011612a14fc3e4e5d8488a96980a950a4b3ad76e75","observation_id":"709620e1-3cdb-448e-ae3e-15838ae8e350","resolution":{"observed_at":"2026-05-18T05:30:54.974819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:7ed0aea0ab00efe0cdfd1a04a5a73dac902fabb3fbf3498cbc26c7e4a085012a","observation_id":"bdc0747a-befe-4b43-9c4a-b213055b852e","resolution":{"observed_at":"2026-05-18T05:30:54.961428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":"2305.13245","doi":"10.48550/arxiv.2305.13245","metadata_source":"pith","pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","venue":"cs.CL","work_id":"b73ad5b2-e553-4c71-b0c9-67e67ba7b158","year":2023},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:8f84e2ec5e78c2aac5307eb8cdfb3c83b7f778ff8ac99a372817fc5c21fac9af","observation_id":"a6499279-3b04-4907-899c-77f49c282663","resolution":{"observed_at":"2026-05-18T05:30:54.979456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:875c9608c722be4a93d32bf91193a208212593d8453abf787ae1b823b29220cf","observation_id":"145ea757-62b2-414d-bff1-47c0818dd646","resolution":{"observed_at":"2026-05-18T05:30:54.957133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-02T00:23:43.521833Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"cited_work":{"arxiv_id":"2501.18107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18107","snapshot_observed_at":"2026-07-01T08:15:31.617791Z","title":"Scaling inference-efficient language mod- els.arXiv preprint arXiv:2501.18107","venue":null,"work_id":"64faa5e2-75c5-47c0-8bb2-d1509e288e2b","year":null},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2501.18107","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:7830da4e62de39c02717e9b663951db2fc3acc97400cd6986de00b9ae9575898","observation_id":"b109582b-e94e-4858-853b-129ad6b632fc","resolution":{"observed_at":"2026-05-18T05:30:54.965606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":"2407.21787","doi":"10.48550/arxiv.2407.21787","metadata_source":"pith","pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","venue":"cs.LG","work_id":"b124064d-5a56-42ad-86f5-3cc349b86a3a","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:2d5f12f55f6d5417cf454d3c7e28ebb4b27e567d83990e97d52753b86abf1d31","observation_id":"3155b484-d3d6-4f13-9fd1-b30a2f9a2bf6","resolution":{"observed_at":"2026-05-18T05:30:55.104414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:20:41.492703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:20:41.492703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:57:14.742120Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901","venue":null,"work_id":"84780adb-76cf-44ac-a8b7-e24d4fa5c592","year":1901},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:74955e33351dcf1ec5ad42cec521b961a6a7ab55b332510ad3721b8aeed78c9b","observation_id":"e5d40e9f-ebb8-4d07-be6e-17c8a44c3b17","resolution":{"observed_at":"2026-05-18T05:30:55.442804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05340","last_updated":"2025-06-06T17:59:47Z","snapshot_observed_at":"2026-07-06T21:37:28.044836Z","submitted_at":"2025-06-05T17:59:40Z","title":"Exploring Diffusion Transformer Designs via Grafting","version":2},"cited_work":{"arxiv_id":"2506.05340","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05340","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring diffusion transformer designs via grafting.arXiv preprint arXiv:2506.05340","venue":null,"work_id":"53d6cabb-10d6-4ec8-94c8-f4eda9eac668","year":2025},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2506.05340","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:0efb9b2ec2ccbf5ae70050487376dbd9262330f53720fb5157d8d9e697b6e4b3","observation_id":"4891e28d-626d-4305-8fa6-0820b87ffeac","resolution":{"observed_at":"2026-05-18T05:30:54.987903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-11T03:27:46.202228Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:db49ffbddf4c4a9831e6f50b1a5851654bc8ae2ffe2eeefbf2be9cf6408b6eab","observation_id":"83b1f712-d611-498f-9b56-7fe78a8936e6","resolution":{"observed_at":"2026-05-18T05:30:55.115874Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14302","last_updated":"2025-05-20T12:54:43Z","snapshot_observed_at":"2026-07-06T21:27:04.310764Z","submitted_at":"2025-05-20T12:54:43Z","title":"Scaling Law for Quantization-Aware Training","version":1},"cited_work":{"arxiv_id":"2505.14302","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14302","snapshot_observed_at":"2026-07-02T23:47:28.471233Z","title":"Scaling law for quantization-aware training.arXiv preprint arXiv:2505.14302","venue":null,"work_id":"ce913bab-af99-46bd-9583-7a9be0e0d99b","year":2025},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2505.14302","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:282bb6cba11603d84e3179d64acd901f0666cc05a9ce9a0fd468f775f3e4190f","observation_id":"29230e97-6ab5-4f76-b4cd-0ae41a7c2b4f","resolution":{"observed_at":"2026-05-18T05:30:55.053160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reducing the carbon impact of generative ai inference (today and in 2035)","venue":null,"work_id":"28749057-35fb-4785-b10f-9e4400a56bb3","year":2035},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:899c89f42805fb70cf0ff00896aac2aace7d9ea2e8605491f8867f52b5c190b1","observation_id":"34b87522-9e74-4c47-b8f5-bfbac89ef4f7","resolution":{"observed_at":"2026-05-18T05:30:55.437460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:7cab6c60c6a1df68084041829c4e43952e99df522d2b02047de93ca40340f8c3","observation_id":"f971779c-a9fc-4fd9-a9fd-738e40178cc9","resolution":{"observed_at":"2026-05-18T05:30:55.057630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:3e451deb88a2d53a34f237ecfa169fa08eb8dede1720a14a18bdfd300f702013","observation_id":"ff32e271-e228-46d2-9303-efb746bd19f2","resolution":{"observed_at":"2026-05-18T05:30:55.011142Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":"2405.21060","doi":"10.48550/arxiv.2405.21060","metadata_source":"pith","pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-07-10T21:57:38.573725Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","venue":"cs.LG","work_id":"d8eba076-0449-4f6a-aae1-5a7260677f0f","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:374f0cc47e7bd84b4626f057a5f958f701bd0577f7bb1c46915d957f225e7613","observation_id":"6f7ef904-a7d1-46ba-b1c4-818fae591acc","resolution":{"observed_at":"2026-05-18T05:30:55.147078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:a51a7aed2d2287a115b82a7e825a0c53bdae2b3f017dd1d8e6ac416e70523037","observation_id":"e85a2c3f-e98e-4305-be55-f6fefa8f9f0c","resolution":{"observed_at":"2026-05-18T05:30:55.031768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08540","last_updated":"2024-06-14T20:21:05Z","snapshot_observed_at":"2026-07-06T17:43:56.860733Z","submitted_at":"2024-03-13T13:54:00Z","title":"Language models scale reliably with over-training and on downstream tasks","version":2},"cited_work":{"arxiv_id":"2403.08540","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08540","snapshot_observed_at":"2026-07-04T20:30:07.554623Z","title":"Kanishk Gandhi, Denise Lee, Gabriel Grand, Muxin Liu, Winson Cheng, Archit Sharma, and Noah D Goodman","venue":null,"work_id":"b3ccca34-2e12-48b4-ad09-521ec9797b0c","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2403.08540","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:37af6bbf3616fc4b06aabaf5cb6982983254010e2da1f7ac6a1ed03bf73e296e","observation_id":"e5b57a8b-8ff2-4038-9194-3c93348bc488","resolution":{"observed_at":"2026-05-18T05:30:55.093261Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1260860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:47:14.558044Z","title":"He, B., Yin, L., Zhen, H.-L., Liu, S., Wu, H., Zhang, X., Yuan, M., and Ma, C","venue":null,"work_id":"e7e9d443-273d-4722-8ec7-59adb893de0e","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:7ee8a45e66b5ba9e4624aa2e4ab2e7f21e1158f6cb43e658615fbfdc27c0d2fd","observation_id":"0b9e6101-b575-4ecc-8611-f7a4b355e517","resolution":{"observed_at":"2026-05-18T05:30:55.069081Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-07-06T20:18:12.456972Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":"2501.04519","doi":"10.48550/arxiv.2501.04519","metadata_source":"pith","pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","venue":"cs.CL","work_id":"49792b83-569e-4f5f-ae80-e96cbd3b7a43","year":2025},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:a32a9556ac8ac2d37f47408b4adbcffab12b4c115f11836c97c6f8cb2c79d5d0","observation_id":"2b12d6ce-7fe1-40c5-baf4-25f423b5945b","resolution":{"observed_at":"2026-05-18T05:30:55.039488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:07.471573+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:07.471573+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:f9402023ff0dfda58abfb3d97143f96811f834328f092a7a45bc7af78d2d7fb5","observation_id":"d14a1da3-bbd1-4d8c-b2d8-95c2ae267dc2","resolution":{"observed_at":"2026-05-18T05:30:55.134729Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-07-10T16:57:24.565388Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:07ff2e5500961951539922148db4c6a069c664e5b14c78ec174900a706e8a77c","observation_id":"26c4dd41-d428-496f-94a5-2159be8a4e24","resolution":{"observed_at":"2026-05-18T05:30:55.048040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:958f800b302194de29ccfef0e16f1a383c2dd8f52aab626784eaf8f430db492f","observation_id":"313ae315-8dad-482c-899a-14b5dbf82c82","resolution":{"observed_at":"2026-05-18T05:30:54.997589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:3c206b9a705a3086f1c983ff5c9c4bdd663f420b5c6570f3758027fb6c5123b5","observation_id":"f662aaaf-2814-40c7-9a9f-294ddf7af60d","resolution":{"observed_at":"2026-05-18T05:30:55.119433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:89828484cec78410df75a9a2d8505772e0c9617a88e2922393095c678c542d97","observation_id":"87954259-ef6d-4d24-a4b2-7bf3539ab4e2","resolution":{"observed_at":"2026-05-18T05:30:55.155139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:436850170029e1388d1787f2344e04a4b369ecc7dfda4e499032b867f29deb5d","observation_id":"830e0122-ba17-4433-8bad-3fd466451386","resolution":{"observed_at":"2026-05-18T05:30:55.122777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07871","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-01T16:05:25.800937Z","submitted_at":"2024-02-12T18:33:47Z","title":"Scaling Laws for Fine-Grained Mixture of Experts","version":1},"cited_work":{"arxiv_id":"2402.07871","doi":"10.48550/arxiv.2402.07871","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.07871","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2402.07871 , year=","venue":null,"work_id":"e67733fa-7550-4e7a-b1e0-d65341a18264","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2402.07871","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:b814bb1ee5510dd461eef36228e01ccc72b08ad3b1179a26db4d6f4037e5f5d1","observation_id":"8e35aa42-8db1-4f09-a7d3-54e90d3459ab","resolution":{"observed_at":"2026-05-18T05:30:55.127020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04330","last_updated":"2024-11-30T02:42:31Z","snapshot_observed_at":"2026-08-04T07:47:22.112536Z","submitted_at":"2024-11-07T00:10:10Z","title":"Scaling Laws for Precision","version":2},"cited_work":{"arxiv_id":"2411.04330","doi":"10.48550/arxiv.2411.04330","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.04330","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spector, Blake Bordelon, Niklas Muennighoff, Mansheej Paul, Cengiz Pehlevan, Christopher Ré, and Aditi Raghunathan","venue":null,"work_id":"988bd25e-4ff9-47cd-89f4-f30e112706ec","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2411.04330","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:232a32925906e00d74172c1dc110de0c93de6f60187cf818a13b77e5808dca16","observation_id":"77a1a9f5-b51f-4a18-b02d-d7fb973e58e6","resolution":{"observed_at":"2026-05-18T05:30:55.061410Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:551ab1d13f02e74414bf3a6227a746f8e70109ed5155b8676765a2890ec77a34","observation_id":"e24042eb-c1cc-4cb0-bca9-681c1e1b0b19","resolution":{"observed_at":"2026-05-18T05:30:55.035438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-07-06T06:59:57.168051Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":"1809.02789","doi":"10.48550/arxiv.1809.02789","metadata_source":"pith","pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","venue":"cs.CL","work_id":"b9d68fc0-5b23-4def-bc5e-6ad71d64eec6","year":2018},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:4ee3256013fd37b691ed43df0291534593d8ebe44f3c3dbaa6361fa3fd435107","observation_id":"21a2512e-a594-4953-aefc-4f2821587e21","resolution":{"observed_at":"2026-05-18T05:30:55.002287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-07-06T05:00:33.838934Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":"1606.06031","doi":null,"metadata_source":"pith","pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-07-10T15:27:20.134743Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","venue":"cs.CL","work_id":"3775e6d1-2f28-4791-82a9-538c0507512c","year":2016},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:e1b92e82324fbca159d16c17df6aec45acd4deb4dd40bf1a569f2afe92aa3cae","observation_id":"b62a3903-ef66-4613-baba-02b1013818cf","resolution":{"observed_at":"2026-05-18T05:30:55.043829Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19956","last_updated":"2024-04-10T18:06:14Z","snapshot_observed_at":"2026-07-06T16:40:47.502692Z","submitted_at":"2023-10-30T19:10:06Z","title":"The Impact of Depth on Compositional Generalization in Transformer Language Models","version":2},"cited_work":{"arxiv_id":"2310.19956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19956","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2310.19956 , year=","venue":null,"work_id":"47d9b677-e2f0-4dee-b8a4-7df70ed47ec3","year":null},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2310.19956","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:a2e21cb6c9e25932f327a4165995e881956b0687b5ba5e6a6584b3f6335c6d32","observation_id":"cda07176-c96d-4846-9525-0d478dccbbda","resolution":{"observed_at":"2026-05-18T05:30:55.112323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06195","last_updated":"2024-08-12T14:42:13Z","snapshot_observed_at":"2026-07-31T21:52:59.633187Z","submitted_at":"2024-08-12T14:42:13Z","title":"Mutual Reasoning Makes Smaller LLMs Stronger Problem-Solvers","version":1},"cited_work":{"arxiv_id":"2408.06195","doi":"10.48550/arxiv.2408.06195","metadata_source":"pith","pith_arxiv_id":"2408.06195","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"L., Yang, F., and Yang, M","venue":"cs.CL","work_id":"6cb85815-b0ca-48b2-8106-652ca78e0351","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2408.06195","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:611b6fe8b25a16bbb00a4aff66beab955a68cef0fd37b6e813ece465d9625a3f","observation_id":"e49369ee-2d24-4817-8bbe-d18c2ee685ec","resolution":{"observed_at":"2026-05-18T05:30:54.993450Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10938","last_updated":"2024-10-01T23:38:10Z","snapshot_observed_at":"2026-07-06T18:15:54.402568Z","submitted_at":"2024-05-17T17:49:44Z","title":"Observational Scaling Laws and the Predictability of Language Model Performance","version":3},"cited_work":{"arxiv_id":"2405.10938","doi":"10.48550/arxiv.2405.10938","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.10938","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Observational scaling laws and the predictability of language model performance.arXiv preprint arXiv:2405.10938","venue":null,"work_id":"e584b9ea-2c55-4358-b53d-c8f3a6b3422d","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2405.10938","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:8a9673ca839dd042f850856b5c2867ffcd8f9e0d223c27a530f30844eb377f84","observation_id":"f272d83c-a6b2-4c07-b2f3-06e2045b63b0","resolution":{"observed_at":"2026-05-18T05:30:55.131188Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00448","last_updated":"2025-04-14T10:11:13Z","snapshot_observed_at":"2026-07-06T17:10:21.098136Z","submitted_at":"2023-12-31T10:53:58Z","title":"Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws","version":3},"cited_work":{"arxiv_id":"2401.00448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.00448","snapshot_observed_at":"2026-07-04T20:40:07.770901Z","title":"Beyond chinchilla-optimal: Ac- counting for inference in language model scaling laws","venue":null,"work_id":"9d425a0e-4f3c-4f59-8aaa-7d767450104a","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2401.00448","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:2ccd7fdf53efed8d5d7ceff54b16399d449ea94102a142eefc4043ba30a1cbf1","observation_id":"64973a38-ee69-4354-a109-9d52931c3803","resolution":{"observed_at":"2026-05-18T05:30:55.139126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":"1701.06538","doi":"10.48550/arxiv.1701.06538","metadata_source":"pith","pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-07-11T01:07:45.051014Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","venue":"cs.LG","work_id":"2c6b3f6d-54e4-4df7-baa7-475a490799af","year":2017},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:f82f7afa25475c3754b56a6c1d73711f808ff50c095e8a4ab83034909da99f6f","observation_id":"988fb2ff-4019-4f6b-9cd8-5ddf3e42bffa","resolution":{"observed_at":"2026-05-18T05:30:54.983448Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-07-10T16:37:23.051852Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:8cec1e6284204af1aa8f59a4458dd6e963ea51d564ac888a489645ee720db739","observation_id":"02ad5651-0047-4b35-8e23-3585d10ce9f5","resolution":{"observed_at":"2026-05-18T05:30:55.076637Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:872a5e052fb41c61eec298a877220193cbb2cc104db91395bab91da9e5d9e21d","observation_id":"e7ebcbc1-7631-4364-8326-91ff1f732d3c","resolution":{"observed_at":"2026-05-18T05:30:55.019596Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00159","last_updated":"2024-06-06T18:46:40Z","snapshot_observed_at":"2026-07-06T17:23:22.706195Z","submitted_at":"2024-01-31T20:29:50Z","title":"Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research","version":2},"cited_work":{"arxiv_id":"2402.00159","doi":"10.48550/arxiv.2402.00159","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.00159","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Dolma: An open corpus of three trillion tokens for language model pretraining research","venue":null,"work_id":"07bf7000-64b4-4c9d-9f3d-cac739d79cf3","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2402.00159","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:1896ba5cf4d5d863cbea25a2e8c66bc0f577cb243f991156c23d724919fb20d9","observation_id":"4a349a68-e32e-4bc8-9752-804a537431a2","resolution":{"observed_at":"2026-05-18T05:30:55.101246Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":"2109.10686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-07-03T20:58:58.624838Z","title":"Scale efficiently: Insights from pre-training and fine-tuning transformers.arXiv preprint arXiv:2109.10686","venue":null,"work_id":"e146a2de-a3c4-40f4-b460-0fe2d6535329","year":2021},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:f5b10a74f34f52cfed086f68b239887683f247fbecfffe2fe403ff22432818fa","observation_id":"ad6a4eb1-b724-46c8-9c8d-59507364db17","resolution":{"observed_at":"2026-05-18T05:30:55.097385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":"2403.08295","doi":"10.48550/arxiv.2403.08295","metadata_source":"pith","pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-07-10T23:07:48.332027Z","title":"Gemma: Open Models Based on Gemini Research and Technology","venue":"cs.CL","work_id":"a9ea2870-df28-40b8-a9e0-a7e9a116f793","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:8a27feae8635a6a43dfde5e7d350066a6f73c470830deee9f3ad05796e569302","observation_id":"b10b1dce-e4e7-4b07-b21d-a88466423d0d","resolution":{"observed_at":"2026-05-18T05:30:55.088775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:0fa7ef1879f02e3610d8e99e5f5630be5642781b6e3a57eb269c65d756b43e14","observation_id":"693b4fc7-6cb5-4544-bafe-17a44bd934c4","resolution":{"observed_at":"2026-05-18T05:30:55.142851Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":"1804.07461","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-07-04T09:19:44.134394Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","venue":"cs.CL","work_id":"1bb6fb0c-482d-43cf-94a8-ed18f72a5563","year":2018},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:c192346c68d6c2832a4177b0885b2e4291068be3b7b3c474014b699c33ec6c20","observation_id":"5d0bb1cb-a0b8-4006-b2cc-121d4b7df4e1","resolution":{"observed_at":"2026-05-18T05:30:55.064540Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":"2206.07682","doi":"10.48550/arxiv.2206.07682","metadata_source":"pith","pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Emergent Abilities of Large Language Models","venue":"cs.CL","work_id":"6ea3375b-837c-4640-a175-be7525aa3c6d","year":2022},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:a7f397dc875ec3983c90a9192be4ecadf0c8d0f46df06dad99b1539961c63f77","observation_id":"a32cf55a-0359-4b57-b055-0f8711cce19d","resolution":{"observed_at":"2026-05-18T05:30:55.072724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-07-06T05:51:51.253539Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":"1707.06209","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-07-04T00:59:20.987277Z","title":"Crowdsourcing Multiple Choice Science Questions","venue":"cs.HC","work_id":"d186f73e-dc39-4d8f-9c07-fb134a60433d","year":2017},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:5fb2c8b8d260fa3d3b10546d651a8713a564d645093b0bac34fc5cdd3e3c9a69","observation_id":"808db350-a29a-451b-8c6a-d6ad43d91182","resolution":{"observed_at":"2026-05-18T05:30:55.108024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":"2309.17453","doi":"10.48550/arxiv.2309.17453","metadata_source":"pith","pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":"cs.CL","work_id":"a8d25452-c237-48c9-88a4-682717c3979a","year":2023},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:4476b7f2c7c0e6c938cc1090a7304f7d66a2fb1b794430adc5ebb1f2f53345dc","observation_id":"3dc8d93e-5ac6-4414-b19f-b16be7165640","resolution":{"observed_at":"2026-05-18T05:30:55.015207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":"2410.10819","doi":"10.48550/arxiv.2410.10819","metadata_source":"pith","pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","venue":"cs.CL","work_id":"dcb5f5ed-ec94-4386-bfa7-02fcaeb844f1","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:c7a1c4068decdbb7d652b25a54198dc4573c4daf009bf3038d0328bc8c8c7367","observation_id":"3da75dd6-ac2e-46ec-b23c-ecce9857d078","resolution":{"observed_at":"2026-05-18T11:49:16.947404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:9c7e35b94cd67fa5a0deb9802aa154df4310e1592904f3539cf5811e869fa338","observation_id":"72fca583-44f3-4719-980d-b715d56f87f3","resolution":{"observed_at":"2026-05-18T05:30:55.085018Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01005","last_updated":"2025-04-21T20:10:11Z","snapshot_observed_at":"2026-07-06T20:15:36.280948Z","submitted_at":"2025-01-02T02:02:20Z","title":"FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving","version":2},"cited_work":{"arxiv_id":"2501.01005","doi":"10.48550/arxiv.2501.01005","metadata_source":"pith","pith_arxiv_id":"2501.01005","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving","venue":"cs.DC","work_id":"a153885b-2460-4177-9053-8d0011adfcb9","year":2025},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2501.01005","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:8a4d36866bdc0be1a32a8ec5c6d62e3a31c97cc407b8183e3d41796e8abd1448","observation_id":"366e5d4d-bf24-4113-9445-f6f00f570e4d","resolution":{"observed_at":"2026-05-18T05:30:55.023596Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":"2502.11089","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-07-10T01:36:44.142264Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","venue":"cs.CL","work_id":"c74d35ec-94d3-48f5-a291-20cfad7c04a3","year":2025},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:4ecc3a46cb936b3ff0c9731255ea5f1f11d67b22edc35ab5950caa166891722a","observation_id":"817612f6-1772-48df-8973-acaaf0cd85c5","resolution":{"observed_at":"2026-05-18T05:30:55.027469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":"1905.07830","doi":"10.48550/arxiv.1905.07830","metadata_source":"pith","pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","venue":"cs.CL","work_id":"79f44c0c-96f4-4edb-bc50-a3c9d6b85936","year":2019},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:28dc7858ded33719d7dc4d2dd87988f1b0a36377df7a91bf4519d21a06023d41","observation_id":"3e18282a-a525-43b9-8ffc-343806a7f11b","resolution":{"observed_at":"2026-05-18T05:30:55.007029Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":"2401.02385","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-07-09T21:16:34.311040Z","title":"TinyLlama: An Open-Source Small Language Model","venue":"cs.CL","work_id":"d2c14bfc-b868-4f6d-8b13-12bf89321d47","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:2b66a343694ec3e638e45bef4cc1ed7055aa49159e33c85d5d82aa0eb245ba77","observation_id":"c338478b-de5f-4260-961b-ead6fc97eb4e","resolution":{"observed_at":"2026-05-18T05:30:55.150782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It was not used to generate research ideas","venue":null,"work_id":"3fce6d6a-cdb9-4fad-8995-7e603473ba30","year":2048},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:608813b01445dc0934cd4b2a952dba7f7371988b8809af4f92a47eae3eab1328","observation_id":"85388c2f-c1de-4033-879f-dc63fd0b9bcc","resolution":{"observed_at":"2026-05-18T05:30:55.447361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Across varying batch sizes and model scales, larger hidden sizes yield higher inference throughput under a fixed parameter budget","venue":null,"work_id":"3dcc0fbd-32e1-4b5a-8d11-11d4c8f5c387","year":2000},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:f30354d4353eef1fb952b1d234d617663f819b4d40aba5c087b84e260033753b","observation_id":"5fc007a8-5807-40d6-89ee-8db1be66b5e0","resolution":{"observed_at":"2026-05-18T05:30:55.449858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moreover, while multiplicative and additive calibrations differ in formulation, their MSE and Spearman values remain nearly identical","venue":null,"work_id":"0ca989ba-53de-4f89-b1f4-263f495fca94","year":2020},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:a51dedb803336409234b1ce2593d0671cd2a3bdffd6da8a8615fe3940c339e3c","observation_id":"2b9ec17b-1782-4749-8eca-43101dfe8541","resolution":{"observed_at":"2026-05-18T05:30:55.445040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ef0820b2-97fa-43bc-81c3-405f9e0d1d5f","year":2048},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:8172e0c5fdd1d22133e8cfd4897640b90c0f243e86a8f2c5b845f4fd32f1c709","observation_id":"8cfb120f-2eff-4147-9a34-e2b24c757cf4","resolution":{"observed_at":"2026-05-18T05:30:55.439819Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":1,"verified_exact":44,"verified_fuzzy":5},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2510.18245."}