{"as_of":"2026-08-20T17:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a8eb829f5a1e494e544605be43d2492436574b10303dcc20810bf997be272c68","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:01:13.489269Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23032/citation-record","integrity":"/paper/2505.23032/integrity","json":"/paper/2505.23032/citation-record.json","paper":"/paper/2505.23032"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.02095","last_updated":"2021-10-05T14:49:00Z","snapshot_observed_at":"2026-08-18T12:17:52.231482Z","submitted_at":"2021-10-05T14:49:00Z","title":"Exploring the Limits of Large Scale Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02095","snapshot_observed_at":"2026-08-07T13:01:06.827148Z","title":"Exploring the limits of large scale pre-training.arXiv preprint arXiv:2110.02095,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:06.827148Z"},"links":{"cited_paper":"/paper/2110.02095","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:ce797ade10180daaf04f0e9df78e0bfdab2b360ca00af700575dd1d215e1ccc2","observation_id":"fdd2f264-e713-4ecc-a805-a541387c8870","resolution":{"observed_at":"2026-08-07T13:01:06.827148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:15.615245Z","title":"LC-PFN includes its own normalization method for y-values, enabling it to predict learning curves across various ranges and directions","venue":null,"work_id":"1759a86a-b6df-465b-8665-95297fcb2e8a","year":2021},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:12.612897Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:c8801c6e8a852873a91d21d9fa183fdb5aa75a2e440a270bc9a965fb0cf8a603","observation_id":"9c05f761-d0e2-4959-a44b-e57c05670dd6","resolution":{"observed_at":"2026-08-07T13:01:15.723117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:15.462503Z","title":null,"venue":null,"work_id":"0f559d74-3c88-4eed-9fdc-96d837c833e9","year":2021},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:12.734525Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:63f8d303436c606e182d650147baa29f3ce93982d7678c65fe74a95b3c3a4eca","observation_id":"e0439754-151a-43f1-b06a-f278a1964b61","resolution":{"observed_at":"2026-08-07T13:01:15.543246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T13:01:07.639110Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding.arXiv preprint arXiv:1810.04805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:07.639110Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:921fa1bfeae4e7ad5074465a2a1ff11b4aea3bb17d90b1fc6e8b840766190750","observation_id":"77b3b307-14c7-4a15-b40f-5f22e5ea9932","resolution":{"observed_at":"2026-08-07T13:01:07.639110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T13:01:07.863181Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:07.863181Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:52b57ec951d2106c49189a62346103bac8074ed461a9cafa8399bbe9ca8d5aea","observation_id":"eb18a8bd-7f8d-4043-b2f9-b52da951dc1a","resolution":{"observed_at":"2026-08-07T13:01:07.863181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04522","last_updated":"2019-10-10T12:49:22Z","snapshot_observed_at":"2026-08-19T11:23:20.631993Z","submitted_at":"2019-10-10T12:49:22Z","title":"Probabilistic Rollouts for Learning Curve Extrapolation Across Hyperparameter Settings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04522","snapshot_observed_at":"2026-08-07T13:01:08.180763Z","title":"Proba- bilistic rollouts for learning curve extrapolation across hy- perparameter settings.arXiv preprint arXiv:1910.04522,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:08.180763Z"},"links":{"cited_paper":"/paper/1910.04522","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:9b76c3d61ff93a9220fdc539180e109b64ecd6da981137a5457dadc8bac7c569","observation_id":"f2d8515e-2c6b-4839-8602-98daed0520dc","resolution":{"observed_at":"2026-08-07T13:01:08.180763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07740","last_updated":"2021-09-16T06:15:20Z","snapshot_observed_at":"2026-08-17T22:13:03.033204Z","submitted_at":"2021-09-16T06:15:20Z","title":"Scaling Laws for Neural Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07740","snapshot_observed_at":"2026-08-07T13:01:08.302824Z","title":"Scaling laws for neural machine translation.arXiv preprint arXiv:2109.07740,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:08.302824Z"},"links":{"cited_paper":"/paper/2109.07740","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:2ecac0f892daecc0e4dd03bbf6aa34687acefa1a1da3b7051ab9ffa783965d0a","observation_id":"1382cf42-2a8d-4721-a172-7a1bbde7e19e","resolution":{"observed_at":"2026-08-07T13:01:08.302824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:18.282403Z","title":"A., Duh, K., and Kaplan, J","venue":null,"work_id":"9020d828-d5f2-4af3-ae42-406cac28cd26","year":2021},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:08.306717Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:802108af417d6bc96ba8e870233069355ad58ecfc577a5a0aeee1fbe4c486f6e","observation_id":"0cd22627-902f-417d-bd1c-ff5840d1d0c4","resolution":{"observed_at":"2026-08-07T13:01:18.373051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-07T13:01:08.309768Z","title":"and Dao, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:08.309768Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:26c21486b1e668ff5a194822734a870dfb681e75dd31dc1692d86bed6afa1b06","observation_id":"f9d6c398-719c-4519-86e5-51c99222c00c","resolution":{"observed_at":"2026-08-07T13:01:08.309768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T13:01:08.318171Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:08.318171Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:5831dbc22f2b199f5e6d1077363b682c603c22a8b3d1ca2ba7f9d525082996e9","observation_id":"a1196ffd-17e5-4607-9739-8ec17f15943e","resolution":{"observed_at":"2026-08-07T13:01:08.318171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01848","last_updated":"2023-09-16T09:33:32Z","snapshot_observed_at":"2026-08-16T22:29:42.020081Z","submitted_at":"2022-07-05T07:17:43Z","title":"TabPFN: A Transformer That Solves Small Tabular Classification Problems in a Second","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01848","snapshot_observed_at":"2026-08-07T13:01:08.424671Z","title":"Tabpfn: A transformer that solves small tabu- lar classification problems in a second.arXiv preprint arXiv:2207.01848,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:08.424671Z"},"links":{"cited_paper":"/paper/2207.01848","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:2a2b0ee8b1755cca7b9be00143f2f9630d7a88525e3bdf9522ebb0d62b8e4a94","observation_id":"9638e76d-ca03-4e52-8dfc-14dde6a80ae7","resolution":{"observed_at":"2026-08-07T13:01:08.424671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1112.5745","last_updated":"2011-12-24T17:53:19Z","snapshot_observed_at":"2026-08-17T04:17:54.065503Z","submitted_at":"2011-12-24T17:53:19Z","title":"Bayesian Active Learning for Classification and Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1112.5745","snapshot_observed_at":"2026-08-07T13:01:08.593177Z","title":"Bayesian active learning for classification and preference learning.arXiv preprint arXiv:1112.5745,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:08.593177Z"},"links":{"cited_paper":"/paper/1112.5745","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:6a3c339d86522ae1f886e353d4ee7d5eadd101e8ac4997b5ab6c5e024f8da95b","observation_id":"b6a147d3-b88b-4145-8350-0c0cbf31437b","resolution":{"observed_at":"2026-08-07T13:01:08.593177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T13:01:08.900521Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:08.900521Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:b6411a7a4403b6c713c0f4058aa6664d7b5fe37fb168d759c8db92cdc5bf8e69","observation_id":"05738292-c67b-4e03-94db-251f250f987a","resolution":{"observed_at":"2026-08-07T13:01:08.900521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T13:01:09.077805Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:09.077805Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:589c93b919e96a9516af36a64da2fd8396134a0715f751422db0782a2687b7c2","observation_id":"185d4cf6-1f3f-454d-920c-238f96a17562","resolution":{"observed_at":"2026-08-07T13:01:09.077805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:17.955069Z","title":"Big transfer (bit): General vi- sual representation learning","venue":null,"work_id":"f9e7934b-7476-4941-981a-1b2c33586d05","year":2020},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:09.270355Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:0b9d80989f809df89ef8aad05ce9949f5e9291d6235307b5e793ebee7c7c051e","observation_id":"ced9f3ce-ce25-4a6a-bd1d-a94109fe6646","resolution":{"observed_at":"2026-08-07T13:01:18.029104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12150","last_updated":"2025-01-28T14:39:26Z","snapshot_observed_at":"2026-08-16T17:25:14.313413Z","submitted_at":"2022-01-28T14:34:32Z","title":"Learning Curves for Decision Making in Supervised Machine Learning: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12150","snapshot_observed_at":"2026-08-07T13:01:09.624853Z","title":"and van Rijn, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:09.624853Z"},"links":{"cited_paper":"/paper/2201.12150","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:038fd3dd2027238b61e5188bb1fc469c477c23d7496a5a2e30fbd1cf0a8e9bf2","observation_id":"917e5e46-da28-41c3-9087-494e22d20220","resolution":{"observed_at":"2026-08-07T13:01:09.624853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:17.771222Z","title":"Deep double descent: Where bigger models and more data hurt.Journal of Statistical Mechan- ics: Theory and Experiment, 2021(12):124003,","venue":null,"work_id":"a914a5db-e662-4d9b-964b-722639907dc6","year":2021},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:09.893412Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:d4e44b0e3544f74dfbc0f39f75e3e133d157f204576422b75960db6fd4ae779e","observation_id":"2e297b8a-b8e3-4ea8-b205-ee52f7c2d91a","resolution":{"observed_at":"2026-08-07T13:01:17.852426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16795","last_updated":"2024-08-12T12:24:45Z","snapshot_observed_at":"2026-08-16T13:57:47.808045Z","submitted_at":"2024-04-25T17:40:52Z","title":"In-Context Freeze-Thaw Bayesian Optimization for Hyperparameter Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16795","snapshot_observed_at":"2026-08-07T13:01:10.039009Z","title":"In-context freeze-thaw bayesian optimization for hyperparameter optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:10.039009Z"},"links":{"cited_paper":"/paper/2404.16795","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:bcaff486a7ac14e0427c0ba59bee92812aad85a70e02263ec76a0fb135f50d72","observation_id":"41ac1026-cf3f-4f01-a04e-f2fa094152aa","resolution":{"observed_at":"2026-08-07T13:01:10.039009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07686","last_updated":"2021-08-17T15:37:05Z","snapshot_observed_at":"2026-08-16T18:02:42.585344Z","submitted_at":"2021-08-17T15:37:05Z","title":"Scaling Laws for Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07686","snapshot_observed_at":"2026-08-07T13:01:10.240133Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:10.240133Z"},"links":{"cited_paper":"/paper/2108.07686","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:dba08379878b1434f460cc55ccf21edb9329d475293ef45bd7798ec940277b30","observation_id":"63f008db-3ba3-4339-9a0d-85137d6cff62","resolution":{"observed_at":"2026-08-07T13:01:10.240133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12673","last_updated":"2019-12-20T18:20:34Z","snapshot_observed_at":"2026-08-14T10:01:12.940280Z","submitted_at":"2019-09-27T13:27:53Z","title":"A Constructive Prediction of the Generalization Error Across Scales","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.12673","snapshot_observed_at":"2026-08-07T13:01:10.422809Z","title":"S., Rosenfeld, A., Belinkov, Y ., and Shavit, N","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:10.422809Z"},"links":{"cited_paper":"/paper/1909.12673","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:c6661674b0062aa1e5946bd5dc9f5a27e39dbc77fdc3d0ee6351aad2263cac1a","observation_id":"f304bba6-12a5-4e57-9755-0e607ee82ca7","resolution":{"observed_at":"2026-08-07T13:01:10.422809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:10.601654Z","title":"Sharma, U","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:10.601654Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:8f16dcae60695becaa787c4702c7c08c11cbe6c5f0c26ad229f38f4bb0c7450f","observation_id":"28fdb080-4af9-49d4-a6ce-036d9a6149b1","resolution":{"observed_at":"2026-08-07T13:01:10.601654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.3896","last_updated":"2014-06-16T03:43:20Z","snapshot_observed_at":"2026-08-14T23:30:18.055974Z","submitted_at":"2014-06-16T03:43:20Z","title":"Freeze-Thaw Bayesian Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.3896","snapshot_observed_at":"2026-08-07T13:01:10.758299Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:10.758299Z"},"links":{"cited_paper":"/paper/1406.3896","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:76d53b30f713bf3d0714db8e4eb8c50e294548f188df7ac64f992f5a4aa9d0c4","observation_id":"47003c76-beec-4893-bb10-ac69546a5f06","resolution":{"observed_at":"2026-08-07T13:01:10.758299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11946","last_updated":"2020-09-11T05:08:01Z","snapshot_observed_at":"2026-08-10T19:44:30.311627Z","submitted_at":"2019-05-28T17:05:32Z","title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11946","snapshot_observed_at":"2026-08-07T13:01:10.912570Z","title":"Efficientnet: Rethinking model scaling for convolu- tional neural networks.arXiv preprint arXiv:1905.11946,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:10.912570Z"},"links":{"cited_paper":"/paper/1905.11946","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:3013bffeca383a792cfef6f8c22f23ff50ca601473daaa0f003dea9ac7baea5d","observation_id":"8dceb799-15c7-4d3a-82f3-978fb371e9d4","resolution":{"observed_at":"2026-08-07T13:01:10.912570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-07T13:01:11.120689Z","title":"Lamda: Language models for dialog appli- cations.arXiv preprint arXiv:2201.08239,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:11.120689Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:45236924749061df108b08eea55c6768b03aa075a909f44f8a2d57f54fff41f2","observation_id":"a10f4bca-2e6b-4766-bb59-07f1ad731e60","resolution":{"observed_at":"2026-08-07T13:01:11.120689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:01:11.277616Z","title":"Llama: Open and efficient foundation lan- guage models.arXiv preprint arXiv:2302.13971, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:11.277616Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:51220fec2d4c3b75c54d16aadb8cc9daf7509a9a43ab0a7bb2af984f1d890cf4","observation_id":"09475916-3935-4c85-bd93-a8a7358fb0bc","resolution":{"observed_at":"2026-08-07T13:01:11.277616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10093","last_updated":"2024-05-22T15:06:45Z","snapshot_observed_at":"2026-08-16T13:52:10.210375Z","submitted_at":"2024-05-16T13:44:56Z","title":"LaT-PFN: A Joint Embedding Predictive Architecture for In-context Time-series Forecasting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10093","snapshot_observed_at":"2026-08-07T13:01:11.415372Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:11.415372Z"},"links":{"cited_paper":"/paper/2405.10093","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:738ff3cf5ab66940bd4e3973cb611e659c7d0e11307ae1806b4ba26c81e15b5e","observation_id":"236a4a35-7656-44fe-bd5b-71517a8e2383","resolution":{"observed_at":"2026-08-07T13:01:11.415372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:17.630822Z","title":null,"venue":null,"work_id":"46bd3ea1-6ee1-4320-886c-ecf8878d867d","year":2017},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:11.528012Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:745dfa3b542ac77d691818d83ab27fcd24e79ca08b7cbbae0325f367d29c94fd","observation_id":"a2a2197e-cc72-41fe-ada7-cf7a83c95839","resolution":{"observed_at":"2026-08-07T13:01:17.690861Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:17.414464Z","title":"Alabdulmohsin et al","venue":null,"work_id":"69ebedbc-49c5-4356-b108-aa19e7303d1e","year":2022},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:11.614395Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:fbbdc832bf4c554e8b0f75cc67f3c551c4f38fdcbe3eec9704af94f11dcf7dde","observation_id":"9f92c4b2-651f-4390-85aa-9f464995aaff","resolution":{"observed_at":"2026-08-07T13:01:17.515798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:17.267854Z","title":"point estimates","venue":null,"work_id":"4f1c5332-e184-458f-8f9c-20585fab3d82","year":2015},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:11.746652Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:d7becb77aec2e1b8b83b4120772cc212262ecea63ed69501e61ea590f8ec25bd","observation_id":"64b6c894-f62b-4144-94e0-84e1bcc64334","resolution":{"observed_at":"2026-08-07T13:01:17.332057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:17.083870Z","title":"For each downstream task, the benchmark provides 18 scaling law variations (2 model sizes × 3 model types × 3 few-shot settings), resulting in a total of 72 scaling laws","venue":null,"work_id":"58ea640f-35ab-4801-9e95-1eda483cde59","year":2015},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:11.845154Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:93b1a65041b04f6f29789f9d1ded8901812053fd36f756e41356cdb891182cf8","observation_id":"f8c2a3c5-2cc9-4d77-abc9-588e68cd5c2d","resolution":{"observed_at":"2026-08-07T13:01:17.158123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:16.911728Z","title":null,"venue":null,"work_id":"18ff8ea2-2a3b-4668-b0b4-c7b8ef2725f9","year":2023},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:11.974374Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:de7433ef20c644e370b3d667ebacfc066642795ae01bd714c6a07d3e4f23e78e","observation_id":"ba26bcd2-b287-4b0f-8faa-40350071b5bb","resolution":{"observed_at":"2026-08-07T13:01:17.011746Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:16.738143Z","title":"nanoGPT-Bench (Nano) is a benchmark introduced in (Kadra et al., 2023), which evaluates the performance of nanoGPT trained on the OpenWebText dataset (Gokaslan et al.,","venue":null,"work_id":"43c76429-d4f3-4c12-97cd-2fa0e720379f","year":2023},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:12.050925Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:a24c890fa78264b310f9c544a133cb277e26176bfc7bc5d7c61a117f843df703","observation_id":"56f86d2c-f5d5-4840-b3ed-9309e333a37c","resolution":{"observed_at":"2026-08-07T13:01:16.849019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:16.556636Z","title":"Both the final and best performance are reported, resulting in a total of 24 scaling laws","venue":null,"work_id":"9a07e70f-4a8d-481d-9daa-c84778ee12de","year":2021},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:12.118045Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:0b068b1f9770ede90ea2ac2b7eadbc818a5a3baf72059c7b88fa908cb3408f85","observation_id":"7baf59dc-cabc-4b67-bece-2bdac6acd460","resolution":{"observed_at":"2026-08-07T13:01:16.657629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:16.369958Z","title":"In these scaling laws, the x-axis represents either the model embedding size or the number of observed examples, while the y-axis reflects the test error or cross-entropy test loss","venue":null,"work_id":"a88cc622-d3c7-4144-9794-e560e367412d","year":2022},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:12.216466Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:47373d4a06aa410cf20bc6d3282d266a84d42e2c4ba26eb450bde364d76ef3c1","observation_id":"aa110da6-e63b-4d61-9c9c-0027d683f000","resolution":{"observed_at":"2026-08-07T13:01:16.462680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:16.149063Z","title":null,"venue":null,"work_id":"0893307d-3f0e-4005-87b4-3ea5cd1434b5","year":2013},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:12.298608Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:02095e1ce8cfdf17760cdc6c5d4eb3b5b4bc2e8285ca6c27b298bcf8601cabe9","observation_id":"f204a248-9cbb-44fa-be96-b1a7086c7da8","resolution":{"observed_at":"2026-08-07T13:01:16.261718Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:15.964976Z","title":"Hyperparameters, including those of the neural network used as the basis function for BLR, are tuned via marginal log-likelihood","venue":null,"work_id":"bc64ca48-79bc-4531-a9f3-6a978c6a6172","year":2016},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:12.386864Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:a2494d519b0ca60c96717154fed4253b39ae823e4a233ebd2f4d8d019668bd36","observation_id":"6310bd41-068a-4b09-897c-74ec254e7c83","resolution":{"observed_at":"2026-08-07T13:01:16.053455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:15.794851Z","title":"As shown in Table 12, BLR models with predefined basis functions exhibit significant performance degradation","venue":null,"work_id":"27b6d470-644f-4bb6-9d2b-3fac21787b50","year":2023},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:12.521966Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:8c1f07d4d24877ac763d47ae5b5346a3461dd76674840b8e5dc9fd2a8d272916","observation_id":"e85c61cf-b281-4ab8-bbca-579c163d59cb","resolution":{"observed_at":"2026-08-07T13:01:15.877690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:15.258647Z","title":null,"venue":null,"work_id":"1958a6a1-0ac4-4b83-8f97-6024741d4b66","year":2021},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:12.889101Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:4a9704e2daeabc7874ac6c79404a16bff38f87938959f58b6dd9f7bdc3717bf2","observation_id":"85ba6b84-2a41-499d-abb4-11e634c12ae8","resolution":{"observed_at":"2026-08-07T13:01:15.381096Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:15.058413Z","title":null,"venue":null,"work_id":"ef79c453-b762-44a1-9202-b27fa07021ef","year":2021},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:12.989299Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:23bb1e3fbe1e77afbb7a19ce1fcb2747887746be1d2de1630be25bf6bb5e1a14","observation_id":"454c9c9a-eb8d-4abe-8a6d-e60a2ae5e77a","resolution":{"observed_at":"2026-08-07T13:01:15.150691Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:14.871841Z","title":null,"venue":null,"work_id":"7e08a711-ab74-45ee-8704-92391399a534","year":2021},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:13.132850Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:cbbe603f2e83a541687293027f610975364bf7baae67f68a324d912f31044c9f","observation_id":"76ff4ed8-7639-45fb-b855-d520eb53432b","resolution":{"observed_at":"2026-08-07T13:01:14.988379Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:14.736529Z","title":null,"venue":null,"work_id":"1ac82a2f-a673-446d-adca-e885300c0a95","year":2021},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:13.240042Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:9e41bcb7176ee2a0a78ace84ae389bff575afddb51af07db2dcdd7f3fd587e0e","observation_id":"e9d365ba-7a9f-45ae-9835-eeb2b9dbf2e8","resolution":{"observed_at":"2026-08-07T13:01:14.799387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:14.581732Z","title":null,"venue":null,"work_id":"bbfc5b21-5a5a-4b69-ac63-4bc21fea0d18","year":2021},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:13.307379Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:e5aa93db17664cbd949bc652ac4d44781b7ab60fef0e19dc8b95b16af3644121","observation_id":"8e20e35e-b20b-40e6-a531-448f380a0643","resolution":{"observed_at":"2026-08-07T13:01:14.648193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:14.418093Z","title":null,"venue":null,"work_id":"152c4955-a800-4f30-9a63-a1459315b852","year":2021},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:13.391618Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:a95de5e82d597fe4039958b460a7e6248f941ba5a9afd39fd56ebf3e486c463e","observation_id":"55d78090-472b-4055-b782-1d35016fc46a","resolution":{"observed_at":"2026-08-07T13:01:14.509419Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:14.233263Z","title":null,"venue":null,"work_id":"b3744c6b-987e-4df3-841e-23a73420c14e","year":2021},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:13.489269Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:ed1004f05ecc478b1247a13cefea4985cfd1a6ece580151a70945a45a0b93572","observation_id":"74a19e3d-2831-4e03-b995-85aa163ea3ed","resolution":{"observed_at":"2026-08-07T13:01:14.319633Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10510","last_updated":"2024-08-13T09:58:44Z","snapshot_observed_at":"2026-08-16T17:33:17.947651Z","submitted_at":"2021-12-20T13:07:39Z","title":"Transformers Can Do Bayesian Inference","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10510","snapshot_observed_at":"2026-08-07T13:01:09.751664Z","title":"P., Grabocka, J., and Hutter, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:09.751664Z"},"links":{"cited_paper":"/paper/2112.10510","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:b747942a6f2580dc870758e724c1a1c15c671c48f313ede347467a6670f7c01a","observation_id":"da1cbe46-0efa-4a87-89f1-2f9e62c76555","resolution":{"observed_at":"2026-08-07T13:01:09.751664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:18.664394Z","title":"Bojar, O., Buck, C., Federmann, C., Haddow, B., Koehn, P., Leveling, J., Monz, C., Pecina, P., Post, M., Saint- Amand, H., et al","venue":null,"work_id":"5794d18d-718c-40c6-8b8d-7d2ce19fdbe2","year":2014},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:07.182351Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:01f035e53d19ddbdd671753174c4cab1fb210896a3c786b5bb9f9dff8399085c","observation_id":"89758209-cf53-49f0-a7df-eb0e457a1ad2","resolution":{"observed_at":"2026-08-07T13:01:18.760694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:18.133085Z","title":"Pre- dicting accuracy on large datasets from smaller pilot data","venue":null,"work_id":"1efa9b75-50d5-4357-b3ef-d4e1cf08bdc7","year":2018},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:08.774770Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:e89fb0608c243d33ff67dd49e59a21974eed4e6703733698753210e0a9dc4ba9","observation_id":"1579d161-20ba-49d2-b4ef-531731c92ff8","resolution":{"observed_at":"2026-08-07T13:01:18.206556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:18.459298Z","title":"and Lane, I","venue":null,"work_id":"c7776085-cdc0-4649-9b20-a8182e27923b","year":2017},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:07.423860Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:0199a6013c38a74a4f4e03e6ab06a817f998a8e63d35f31d49c57d7677349e0d","observation_id":"d07133d3-8122-4490-bc16-2b2065132a5e","resolution":{"observed_at":"2026-08-07T13:01:18.548458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-07T13:01:07.281201Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:07.281201Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:6c3e979cc1e9604f4666493f06699b58ae140ede8af6f348b4d5cc58a1b05b78","observation_id":"444f3cbc-131b-4dd7-a666-013374b0900c","resolution":{"observed_at":"2026-08-07T13:01:07.281201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-07T13:01:07.715248Z","title":"A survey on in-context learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:07.715248Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:70d1ff691767d6e0d4751ed5da9629573d2641606d4dce9ebe6ceca099c826d0","observation_id":"ab99f2b2-7929-4bd2-afee-3fa4de63f9c4","resolution":{"observed_at":"2026-08-07T13:01:07.715248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06348","last_updated":"2016-01-07T21:08:10Z","snapshot_observed_at":"2026-08-19T10:11:22.528882Z","submitted_at":"2015-11-19T20:38:43Z","title":"How much data is needed to train a medical image deep learning system to achieve necessary high accuracy?","version":2},"cited_work":{"arxiv_id":"1511.06348","doi":null,"metadata_source":"pith","pith_arxiv_id":"1511.06348","snapshot_observed_at":"2026-08-07T13:01:14.011289Z","title":"How much data is needed to train a medical image deep learning system to achieve necessary high accuracy?","venue":"cs.LG","work_id":"0e3efdeb-54f2-42c4-97ad-1acc7c709679","year":2015},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:07.496686Z"},"links":{"cited_paper":"/paper/1511.06348","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:2b3a1031b5d7e65ca86941d2438b96069ac92509414a14ee418108d1f19bcbe6","observation_id":"4cce7a69-a793-481a-bb78-c776ecbb5e0a","resolution":{"observed_at":"2026-08-07T13:01:14.084310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17918","last_updated":"2024-05-28T07:38:39Z","snapshot_observed_at":"2026-08-16T13:48:44.577363Z","submitted_at":"2024-05-28T07:38:39Z","title":"Cost-Sensitive Multi-Fidelity Bayesian Optimization with Transfer of Learning Curve Extrapolation","version":1},"cited_work":{"arxiv_id":"2405.17918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.17918","snapshot_observed_at":"2026-08-07T13:01:13.690720Z","title":"Cost-Sensitive Multi-Fidelity Bayesian Optimization with Transfer of Learning Curve Extrapolation","venue":"cs.LG","work_id":"bdaf0e36-d9a7-465e-ac30-57ea910bfed6","year":2024},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:09.449061Z"},"links":{"cited_paper":"/paper/2405.17918","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:10373ceceed0c86b1f5af0e5654547a7347237581d1c6f2229ea0833d6f89d2b","observation_id":"f5939238-4506-4893-a364-d953de9fb331","resolution":{"observed_at":"2026-08-07T13:01:13.793491Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:08.043296Z","title":"Learning generative visual models from few training examples: An incremen- tal bayesian approach tested on 101 object categories","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:08.043296Z"},"links":{"citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:715dad6908a3efef6aa44a9c62ef364f60bed96c8c873883aa37188e1a574a83","observation_id":"b2687651-7b3a-4c08-af57-a1711c93a170","resolution":{"observed_at":"2026-08-07T13:01:08.043296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14891","last_updated":"2023-07-24T00:05:04Z","snapshot_observed_at":"2026-08-18T12:06:50.233450Z","submitted_at":"2022-10-26T17:45:01Z","title":"Broken Neural Scaling Laws","version":17},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14891","snapshot_observed_at":"2026-08-07T13:01:07.344212Z","title":"Broken neural scaling laws.arXiv preprint arXiv:2210.14891,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:07.344212Z"},"links":{"cited_paper":"/paper/2210.14891","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:6603b8191881244cf9ae0a2b89c91442611af0d76ec6fccdfce02787460f96c0","observation_id":"282fcb84-bb5a-4003-a40f-89c1026087ec","resolution":{"observed_at":"2026-08-07T13:01:07.344212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:01:06.967498Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:06.967498Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:5fd0428074757685d96d51f6d73e3db2550eb3e92e3a1e05d7a55f9009d038ed","observation_id":"0c15ca9f-ddbb-4021-a0c8-fc0b51a2fc80","resolution":{"observed_at":"2026-08-07T13:01:06.967498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T13:01:07.078889Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv: 2010.11929,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:07.078889Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:deffc233501dbf8a665ec4bd441d98a9a0e311cce5ec1990672e60128f4588dd","observation_id":"ac97fa5b-1e38-48a6-9fe9-66199ed4dad7","resolution":{"observed_at":"2026-08-07T13:01:07.078889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-08-14T02:46:56.838057Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-07T13:01:08.312943Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:08.312943Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:2c989ddf28f686ac9c151f537019d93276bbb074c5a56685ac37a5e156612533","observation_id":"bb8821e6-5ba6-45c5-a6d2-f5a79739dda9","resolution":{"observed_at":"2026-08-07T13:01:08.312943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11840","last_updated":"2025-06-02T19:33:41Z","snapshot_observed_at":"2026-08-18T21:56:06.362460Z","submitted_at":"2024-10-15T17:59:10Z","title":"A Hitchhiker's Guide to Scaling Law Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11840","snapshot_observed_at":"2026-08-07T13:01:07.578271Z","title":"10 Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks Chung, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:07.578271Z"},"links":{"cited_paper":"/paper/2410.11840","citing_paper":"/paper/2505.23032"},"observation_digest":"sha256:0a84a4b283aab0462bbb69e6445d3c049679772db4fa969bc6ff30aaf98046a6","observation_id":"c9e54adb-4ead-45dc-8789-86d25bd2e632","resolution":{"observed_at":"2026-08-07T13:01:07.578271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23032","last_updated":"2025-06-16T01:34:25Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T10:59:21.656397Z","submitted_at":"2025-05-29T03:19:17Z","title":"Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":2,"verified_fuzzy":15},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2505.23032."}