{"as_of":"2026-08-08T05:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:670f6eb95dfeef998e7eb1e68c1a99d6dd4666f4401e5a2ff7770057624984a4","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:09:51.114106Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.19893/citation-record","integrity":"/paper/2505.19893/integrity","json":"/paper/2505.19893/citation-record.json","paper":"/paper/2505.19893"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.16827","last_updated":"2024-08-02T17:59:31Z","snapshot_observed_at":"2026-08-03T03:15:21.035418Z","submitted_at":"2024-02-26T18:54:35Z","title":"A Survey on Data Selection for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16827","snapshot_observed_at":"2026-08-07T14:09:44.390210Z","title":"M., Longpre, S., Lambert, N., Wang, X., Muennighoff, N., Hou, B., Pan, L., Jeong, H., Raffel, C., Chang, S., Hashimoto, T., and Wang, W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:44.390210Z"},"links":{"cited_paper":"/paper/2402.16827","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:a1b292e2f373cb77650ef1b27425c237431890218a137673df6e4fbb87abedfc","observation_id":"c5e4565a-faa7-4ee1-b74f-98c0c8a8b8f0","resolution":{"observed_at":"2026-08-07T14:09:44.390210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:57.699283Z","title":null,"venue":null,"work_id":"c5338a76-5945-4488-bdf2-1a18e791561c","year":1999},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:44.493543Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:d9ff970b4cb86b91ec5ec300ac4bc8351d4096cd5ddf5e9671481c3f351646de","observation_id":"22613bfc-4a69-440c-a367-0dd88544161b","resolution":{"observed_at":"2026-08-07T14:09:57.859226Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:57.547953Z","title":null,"venue":null,"work_id":"c3f81ce3-ecfc-4394-8480-7a8008118382","year":2009},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:44.602907Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:16176be67a59064c5a60e63254018a10f5c9364b8a45f5ce027862e096c4af33","observation_id":"41a33a96-71a8-4589-96cf-cafbfb7f13cb","resolution":{"observed_at":"2026-08-07T14:09:57.617607Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:57.343612Z","title":null,"venue":null,"work_id":"9a27c8cd-f975-4742-b510-e687ee2dd6ce","year":2020},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:44.698697Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:a2a20fbd7d917cb8586f2f19e08838186b31fe4f8ec1be7f32fe3fcecc49b89f","observation_id":"6385af8d-a6d1-45f2-9e05-cfea51f8e003","resolution":{"observed_at":"2026-08-07T14:09:57.436143Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:57.156208Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":"9cc0e0c0-4e7b-458e-b379-f25f20a9629b","year":2020},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:44.821958Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:7c3d3589d83d498005dff9de11323967f549f16c74f774c13c75426609d6d8b5","observation_id":"7ccbd500-5237-46e3-b4fc-794627f6b1af","resolution":{"observed_at":"2026-08-07T14:09:57.223478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:57.017303Z","title":null,"venue":null,"work_id":"817d5b47-9491-4697-995c-9cfd0d3b7cda","year":2006},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:44.948297Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:b83a3cc5b8df6ab8dd319da5d1a68f96a5d6273405f65fa1f22ae28ff9865e7a","observation_id":"f016df29-0942-466c-abcd-bea4ff47626a","resolution":{"observed_at":"2026-08-07T14:09:57.099697Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:56.825303Z","title":null,"venue":null,"work_id":"26c1c4fd-7fcc-448b-9131-10dbb5e6670b","year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:45.043318Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:2599099280ad488fed2320ed3535b72b88fe1e61e6075911fb7bf336e20be428","observation_id":"04200d5a-070a-4966-ab4a-f4170eb4c6af","resolution":{"observed_at":"2026-08-07T14:09:56.914899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:56.680411Z","title":"W., Sutton, C., Gehrmann, S., et al","venue":null,"work_id":"7e7a4541-f014-4734-ab05-6202b354fb39","year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:45.094544Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:24d5537a28ef5bb4c38aaa4a1367f8a8d8151f84b0f4251964a9089d3db34737","observation_id":"5abf293f-23b7-41ad-801e-d5bc083f1928","resolution":{"observed_at":"2026-08-07T14:09:56.759624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T14:09:45.215581Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:45.215581Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:82c4401f0db9c308bf4f207d2909045b4a0e74484998b074475c212b1964c064","observation_id":"84469261-e86d-4aac-a1c0-eb5e97ff0784","resolution":{"observed_at":"2026-08-07T14:09:45.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:56.536680Z","title":null,"venue":null,"work_id":"dc039426-2882-4d9d-bd26-c681a0f1f67c","year":2020},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:45.331575Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:ae9ab3467abbcd5dc61c1bfc8b645d49a65748cd3ad431457ca8b271e31d3ae2","observation_id":"11b824f8-893b-429e-9bcc-ade2347145a8","resolution":{"observed_at":"2026-08-07T14:09:56.580390Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:56.372024Z","title":"Y., Jegelka, S., and Krause, A","venue":null,"work_id":"6e45bf99-eae7-4c9b-b7c9-3a450dc61c61","year":2020},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:45.511080Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:7e4282286b4a17734606e87fbb62dc9a80519f11e0c2a1ce6ad0ea31c6e6de19","observation_id":"6ccd29a6-41ae-4e3d-93d3-daa5aa0ed334","resolution":{"observed_at":"2026-08-07T14:09:56.454906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T14:09:45.618244Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:45.618244Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:6c5d6f9600ef0697375468c1ad5d4fa9fd09e47c255fbb44e64962be8a70c406","observation_id":"a3f0f741-599d-4cd8-8ee9-9136b1a2ec0a","resolution":{"observed_at":"2026-08-07T14:09:45.618244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:56.219096Z","title":"and Namkoong, H","venue":null,"work_id":"f1045caa-1153-4317-937f-3a1b62391c6d","year":2021},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:45.723599Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:467a3914fb747838656797519374176339b5325afb7b57cce048281cfe8f64cb","observation_id":"20c14fee-ce53-41ab-ab0b-a495f8a75a7c","resolution":{"observed_at":"2026-08-07T14:09:56.317730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15389","last_updated":"2023-10-23T22:41:33Z","snapshot_observed_at":"2026-08-05T00:09:24.579877Z","submitted_at":"2023-10-23T22:41:33Z","title":"Irreducible Curriculum for Language Model Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15389","snapshot_observed_at":"2026-08-07T14:09:45.871063Z","title":"and Jaggi, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:45.871063Z"},"links":{"cited_paper":"/paper/2310.15389","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:1742495c6ce293b69354aef536513be755633eba89e8d04c8cad90f1890cc617","observation_id":"0216d8e9-b967-4926-bfba-5ea684dea030","resolution":{"observed_at":"2026-08-07T14:09:45.871063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15393","last_updated":"2024-02-05T16:33:05Z","snapshot_observed_at":"2026-07-06T16:37:31.409792Z","submitted_at":"2023-10-23T22:51:58Z","title":"DoGE: Domain Reweighting with Generalization Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15393","snapshot_observed_at":"2026-08-07T14:09:45.950397Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:45.950397Z"},"links":{"cited_paper":"/paper/2310.15393","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:f9563b2410fd3ca5c600dbb7a75a4183d4f57c8d1afd9c2bd964ec978cc70f5d","observation_id":"eb274786-b2dd-4323-ac48-42b72e660c48","resolution":{"observed_at":"2026-08-07T14:09:45.950397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:56.104498Z","title":"and Dayan, P","venue":null,"work_id":"3ea51422-8663-421b-bdf3-7f8ac87f52e7","year":2021},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:46.064723Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:20a726b580e9c8bc9c4f28ecf54c04c770f4ceaa4094ad35ae974e160f2600b2","observation_id":"93504c1f-4915-4a9e-bf7f-2902b47c8450","resolution":{"observed_at":"2026-08-07T14:09:56.154815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:46.163491Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:46.163491Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:756af37df79a55b30811532072fb4888257fb5c050eba8f3a488ad2c0bdab3e2","observation_id":"3614366c-30a7-4828-934b-cf16d6ae7b00","resolution":{"observed_at":"2026-08-07T14:09:46.163491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:55.924617Z","title":"and Cohen, V","venue":null,"work_id":"8d5884ca-c98c-4677-8ff1-1d292ebe5cdb","year":2019},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:46.335902Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:f0e75b1994e0a4be62a7d62e654a8018299495493df2637ee0bac72cc2701353","observation_id":"c51a7a9a-970e-4891-8482-a96b972bd708","resolution":{"observed_at":"2026-08-07T14:09:56.029767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T14:09:46.458825Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:46.458825Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:698a5de4ffe96febe7f482e8e072015b735faa0e5c343bcf59d42455df8d24d7","observation_id":"163cdd05-cc9b-4096-b917-be7194f12bd5","resolution":{"observed_at":"2026-08-07T14:09:46.458825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:55.763577Z","title":"Y., Zhou, T., Wu, Y., Song, X., Song, X., and Zhou, D","venue":null,"work_id":"24f09e7c-5f24-42c4-bb8f-afc28e8779ab","year":2022},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:46.587696Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:725524e2586189018f590e8928daf784d073cf94f8b2f85378c6af9a07363b4f","observation_id":"01b09708-2514-4827-8aed-eeba5c7b2e94","resolution":{"observed_at":"2026-08-07T14:09:55.823606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:46.713461Z","title":"and Waegeman, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:46.713461Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:eb233c46da49ccedac078f28919e13f9aea7d77390375d3ec91cba0109e5f288","observation_id":"53d10d34-f94a-47f0-a91e-55cb4955404b","resolution":{"observed_at":"2026-08-07T14:09:46.713461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:55.568345Z","title":null,"venue":null,"work_id":"ea892409-95ab-4f32-a365-09bbf5d584d8","year":2025},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:46.822031Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:4eb663010267a95da1001e7540e490e55f76a4464d817cfaf84d0159636b3bf1","observation_id":"b20dc414-e6ce-4934-bfc4-b9b438aaf92f","resolution":{"observed_at":"2026-08-07T14:09:55.665120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00762","last_updated":"2019-10-02T03:34:29Z","snapshot_observed_at":"2026-08-07T07:17:09.592892Z","submitted_at":"2019-10-02T03:34:29Z","title":"Accelerating Deep Learning by Focusing on the Biggest Losers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00762","snapshot_observed_at":"2026-08-07T14:09:46.918110Z","title":"H., Wong, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:46.918110Z"},"links":{"cited_paper":"/paper/1910.00762","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:54b44e7097c5ffe605a718e81d09a1135772c737019c7346d4bc688369886c69","observation_id":"5ed818e2-10a8-43cd-b75e-02687ffcc794","resolution":{"observed_at":"2026-08-07T14:09:46.918110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-07T14:09:47.012470Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:47.012470Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:f9d85b4d47eae53478cdd7e96302345361e4cf791b076e78006d127233ca5a5b","observation_id":"85097b5e-ad96-4b9d-889e-cb1715872737","resolution":{"observed_at":"2026-08-07T14:09:47.012470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T14:09:47.106847Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:47.106847Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:8addbf161e6473666b7a80cd1a8612dab3ae7b0dfbe09dc39997299c78b8366e","observation_id":"0a94f43e-7514-4392-9c0c-d167e1717feb","resolution":{"observed_at":"2026-08-07T14:09:47.106847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:55.383586Z","title":null,"venue":null,"work_id":"4c90a39b-16e7-4873-99f0-dffa4998d133","year":2022},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:47.274894Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:982f3ce9dac135e14cee0927ea5b9ad05bc25604b33b899d52f15a9082804850","observation_id":"b6f1a256-586c-4997-9bac-88b6d80a36fb","resolution":{"observed_at":"2026-08-07T14:09:55.474628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:55.205904Z","title":"and Fleuret, F","venue":null,"work_id":"8141433e-4584-4336-bd82-c9056328f960","year":2018},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:47.388011Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:e190f854b483d785dd595d5a0d2f3f0af925a9ed1d8eb22c8f00b06feb4a20bc","observation_id":"a39e50b7-01c8-40ed-872f-321d1da91158","resolution":{"observed_at":"2026-08-07T14:09:55.305333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:55.005624Z","title":null,"venue":null,"work_id":"e169cddb-6cb1-4dc8-9cd1-adfc31d24640","year":2021},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:47.497294Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:d9097bdc842e543a5a70c5978337d2153e571eebbd51deca2de541680e614689","observation_id":"7d6b3ba7-5fb1-4090-8fb2-74f628c16113","resolution":{"observed_at":"2026-08-07T14:09:55.101657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:54.849852Z","title":"and Rush, A","venue":null,"work_id":"5e4dcedb-afac-4713-9e6f-802564796826","year":2016},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:47.643905Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:38c6ca46bffcf1b237b3851f9acbaf0df134b315ea71ad9ccd1b83b7ab900e27","observation_id":"2b0f463c-7082-4204-bf9b-f3f0b6ff0715","resolution":{"observed_at":"2026-08-07T14:09:54.950509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02549","last_updated":"2025-05-26T19:59:17Z","snapshot_observed_at":"2026-07-06T19:45:08.566279Z","submitted_at":"2024-11-04T19:32:24Z","title":"Distributionally Robust Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02549","snapshot_observed_at":"2026-08-07T14:09:47.837432Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:47.837432Z"},"links":{"cited_paper":"/paper/2411.02549","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:ce9d5f768bf19599ba08fd134f5ff3d1eda44debbd1a65681daaf3a1cdc855ba","observation_id":"c4b5ab01-bbb7-4392-9d9b-ba946e937fd5","resolution":{"observed_at":"2026-08-07T14:09:47.837432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07965","last_updated":"2025-01-08T09:07:54Z","snapshot_observed_at":"2026-08-07T08:00:00.868748Z","submitted_at":"2024-04-11T17:52:01Z","title":"Rho-1: Not All Tokens Are What You Need","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07965","snapshot_observed_at":"2026-08-07T14:09:47.959331Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:47.959331Z"},"links":{"cited_paper":"/paper/2404.07965","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:ba57596057370c4b7d9e0128a2d1624b91359606fd6f430e2814e0f4cb0cc5d9","observation_id":"e59e25b1-d230-4505-b4dd-5b381d0f9aad","resolution":{"observed_at":"2026-08-07T14:09:47.959331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06343","last_updated":"2016-04-25T14:00:21Z","snapshot_observed_at":"2026-08-06T18:58:16.729973Z","submitted_at":"2015-11-19T20:24:09Z","title":"Online Batch Selection for Faster Training of Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06343","snapshot_observed_at":"2026-08-07T14:09:48.082527Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:48.082527Z"},"links":{"cited_paper":"/paper/1511.06343","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:5d79718f8a26550ed87ca43e17f9d108cf11de62ee41d0462d40e940adc8d2db","observation_id":"d40f7a1d-b4bb-4e0e-98f7-9b80fde34623","resolution":{"observed_at":"2026-08-07T14:09:48.082527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:54.688812Z","title":null,"venue":null,"work_id":"352516f3-a5e6-4818-8fcb-59614207c8e2","year":2015},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:48.197734Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:132554e500303caaccb929eee84d1713ee0d81cac8db33ff63470d6dcf54bc39","observation_id":"0d4dafe6-fe6e-433a-abf7-9a58b36b6db5","resolution":{"observed_at":"2026-08-07T14:09:54.743834Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04564","last_updated":"2023-09-08T19:34:05Z","snapshot_observed_at":"2026-08-07T03:50:04.516601Z","submitted_at":"2023-09-08T19:34:05Z","title":"When Less is More: Investigating Data Pruning for Pretraining LLMs at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04564","snapshot_observed_at":"2026-08-07T14:09:48.284205Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:48.284205Z"},"links":{"cited_paper":"/paper/2309.04564","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:5a1a3bd6fc6c434d4cc26462f7f5f7183e7a85977be78cf04850be998214bcb2","observation_id":"ea4f463e-8f5a-43cf-a59f-4cf597277efc","resolution":{"observed_at":"2026-08-07T14:09:48.284205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12120","snapshot_observed_at":"2026-08-07T14:09:48.398461Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:48.398461Z"},"links":{"cited_paper":"/paper/2502.12120","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:cae38c1bf3d6fb9f8e2c3292e91c8c4310e7fe6abeeb8322e9c419eba43063e4","observation_id":"7fcf85e1-298e-4c01-8cb1-422e54e41ba0","resolution":{"observed_at":"2026-08-07T14:09:48.398461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-08T02:19:52.596062Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-07T14:09:48.521179Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:48.521179Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:c900515d070cf161f28bd45c4e885463489319a2a896f8dfe16018f1108885a0","observation_id":"a08605b6-4ef4-4c92-93e3-f997ae50026e","resolution":{"observed_at":"2026-08-07T14:09:48.521179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:54.537997Z","title":"M., Razzak, M","venue":null,"work_id":"ced11b2a-f44c-460d-8b17-bd8c84380431","year":2022},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:48.648493Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:c1e43a497fe0baeec38dae6052836cbf695ebe04e3d29ea820dcd3f6831bc602","observation_id":"00e1647d-6d87-4f44-a0c2-21413d663041","resolution":{"observed_at":"2026-08-07T14:09:54.610272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02060","last_updated":"2019-09-04T19:07:33Z","snapshot_observed_at":"2026-07-06T08:19:12.871715Z","submitted_at":"2019-09-04T19:07:33Z","title":"Distributionally Robust Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02060","snapshot_observed_at":"2026-08-07T14:09:48.756530Z","title":"B., and Liang, P","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:48.756530Z"},"links":{"cited_paper":"/paper/1909.02060","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:e2b9960f148cc30af795094b0bd043efdc094ab68bf63ec92b947c1cae6ddf4b","observation_id":"2d482e1e-045c-4946-b5d6-fea337de7d4c","resolution":{"observed_at":"2026-08-07T14:09:48.756530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:54.384644Z","title":"Q., Bernardi, R., Pezzelle, S., Baroni, M., Boleda, G., and Fernandez, R","venue":null,"work_id":"a14c6165-f636-4c0f-ace8-838098cbce76","year":2016},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:48.909920Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:0291e2aec2f09f266ad269dda0b59613af15e9fc77a587a5431825e10d82b5fb","observation_id":"84d475bd-9238-4f02-ae19-0b95e44c49b0","resolution":{"observed_at":"2026-08-07T14:09:54.449216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:54.244272Z","title":null,"venue":null,"work_id":"450cb7f5-b3d5-4da9-bebf-354f7962d2fa","year":2019},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.043623Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:3e50666b7cf3920162967256eb70d9c9b461e1ef39c40686d5b6df2090c3f8e9","observation_id":"48ae6b37-6f3a-4ac5-af48-a32d7dc34571","resolution":{"observed_at":"2026-08-07T14:09:54.285715Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:49.175622Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.175622Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:a30207fc3582e56e1f8dbe44f2f534f254d513b7c217d053325b031d51f73f42","observation_id":"2f9ecefc-1c9e-4d9a-9e06-67ac405c031d","resolution":{"observed_at":"2026-08-07T14:09:49.175622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:54.042740Z","title":null,"venue":null,"work_id":"d8898e9f-4a2d-4e47-ad45-52cad264738a","year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.330327Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:e1f3b374db2843d22b088c8f60fbb6ceb546e3e19ca96303554f60f4d8b467cd","observation_id":"2d93fa79-547f-4789-a82b-dc4b0615d23d","resolution":{"observed_at":"2026-08-07T14:09:54.132135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18779","last_updated":"2024-10-24T14:31:52Z","snapshot_observed_at":"2026-07-06T19:39:06.300432Z","submitted_at":"2024-10-24T14:31:52Z","title":"A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18779","snapshot_observed_at":"2026-08-07T14:09:49.458727Z","title":"S., Sadhanala, V., Rostamizadeh, A., Chakrabarti, A., Jitkrittum, W., Feinberg, V., Kim, S., Harutyunyan, H., Saunshi, N., Nado, Z., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.458727Z"},"links":{"cited_paper":"/paper/2410.18779","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:08cc40170d8bfb12054061e94f59de7a9875602404b8d0ee63a3f536ac269e34","observation_id":"70e14c5c-ba69-43c5-9b61-afb4f22427b7","resolution":{"observed_at":"2026-08-07T14:09:49.458727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:53.856832Z","title":null,"venue":null,"work_id":"1d566c2a-4dfc-43d2-b468-b0c9137f761b","year":2002},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.569016Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:4897de7be23694c26c52b99c608f1334558d10b78569f9b1a6af6c18d4f5bf28","observation_id":"270d6c88-c103-4b63-bee1-10adb4d7679f","resolution":{"observed_at":"2026-08-07T14:09:53.931666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:49.660065Z","title":"T., Uryasev, S., et al","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.660065Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:e928b3aac25316db621e95e3790634d0bdd924d86a21ff09608558992efa24f4","observation_id":"ade882c0-2caf-4109-a564-bdd621b92250","resolution":{"observed_at":"2026-08-07T14:09:49.660065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-07T14:09:49.740308Z","title":"H., Caverlee, J., McAuley, J., and Cheng, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.740308Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:ff4d9eba259b7fd029689767fdc63123dd83fb362157b98aee0a1c05b44c3560","observation_id":"7be11a93-fc4f-456a-b1ce-c09431db1d5d","resolution":{"observed_at":"2026-08-07T14:09:49.740308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:53.708236Z","title":null,"venue":null,"work_id":"f4de7697-9b0d-4642-9eb3-d6293d84054c","year":2016},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.807202Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:c182e59cb1425cedc24d14758a7df96950b16e4bedea625d1827d8f91c42237b","observation_id":"85769876-7f40-42db-93e9-6a6007ecca82","resolution":{"observed_at":"2026-08-07T14:09:53.774772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:53.525345Z","title":null,"venue":null,"work_id":"1719f8df-51d0-411e-98d5-55ca8dbee3c5","year":1948},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.891517Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:f7c105e1af239023cb4ba23f7dce81dd871a18c00d65821f5a19f90728c5b3ee","observation_id":"d6d22732-e402-401b-b4a1-1c824496e6af","resolution":{"observed_at":"2026-08-07T14:09:53.596269Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:53.409060Z","title":"R., Hestness, J., and Dey, N","venue":null,"work_id":"691e0aeb-a6ba-47a3-b247-f04b6d5afd5d","year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.980510Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:2731f12a71f5c5020f30e5ddadf457042abe646d1a5b47c834f680d004a58c6b","observation_id":"5bd8cad6-0366-4a12-884c-72c61a5d7d73","resolution":{"observed_at":"2026-08-07T14:09:53.460624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2502.06733","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06733","snapshot_observed_at":"2026-08-07T14:09:51.295780Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","venue":"cs.LG","work_id":"e868ae07-fb4a-474f-a69b-c36e69aa2487","year":2025},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.090492Z"},"links":{"cited_paper":"/paper/2502.06733","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:bd454527543ab84217291278aa9d7420581a8f32018137a768df1f8b5d65e2f7","observation_id":"457b51ea-2390-4ed0-8f05-fefe992ccef0","resolution":{"observed_at":"2026-08-07T14:09:51.406696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:53.213446Z","title":null,"venue":null,"work_id":"c347a76f-f78b-49a2-8e6d-5cbc2256b20d","year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.182360Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:7ad8bb8983fb5612afa36f514b3eb0ca0d0a478f4811b6bc88ffd4cb09ea1e37","observation_id":"27c94bad-4712-4b5e-b319-730577f541bb","resolution":{"observed_at":"2026-08-07T14:09:53.320047Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:52.991577Z","title":null,"venue":null,"work_id":"bab1b41c-e372-4964-b5c1-058c2c18c2fe","year":2019},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.257296Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:a6659ccb3589ca7615a9c32243daed4772eaa49b34c733cd8dbff422a7c71c59","observation_id":"4fe5b468-ad36-4369-9851-690c6dd90719","resolution":{"observed_at":"2026-08-07T14:09:53.099622Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:52.858197Z","title":"T., Wu, T., Song, D., Mittal, P., and Jia, R","venue":null,"work_id":"d0c31749-50b0-4f97-99b0-924ff943aab2","year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.366434Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:a41ae7e3fddb9e172c1a129a28ed5b2b65969144eb39e3391c5ffa9ed1e80c6c","observation_id":"31b392eb-f669-404e-9718-ca12259c90d1","resolution":{"observed_at":"2026-08-07T14:09:52.930135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-08-06T06:05:27.671303Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-08-07T14:09:50.466643Z","title":"F., and Gardner, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.466643Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:67929bd8f4d5c1f6cc0c3f20b48ed4cf82a5b8b65bb4b73020e06a7261787616","observation_id":"b3c893cf-3193-42c0-a86a-28d011a4c289","resolution":{"observed_at":"2026-08-07T14:09:50.466643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:52.665551Z","title":null,"venue":null,"work_id":"d051a1a2-b317-479a-ad67-e0c391bcf0db","year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.566769Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:6e9f9dc025d5aff3ed9ff17dd3d5b6d5f8810c7c15763f224659ed2deb6bf914","observation_id":"9b377001-9843-44c5-8f08-6186730925c2","resolution":{"observed_at":"2026-08-07T14:09:52.752364Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:52.480140Z","title":"and Menon, A","venue":null,"work_id":"4a9af5be-cdbc-45fb-a53a-c1c790b557a2","year":2019},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.667952Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:ba75e47214f3b882d22fd574b9e79cc7710b327d20a406dcbc4ca90b00775875","observation_id":"6cdf1910-301f-4cf2-8fa3-950e08d3ead0","resolution":{"observed_at":"2026-08-07T14:09:52.566666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:52.302811Z","title":null,"venue":null,"work_id":"13c5a762-1d2c-4b92-aaa7-9368f575ae3b","year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.756681Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:adedad34503f908a97e3b6c73b7d91ea9ff41bb2c652667ac0547a4fb444fb0d","observation_id":"0d5f2cf0-b35a-49d8-8c0c-859f1d51c1b8","resolution":{"observed_at":"2026-08-07T14:09:52.388361Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:52.172371Z","title":"M., Pham, H., Dong, X., Du, N., Liu, H., Lu, Y., Liang, P","venue":null,"work_id":"c9d61c12-6771-4fb2-b919-a8b55070a4b5","year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.817490Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:bec44b1b83f74da196aa0cc7cac67f7651e2d1702143c3f35c105050329189ad","observation_id":"02ba56f4-1ed8-4022-b299-a43b1f23055e","resolution":{"observed_at":"2026-08-07T14:09:52.227595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:51.993285Z","title":"M., Santurkar, S., Ma, T., and Liang, P","venue":null,"work_id":"640a1769-b863-47af-ae55-829bfda71bce","year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.936488Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:4e65438b64cace6ea79430e0108e76c521cdf30ddc773ccfb00dae15d64ee37f","observation_id":"a11d0f2b-811d-4186-bc3f-cf0a2362e079","resolution":{"observed_at":"2026-08-07T14:09:52.067412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:51.796066Z","title":null,"venue":null,"work_id":"eb80f53d-cb70-43a6-962a-0d0ae0ba7bc0","year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:51.032016Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:04d20b67683e0140181f9a385602b9b3c7185246d089c798b60d0178c65d9adb","observation_id":"f8237699-5b1f-4ffb-93f9-943734fc649c","resolution":{"observed_at":"2026-08-07T14:09:51.888153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-07T14:09:51.114106Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:51.114106Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:74fa664ceecc19b3d7eb1da6db48d902353f1c2f7a493bd9306fdada34c83d7c","observation_id":"dea4ee42-38ff-4b32-9c67-a4b012fa56b0","resolution":{"observed_at":"2026-08-07T14:09:51.114106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:01:57.359586Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2505.19893."}