{"as_of":"2026-08-07T21:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b609131306550b439b574c318cd3c97831b00005acefd7997f8efdd313771efe","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:31:40.416807Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T04:49:28.598430Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:49:52.413967Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"cited_work":{"arxiv_id":"2506.21545","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21545","snapshot_observed_at":"2026-07-04T13:49:52.413967Z","title":"Dao, T., Fu, D., Ermon, S., Rudra, A., and R´e, C","venue":null,"work_id":"15f93799-8b8f-401a-a421-fb346c3ef82f","year":null},"citing_paper":{"arxiv_id":"2606.26917","last_updated":"2026-06-25T11:53:37Z","snapshot_observed_at":"2026-08-02T12:26:23.472017Z","submitted_at":"2026-06-25T11:53:37Z","title":"GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T04:49:28.598430Z"},"links":{"cited_paper":"/paper/2506.21545","citing_paper":"/paper/2606.26917"},"observation_digest":"sha256:de9771492848386165361433a7e6d8250ff7470881e9709f0a8bd89383b70e88","observation_id":"e2a8aeb6-0d71-470b-aa72-6e671db70eb7","resolution":{"observed_at":"2026-07-04T13:49:52.415420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21545/citation-record","integrity":"/paper/2506.21545/integrity","json":"/paper/2506.21545/citation-record.json","paper":"/paper/2506.21545"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:19.795365Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:19.795365Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:dfee265f107f3159d2639928c7db5b08ed85f5e23ee278d843966143fcdf2eea","observation_id":"3472e36a-d530-47ef-ae56-b2e31262b75a","resolution":{"observed_at":"2026-08-06T22:31:19.795365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T22:31:34.789743Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:34.789743Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:1e04b56edb6454fd06a7b59228dccb942bae36363ccd44c3a3d64d5dfb6dbdba","observation_id":"34907434-1239-45b4-88c2-d0f1c4fee130","resolution":{"observed_at":"2026-08-06T22:31:34.789743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:31:34.895488Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:34.895488Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:40910541e1f5f2baab5ce2832da5b1a84b5eef10c40f627daf1c56dbac5a33ac","observation_id":"c20a7caf-e52b-4419-ab88-69ffb3476f62","resolution":{"observed_at":"2026-08-06T22:31:34.895488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:46.175656Z","title":"Advances in natural language processing","venue":null,"work_id":"477034d6-b5bc-48ec-b705-9b4720b63b00","year":2015},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.076029Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:78d5870315545179e8460e776b3fa68addc06660c2c09a483f56b5c2ae2e73bf","observation_id":"109ce30e-a715-4be8-9bde-903bf3f6e665","resolution":{"observed_at":"2026-08-06T22:31:46.230969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14842","last_updated":"2023-05-24T07:48:41Z","snapshot_observed_at":"2026-08-06T11:01:16.225263Z","submitted_at":"2023-05-24T07:48:41Z","title":"Exploring Sentiment Analysis Techniques in Natural Language Processing: A Comprehensive Review","version":1},"cited_work":{"arxiv_id":"2305.14842","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14842","snapshot_observed_at":"2026-08-06T22:31:40.875564Z","title":"Exploring Sentiment Analysis Techniques in Natural Language Processing: A Comprehensive Review","venue":"cs.CL","work_id":"ddc82d8f-9382-4226-a209-7f8d3e04c65c","year":2023},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.157846Z"},"links":{"cited_paper":"/paper/2305.14842","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:b12d165ba1efd8f10d6af2a8d8d794f297a5d8a787437c463871150b6e7ca122","observation_id":"43b7d785-8f9e-4852-8966-d9661c2e5f0c","resolution":{"observed_at":"2026-08-06T22:31:40.922314Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:35.320880Z","title":"Natural language reasoning, a survey.ACM Computing Surveys, 56(12):1–39, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.320880Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:2b04218b84ae545a99e906c41fc04a38496640ca8c4b94783b95d7e8c14a82c3","observation_id":"13d9fd78-e418-4d90-ab5a-2a45644dba8a","resolution":{"observed_at":"2026-08-06T22:31:35.320880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:45.990339Z","title":"Ai- based conversational agents: a scoping review from technologies to future directions","venue":null,"work_id":"b2d52512-d6a9-478d-890a-38f7c0ed3e9a","year":2022},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.434001Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:4fe2c75b57b56c9d65c9ccf0a95a37ed2590e9c83100520c2fa6e2b1b82f3c38","observation_id":"af796198-10d4-423a-b3d0-5532553f81bc","resolution":{"observed_at":"2026-08-06T22:31:46.065682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16827","last_updated":"2024-08-02T17:59:31Z","snapshot_observed_at":"2026-08-03T03:15:21.035418Z","submitted_at":"2024-02-26T18:54:35Z","title":"A Survey on Data Selection for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16827","snapshot_observed_at":"2026-08-06T22:31:35.530387Z","title":"A survey on data selection for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.530387Z"},"links":{"cited_paper":"/paper/2402.16827","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:0d11c0114f12ded87f1deacb3466718040973c575610f64ea6ade4f4e61f53fc","observation_id":"a1927fc7-0ceb-4778-b125-e5bfacb792d9","resolution":{"observed_at":"2026-08-06T22:31:35.530387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:45.804359Z","title":"Data selection for language models via importance resampling","venue":null,"work_id":"458ad1de-ac19-4ca0-a93c-e729dcfd55e4","year":2023},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.679951Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:1ac15626483727b4168ae70e12e92573dd0cb4c8ddc127c6ca139a8e00eb4ed6","observation_id":"ef3463bf-d78b-476a-ac3e-401d1550cb6f","resolution":{"observed_at":"2026-08-06T22:31:45.895241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07064","last_updated":"2025-03-18T23:52:27Z","snapshot_observed_at":"2026-08-06T21:53:46.581552Z","submitted_at":"2024-10-09T17:06:57Z","title":"Data Selection via Optimal Control for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07064","snapshot_observed_at":"2026-08-06T22:31:35.732689Z","title":"Data selection via optimal control for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.732689Z"},"links":{"cited_paper":"/paper/2410.07064","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:a0f209d9a06d8199131292f0d88ae42353dc8151c996bfd0d97f937cd4f74b51","observation_id":"e3ec3028-3dba-451f-a437-18ddd3f97bb0","resolution":{"observed_at":"2026-08-06T22:31:35.732689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.02170","last_updated":"2021-08-04T16:53:43Z","snapshot_observed_at":"2026-07-06T11:35:35.934125Z","submitted_at":"2021-08-04T16:53:43Z","title":"Curriculum learning for language modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.02170","snapshot_observed_at":"2026-08-06T22:31:35.794833Z","title":"Curriculum learning for language modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.794833Z"},"links":{"cited_paper":"/paper/2108.02170","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:199bd7d553546eabf9d45f82ad973ebd950a856dd32d97cca373de9f5b864437","observation_id":"9afb825a-41b3-4b1a-ab8e-df850b14d8db","resolution":{"observed_at":"2026-08-06T22:31:35.794833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:35.871785Z","title":"A survey on curriculum learning.IEEE transactions on pattern analysis and machine intelligence, 44(9):4555–4576, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.871785Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:9056678f057624c1e591b782873044af714c9b6160a4a73c72a12d26f7230743","observation_id":"5455404c-f873-465e-8537-443144bf71ca","resolution":{"observed_at":"2026-08-06T22:31:35.871785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:45.559590Z","title":"hello-gpt-4o","venue":null,"work_id":"6ebabf17-ee13-41f3-9a46-e156c5caf3d3","year":2024},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.032874Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:1e498afcec7a2b4bbc0e809c5ae456eba21e4d44b887fbc4a068521a4dad5938","observation_id":"181826f8-e99f-458a-b806-4e797e939955","resolution":{"observed_at":"2026-08-06T22:31:45.681972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T22:31:36.095933Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.095933Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:08ccc261100ffac43c6d29775917a4f7ab36e3c73302bb4526cc0e839304d659","observation_id":"732c55b2-97bc-4c44-84b0-dcb59c421d78","resolution":{"observed_at":"2026-08-06T22:31:36.095933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.1078","last_updated":"2014-09-03T00:25:02Z","snapshot_observed_at":"2026-07-06T03:45:28.546418Z","submitted_at":"2014-06-03T17:47:08Z","title":"Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.1078","snapshot_observed_at":"2026-08-06T22:31:36.144310Z","title":"Learning phrase representations using rnn encoder-decoder for statistical machine translation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.144310Z"},"links":{"cited_paper":"/paper/1406.1078","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:4866804e26f489e6205efc416b32f537d17225302c40317afbd5a018c739ee03","observation_id":"bfed6da5-5d01-4875-bc9d-f1b78466d95d","resolution":{"observed_at":"2026-08-06T22:31:36.144310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:36.249863Z","title":"Long short-term memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.249863Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:1af9d2770f34cd4920b9056bbc9bdf58d5d8507cd55fce171a86dd01c43cb9b8","observation_id":"688f2516-476c-4595-b6e0-f95ff308ca9e","resolution":{"observed_at":"2026-08-06T22:31:36.249863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T22:31:36.341314Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.341314Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:29fdf83e3d27a14a7f8b11db24a76b1c3f39cbcc0081a9680906e5202ab3ed42","observation_id":"6d60b150-431e-4a24-a423-184016f8a3e5","resolution":{"observed_at":"2026-08-06T22:31:36.341314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:45.316366Z","title":"Scaling laws for data filtering–data curation cannot be compute agnostic","venue":null,"work_id":"de2f9342-4e2c-4f27-b067-806fbe5e7fd7","year":2024},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.403199Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:ad8397d2dffe571a72af2a512787a1ad320df02df051761a5788b1d748420d87","observation_id":"0858127b-aa58-4d30-8628-25ec4970a281","resolution":{"observed_at":"2026-08-06T22:31:45.455618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:45.104346Z","title":"KenLM: Faster and smaller language model queries","venue":null,"work_id":"57ce3dd8-7288-4421-ab13-f2a861f37175","year":2011},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.509845Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:582009cfa9b356a85f02f1814bd1a533ca630d82e8356b72b03d9aaa5404efd4","observation_id":"02bebf18-ee54-457b-b079-53b8c8b972d8","resolution":{"observed_at":"2026-08-06T22:31:45.203086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.926283Z","title":"Claude 3 haiku: our fastest model yet","venue":null,"work_id":"5c686732-31c3-4724-975e-fd6830711387","year":2024},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.629087Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:eee36930a70f8c1b829e1e1f133a94e4134f4e5e225bb3ccd4c6426270c94481","observation_id":"8c87e9eb-75b3-4a0a-9f11-8afdcd28682a","resolution":{"observed_at":"2026-08-06T22:31:44.984977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.793604Z","title":"Paml 4: phylogenetic analysis by maximum likelihood","venue":null,"work_id":"6dbfb569-edbd-4f62-847f-52900ba28cd7","year":2007},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.737006Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:fbd52fcd367fedc4afd1f9fc1d2b4e082a641cb9bc7cb2095fdaa311ea8109a6","observation_id":"1252c827-a720-4254-8352-bdd6bde866cf","resolution":{"observed_at":"2026-08-06T22:31:44.857188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.688583Z","title":"Common crawl – building an open web-scale crawl using hadoop, 2010","venue":null,"work_id":"7de3bce1-a12e-40b6-82b6-ffa3a1d8760e","year":2010},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.842436Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:e24150221bb64d7dea8ad5ab3eb9adf511500a58c33240123f7eb930feeffb44","observation_id":"edcc5ac3-4dc4-4523-a9fe-b72b283f75ac","resolution":{"observed_at":"2026-08-06T22:31:44.730683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.563942Z","title":"Project gutenberg, 2004","venue":null,"work_id":"6031463c-64d2-4a6f-8389-8d8b32833348","year":2004},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.925600Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:95a34aff9dde0b54cf16514bef90c6390b84062acbc9acbd2b2b21b3290a2468","observation_id":"2a3c4282-7a05-45db-aa0a-e57051d3bb3b","resolution":{"observed_at":"2026-08-06T22:31:44.626745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.455122Z","title":"Synthetic data for deep learning , volume 174","venue":null,"work_id":"acd7aebd-77ee-4684-ae72-9db62907b2c6","year":2021},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.983223Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:4bbf5453db81f2cce79cf823cb6f7e2cfee63708cb7008d2a135bfa83097828c","observation_id":"1800c862-3d77-4e66-8e4d-b2ff96e97ab8","resolution":{"observed_at":"2026-08-06T22:31:44.504460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.377763Z","title":"Virtual sensors: Abstracting data from physical sensors","venue":null,"work_id":"3bfe0497-50a6-4893-8367-ef152606c4b1","year":2006},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.055947Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:52e9ecf7116e90950f19ac0728c70c453ba5a50c06aa2b2e78ca1fac87934c4e","observation_id":"e1b7d25e-5cca-4c8c-8ae9-ab772e92dc82","resolution":{"observed_at":"2026-08-06T22:31:44.406796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:37.178879Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.178879Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:f48299278833e39c1ba5e7c6142572252fd138d1f928accd01a61d553ba53ea6","observation_id":"ef5ba448-e607-4b88-95f1-db06e6d7af76","resolution":{"observed_at":"2026-08-06T22:31:37.178879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.263363Z","title":"The refinedweb dataset for falcon llm: Outperforming curated corpora with web data only","venue":null,"work_id":"77d69b50-7535-4a10-8a01-2435c0ebb4a6","year":2023},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.243725Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:da9f4e2f359507b8f3e06eb930c8eabc4f17dd86c7bad07e22ad346c4e66bbee","observation_id":"53478cd4-9bc4-4938-9b6e-df65e110288a","resolution":{"observed_at":"2026-08-06T22:31:44.320180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:37.336209Z","title":"Redpajama: an open dataset for training large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.336209Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:ab546946ef924aa74794abc76d69f10b0bcc78d171dd710dfa1189a969add304","observation_id":"61cb4c60-bc85-4f79-8533-cfae6e3eb1ff","resolution":{"observed_at":"2026-08-06T22:31:37.336209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03398","last_updated":"2024-12-04T15:27:39Z","snapshot_observed_at":"2026-08-02T13:13:42.609108Z","submitted_at":"2024-12-04T15:27:39Z","title":"RedStone: Curating General, Code, Math, and QA Data for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03398","snapshot_observed_at":"2026-08-06T22:31:37.409614Z","title":"Redstone: Curating general, code, math, and qa data for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.409614Z"},"links":{"cited_paper":"/paper/2412.03398","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:7ebc955597f516cbc6f40a8a32a800488c958756297433309564f7de3db68a4b","observation_id":"a9af43c7-a9b7-451e-b517-6d0514dd2b55","resolution":{"observed_at":"2026-08-06T22:31:37.409614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.160800Z","title":"Mates: Model-aware data selection for efficient pretraining with data influence models","venue":null,"work_id":"551e95eb-19a9-4347-a0fe-c1706846d7e0","year":2024},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.516009Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:4f3f806827ef5c447b655b0185a4139ebad0cb2dbd4ab7c29bfc1ae593d52e91","observation_id":"a2af7a3f-b91f-433b-9166-60a72cc70ff1","resolution":{"observed_at":"2026-08-06T22:31:44.202949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.051082Z","title":"Training-free dataset pruning for instance segmentation","venue":null,"work_id":"0bf7729e-227e-4d27-bf70-3d94dae1ccbd","year":null},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.572752Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:0fd79f377fbdf8a2e979c2647454021515771a7d9928b5f4ad46981238ad0f6d","observation_id":"e7f4349a-1d10-4a6f-a369-fef8925df5bf","resolution":{"observed_at":"2026-08-06T22:31:44.095050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.936981Z","title":"P-diff+: Improving learning classifier with noisy labels by noisy negative learning loss","venue":null,"work_id":"48a5582e-5671-4889-bea3-72eb1525dd87","year":2021},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.620112Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:12b844dc1fb1b390ed23c656eaa26aa50e32a8296913f1cebb72336c50f7858c","observation_id":"5ad266e4-2031-4862-899b-a22d6be16703","resolution":{"observed_at":"2026-08-06T22:31:43.990600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.829734Z","title":"P-diff: Learning classifier with noisy labels based on probability difference distributions","venue":null,"work_id":"9f1703d8-bfdd-4430-93de-2fce0043091b","year":2020},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.665766Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:386c1e7bcf85907cb2ad142719b14ed4d6bbe172db9c865fbfa8afa55e92b02a","observation_id":"3fb4ae5a-4f96-48e0-9d3f-a804118be1dd","resolution":{"observed_at":"2026-08-06T22:31:43.881483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-06T22:31:37.703358Z","title":"Semdedup: Data-efficient learning at web-scale through semantic deduplication","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.703358Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:ba639f97a735aad14e1620ecd72ca0f2be8c8f39e245d31ac4ffe7e835d1ff16","observation_id":"ea0935cd-49b8-421c-b4b8-883d969337d8","resolution":{"observed_at":"2026-08-06T22:31:37.703358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.730026Z","title":"D4: Improving llm pretraining via document de-duplication and diversification","venue":null,"work_id":"5f84392e-2c39-494e-8a64-089a711f3544","year":2023},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.798234Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:dfab88b144bd433d6b410b16fca70d006c0f25e8d60615a1538c566169a3e9e3","observation_id":"e655be23-c353-4bf2-8cc8-0f06301c35cc","resolution":{"observed_at":"2026-08-06T22:31:43.768535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07490","last_updated":"2024-05-13T06:09:10Z","snapshot_observed_at":"2026-07-06T18:13:20.536375Z","submitted_at":"2024-05-13T06:09:10Z","title":"Strategic Data Ordering: Enhancing Large Language Model Performance through Curriculum Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07490","snapshot_observed_at":"2026-08-06T22:31:37.853648Z","title":"Strategic data ordering: Enhancing large language model performance through curriculum learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.853648Z"},"links":{"cited_paper":"/paper/2405.07490","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:b3923491bfa7a5532264b3cc5a196029699ebdaacdcdb0542249fcfb9cf885dc","observation_id":"13b16161-46e5-45cc-b23a-cb4b4c4a5f00","resolution":{"observed_at":"2026-08-06T22:31:37.853648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.03554","last_updated":"2021-02-06T10:14:18Z","snapshot_observed_at":"2026-08-06T16:16:16.489062Z","submitted_at":"2021-02-06T10:14:18Z","title":"Does the Order of Training Samples Matter? Improving Neural Data-to-Text Generation with Curriculum Learning","version":1},"cited_work":{"arxiv_id":"2102.03554","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.03554","snapshot_observed_at":"2026-08-06T22:31:40.661255Z","title":"Does the Order of Training Samples Matter? Improving Neural Data-to-Text Generation with Curriculum Learning","venue":"cs.CL","work_id":"d98b6923-1ec3-4219-bad1-63b284b582a4","year":2021},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.971943Z"},"links":{"cited_paper":"/paper/2102.03554","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:4960558126479f26bfaea1889bb737fcc8a5e0768603a92ad27f11626fd1ab27","observation_id":"4b295c33-2616-43ae-a09a-71f2730342b9","resolution":{"observed_at":"2026-08-06T22:31:40.710309Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.619123Z","title":"DoReMi: Optimizing data mixtures speeds up language model pretraining","venue":null,"work_id":"aedd343f-838b-4ee5-8179-767763d752b5","year":2024},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.143000Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:483fc66224d35e3ae24f33895aa0156822b6259bf16f64b6b3b2ca064e962ded","observation_id":"8c0be7cb-f617-4dd3-8ec5-df298404a13f","resolution":{"observed_at":"2026-08-06T22:31:43.673371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.513689Z","title":"Lima: Less is more for alignment","venue":null,"work_id":"fe2aa619-cd40-4795-a1e1-1d4cf7d74044","year":2024},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.258542Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:031a265601faa86cd439e63b769533969189adc0ffdb1ec0a1026defac6fdd49","observation_id":"0b2a68e7-4a68-4024-9700-cf5ce660c34e","resolution":{"observed_at":"2026-08-06T22:31:43.563723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:38.370698Z","title":"Openwebmath: An open dataset of high-quality mathematical web text, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.370698Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:f4ae87a374d763dbbdc1be1519bff533b8c66713edd5bc11ad0e30534f022689","observation_id":"ca58f8fa-b5bd-49ec-963f-0d6d9132a0b2","resolution":{"observed_at":"2026-08-06T22:31:38.370698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00110","last_updated":"2022-02-28T06:03:23Z","snapshot_observed_at":"2026-08-06T09:47:40.209642Z","submitted_at":"2021-08-31T23:21:12Z","title":"MiniF2F: a cross-system benchmark for formal Olympiad-level mathematics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00110","snapshot_observed_at":"2026-08-06T22:31:38.509344Z","title":"Minif2f: a cross-system benchmark for formal olympiad-level mathematics","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.509344Z"},"links":{"cited_paper":"/paper/2109.00110","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:03685b0edb1f17df46d5682389d4c77ec57606bb720fa8d430ee166b89bb6350","observation_id":"3eb84262-2755-4f47-9c16-039dbd257e40","resolution":{"observed_at":"2026-08-06T22:31:38.509344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19173","last_updated":"2024-02-29T13:53:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T13:53:35Z","title":"StarCoder 2 and The Stack v2: The Next Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19173","snapshot_observed_at":"2026-08-06T22:31:38.679922Z","title":"Starcoder 2 and the stack v2: The next generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.679922Z"},"links":{"cited_paper":"/paper/2402.19173","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:e1af66321ca9e8afb674a398e201343a1d97dff390e8090c9f6b7f6d7b2faa9d","observation_id":"b18f4e11-793c-4db5-b71e-5e668be63f4a","resolution":{"observed_at":"2026-08-06T22:31:38.679922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:38.794928Z","title":"Epicoder: Encompassing diversity and complexity in code generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.794928Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:dc759242d68ca22fb191af5ebcc7a3e9f6b1215e1788c4676339fa1e80104bb6","observation_id":"f1c0a048-7337-4760-b423-606723280f2d","resolution":{"observed_at":"2026-08-06T22:31:38.794928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T22:31:38.889964Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.889964Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:91c2d74a06ec917426cbf7baf48bfd5db70e0fd631956f162715db7063499359","observation_id":"7eaf93f6-b84b-47a9-af78-a170358f2de2","resolution":{"observed_at":"2026-08-06T22:31:38.889964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T22:31:38.997852Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.997852Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:15038ca8071656e17be9be5855411297b9d43e1abaab3070ec4294dd6a82448c","observation_id":"e5ee4398-ee2c-41cb-a1c9-f5e6ec0c7bf8","resolution":{"observed_at":"2026-08-06T22:31:38.997852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00838","last_updated":"2024-06-07T21:59:52Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T18:28:55Z","title":"OLMo: Accelerating the Science of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00838","snapshot_observed_at":"2026-08-06T22:31:39.060536Z","title":"OLMo: Accelerating the science of language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.060536Z"},"links":{"cited_paper":"/paper/2402.00838","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:15efc7bdb0d71dc4baf9e1ff1ee2bf061057614b37ab52dbb3863c408ebc5811","observation_id":"3bb581e0-945e-4cf0-bbb4-8478a8f754fd","resolution":{"observed_at":"2026-08-06T22:31:39.060536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.329863Z","title":"Hellaswag: Can a machine really finish your sentence? In Proceedings of ACL, 2019","venue":null,"work_id":"0868a3c1-2bc5-44b5-ab55-e0aafa719132","year":2019},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.121670Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:83934862a6f47b6aab9ce56daacf65ad0f2912d6f240fa0d52113442d3cb0942","observation_id":"0e32dec9-e955-44f6-b0b1-f9a89ceda0eb","resolution":{"observed_at":"2026-08-06T22:31:43.416290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.169491Z","title":"The winograd schema challenge","venue":null,"work_id":"b3cd9b6d-d159-4a01-ae8d-02eec3225a88","year":2012},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.177098Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:2748055c24e2b5f69555cbd2aacd633e208f314795aaf45443dea16a884cb149","observation_id":"d30f3ec4-a3b1-498c-b6e9-edfd1ef90b55","resolution":{"observed_at":"2026-08-06T22:31:43.234992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.004978Z","title":"The lambada dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":"8b21ecfb-b3e8-4e3c-8553-f4ca4821f60a","year":2016},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.220870Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:7c2851631e46b628077a4b2fbbb2d33c2e2dc2a22f975af2233a1a87eac01c28","observation_id":"1f834b77-8d9d-473d-b3fb-7b758a0a26b8","resolution":{"observed_at":"2026-08-06T22:31:43.085204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:42.810091Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":"824566ed-7ded-4b1d-91c7-3d029b02610f","year":2018},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.290035Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:7a1d72e10afdbc2dac6e4d884fb2bfdc6bf186f702ea0fc660f9271f837bdc3a","observation_id":"6aa43bff-0821-4ecb-9854-5b3586e92bc1","resolution":{"observed_at":"2026-08-06T22:31:42.927964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T22:31:39.363914Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.363914Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:4dba7125305b259a0dc856fb8bb153bdba66b5ab779219d7e541b840a2b06f4d","observation_id":"a029a61f-bf3a-4d63-8253-7a5d63fb8916","resolution":{"observed_at":"2026-08-06T22:31:39.363914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:42.627031Z","title":"Piqa: Reasoning about physical common- sense in natural language","venue":null,"work_id":"b2b7557a-68a2-462d-b7f1-fa48cda2799e","year":2020},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.444920Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:281e1c0e2ff83f057ca7b8ff1a532060ec0f26b23f2076e49b7858ff14b73378","observation_id":"fc872b53-e93a-4a05-a77d-65bd721bfd29","resolution":{"observed_at":"2026-08-06T22:31:42.710576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:42.402504Z","title":"Liu, and Matt Gardner","venue":null,"work_id":"3f366ae6-ff87-4fb4-af88-9949d651c280","year":2017},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.518996Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:4b3b0752b025b6baf7d1b6677e7538c8ffd30bd82d597a49d8f7364c7c5efbea","observation_id":"f407e16b-dd00-4152-aab2-32f538352ad5","resolution":{"observed_at":"2026-08-06T22:31:42.527336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:42.265590Z","title":"BoolQ: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":"49edff79-d65b-46e4-ae15-fc8ad6ab8c34","year":2019},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.599850Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:c4dc854af7d7b6e08bd17f32d91556cfc2d9a05002c980cccd4c44ad6fd6354d","observation_id":"451ce2a6-f0a4-45f6-9ee0-4059911f2b09","resolution":{"observed_at":"2026-08-06T22:31:42.323259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:39.689642Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.689642Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:fc1c8a57ff8806d6bb1f0f0b681df46bef24a194a6a54213a45896fe14668ce2","observation_id":"fa2ec6e9-33ea-4869-8e1b-9ea6d509a64e","resolution":{"observed_at":"2026-08-06T22:31:39.689642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:39.764554Z","title":"Mathqa: Towards interpretable math word problem solving with operation-based formalisms, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.764554Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:ab761c836d68a5d39a8747f07579fe4366867b3d0afb7db923ff76cb9eeda393","observation_id":"17350254-b8c4-48a4-8322-bfa482950b43","resolution":{"observed_at":"2026-08-06T22:31:39.764554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:42.070579Z","title":null,"venue":null,"work_id":"373f12e3-eb34-4462-8b53-33232656bb15","year":2021},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.849319Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:81e6e39de07e0e6495bada2a919b045ab67d3a3b215ee55ce1472dc8382693f1","observation_id":"9caa4a74-9795-4b26-ae42-fdb2e2fb3e54","resolution":{"observed_at":"2026-08-06T22:31:42.162493Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-06T22:31:39.955344Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.955344Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:9e983aa4a9794538315639c36f33dd00fc62103b688fe9a73a52e3e4c51cd6fb","observation_id":"ed73ddf4-2c92-400d-a2e8-1fc17282ccd3","resolution":{"observed_at":"2026-08-06T22:31:39.955344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:41.889165Z","title":"Efficient large scale language modeling with mixtures of experts","venue":null,"work_id":"479bde9d-408e-450f-97ce-9c88a35c7e0e","year":2022},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:40.039407Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:967829617186fb41ead460e9f7f24e53492bb01ca14ea52ef43ca697d0b220c4","observation_id":"752b0d3d-0c92-47dd-aad2-1212e2992466","resolution":{"observed_at":"2026-08-06T22:31:41.973753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:41.691587Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"c93b97ef-9137-41ea-beaf-c68f16380f6f","year":2019},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:40.140435Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:d7188f036e41a335474720ac4f29d5a73b7f53afa9db6c61b2be096b105fca8c","observation_id":"bd642587-8300-4094-999f-0cd460e8c61d","resolution":{"observed_at":"2026-08-06T22:31:41.786740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:41.472667Z","title":"Comparing the pearson and spearman correla- tion coefficients across distributions and sample sizes: A tutorial using simulations and empirical data","venue":null,"work_id":"abe25551-fd49-4781-a0e7-1f0ed6843043","year":2016},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:40.240414Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:5b4dc8633d1ab35a90779a347059dad0241369a18fc1fd99fd68748b62f9e14c","observation_id":"2bc119d4-5638-4b74-be28-6607582b63c6","resolution":{"observed_at":"2026-08-06T22:31:41.578495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:41.271974Z","title":"As described in algorithm 1, we apply a linear transformation to the mean-pooled representations of instances along the sequence length","venue":null,"work_id":"9a2d48b3-5d15-4cab-9636-18b0093eb027","year":null},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:40.328843Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:b208295bbbaf200cdb6f6e762131a6cfe8b60ec4c11fb513e1ff724658027901","observation_id":"6d65bff9-d365-460a-af49-54a81ef4cd17","resolution":{"observed_at":"2026-08-06T22:31:41.369377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:41.055145Z","title":"I am overpowered by the discovery of my own genius for management","venue":null,"work_id":"8610b51f-c756-4f4d-b325-9289e54786ac","year":1968},"citing_paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:40.416807Z"},"links":{"citing_paper":"/paper/2506.21545"},"observation_digest":"sha256:6d05c4b3d69218a6eacd5fc29b1d4ed550059a18ff995fb5af0901d5807037c9","observation_id":"dc04d5f7-4d10-422b-bf68-e651558f3866","resolution":{"observed_at":"2026-08-06T22:31:41.149390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21545","last_updated":"2025-06-26T17:59:07Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T22:21:12.404978Z","submitted_at":"2025-06-26T17:59:07Z","title":"Data Efficacy for Language Model Training"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":32},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 1 inbound Pith citation observation for arXiv:2506.21545."}