{"as_of":"2026-08-08T18:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a311acd198f66e991e8782047bfdb4583b15eef7380bdeac2c2fa7f94f9e19df","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:59:05.807268Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.03004/citation-record","integrity":"/paper/2507.03004/integrity","json":"/paper/2507.03004/citation-record.json","paper":"/paper/2507.03004"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.10832","last_updated":"2022-10-10T20:20:12Z","snapshot_observed_at":"2026-07-06T12:00:03.070535Z","submitted_at":"2021-10-21T00:08:17Z","title":"Ensemble of Averages: Improving Model Selection and Boosting Performance in Domain Generalization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.10832","snapshot_observed_at":"2026-08-06T20:59:03.016155Z","title":"Ensemble of averages: Im- proving model selection and boosting performance in domain generalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:03.016155Z"},"links":{"cited_paper":"/paper/2110.10832","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:08bfb767ba0de9957acd9a8e7d38a3ac924f4294117f282774729ea811143e47","observation_id":"aaec66fd-bc79-4ffc-8a35-33da17352c3a","resolution":{"observed_at":"2026-08-06T20:59:03.016155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:09.308222Z","title":"Swad: Domain generalization by seeking flat minima","venue":null,"work_id":"886e2702-11ca-4fc2-9abc-57759243786f","year":2021},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:03.086726Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:9181221f3c90f3eac45da1e1ceadab907e6a5632a0cda40719ff1af4a0034743","observation_id":"572e5edd-f68a-48ee-b94d-02ff5eb4b76d","resolution":{"observed_at":"2026-08-06T20:59:09.363367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:09.026093Z","title":"Redpajama: an open dataset for training large language models, 2023","venue":null,"work_id":"fbbec371-d2c4-43fa-abbd-3c118e187049","year":2023},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:03.150293Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:ee1e68fa8b763bc8745c6dc75ab483e7712536473161477f4f4141747e9e126e","observation_id":"38ce1e0c-ebb4-4d27-a93e-97999bd3ed73","resolution":{"observed_at":"2026-08-06T20:59:09.169369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.01378","last_updated":"2023-09-13T15:07:01Z","snapshot_observed_at":"2026-08-06T10:09:24.782048Z","submitted_at":"2022-12-02T18:59:04Z","title":"ColD Fusion: Collaborative Descent for Distributed Multitask Finetuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.01378","snapshot_observed_at":"2026-08-06T20:59:03.238055Z","title":"Cold fusion: Collaborative descent for distributed multitask finetuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:03.238055Z"},"links":{"cited_paper":"/paper/2212.01378","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:f029030f76ef8a940d8205f03dbe1adf02a871e2821152078696103db83793d1","observation_id":"edd93686-42b9-412c-afe2-eff4b3ec2884","resolution":{"observed_at":"2026-08-06T20:59:03.238055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:08.823777Z","title":"fingpt-fiqa_qa","venue":null,"work_id":"d0a59bdd-5669-4895-a4fa-7a7fe37249db","year":null},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:03.271090Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:d6cfb1ed58a46d63cc09c3acaba425e37fe61ba1e8a24525cb779f1e9d4da6a5","observation_id":"47657797-cbe2-4693-8e1c-828c9bc605e7","resolution":{"observed_at":"2026-08-06T20:59:08.950675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13257","last_updated":"2025-01-09T22:21:56Z","snapshot_observed_at":"2026-08-02T11:25:49.310871Z","submitted_at":"2024-03-20T02:38:01Z","title":"Arcee's MergeKit: A Toolkit for Merging Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13257","snapshot_observed_at":"2026-08-06T20:59:03.405349Z","title":"Arcee’s mergekit: A toolkit for merging large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:03.405349Z"},"links":{"cited_paper":"/paper/2403.13257","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:7afd978346acec371aba131e932b755f1819a62bcf59bafa3ace4a1a36d0f7ed","observation_id":"233ec159-5fac-4c5a-bda5-1ed459a0591a","resolution":{"observed_at":"2026-08-06T20:59:03.405349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.02312","last_updated":"2020-01-07T23:13:35Z","snapshot_observed_at":"2026-08-07T23:05:10.510860Z","submitted_at":"2020-01-07T23:13:35Z","title":"Stochastic Weight Averaging in Parallel: Large-Batch Training that Generalizes Well","version":1},"cited_work":{"arxiv_id":"2001.02312","doi":null,"metadata_source":"pith","pith_arxiv_id":"2001.02312","snapshot_observed_at":"2026-08-06T20:59:06.334022Z","title":"Stochastic Weight Averaging in Parallel: Large-Batch Training that Generalizes Well","venue":"cs.LG","work_id":"81a1db05-a657-4c6b-9480-1d889f2926b6","year":2020},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:03.457350Z"},"links":{"cited_paper":"/paper/2001.02312","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:385abb8454ac0daf7a596aed2c180aafecf04652f13347bf6aed6f2450d94679","observation_id":"06f926cf-8a87-4a15-b003-00af713ae37e","resolution":{"observed_at":"2026-08-06T20:59:06.406840Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08247","last_updated":"2025-03-18T21:31:51Z","snapshot_observed_at":"2026-08-07T23:01:40.564640Z","submitted_at":"2023-04-14T11:28:08Z","title":"MedAlpaca -- An Open-Source Collection of Medical Conversational AI Models and Training Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08247","snapshot_observed_at":"2026-08-06T20:59:03.537575Z","title":"Medalpaca–an open-source collection of medical conversational ai models and training data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:03.537575Z"},"links":{"cited_paper":"/paper/2304.08247","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:1c6144cb0a33f5ecf23954308cb64f06c23347f586c177a6de8270fe1eb5a819","observation_id":"f384dfab-44f5-43ee-bdaf-54de593205b1","resolution":{"observed_at":"2026-08-06T20:59:03.537575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:08.380394Z","title":"Aligning ai with shared human values","venue":null,"work_id":"f162664a-9040-430f-b3d4-7d39195d5f97","year":2021},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:03.614700Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:2a698d9a0589ecdbc4f7183075bca4e00c09c3af23a383650e63f23ec19fd09f","observation_id":"5c03d426-077e-46c1-87c6-5f6ae6c65225","resolution":{"observed_at":"2026-08-06T20:59:08.462363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:03.688113Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:03.688113Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:0cd9c2725a49bfc3bd5e4964e3ba36d8f985ea158eabc6b320f01fc93ede80b7","observation_id":"3e8fa007-e055-4d06-b35d-9410b90bd1fe","resolution":{"observed_at":"2026-08-06T20:59:03.688113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T20:59:03.750654Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:03.750654Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:318ee097a679bcf7d257772983bfba9a683080654391a5f8f27abb66d87600cf","observation_id":"dea18d27-d4d6-4c69-8d0c-b4eddf2784f8","resolution":{"observed_at":"2026-08-06T20:59:03.750654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-03T22:12:27.993418Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-06T20:59:03.793097Z","title":"Editing models with task arithmetic","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:03.793097Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:98eeeb67d1a3b1543dab0adc3178ef399053a92252d7d8a3dd44ae85698da4de","observation_id":"adef72ab-8162-40df-bd11-f5bdd8788cf8","resolution":{"observed_at":"2026-08-06T20:59:03.793097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:08.176024Z","title":"Editing models with task arithmetic","venue":null,"work_id":"c5f80c1c-c9be-42b0-a066-c4497bacdb12","year":2023},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:03.882507Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:28e2252c7b5f931cc9e6c228e03cca6ab16942af26cfdb2df51501b2708cbdc1","observation_id":"29e40bf6-489f-46b2-aba5-bfaa11642f77","resolution":{"observed_at":"2026-08-06T20:59:08.264099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05407","last_updated":"2019-02-25T14:18:11Z","snapshot_observed_at":"2026-07-31T19:09:21.589864Z","submitted_at":"2018-03-14T17:09:27Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05407","snapshot_observed_at":"2026-08-06T20:59:03.979947Z","title":"Averaging weights leads to wider optima and better generalization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:03.979947Z"},"links":{"cited_paper":"/paper/1803.05407","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:23a36acb2a1427674887d7f75e65ae9ba33a10ceb20271e82318beffcf463783","observation_id":"44e194b9-90c5-4e62-84b6-13799926e0df","resolution":{"observed_at":"2026-08-06T20:59:03.979947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T20:59:04.054223Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:04.054223Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:588931c152c69deced797517a0362c7be33b1bc29498a2748b1966a584dc940a","observation_id":"23e8ea93-bcdb-457e-9987-41bcc420b476","resolution":{"observed_at":"2026-08-06T20:59:04.054223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:04.112753Z","title":"What disease does this patient have? a large-scale open domain question answering dataset from medical exams","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:04.112753Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:cbdeeb28c7d3cd4685460faa7524ae1d4eb641d8ef206b9d3e34ed891ae3869a","observation_id":"d1d4183e-6672-4d6f-b8fb-04e3c61b6317","resolution":{"observed_at":"2026-08-06T20:59:04.112753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.06146","last_updated":"2019-09-13T11:18:20Z","snapshot_observed_at":"2026-07-06T08:21:28.880621Z","submitted_at":"2019-09-13T11:18:20Z","title":"PubMedQA: A Dataset for Biomedical Research Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.06146","snapshot_observed_at":"2026-08-06T20:59:04.195793Z","title":"Pubmedqa: A dataset for biomedical research question answering","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:04.195793Z"},"links":{"cited_paper":"/paper/1909.06146","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:9421ea37663ff008ca843857686e1de3c18898130a019e72011e7244b5f695c4","observation_id":"7cd79f5e-271d-47ac-9905-102d29b8a2ed","resolution":{"observed_at":"2026-08-06T20:59:04.195793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09849","last_updated":"2025-05-21T23:53:00Z","snapshot_observed_at":"2026-08-07T00:34:34.195906Z","submitted_at":"2022-12-19T20:46:43Z","title":"Dataless Knowledge Fusion by Merging Weights of Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09849","snapshot_observed_at":"2026-08-06T20:59:04.284153Z","title":"Dataless knowledge fusion by merging weights of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:04.284153Z"},"links":{"cited_paper":"/paper/2212.09849","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:49e673376d3c81c893ada80d82a2bf227f25a6686b588a403d29f46438fda999","observation_id":"73b9f224-2889-49f1-9818-9853e3743ba2","resolution":{"observed_at":"2026-08-06T20:59:04.284153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:04.344075Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:04.344075Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:2597352656eeefe0391e321176e622bd4f7a48b9a6817517ff0ef0bc04136177","observation_id":"c14d7b81-4133-40c1-8ea1-78ef07c2bf85","resolution":{"observed_at":"2026-08-06T20:59:04.344075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:04.413299Z","title":"Understanding black-box predictions via influence functions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:04.413299Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:9129e012044b1899dc1ce7e5807fe3ebedeab192cca9065e301d6245f6ee2f96","observation_id":"b72e4507-2984-49d4-992e-2f1c6e57a487","resolution":{"observed_at":"2026-08-06T20:59:04.413299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.05492","last_updated":"2017-10-30T20:52:14Z","snapshot_observed_at":"2026-07-06T05:15:00.158639Z","submitted_at":"2016-10-18T09:11:51Z","title":"Federated Learning: Strategies for Improving Communication Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.05492","snapshot_observed_at":"2026-08-06T20:59:04.487530Z","title":"Federated learning: Strategies for improving communication efficiency","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:04.487530Z"},"links":{"cited_paper":"/paper/1610.05492","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:7adb95a8200bae71bcce4291888d5a6aadbfd72d5454ef921b273ca85c7f4b23","observation_id":"7d20b216-b0f3-4f58-942f-a5c4f2c97ed0","resolution":{"observed_at":"2026-08-06T20:59:04.487530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00902","last_updated":"2024-03-13T14:27:46Z","snapshot_observed_at":"2026-08-05T00:50:30.348219Z","submitted_at":"2023-10-02T04:59:19Z","title":"DataInf: Efficiently Estimating Data Influence in LoRA-tuned LLMs and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00902","snapshot_observed_at":"2026-08-06T20:59:04.543992Z","title":"Datainf: Efficiently estimating data influence in lora-tuned llms and diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:04.543992Z"},"links":{"cited_paper":"/paper/2310.00902","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:28cf073df461ab53464203434dcf19c368d1d76f9f2f539dcda351eb382065fe","observation_id":"e2ae71c0-b837-4dbb-9ef4-62d50e9e3ee5","resolution":{"observed_at":"2026-08-06T20:59:04.543992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06499","last_updated":"2022-03-24T19:29:45Z","snapshot_observed_at":"2026-08-05T18:30:13.997811Z","submitted_at":"2021-07-14T06:06:52Z","title":"Deduplicating Training Data Makes Language Models Better","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06499","snapshot_observed_at":"2026-08-06T20:59:04.607253Z","title":"Deduplicating training data makes language models better","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:04.607253Z"},"links":{"cited_paper":"/paper/2107.06499","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:dc3d45586db9fc6ce2c6bbe61ac8270e387cb7375c8e724e08faae24a0997e36","observation_id":"d76afe2c-0be6-4305-8abe-91a0e68ffbdc","resolution":{"observed_at":"2026-08-06T20:59:04.607253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-06T20:59:04.662169Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:04.662169Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:f3fbf4c3db88f3184b04b70597dfa9716d4f860adb51190d18db168ba2ea6f16","observation_id":"24e3a7d0-fe10-400a-8c73-3d34e3d9eb7e","resolution":{"observed_at":"2026-08-06T20:59:04.662169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12032","last_updated":"2024-04-06T03:52:04Z","snapshot_observed_at":"2026-07-06T16:09:28.325603Z","submitted_at":"2023-08-23T09:45:29Z","title":"From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12032","snapshot_observed_at":"2026-08-06T20:59:04.732253Z","title":"From quantity to quality: Boosting llm performance with self- guided data selection for instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:04.732253Z"},"links":{"cited_paper":"/paper/2308.12032","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:ad63b1bfafe5eb5032385a3d863828858077868bd8d446bebea9274190508464","observation_id":"2ca8c4a2-3841-4b2c-9632-0b03d8b467b3","resolution":{"observed_at":"2026-08-06T20:59:04.732253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:07.951640Z","title":"Convergence analysis of two-layer neural networks with relu activation","venue":null,"work_id":"edcbb3ff-ca54-4ba1-a9cf-c6a76b17c85e","year":2017},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:04.810874Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:b4e7930139b141a3aecea18282caa09de32e207f2ad5819236213d343146b8e1","observation_id":"9edf96f8-4fdc-4348-9b18-af5b230dce42","resolution":{"observed_at":"2026-08-06T20:59:08.050971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:07.781815Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"d064ea3e-19f7-425a-87bd-768649cf4cf0","year":2019},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:04.859470Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:e3477a9428aed122abb71569b568fc658765afe207f763398640d557f52a4a2c","observation_id":"b5f36549-3092-4a43-b488-8c3fef8ff3f0","resolution":{"observed_at":"2026-08-06T20:59:07.895186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:07.572323Z","title":"Peft: State-of-the-art parameter-efficient fine-tuning methods, 2022","venue":null,"work_id":"019cb49f-842b-441c-84b1-1d47ea87841c","year":2022},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:04.898979Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:ea4f1377c96f9d98d20da5438a5340aa84f7e21a8e99135e686dab9f371eec59","observation_id":"a22bc54d-1f72-4a4d-b984-30404b02b74c","resolution":{"observed_at":"2026-08-06T20:59:07.661908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-319-99713-1_5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":"Mondschein and Cosimo Monda","venue":null,"work_id":"40b72080-3179-492e-95f6-5a127dc55cec","year":2019},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:04.956644Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:a740cbe5d101ef04c462da72d4d3ea094b13d12932f717889d387fdc4a87be76","observation_id":"da38bd29-33fd-4215-a67d-096ed2cb5e62","resolution":{"observed_at":"2026-08-06T20:59:06.009321Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16264","last_updated":"2025-06-28T00:00:06Z","snapshot_observed_at":"2026-08-08T06:18:27.640980Z","submitted_at":"2023-05-25T17:18:55Z","title":"Scaling Data-Constrained Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16264","snapshot_observed_at":"2026-08-06T20:59:05.011183Z","title":"Scaling data-constrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:05.011183Z"},"links":{"cited_paper":"/paper/2305.16264","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:e84e2bb8522b62934a47ad348a6edc5c027dd7eb7e37c993e77dc33ce336c5ac","observation_id":"2f931eb1-dc06-4d8c-ba9b-afe80ae66a1e","resolution":{"observed_at":"2026-08-06T20:59:05.011183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:07.384166Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":"d5267d40-ad11-4519-8540-511b70879562","year":2023},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:05.049128Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:f7c0dec208e4b7999ab1ab959071c3f5dfe96bfc4fd4886bc3db50e34c435b08","observation_id":"44ae9e10-007c-4325-b5be-4a6d15ed37d9","resolution":{"observed_at":"2026-08-06T20:59:07.471972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:07.188234Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":null,"work_id":"a2f45ef4-4cae-4048-9e75-284141c814bf","year":2022},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:05.120120Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:ade1046a949e7983979011a5c786dde8048e8510f5b679dfc478435c217373ce","observation_id":"58927896-5d8a-4e21-b1ba-ebde90c9ca09","resolution":{"observed_at":"2026-08-06T20:59:07.264666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:06.978177Z","title":"Pytorch: An imperative style, high- performance deep learning library","venue":null,"work_id":"6ba77f48-ec53-4ecf-bb8b-dca6909a4e93","year":2019},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:05.167550Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:21a5ffd9011e5353551c52e278e9e765346d9163681489bb85b73a06907f227e","observation_id":"cc517d00-a1ab-4f66-9bd0-eb11672d3170","resolution":{"observed_at":"2026-08-06T20:59:07.069483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:05.214502Z","title":"Towards building multilingual language model for medicine, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:05.214502Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:d22bb75f313073857ce97102005eca2e27e0074ec2bb17ca5408529dcad06028","observation_id":"d8a339a3-ce17-44bd-8d4d-bc94437fe42b","resolution":{"observed_at":"2026-08-06T20:59:05.214502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:05.278207Z","title":"Smith, and Yejin Choi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:05.278207Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:31c2015a54a0a4b5f1ffe850908975b5ac964b3d49e742fb5b11372a38840106","observation_id":"1a4ebf0b-0241-4156-a348-ae44be7fefca","resolution":{"observed_at":"2026-08-06T20:59:05.278207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13405","last_updated":"2019-06-28T16:44:04Z","snapshot_observed_at":"2026-08-01T16:25:32.205869Z","submitted_at":"2019-05-31T04:07:58Z","title":"Luck Matters: Understanding Training Dynamics of Deep ReLU Networks","version":4},"cited_work":{"arxiv_id":"1905.13405","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.13405","snapshot_observed_at":"2026-08-06T20:59:06.175066Z","title":"Luck Matters: Understanding Training Dynamics of Deep ReLU Networks","venue":"cs.LG","work_id":"3859b56e-d43a-4f6c-8c8d-5d67bb155b7a","year":2019},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:05.333594Z"},"links":{"cited_paper":"/paper/1905.13405","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:c65f04153f29da1e4c2d8c92b72a3c0f8017921dea068e0e01fe0ea9b328c332","observation_id":"d85f393b-0f7e-4acb-ad6b-b691dc3c5779","resolution":{"observed_at":"2026-08-06T20:59:06.219462Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:05.393072Z","title":"Llama: Open and efficient foundation language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:05.393072Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:fdc0ab8d7c9da457a6913c87bea17e094530ec17d3359f7161b72d3261ee5f58","observation_id":"03cd30a0-72e3-4df6-a945-3b401adc160d","resolution":{"observed_at":"2026-08-06T20:59:05.393072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:05.458271Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:05.458271Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:8aa9ab7ae85068e612691f687182e9cc193e0ae48cac2cbc5f8627346975bdfd","observation_id":"4cb854e7-f732-4c3a-a0da-7d8cf00fcdae","resolution":{"observed_at":"2026-08-06T20:59:05.458271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/s0893-6080(96)00119-0","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:05.868053Z","title":"Wilson, James L","venue":null,"work_id":"6a66da44-cad0-48b9-8bbd-32b796ac49d5","year":1997},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:05.524371Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:407a921a6bc491691eb096142cdf771a3d0af07f15bf3f442e25d50160b4b2ac","observation_id":"80e75d6c-c521-41fd-bf54-d7bd2567e041","resolution":{"observed_at":"2026-08-06T20:59:05.908802Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:05.584862Z","title":"Transformers: State-of-the-art natural language processing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:05.584862Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:49e0976262d0633c2fb3717ea2919d0d5a867edc37a5773fbce08df2cc05eab5","observation_id":"5bd36964-1ed4-4161-bd38-27c029102767","resolution":{"observed_at":"2026-08-06T20:59:05.584862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:06.697484Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":"a0a5f004-df3b-411a-992d-4b1a9b663a20","year":2022},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:05.649932Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:b90253238d552987c09bbcbfe547e7e4ab990eb183d73ea381fec9874aada0d7","observation_id":"50609034-247e-4c41-bbc3-8f3ca6128a6a","resolution":{"observed_at":"2026-08-06T20:59:06.854254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14454","last_updated":"2023-08-25T14:08:38Z","snapshot_observed_at":"2026-08-04T20:48:57.839385Z","submitted_at":"2023-04-27T18:29:05Z","title":"PMC-LLaMA: Towards Building Open-source Language Models for Medicine","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14454","snapshot_observed_at":"2026-08-06T20:59:05.693572Z","title":"Pmc-llama: Further finetuning llama on medical papers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:05.693572Z"},"links":{"cited_paper":"/paper/2304.14454","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:5e54603f7c3377d4513add2a1e3365be03d52c78df3041a2761a03260650cc89","observation_id":"7b749274-5670-49c3-81f0-cc4450a47a81","resolution":{"observed_at":"2026-08-06T20:59:05.693572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:06.496929Z","title":"TIES-merging: Resolving interference when merging models","venue":null,"work_id":"58ce3c05-f0d3-4e6f-8fa8-4b17e0d9c08b","year":2023},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:05.750506Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:a1fe1a3dc1a4c135e3400cafad6ef3141b259620916ba83184e002b8ca50c32f","observation_id":"3fe58433-ced4-4581-9302-70435df37255","resolution":{"observed_at":"2026-08-06T20:59:06.600515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:05.807268Z","title":"surprised","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:05.807268Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:ba8e474c016a0c361119406e192a757626db0b8d9e94d2dc13cd9cc9817d64fe","observation_id":"3f06e261-7424-493d-9280-ef4695199cc2","resolution":{"observed_at":"2026-08-06T20:59:05.807268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:59:08.600098Z","title":null,"venue":null,"work_id":"b9a4eb54-81d2-439e-8c3d-683a33ad3295","year":null},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:03.350941Z"},"links":{"citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:d546423ed7b013e2095c9dca6bcc88d028433e56ace7cce51ca232f935b9ac30","observation_id":"3baf143b-81a2-464f-9ca5-9e4e3ba88dbb","resolution":{"observed_at":"2026-08-06T20:59:08.676193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":4,"verified_fuzzy":13},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2507.03004."}