{"as_of":"2026-08-08T03:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b40952607ed186d92305476dca59142ec2d6cf9c77b9c95788730a0b6be0412","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:04:24.977197Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:17:27.176059Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20380","snapshot_observed_at":"2026-08-03T04:17:27.176059Z","title":"Grape: Optimize data mixture for group robust multi-target adaptive pretraining.arXiv preprint arXiv:2505.20380, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05547","last_updated":"2026-08-05T16:57:37Z","snapshot_observed_at":"2026-08-08T03:12:13.207542Z","submitted_at":"2026-02-05T11:06:37Z","title":"Multi-Task GRPO: Reliable LLM Reasoning Across Tasks","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T04:17:27.176059Z"},"links":{"cited_paper":"/paper/2505.20380","citing_paper":"/paper/2602.05547"},"observation_digest":"sha256:4585b4227faf2a8e00965a5e6a5db545845de14c31ae34aca3bd59bdd0a8859c","observation_id":"c1292400-923a-4c76-bc8e-077a045b9afa","resolution":{"observed_at":"2026-08-03T04:17:27.176059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20380/citation-record","integrity":"/paper/2505.20380/integrity","json":"/paper/2505.20380/citation-record.json","paper":"/paper/2505.20380"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:22.381295Z","title":"The pile: An 800gb dataset of diverse text for language modeling, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:22.381295Z"},"links":{"citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:2e3f618230a63a4faefb7c0e8ac4173105c0976a21f092332895dc219fe2636e","observation_id":"891c50f9-c251-4812-a846-2013608f0c80","resolution":{"observed_at":"2026-08-07T14:04:22.381295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:26.257489Z","title":"Redpajama: An open source recipe to reproduce llama training dataset, 2023","venue":null,"work_id":"4a2dc5b0-7ac5-4a35-b462-b8081d4daa99","year":2023},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:22.438328Z"},"links":{"citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:679ba350aa4c071fe292226d5b25e8ae988c1ec9ca0afcdda14492221dd20bbb","observation_id":"a3914e3c-bc38-4ed8-a2e0-a02e4569b9f7","resolution":{"observed_at":"2026-08-07T14:04:26.325372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10429","last_updated":"2023-11-21T02:01:53Z","snapshot_observed_at":"2026-07-06T15:28:49.253125Z","submitted_at":"2023-05-17T17:58:13Z","title":"DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10429","snapshot_observed_at":"2026-08-07T14:04:22.550042Z","title":"Le, Tengyu Ma, and Adams Wei Yu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:22.550042Z"},"links":{"cited_paper":"/paper/2305.10429","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:adce0ca0a46e279229dd07eb15dc13d9a3a97cd3e49ffa90005b2989a0b8118d","observation_id":"b4303d09-6850-428d-9ed4-32fa963c15ef","resolution":{"observed_at":"2026-08-07T14:04:22.550042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01492","last_updated":"2025-01-23T17:35:43Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-07-01T17:31:03Z","title":"RegMix: Data Mixture as Regression for Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01492","snapshot_observed_at":"2026-08-07T14:04:22.629012Z","title":"Regmix: Data mixture as regression for language model pre-training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:22.629012Z"},"links":{"cited_paper":"/paper/2407.01492","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:4bf52c15aec5167753c38c9064b2527e1549d9b0d9ce175da2a632b88e68c5f2","observation_id":"5845024c-8104-4c50-90dd-1a03c46a31a9","resolution":{"observed_at":"2026-08-07T14:04:22.629012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15393","last_updated":"2024-02-05T16:33:05Z","snapshot_observed_at":"2026-07-06T16:37:31.409792Z","submitted_at":"2023-10-23T22:51:58Z","title":"DoGE: Domain Reweighting with Generalization Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15393","snapshot_observed_at":"2026-08-07T14:04:22.784397Z","title":"Doge: Domain reweighting with generalization estimation, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:22.784397Z"},"links":{"cited_paper":"/paper/2310.15393","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:38cc091e23916b05d16c729e86e5278c70fe34f58d8c1eb0003d366820add2fa","observation_id":"59c3bb8f-c3bd-49c5-977d-081837ee815c","resolution":{"observed_at":"2026-08-07T14:04:22.784397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03735","last_updated":"2025-03-11T00:20:30Z","snapshot_observed_at":"2026-08-01T06:32:48.110512Z","submitted_at":"2024-09-30T20:49:54Z","title":"Task-Adaptive Pretrained Language Models via Clustered-Importance Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03735","snapshot_observed_at":"2026-08-07T14:04:22.901349Z","title":"Task-adaptive pretrained language models via clustered-importance sampling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:22.901349Z"},"links":{"cited_paper":"/paper/2410.03735","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:c399622ee9fa4c03b898f1d3815f334dfeb3517550a64345c1d2b754712d9cc7","observation_id":"4514bdcb-4843-496a-b304-2ba5fc63bd0c","resolution":{"observed_at":"2026-08-07T14:04:22.901349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02498","last_updated":"2024-10-03T14:00:44Z","snapshot_observed_at":"2026-08-05T18:55:08.459445Z","submitted_at":"2024-10-03T14:00:44Z","title":"Dynamic Gradient Alignment for Online Data Mixing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02498","snapshot_observed_at":"2026-08-07T14:04:22.974581Z","title":"Dynamic gradient alignment for online data mixing, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:22.974581Z"},"links":{"cited_paper":"/paper/2410.02498","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:43aaf12f4e7f20d4bd9e7b5369fc486587f9b52598f426e408fa8a50259d95ba","observation_id":"9e77b75e-a9a1-4abf-8af6-eed623f1219b","resolution":{"observed_at":"2026-08-07T14:04:22.974581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.06782","last_updated":"2020-12-22T00:35:46Z","snapshot_observed_at":"2026-08-07T17:16:18.324802Z","submitted_at":"2020-01-19T06:33:47Z","title":"Gradient Surgery for Multi-Task Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.06782","snapshot_observed_at":"2026-08-07T14:04:23.075091Z","title":"Gradient surgery for multi-task learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.075091Z"},"links":{"cited_paper":"/paper/2001.06782","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:5dd29364f29094c1783758f5b63d9daaba4b9917f828b3e38ce7bf7a4b952025","observation_id":"ddf230ea-6079-4599-bf9e-7fea37ee7b7d","resolution":{"observed_at":"2026-08-07T14:04:23.075091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03792","last_updated":"2023-10-30T02:45:50Z","snapshot_observed_at":"2026-07-06T15:39:18.493629Z","submitted_at":"2023-06-06T15:39:54Z","title":"FAMO: Fast Adaptive Multitask Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03792","snapshot_observed_at":"2026-08-07T14:04:23.171525Z","title":"Famo: Fast adaptive multitask optimization, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.171525Z"},"links":{"cited_paper":"/paper/2306.03792","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:b0a3e7c4297ffe1a79d2a58bfdda0696d9ae15887018819c29d9d1a727b23f3c","observation_id":"fc54a80d-348a-4890-8693-3559ff35ebce","resolution":{"observed_at":"2026-08-07T14:04:23.171525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01793","last_updated":"2024-09-03T11:17:44Z","snapshot_observed_at":"2026-08-01T22:05:12.610689Z","submitted_at":"2024-09-03T11:17:44Z","title":"Task Weighting through Gradient Projection for Multitask Learning","version":1},"cited_work":{"arxiv_id":"2409.01793","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.01793","snapshot_observed_at":"2026-08-07T14:04:25.594547Z","title":"Task Weighting through Gradient Projection for Multitask Learning","venue":"cs.LG","work_id":"8160f680-8195-4b47-a13f-e9fa97d3bb2d","year":2024},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.239267Z"},"links":{"cited_paper":"/paper/2409.01793","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:58485e9953b9898f6dd1d963c321f1d94d8d62e50a016afc833b01e44df9e8a0","observation_id":"92c0370f-7511-416a-a66f-6593e8b22641","resolution":{"observed_at":"2026-08-07T14:04:25.628062Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08750","last_updated":"2020-07-18T01:20:20Z","snapshot_observed_at":"2026-07-06T07:09:29.571298Z","submitted_at":"2018-10-20T03:50:29Z","title":"Learning Models with Uniform Performance via Distributionally Robust Optimization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08750","snapshot_observed_at":"2026-08-07T14:04:23.320223Z","title":"Learning models with uniform performance via distributionally robust optimization, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.320223Z"},"links":{"cited_paper":"/paper/1810.08750","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:973f29b0344b091ca8c9353d6e6679628384f208cfb6836ed6dfaeedfd9ac663","observation_id":"890473d1-52e4-421e-9104-c33da6a6e0ee","resolution":{"observed_at":"2026-08-07T14:04:23.320223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.08731","last_updated":"2020-04-02T05:40:29Z","snapshot_observed_at":"2026-08-02T19:28:48.954133Z","submitted_at":"2019-11-20T06:43:41Z","title":"Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.08731","snapshot_observed_at":"2026-08-07T14:04:23.384622Z","title":"Hashimoto, and Percy Liang","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.384622Z"},"links":{"cited_paper":"/paper/1911.08731","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:9705ab80462675152c51e7a11d243da36d7555cd7491c6faa1be9f05a7bf645b","observation_id":"01494077-0de8-451a-9b61-b332c00f151f","resolution":{"observed_at":"2026-08-07T14:04:23.384622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10138","last_updated":"2021-11-12T15:52:00Z","snapshot_observed_at":"2026-08-06T16:20:24.397386Z","submitted_at":"2020-06-17T20:19:25Z","title":"An Online Method for A Class of Distributionally Robust Optimization with Non-Convex Objectives","version":5},"cited_work":{"arxiv_id":"2006.10138","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.10138","snapshot_observed_at":"2026-08-07T14:04:25.399472Z","title":"An Online Method for A Class of Distributionally Robust Optimization with Non-Convex Objectives","venue":"cs.LG","work_id":"f8e598b3-9a06-40b3-99f8-6946f407f183","year":2020},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.474114Z"},"links":{"cited_paper":"/paper/2006.10138","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:3f34c4fd69a52d24eda2d018eda4e4ea9a82f37c71c7fbe8505af9a12813fd60","observation_id":"2161bc10-f925-448e-8759-e77f382bd826","resolution":{"observed_at":"2026-08-07T14:04:25.474251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:26.055342Z","title":"Stochastic gradient methods for distributionally robust optimization with f-divergences","venue":null,"work_id":"1042a112-fd08-4d4e-9b14-4a5387b872fe","year":2016},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.584016Z"},"links":{"citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:84ffaee9c326158d62aec3599ec636ce0573adf7c03cace9e51ae10ae2b6cd22","observation_id":"48ac4f27-bcf8-43ea-98d2-556ad10af6f0","resolution":{"observed_at":"2026-08-07T14:04:26.145954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T14:04:23.690591Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.690591Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:990ef041fb1edbad8c377608ca7a0ea20219d826f4c28647d1e0669a6bd33d2b","observation_id":"6428e2da-6ee0-4c9d-a343-0a49a53c2441","resolution":{"observed_at":"2026-08-07T14:04:23.690591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13161","last_updated":"2025-11-30T07:03:40Z","snapshot_observed_at":"2026-08-07T16:01:21.371569Z","submitted_at":"2025-04-17T17:58:13Z","title":"Nemotron-CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13161","snapshot_observed_at":"2026-08-07T14:04:23.796108Z","title":"Climb: Clustering-based iterative data mixture bootstrapping for language model pre-training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.796108Z"},"links":{"cited_paper":"/paper/2504.13161","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:9d19527f4acf948301b01c0ee1c6f6e12006434da340da16e7d497eccd7c9112","observation_id":"8d2d5629-0069-4604-8384-21c8d0164403","resolution":{"observed_at":"2026-08-07T14:04:23.796108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T14:04:23.913426Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.913426Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:991efdd156db3fc6b50749c4de6ca6e554a4fe422e7bd3f424ef425bfc8463c3","observation_id":"b47ec271-8c07-4c8d-b297-fe2d808ee1c9","resolution":{"observed_at":"2026-08-07T14:04:23.913426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-08-06T06:05:27.671303Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-08-07T14:04:24.035893Z","title":"Liu, and Matt Gardner","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.035893Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:57440c9ecf6c7bb989531407e133f0cba46425960c7a8c9c0a0cc5283c032a10","observation_id":"f8c2bc0f-7a6c-4fa5-893d-9d91a140078c","resolution":{"observed_at":"2026-08-07T14:04:24.035893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-08-08T00:48:01.603669Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-07T14:04:24.118899Z","title":"Piqa: Reasoning about physical commonsense in natural language, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.118899Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:3be7812edd1626b965d7e489b1ff4b16a6ad8aec63157e04a179154d1755f6ac","observation_id":"948a9799-9802-45c3-8935-abbffd40b00a","resolution":{"observed_at":"2026-08-07T14:04:24.118899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-07-06T09:38:41.713097Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-07T14:04:24.217182Z","title":"Logiqa: A challenge dataset for machine reading comprehension with logical reasoning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.217182Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:e46030f9751d0eb40aa29f8a6f043fecccaf95db67c7e6380c05760815922d3b","observation_id":"5d2d7f5b-e799-49fe-bfe4-cc6e5db02d67","resolution":{"observed_at":"2026-08-07T14:04:24.217182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-07T14:04:24.262249Z","title":"Hellaswag: Can a machine really finish your sentence?, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.262249Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:8a1df0c29341a99f8ac8c47702ded9d0f8ca9e9d86e4e009e3fc180b29f8680d","observation_id":"4f8b13c0-bbd2-4f9c-bf77-18f58daf0c7d","resolution":{"observed_at":"2026-08-07T14:04:24.262249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:25.928761Z","title":"W iki-40 B : Multilingual language model dataset","venue":null,"work_id":"64c6493b-8841-4f6d-91b6-b9cb0c070c1b","year":2020},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.331842Z"},"links":{"citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:ba23f65231a177d0625494c92ffdbd7f4090bbab3f80e6caf3900d0a173018bb","observation_id":"3f4148fc-f73e-403c-b182-5b53eb5ad82f","resolution":{"observed_at":"2026-08-07T14:04:25.971942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14430","last_updated":"2023-07-26T18:01:49Z","snapshot_observed_at":"2026-08-02T22:31:42.480177Z","submitted_at":"2023-07-26T18:01:49Z","title":"Skill-it! A Data-Driven Skills Framework for Understanding and Training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14430","snapshot_observed_at":"2026-08-07T14:04:24.403499Z","title":"Chen, Nicholas Roberts, Kush Bhatia, Jue Wang, Ce Zhang, Frederic Sala, and Christopher Ré","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.403499Z"},"links":{"cited_paper":"/paper/2307.14430","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:be375d23b02231cb724c32818be1d5db890d2073a09cbe973e5f2331074204c1","observation_id":"32058b09-fae7-4ce8-bfc0-e861a5801d4b","resolution":{"observed_at":"2026-08-07T14:04:24.403499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08801","last_updated":"2020-07-28T15:12:38Z","snapshot_observed_at":"2026-07-06T09:39:02.518657Z","submitted_at":"2020-07-17T07:52:44Z","title":"Learning to Combine: Knowledge Aggregation for Multi-Source Domain Adaptation","version":3},"cited_work":{"arxiv_id":"2007.08801","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.08801","snapshot_observed_at":"2026-08-07T14:04:25.176334Z","title":"Learning to Combine: Knowledge Aggregation for Multi-Source Domain Adaptation","venue":"cs.CV","work_id":"d0ba9585-ee2e-4878-85fa-caa52c168760","year":2020},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.473199Z"},"links":{"cited_paper":"/paper/2007.08801","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:c6b47c83b2a706e6f052b3bbd81da0fdbb34d9e56f26ee0d2583f273ef2d412a","observation_id":"1e101994-f756-4a34-9730-29927a129382","resolution":{"observed_at":"2026-08-07T14:04:25.253706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-07-06T16:56:57.763886Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-07T14:04:24.571162Z","title":"Efficient online data mixing for language model pre-training, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.571162Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:808f7d9d36b9100d4dab0eee6eb1a3453200acf93974cd60f12709d0ecd1e61c","observation_id":"4f784259-f93c-48de-97e0-b32d974601ba","resolution":{"observed_at":"2026-08-07T14:04:24.571162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14048","last_updated":"2024-02-21T04:18:38Z","snapshot_observed_at":"2026-07-06T12:02:19.650098Z","submitted_at":"2021-10-26T22:03:51Z","title":"Conflict-Averse Gradient Descent for Multi-task Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14048","snapshot_observed_at":"2026-08-07T14:04:24.642321Z","title":"Conflict-averse gradient descent for multi-task learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.642321Z"},"links":{"cited_paper":"/paper/2110.14048","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:f119bb214adcb0e440590d5d14ed6ac9578881d53584bde184a066ebddec021c","observation_id":"f8a9d79b-2215-444b-a291-5b99e7ab11d2","resolution":{"observed_at":"2026-08-07T14:04:24.642321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.02257","last_updated":"2018-06-12T06:45:49Z","snapshot_observed_at":"2026-08-01T19:42:19.684191Z","submitted_at":"2017-11-07T02:08:12Z","title":"GradNorm: Gradient Normalization for Adaptive Loss Balancing in Deep Multitask Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.02257","snapshot_observed_at":"2026-08-07T14:04:24.716563Z","title":"Gradnorm: Gradient normalization for adaptive loss balancing in deep multitask networks, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.716563Z"},"links":{"cited_paper":"/paper/1711.02257","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:ee015c45859bfb8177ddcd592fb02e52f04a3bcea4085db9963fbf55d0c2ccb0","observation_id":"a31677a6-6ff4-49b5-a0c2-2baae3a7fd06","resolution":{"observed_at":"2026-08-07T14:04:24.716563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01017","last_updated":"2022-07-08T12:00:51Z","snapshot_observed_at":"2026-08-03T15:35:05.073940Z","submitted_at":"2022-02-02T13:21:53Z","title":"Multi-Task Learning as a Bargaining Game","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.01017","snapshot_observed_at":"2026-08-07T14:04:24.809400Z","title":"Multi-task learning as a bargaining game, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.809400Z"},"links":{"cited_paper":"/paper/2202.01017","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:54bed60e2074cac065b963f868b6c097eb9649b10f0c4a984ba7941a23c96463","observation_id":"1fa80b2f-9c0c-4312-ad17-8504c1af612b","resolution":{"observed_at":"2026-08-07T14:04:24.809400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:25.755062Z","title":"Multiple-gradient descent algorithm ( MGDA ) for multiobjective optimization","venue":null,"work_id":"15b8eda2-fef4-463f-91f0-2a73916e3b18","year":2012},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.912025Z"},"links":{"citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:13fa63d6039b72432227ff0164662c2317d56b4a23cfa3e4220774a781bff7e1","observation_id":"3fbc81cf-d05b-4848-ae99-bc8f97745d6f","resolution":{"observed_at":"2026-08-07T14:04:25.848930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-07T14:04:24.977197Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.977197Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:f10cc1b4ea3b4771a7af83c955f3493e6d16fd2f59068565d456be88d8360c87","observation_id":"131c85fc-1716-4469-97cf-1d194ba1e879","resolution":{"observed_at":"2026-08-07T14:04:24.977197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T13:53:51.336748Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":3,"verified_fuzzy":4},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2505.20380."}