{"as_of":"2026-08-22T20:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e88e1df96b0bc4c35ae489b17a802cfd0a5edc678f70028da098d72a4ce3b308","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:49:33.125140Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:02:00.932716Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:58:46.760870Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00358","snapshot_observed_at":"2026-08-10T21:02:00.932716Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.06708","last_updated":"2026-05-25T22:00:48Z","snapshot_observed_at":"2026-08-17T03:31:02.136201Z","submitted_at":"2025-01-12T04:28:14Z","title":"Evaluating Sample Utility for Efficient Data Selection by Mimicking Model Weights","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:00.932716Z"},"links":{"cited_paper":"/paper/2505.00358","citing_paper":"/paper/2501.06708"},"observation_digest":"sha256:a40ac3d4b2d1018864a7735e76ca6dbbc5c73e229b4d8751ffb0cf2c0625cc12","observation_id":"df0770f5-85c7-420a-b891-2cf29453ced8","resolution":{"observed_at":"2026-08-10T21:02:00.932716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"cited_work":{"arxiv_id":"2505.00358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00358","snapshot_observed_at":"2026-07-03T17:58:46.760870Z","title":"R&b: Domain regrouping and data mixture balancing for efficient foundation model training","venue":null,"work_id":"f21162ae-5f71-40bb-a892-a2f6412c9b45","year":2025},"citing_paper":{"arxiv_id":"2604.16380","last_updated":"2026-03-25T13:30:40Z","snapshot_observed_at":"2026-08-15T22:16:01.152280Z","submitted_at":"2026-03-25T13:30:40Z","title":"Data Mixing for Large Language Models Pretraining: A Survey and Outlook","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:04.958757Z"},"links":{"cited_paper":"/paper/2505.00358","citing_paper":"/paper/2604.16380"},"observation_digest":"sha256:5099b6ea1342a0f88a7c659d01d2045e63f06e873f8f57295ac4e106b1fe1ee1","observation_id":"aab1ca16-6c06-452b-b232-3451f46e26be","resolution":{"observed_at":"2026-05-15T00:58:25.732902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"cited_work":{"arxiv_id":"2505.00358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00358","snapshot_observed_at":"2026-07-03T17:58:46.760870Z","title":"R&b: Domain regrouping and data mixture balancing for efficient foundation model training","venue":null,"work_id":"f21162ae-5f71-40bb-a892-a2f6412c9b45","year":2025},"citing_paper":{"arxiv_id":"2607.01686","last_updated":"2026-07-02T04:27:45Z","snapshot_observed_at":"2026-08-09T02:25:47.839654Z","submitted_at":"2026-07-02T04:27:45Z","title":"WARP: Weight-Space Analysis for Recovering Training Data Portfolios","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-03T17:54:31.856386Z"},"links":{"cited_paper":"/paper/2505.00358","citing_paper":"/paper/2607.01686"},"observation_digest":"sha256:386392aa784e60e7581c53ef962d4d9743cf688545a90ffe8d111acb3de5c8d3","observation_id":"b81392e0-504d-4e37-90eb-d8aa1db6d013","resolution":{"observed_at":"2026-07-03T17:58:46.762888Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.00358/citation-record","integrity":"/paper/2505.00358/integrity","json":"/paper/2505.00358/citation-record.json","paper":"/paper/2505.00358"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.15393","last_updated":"2024-02-05T16:33:05Z","snapshot_observed_at":"2026-08-18T19:03:41.103305Z","submitted_at":"2023-10-23T22:51:58Z","title":"DoGE: Domain Reweighting with Generalization Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15393","snapshot_observed_at":"2026-08-16T04:49:32.939849Z","title":"DoGE: Domain Reweighting with Generalization Estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:32.939849Z"},"links":{"cited_paper":"/paper/2310.15393","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:9e02da05b933f3fe8ef09b766b933deb699ac80f2be1c656ff93a45038256630","observation_id":"81d4a51a-0e1d-4e50-ade2-f2ab54d600d5","resolution":{"observed_at":"2026-08-16T04:49:32.939849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10429","last_updated":"2023-11-21T02:01:53Z","snapshot_observed_at":"2026-08-18T18:57:46.398716Z","submitted_at":"2023-05-17T17:58:13Z","title":"DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10429","snapshot_observed_at":"2026-08-16T04:49:32.945685Z","title":"M.; Pham, H.; Dong, X.; Du, N.; Liu, H.; Lu, Y.; Liang, P.; Le, Q","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:32.945685Z"},"links":{"cited_paper":"/paper/2305.10429","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:22b024d5cb8caac8d91b032134c00f7b582323d5507b883e8eba72e6bd650198","observation_id":"224d3fe8-7e53-490e-b635-2bc8bc3f5401","resolution":{"observed_at":"2026-08-16T04:49:32.945685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14430","last_updated":"2023-07-26T18:01:49Z","snapshot_observed_at":"2026-08-18T18:58:19.144150Z","submitted_at":"2023-07-26T18:01:49Z","title":"Skill-it! A Data-Driven Skills Framework for Understanding and Training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14430","snapshot_observed_at":"2026-08-16T04:49:32.951293Z","title":"F.; Roberts, N.; Bhatia, K.; Wang, J.; Zhang, C.; Sala, F.; R´ e, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:32.951293Z"},"links":{"cited_paper":"/paper/2307.14430","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:18b1244d74c4c9de69141b36d8f00a1c3b2b3b59d4554bae97e77253abb7e7ee","observation_id":"19297c32-4a8a-4099-8b3b-f3ec652e8c0b","resolution":{"observed_at":"2026-08-16T04:49:32.951293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05735","last_updated":"2025-04-21T03:50:23Z","snapshot_observed_at":"2026-08-20T14:41:33.557208Z","submitted_at":"2024-11-08T17:50:24Z","title":"Aioli: A Unified Optimization Framework for Language Model Data Mixing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05735","snapshot_observed_at":"2026-08-16T04:49:32.957200Z","title":"F.; Hu, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:32.957200Z"},"links":{"cited_paper":"/paper/2411.05735","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:cebbc61ba219ba56fa08c0963df200642861545eb9b7e8cef0cdf6ad92247904","observation_id":"dd02610f-40ee-4562-8007-414a59b4bc28","resolution":{"observed_at":"2026-08-16T04:49:32.957200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11820","last_updated":"2024-10-15T17:47:44Z","snapshot_observed_at":"2026-08-16T13:09:05.378101Z","submitted_at":"2024-10-15T17:47:44Z","title":"Adaptive Data Optimization: Dynamic Sample Selection with Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11820","snapshot_observed_at":"2026-08-16T04:49:32.962436Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:32.962436Z"},"links":{"cited_paper":"/paper/2410.11820","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:530f9894327ed99f4a7fa0f16ca696e65bc7590b243bdf7b6439740b6402f6bb","observation_id":"d2458274-30be-4b2f-acce-943e628953b7","resolution":{"observed_at":"2026-08-16T04:49:32.962436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-14T15:17:42.222016Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-16T04:49:32.967892Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:32.967892Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:0233ffb90b21388b646b0c8672780309913b1cef0ed3b4bfa512b4a9501f8538","observation_id":"c628917d-b185-45e4-b65a-54a1a1688f7e","resolution":{"observed_at":"2026-08-16T04:49:32.967892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:49:33.857092Z","title":"Free Dolly: Introducing the World’s First Truly Open Instruction-Tuned LLM","venue":null,"work_id":"06b7883e-1954-4bf6-a188-1579d913b751","year":2023},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:32.973525Z"},"links":{"citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:337c6fe4a1dbc2e906218cbdcda8b7bee0fef7c11f9eb67db131f729bfc0420b","observation_id":"41a4d3a7-b7fa-4844-a771-899d6cd21c7d","resolution":{"observed_at":"2026-08-16T04:49:33.862331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-08-16T14:25:07.499144Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-08-16T04:49:32.978094Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:32.978094Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:3655ef28ab206733e3ec1fa54f9d7ce4e5c24bf0e97ea208c1a823d7f2261dd7","observation_id":"5a240039-300b-46bc-8c9f-7b94873a0222","resolution":{"observed_at":"2026-08-16T04:49:32.978094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04333","last_updated":"2024-06-13T03:42:02Z","snapshot_observed_at":"2026-08-21T12:18:22.723343Z","submitted_at":"2024-02-06T19:18:04Z","title":"LESS: Selecting Influential Data for Targeted Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04333","snapshot_observed_at":"2026-08-16T04:49:32.984118Z","title":"LESS: Selecting Influential Data for Targeted Instruction Tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:32.984118Z"},"links":{"cited_paper":"/paper/2402.04333","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:e13afdc8d94f7ddbc7535370c7503c760a7059c61fc96a7f5fdeacb7a15d2c72","observation_id":"432ae583-2d6a-4763-9dc0-3ca9eee05459","resolution":{"observed_at":"2026-08-16T04:49:32.984118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:49:33.840192Z","title":"Grad-match: Gradient matching based data subset selection for efficient deep model training","venue":null,"work_id":"9e066a99-67c0-49ee-a4a7-6b36e78b6998","year":2021},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:32.989113Z"},"links":{"citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:235f49f0a88c8d1334c61db8c1505735e1847468c1eaf4baf86e3a3a938e51ab","observation_id":"e330450b-43a4-4a61-81a1-b90d6253c7d4","resolution":{"observed_at":"2026-08-16T04:49:33.845746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06708","last_updated":"2026-05-25T22:00:48Z","snapshot_observed_at":"2026-08-17T03:31:02.136201Z","submitted_at":"2025-01-12T04:28:14Z","title":"Evaluating Sample Utility for Efficient Data Selection by Mimicking Model Weights","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06708","snapshot_observed_at":"2026-08-16T04:49:32.994117Z","title":"Evaluating Sample Utility for Data Selection by Mimicking Model Weights","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:32.994117Z"},"links":{"cited_paper":"/paper/2501.06708","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:b3437da884d38adeb92ad22e9d49e4f4842bc1f0a06b63fd0bc3864f42e183af","observation_id":"5a4f720f-a99b-4093-a136-3438962ed0bf","resolution":{"observed_at":"2026-08-16T04:49:32.994117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08811","last_updated":"2024-10-06T14:44:22Z","snapshot_observed_at":"2026-08-16T13:43:29.446745Z","submitted_at":"2024-06-13T05:01:28Z","title":"Mixture-of-Skills: Learning to Optimize Data Usage for Fine-Tuning Large Language Models","version":2},"cited_work":{"arxiv_id":"2406.08811","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08811","snapshot_observed_at":"2026-08-16T04:49:33.557622Z","title":"Mixture-of-Skills: Learning to Optimize Data Usage for Fine-Tuning Large Language Models","venue":"cs.CL","work_id":"c7c5c7f1-a9cf-4be6-a37d-2831beeeeea5","year":2024},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:32.999255Z"},"links":{"cited_paper":"/paper/2406.08811","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:665dc42ed76e1b32d001ede1f3a5126f1fc2ee7e516ca11106e70e29285e91f5","observation_id":"9f192524-0fa1-4b23-aee7-f9d5116fa2a9","resolution":{"observed_at":"2026-08-16T04:49:33.565611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12225","last_updated":"2024-01-05T08:40:06Z","snapshot_observed_at":"2026-08-20T22:11:37.290332Z","submitted_at":"2024-01-05T08:40:06Z","title":"Multimodal Data Curation via Object Detection and Filter Ensembles","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12225","snapshot_observed_at":"2026-08-16T04:49:33.005055Z","title":"J.; Adila, D.; Sala, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.005055Z"},"links":{"cited_paper":"/paper/2401.12225","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:cb375d7a1112605eb8b76a6bebed150354f7d3507e3d76011e2defe41e000eb1","observation_id":"d5ff941e-fdff-4311-bbc3-e3f5bed18bc8","resolution":{"observed_at":"2026-08-16T04:49:33.005055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03169","last_updated":"2023-11-18T21:33:01Z","snapshot_observed_at":"2026-08-16T15:57:14.268911Z","submitted_at":"2023-02-06T23:57:56Z","title":"Data Selection for Language Models via Importance Resampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03169","snapshot_observed_at":"2026-08-16T04:49:33.010284Z","title":"M.; Santurkar, S.; Ma, T.; Liang, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.010284Z"},"links":{"cited_paper":"/paper/2302.03169","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:c101dd38dc7be1853706dd7d91c207b1514dcf47209b31c4be1fe206ae5e0718","observation_id":"2c4c4724-04a7-4534-a067-485d6611f390","resolution":{"observed_at":"2026-08-16T04:49:33.010284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-16T04:49:33.015503Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.015503Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:77c57141624a14dff829d113a2f72f065b6fa14dee2c28c3573108a386070cba","observation_id":"f9ede20b-ab34-4238-8082-4b9e67acb531","resolution":{"observed_at":"2026-08-16T04:49:33.015503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06499","last_updated":"2022-03-24T19:29:45Z","snapshot_observed_at":"2026-08-14T07:55:03.346803Z","submitted_at":"2021-07-14T06:06:52Z","title":"Deduplicating Training Data Makes Language Models Better","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06499","snapshot_observed_at":"2026-08-16T04:49:33.021069Z","title":"Deduplicating Training Data Makes Language Models Better","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.021069Z"},"links":{"cited_paper":"/paper/2107.06499","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:57bd1ebf475aa26dabaf7262d892815151a39833e0a668e29b5da79b9a63ef03","observation_id":"2fdad599-8cb4-4361-8f48-a8eb11216028","resolution":{"observed_at":"2026-08-16T04:49:33.021069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12284","last_updated":"2023-08-23T17:58:14Z","snapshot_observed_at":"2026-08-16T15:06:18.240835Z","submitted_at":"2023-08-23T17:58:14Z","title":"D4: Improving LLM Pretraining via Document De-Duplication and Diversification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12284","snapshot_observed_at":"2026-08-16T04:49:33.026439Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.026439Z"},"links":{"cited_paper":"/paper/2308.12284","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:fca41b935e2827b5f0b6543e43235d461e0b3b18f467d20420599388503a5849","observation_id":"328c1cbe-0204-4b6e-9cc3-b01538cb663f","resolution":{"observed_at":"2026-08-16T04:49:33.026439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14908","last_updated":"2025-01-27T11:25:33Z","snapshot_observed_at":"2026-08-19T12:45:29.029456Z","submitted_at":"2024-05-23T09:44:02Z","title":"BiMix: A Bivariate Data Mixing Law for Language Model Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14908","snapshot_observed_at":"2026-08-16T04:49:33.032610Z","title":"BiMix: Bivariate Data Mixing Law for Language Model Pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.032610Z"},"links":{"cited_paper":"/paper/2405.14908","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:585b9eb2f364f6f7072533fc4320aaff04958bc06a0ef3ff5eff95b41e25e9ae","observation_id":"02797f87-ccbb-419c-9662-701610fd8a6b","resolution":{"observed_at":"2026-08-16T04:49:33.032610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-08-16T14:06:35.643964Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-08-16T04:49:33.038457Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.038457Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:1151f47ec279c901a6f748de6cb536a1486ff4a5722f4284a01cea5ba22004ed","observation_id":"ba23610f-decb-47cb-a908-b3ffb0178216","resolution":{"observed_at":"2026-08-16T04:49:33.038457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01492","last_updated":"2025-01-23T17:35:43Z","snapshot_observed_at":"2026-08-18T18:58:59.065205Z","submitted_at":"2024-07-01T17:31:03Z","title":"RegMix: Data Mixture as Regression for Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01492","snapshot_observed_at":"2026-08-16T04:49:33.044017Z","title":"RegMix: Data Mixture as Regression for Language Model Pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.044017Z"},"links":{"cited_paper":"/paper/2407.01492","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:e7e96d419ba74b855cbde392a2b44b4d28c3db6364375209e92005452fcbccad","observation_id":"389e68ba-317f-446b-935c-19e3f599e2a2","resolution":{"observed_at":"2026-08-16T04:49:33.044017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:49:33.048755Z","title":"AutoScale: Automatic Prediction of Compute-optimal Data Composition for Training LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.048755Z"},"links":{"citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:9e5f5d6aaf98ba53e8c0929f8b9df7cce40bb6b01d384c01d820c030f134c99a","observation_id":"d28db4c1-d9fd-4a04-b58c-501cb6461167","resolution":{"observed_at":"2026-08-16T04:49:33.048755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10061","last_updated":"2025-06-13T21:16:23Z","snapshot_observed_at":"2026-08-19T05:49:13.861396Z","submitted_at":"2025-03-13T05:21:22Z","title":"Compute Optimal Scaling of Skills: Knowledge vs Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10061","snapshot_observed_at":"2026-08-16T04:49:33.053552Z","title":"Compute Optimal Scaling of Skills: Knowledge vs Reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.053552Z"},"links":{"cited_paper":"/paper/2503.10061","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:23b7c667bed3caf13521830074282902132a5f48920ece57cbe69f25428cd5de","observation_id":"efaf0881-acb5-401e-9f28-c0bb87518940","resolution":{"observed_at":"2026-08-16T04:49:33.053552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01613","last_updated":"2025-02-03T22:26:56Z","snapshot_observed_at":"2026-08-21T03:10:22.262998Z","submitted_at":"2024-02-02T18:23:18Z","title":"Nomic Embed: Training a Reproducible Long Context Text Embedder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01613","snapshot_observed_at":"2026-08-16T04:49:33.058764Z","title":"X.; Duderstadt, B.; Mulyar, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.058764Z"},"links":{"cited_paper":"/paper/2402.01613","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:d68d73a972fb37365724dcd5e6e8fa80e58decb753d86a4d6a5da7a37cb39f0e","observation_id":"021afc3b-cc65-4b7f-9645-ae37893ef349","resolution":{"observed_at":"2026-08-16T04:49:33.058764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07705","last_updated":"2022-10-24T07:00:15Z","snapshot_observed_at":"2026-08-19T23:18:55.569234Z","submitted_at":"2022-04-16T03:12:30Z","title":"Super-NaturalInstructions: Generalization via Declarative Instructions on 1600+ NLP Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.07705","snapshot_observed_at":"2026-08-16T04:49:33.064158Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.064158Z"},"links":{"cited_paper":"/paper/2204.07705","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:721302a2a63134de1cad17bb0b446a14114b51808fb24664b08485f0ea12fb13","observation_id":"7099e4e5-4518-412d-bd37-d7c940c624d0","resolution":{"observed_at":"2026-08-16T04:49:33.064158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-16T04:49:33.070209Z","title":"L.; Fei-Fei, L.; Hajishirzi, H.; Zettlemoyer, L.; Liang, P.; Cand` es, E.; Hashimoto, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.070209Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:00324f44fd67ec4227c6f63327f5951de1d81f52815eb48261d074b2e8537c3b","observation_id":"57af264c-041f-4fc4-b793-ee6f426326b4","resolution":{"observed_at":"2026-08-16T04:49:33.070209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:49:33.824418Z","title":null,"venue":null,"work_id":"44a72142-cfce-421b-a74e-e031dfade2db","year":1987},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.075458Z"},"links":{"citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:793cd775d70a9ae4f2b92a31f4b22136af114165f77dab6a15e1d35c4f768b56","observation_id":"70ca7e16-73e5-408b-9340-8967cb65444f","resolution":{"observed_at":"2026-08-16T04:49:33.829305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02498","last_updated":"2024-10-03T14:00:44Z","snapshot_observed_at":"2026-08-16T13:12:58.007572Z","submitted_at":"2024-10-03T14:00:44Z","title":"Dynamic Gradient Alignment for Online Data Mixing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02498","snapshot_observed_at":"2026-08-16T04:49:33.080406Z","title":"Dynamic Gradient Alignment for Online Data Mixing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.080406Z"},"links":{"cited_paper":"/paper/2410.02498","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:2f6bfd4ea831dbbcba3c247777c73dff9980e497772df4aaed8c2341605b0b2d","observation_id":"17f27a45-e219-48db-979c-f4f7ed806464","resolution":{"observed_at":"2026-08-16T04:49:33.080406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:49:33.085127Z","title":"GPT-Neo: Large Scale Autoregressive Language Modeling with Mesh-Tensorflow","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.085127Z"},"links":{"citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:117329ada7ebaa2cf3a0a8309209593241ea2416b2f95c542598f3b166336499","observation_id":"789e55bd-e8ab-4a4a-ab52-77deb021e3ce","resolution":{"observed_at":"2026-08-16T04:49:33.085127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-16T04:49:33.090579Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.090579Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:d057aab4063566369a1fbaf17df9a7aeb6bf0125fcbafaf728c95af36a7c63cf","observation_id":"38521ce1-5d5a-4fd5-88ac-25b1b63aca47","resolution":{"observed_at":"2026-08-16T04:49:33.090579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:49:33.095840Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; others Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.095840Z"},"links":{"citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:5cc9fc16e8e596d4a5ba846de9b40f3ea877497a7d5d8acb01ce95b92370adfe","observation_id":"e16b524e-817a-450d-a245-3435cf3fb005","resolution":{"observed_at":"2026-08-16T04:49:33.095840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:49:33.100308Z","title":"OpenCLIP","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.100308Z"},"links":{"citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:deed9c6f662a457a02c757f178f6afd36030d4ea79bfa2b2ce294d1e14688fcf","observation_id":"aefc898a-7480-4144-bb5b-78c81c0fe048","resolution":{"observed_at":"2026-08-16T04:49:33.100308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:49:33.796676Z","title":null,"venue":null,"work_id":"6fb9b9c9-cdec-4c25-b146-fe6bb68c6759","year":2023},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.104899Z"},"links":{"citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:5b948f156316da9e2d502ad7b3a3914e7556262fdea2eb521b31b84086b2fa59","observation_id":"7fb9ef74-0e31-4665-aa46-c9fb67b99a2a","resolution":{"observed_at":"2026-08-16T04:49:33.801543Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-16T04:49:33.109757Z","title":"B.; Chess, B.; Child, R.; Gray, S.; Radford, A.; Wu, J.; Amodei, D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.109757Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:eaad0fbc4835ced24a3b18359ec7602b3177b6dfc393aa93c5ace00922be34dc","observation_id":"db1c332a-6950-4207-b627-174cbfffcb5f","resolution":{"observed_at":"2026-08-16T04:49:33.109757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:49:33.779559Z","title":"What’s the Backward-Forward FLOP Ratio for Neural Networks? 2021; https: //epoch.ai/blog/backward-forward-FLOP-ratio","venue":null,"work_id":"4bc158d4-0918-42b4-ada9-3346ababf8fc","year":2021},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.114538Z"},"links":{"citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:9457e7b14406e8f36085f27771b63c43b3d8a481b2f6d886d1b170a4cdd522ef","observation_id":"14ba2936-c0c3-4606-bf87-a699f693d867","resolution":{"observed_at":"2026-08-16T04:49:33.785127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.01799","last_updated":"2015-10-09T23:59:02Z","snapshot_observed_at":"2026-08-14T22:29:15.254486Z","submitted_at":"2015-10-07T01:42:23Z","title":"Efficient Per-Example Gradient Computations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.01799","snapshot_observed_at":"2026-08-16T04:49:33.119833Z","title":"Efficient Per-Example Gradient Computations","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.119833Z"},"links":{"cited_paper":"/paper/1510.01799","citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:17c733135d1269df3151a2dde83faa94f84f66cde44d5b0244faf7f1cd212286","observation_id":"9972a7e5-bacd-437a-9d6b-82d0697ed2a6","resolution":{"observed_at":"2026-08-16T04:49:33.119833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:49:33.762341Z","title":"T.; Wu, T.; Song, D.; Mittal, P.; Jia, R","venue":null,"work_id":"2ca87088-fe10-4fc4-87e3-deb97c3c7c5e","year":2024},"citing_paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:33.125140Z"},"links":{"citing_paper":"/paper/2505.00358"},"observation_digest":"sha256:c78b85a4bc4ed64aab5374ed2e46adc4774017e4230f7b083186f0a72db7b3d8","observation_id":"1a8dc2cd-c182-4726-a852-b732df22b334","resolution":{"observed_at":"2026-08-16T04:49:33.767439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.00358","last_updated":"2025-05-01T07:08:19Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T18:58:21.785291Z","submitted_at":"2025-05-01T07:08:19Z","title":"R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 3 inbound Pith citation observations for arXiv:2505.00358."}