{"as_of":"2026-08-09T02:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0c091e6e6824450fc8f416a0b376794bd5d316a1ca3e44f4c04e911ad8cd6091","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T16:20:38.459757Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T00:56:04.958757Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T00:58:25.718587Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"cited_work":{"arxiv_id":"2502.06244","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06244","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pike: Adaptive data mixing for multitask learning under low gradient conflicts","venue":null,"work_id":"6f246f80-322d-4655-9882-0c3c6e6e10d6","year":2025},"citing_paper":{"arxiv_id":"2604.16380","last_updated":"2026-03-25T13:30:40Z","snapshot_observed_at":"2026-08-08T06:45:13.140900Z","submitted_at":"2026-03-25T13:30:40Z","title":"Data Mixing for Large Language Models Pretraining: A Survey and Outlook","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:04.958757Z"},"links":{"cited_paper":"/paper/2502.06244","citing_paper":"/paper/2604.16380"},"observation_digest":"sha256:63f5256ccd473b1844dd89acdf7b2ac7461c79d4154e6cdeb5551f70a9ff87ee","observation_id":"b09ad5ab-9b34-4b15-86d9-c498ab759d4f","resolution":{"observed_at":"2026-05-15T00:58:25.720393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06244/citation-record","integrity":"/paper/2502.06244/integrity","json":"/paper/2502.06244/citation-record.json","paper":"/paper/2502.06244"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-08T16:20:37.957601Z","title":"Abbas, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:37.957601Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:4b6e70ed1eaf0a9a0cf7330457cb1f6d17571867842c5ab9cf71d8821e78cd96","observation_id":"7eea74f6-9ee1-4216-9e36-571f6d6a40cb","resolution":{"observed_at":"2026-08-08T16:20:37.957601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-08T16:20:38.007383Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.007383Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:caeb6cd1e7cb7e2e7d956de968779533de06f1509862c649f4d009c01d9242f0","observation_id":"bb5bc95b-0130-44d0-921e-ae70424bf682","resolution":{"observed_at":"2026-08-08T16:20:38.007383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15638","last_updated":"2024-07-02T02:09:32Z","snapshot_observed_at":"2026-07-06T17:34:49.001670Z","submitted_at":"2024-02-23T22:46:14Z","title":"Fair Resource Allocation in Multi-Task Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15638","snapshot_observed_at":"2026-08-08T16:20:38.048244Z","title":"Ban and K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.048244Z"},"links":{"cited_paper":"/paper/2402.15638","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:d04417083e94de1118fbba95477bed4f30e9ddebc5500e203f62bfce1c31d1fd","observation_id":"d16e5144-f9a8-4058-bfa5-f7d3dd021705","resolution":{"observed_at":"2026-08-08T16:20:38.048244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.642584Z","title":"Bengio, J","venue":null,"work_id":"24d29e81-8bc6-4a6f-a80e-b3e70146830a","year":2009},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.084266Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:b4adafe23c4c690f6b2880faf1d14a7e7f3ad33455c016801c2d59f67e017f67","observation_id":"0ab05056-708a-4eb4-b699-1bfbf031ea6a","resolution":{"observed_at":"2026-08-08T16:20:39.647558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.627019Z","title":null,"venue":null,"work_id":"6670f25a-ac79-484a-a55b-ee4f4953dda1","year":2019},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.125257Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:160635bede452a497e042b8cb481240870ebabdcb7850e6314b28bbaa77a39ff","observation_id":"fed561dd-2124-4d5c-af46-cfe9dd3142c6","resolution":{"observed_at":"2026-08-08T16:20:39.631923Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.611211Z","title":"Bradbury, R","venue":null,"work_id":"6e36ff1f-c812-458b-a1ea-c4572cf6b6dc","year":2018},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.141490Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:d88cb00ea36b9ab339aeff5b408543e007d0ba7e82195ea3357316df4c379856","observation_id":"2e23761e-4bfd-4014-94fd-3a07a21c1811","resolution":{"observed_at":"2026-08-08T16:20:39.616164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:38.146418Z","title":"Brown, B","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.146418Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:cb8cb821d600f5b043c3a717fbea2a55049709da90fd3ab76c59f8eb550322fe","observation_id":"aa8495b0-9022-44dc-becb-07962b10f208","resolution":{"observed_at":"2026-08-08T16:20:38.146418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.586065Z","title":null,"venue":null,"work_id":"b6e68ef7-a311-4708-ad60-b04036d049c7","year":2018},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.150633Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:27a5903515e0b9576ae9f4680bb9dcb4b9051d0e48d4ef11564783f660fe63fe","observation_id":"4022e036-0f92-4b20-8b65-d5ef5535eb82","resolution":{"observed_at":"2026-08-08T16:20:39.591008Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-08T16:20:38.154722Z","title":"Chowdhery, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.154722Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:a71594e566db5d7c8f688f01292ff1cca4a59af911ed473986f2429333e221b5","observation_id":"e24d4ab6-2d26-45b4-8e5a-8ea07cd90dcc","resolution":{"observed_at":"2026-08-08T16:20:38.154722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:38.159387Z","title":"Chowdhery, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.159387Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:a8dfc9b2d81bbac9cd6560a291001932ea71339e3b746478247c4fc0a4a5b644","observation_id":"d509d39f-d615-4941-ac6b-5fcd5d29086f","resolution":{"observed_at":"2026-08-08T16:20:38.159387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-08T16:20:38.163261Z","title":"Clark, I","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.163261Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:ca6609ac927074fd0262bd1341ec6394c895ff39a94d5c66fc88c28e51095141","observation_id":"80aa0092-58bc-4014-88ef-842146fc39e6","resolution":{"observed_at":"2026-08-08T16:20:38.163261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.560680Z","title":"Dac Lai, C","venue":null,"work_id":"f0f76d22-c70b-48b0-aeba-1804e16729f9","year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.167134Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:015b8fc0db697e66268d544fa3044d311e157673082ac35e85e6431b0ac879f0","observation_id":"99d68fc0-18d1-4ceb-acfb-3d044c95a3e5","resolution":{"observed_at":"2026-08-08T16:20:39.565564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.545487Z","title":null,"venue":null,"work_id":"1cd55ebc-4528-4b15-94e3-07a85d40ca65","year":2016},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.171109Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:65f0705650e34122d2c25f9ed1c9d641fbf9c0d72b5145e064e6d54ab9147df9","observation_id":"96c48b7a-c554-44f2-a567-4220d5598043","resolution":{"observed_at":"2026-08-08T16:20:39.550380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05442","last_updated":"2023-02-10T18:58:21Z","snapshot_observed_at":"2026-08-04T12:07:24.626442Z","submitted_at":"2023-02-10T18:58:21Z","title":"Scaling Vision Transformers to 22 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05442","snapshot_observed_at":"2026-08-08T16:20:38.174869Z","title":"Dehghani, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.174869Z"},"links":{"cited_paper":"/paper/2302.05442","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:62b9b2f1d923658ae0f4aeafcfc58dfe853507f9fd6903b6c361f17148e2bdf8","observation_id":"9573a299-a857-4fa5-b700-90716e570d7b","resolution":{"observed_at":"2026-08-08T16:20:38.174869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.529674Z","title":"Désidéri","venue":null,"work_id":"d1631e1e-ba61-49e4-adec-58786d481bcb","year":2012},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.179124Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:96f9ea011af05aed372b3f54d79c08fe1c2015cd3554d3dbeb380ddcf8c4fcce","observation_id":"222aa175-a7e4-4552-b185-e831da369416","resolution":{"observed_at":"2026-08-08T16:20:39.535036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-08T16:20:38.183058Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.183058Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:5767ddf8bb91ccd177a5fd6247966f3e9b25b197ac4db31aa47ef14368dca06b","observation_id":"6438c6fd-f81f-4cc1-8d9f-eb804d00af1e","resolution":{"observed_at":"2026-08-08T16:20:38.183058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.514738Z","title":null,"venue":null,"work_id":"1dcfef7a-4b47-48dc-bb51-0fa24c42d962","year":2022},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.186992Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:2dfdd75c714aa0a4eb184b7c8e896d247c60374a16b04d974725b03b795bfbb8","observation_id":"1d59d02a-9f09-4bd5-93ca-04f7984c889f","resolution":{"observed_at":"2026-08-08T16:20:39.519550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T16:20:38.191917Z","title":"Dubey, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.191917Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:cd660c5e67e47feb3cb0071fa70da0fa206b231fac605f956dceeb98b782f3c7","observation_id":"51faab7c-590c-49ee-bbde-47358fd8bc07","resolution":{"observed_at":"2026-08-08T16:20:38.191917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.498128Z","title":"Gaffney, D","venue":null,"work_id":"1654f786-60e3-491f-8437-beb909d6eb8c","year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.196888Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:e993484bae21d6fa0e5e7e89c4637faf25e06a75eaecfbe8ffc3e4d879ffecbf","observation_id":"3d3b51c1-4a66-43af-8dc0-93f942f09b8d","resolution":{"observed_at":"2026-08-08T16:20:39.503601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-08T16:20:38.201229Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.201229Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:217fc4666479d2b3e2025d6fa7e52032c891467eeecb7e957669d1ad32c1d9fb","observation_id":"ae15711a-4fc0-4c9e-b3f8-47b28790e8a6","resolution":{"observed_at":"2026-08-08T16:20:38.201229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01956","last_updated":"2025-06-27T17:15:09Z","snapshot_observed_at":"2026-08-04T06:32:48.291603Z","submitted_at":"2025-01-03T18:59:23Z","title":"Metadata Conditioning Accelerates Language Model Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01956","snapshot_observed_at":"2026-08-08T16:20:38.205938Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.205938Z"},"links":{"cited_paper":"/paper/2501.01956","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:b4b85d922a2b9e3f589b1b6c4659124b4b759b65e63d3785c20f69007790c429","observation_id":"4f39b70b-f8fe-45e9-9077-f493172e22b9","resolution":{"observed_at":"2026-08-08T16:20:38.205938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14908","last_updated":"2025-01-27T11:25:33Z","snapshot_observed_at":"2026-08-07T08:10:41.068262Z","submitted_at":"2024-05-23T09:44:02Z","title":"BiMix: A Bivariate Data Mixing Law for Language Model Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14908","snapshot_observed_at":"2026-08-08T16:20:38.210654Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.210654Z"},"links":{"cited_paper":"/paper/2405.14908","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:8266ee0712b7893294a38dbd84b474e8826543981cad05c28f0d38b4070f3559","observation_id":"e1e18744-1e5a-4135-a13b-a28118e13e12","resolution":{"observed_at":"2026-08-08T16:20:38.210654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.481990Z","title":"Grain - feeding jax models, 2023","venue":null,"work_id":"2e8ecb21-3f27-49f0-9c87-39176ccc6637","year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.215359Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:6760e2dfef282a9440146a9ea5ecb537349a42bc256d146e6a39cf81cdf45c80","observation_id":"aaa4398d-d4b3-4e59-9229-df950679d7bc","resolution":{"observed_at":"2026-08-08T16:20:39.486669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08446","last_updated":"2025-02-11T18:59:26Z","snapshot_observed_at":"2026-08-06T16:31:19.141189Z","submitted_at":"2024-06-12T17:37:09Z","title":"OLMES: A Standard for Language Model Evaluations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08446","snapshot_observed_at":"2026-08-08T16:20:38.219629Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.219629Z"},"links":{"cited_paper":"/paper/2406.08446","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:644e8e0ee99cc8e2d96b0ef3ca679fb7280bcfbf3a28c9f668b6a2e985a948e5","observation_id":"ec5e14aa-2d17-4068-8c94-99f3c1b3ecea","resolution":{"observed_at":"2026-08-08T16:20:38.219629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08114","last_updated":"2023-03-14T17:47:25Z","snapshot_observed_at":"2026-07-06T15:03:16.833701Z","submitted_at":"2023-03-14T17:47:25Z","title":"Simfluence: Modeling the Influence of Individual Training Examples by Simulating Training Runs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08114","snapshot_observed_at":"2026-08-08T16:20:38.223631Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.223631Z"},"links":{"cited_paper":"/paper/2303.08114","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:cacc7b1166e6109198e210f183218113af7e19e8c4558b24765d4362e278bcae","observation_id":"49da94a5-ba5d-4592-9fc8-99793e945086","resolution":{"observed_at":"2026-08-08T16:20:38.223631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.466566Z","title":null,"venue":null,"work_id":"ffd73bb2-5feb-4ea8-b65f-0d108739cac5","year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.228040Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:74adfa5f8452f3d7d31e34f86bb57de61716053967a3e25f6ed9c07556a381fe","observation_id":"9704e15c-f232-4f7a-9ab6-02d7f1c73330","resolution":{"observed_at":"2026-08-08T16:20:39.471360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.450722Z","title":"Hoffmann, S","venue":null,"work_id":"715d19eb-d40d-43fd-830f-0ef6859661f7","year":2022},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.231910Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:751e20526b013afb2425cb7b6c0d96dfad4bb20f269cae035a83d05d9c453851","observation_id":"e3362410-cd3a-4c67-9954-9a3cba00c1cc","resolution":{"observed_at":"2026-08-08T16:20:39.456007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11820","last_updated":"2024-10-15T17:47:44Z","snapshot_observed_at":"2026-08-04T18:20:45.624958Z","submitted_at":"2024-10-15T17:47:44Z","title":"Adaptive Data Optimization: Dynamic Sample Selection with Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11820","snapshot_observed_at":"2026-08-08T16:20:38.235917Z","title":"Jiang, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.235917Z"},"links":{"cited_paper":"/paper/2410.11820","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:dd921ab2e2c3e84d5feea50c0e1ef69e361f9a50b47f98d6afcba485a184a231","observation_id":"c682751e-f173-4956-b12a-2c77e6c2917b","resolution":{"observed_at":"2026-08-08T16:20:38.235917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.435312Z","title":null,"venue":null,"work_id":"ce64d254-8784-465c-bea1-363fb8ae9d03","year":2017},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.240263Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:1a85516bbe58f0ffcd7a0370de6db5f4ca76ec87b0eadb77bd6c87c103c1f388","observation_id":"f6f930fb-f5ef-4ab3-a575-c6000b0a0f97","resolution":{"observed_at":"2026-08-08T16:20:39.440017Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.420477Z","title":"Laurençon, L","venue":null,"work_id":"9ed14e1f-9d9d-4de8-b8cc-03ea292e749c","year":2022},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.244092Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:4e1e4ea8fc6ead840e6639f180e33dd8bd32c85c4e20c742f1499c746a07981c","observation_id":"5e6ab6f4-8e25-47d9-8bf6-b33023df33df","resolution":{"observed_at":"2026-08-08T16:20:39.424986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06499","last_updated":"2022-03-24T19:29:45Z","snapshot_observed_at":"2026-08-05T18:30:13.997811Z","submitted_at":"2021-07-14T06:06:52Z","title":"Deduplicating Training Data Makes Language Models Better","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06499","snapshot_observed_at":"2026-08-08T16:20:38.248064Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.248064Z"},"links":{"cited_paper":"/paper/2107.06499","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:ce38e9ffea1fdffc331c198e87662ef17c0fc52c5a29d853fc5682d33964fd65","observation_id":"99ab4cc0-eb81-487a-b8c9-a410b53ec1d9","resolution":{"observed_at":"2026-08-08T16:20:38.248064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.08838","last_updated":"2018-04-24T04:29:10Z","snapshot_observed_at":"2026-08-06T23:47:57.134059Z","submitted_at":"2018-04-24T04:29:10Z","title":"Measuring the Intrinsic Dimension of Objective Landscapes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.08838","snapshot_observed_at":"2026-08-08T16:20:38.252309Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.252309Z"},"links":{"cited_paper":"/paper/1804.08838","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:3b6badeb1fac3d3ad9883d283921719b43aac3f2103ff4b53a3e29214f9c496b","observation_id":"0df1ed79-cb88-45ba-b876-2abb3c65208e","resolution":{"observed_at":"2026-08-08T16:20:38.252309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.01162","last_updated":"2021-03-17T16:34:26Z","snapshot_observed_at":"2026-08-07T10:37:30.221346Z","submitted_at":"2020-07-02T14:49:48Z","title":"Tilted Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.01162","snapshot_observed_at":"2026-08-08T16:20:38.256693Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.256693Z"},"links":{"cited_paper":"/paper/2007.01162","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:5f4a546026c805bad479d23fb76bb810c1c391cb8265af7133ca358ca98682ea","observation_id":"c7165800-d266-43e5-a708-d1d9beb882d8","resolution":{"observed_at":"2026-08-08T16:20:38.256693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-08T16:20:38.261204Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.261204Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:2160cfb213ea51b95aa9a4d7263c126229294725f59c8e0377b91da8135a9c5a","observation_id":"0ebbc5bc-b4bd-4e9f-b7c8-538b129b2a3b","resolution":{"observed_at":"2026-08-08T16:20:38.261204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:38.265770Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.265770Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:103cb144d19af778fdf26d27d4adc5fa3bf017d8652f92f798e1b9433461a44c","observation_id":"75570df8-02cd-49dc-99e2-82ef62db82c9","resolution":{"observed_at":"2026-08-08T16:20:38.265770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.394650Z","title":null,"venue":null,"work_id":"fbd64d81-645b-44f1-a953-b106f4c234fa","year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.269893Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:1925af45d50ed6b47bfe92aedef5b78378d7b31bd6d91fe66519c2927bc71528","observation_id":"987a94fa-0333-4995-acd7-d7687431f4c6","resolution":{"observed_at":"2026-08-08T16:20:39.399591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.379208Z","title":null,"venue":null,"work_id":"2758fd3f-4bde-4d16-a70f-037fe6b86aac","year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.274218Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:f3bbfe5a7353548778b2e66a6ab28888d57c8ef645d3ab595bc7498bb9db8d2b","observation_id":"c7e739be-ec96-4b2c-b030-bbec1ed76556","resolution":{"observed_at":"2026-08-08T16:20:39.384081Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01492","last_updated":"2025-01-23T17:35:43Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-07-01T17:31:03Z","title":"RegMix: Data Mixture as Regression for Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01492","snapshot_observed_at":"2026-08-08T16:20:38.278606Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.278606Z"},"links":{"cited_paper":"/paper/2407.01492","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:26fab2dfb2501ec8a8e10041ab307545e85f7dd39793a345f5c8f85ba447971c","observation_id":"c446b3ae-c66f-4750-a6fa-c89a146a83e0","resolution":{"observed_at":"2026-08-08T16:20:38.278606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.362860Z","title":null,"venue":null,"work_id":"7927553c-4cd6-420b-a976-d25593469907","year":2015},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.283009Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:c7b9bd72e4d6ebeb58bd1958bba646a68cd9b24021844c672523e0ce3181efcf","observation_id":"cf503f5f-4eb8-4b62-b3c9-9199d29ad02d","resolution":{"observed_at":"2026-08-08T16:20:39.368238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11504","last_updated":"2019-05-30T00:01:20Z","snapshot_observed_at":"2026-07-06T07:30:20.997518Z","submitted_at":"2019-01-31T18:07:25Z","title":"Multi-Task Deep Neural Networks for Natural Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11504","snapshot_observed_at":"2026-08-08T16:20:38.287083Z","title":null,"venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.287083Z"},"links":{"cited_paper":"/paper/1901.11504","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:b47edd5ef31a4ff551087dd131a1f4208704cfb89aebc19444d8a62c199ea2ab","observation_id":"0f5ff7bc-e362-4451-ad1d-a7f9cf62e3c7","resolution":{"observed_at":"2026-08-08T16:20:38.287083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.346683Z","title":"Loshchilov and F","venue":null,"work_id":"8a211d89-1f07-46d7-80b8-9ebe26582736","year":2019},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.291352Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:5d61bfb7d34af42b08d7f666f94fb8d712649181018c18864ac34f3e7611ecfa","observation_id":"54ccfab3-0751-4d21-a7a3-10c1c037aedd","resolution":{"observed_at":"2026-08-08T16:20:39.351350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06114","last_updated":"2016-03-01T10:55:58Z","snapshot_observed_at":"2026-08-01T19:23:26.365417Z","submitted_at":"2015-11-19T10:24:14Z","title":"Multi-task Sequence to Sequence Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06114","snapshot_observed_at":"2026-08-08T16:20:38.295637Z","title":"Luong, Q","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.295637Z"},"links":{"cited_paper":"/paper/1511.06114","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:41bd12265d57f934219c9431cd36b3bc558caf66194f49ebf1bb3ad2d476b814","observation_id":"cf99c504-1c9a-432f-8198-869faa32fc2a","resolution":{"observed_at":"2026-08-08T16:20:38.295637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.330717Z","title":"Misra, A","venue":null,"work_id":"c39f1f77-09df-4460-bc3d-c110a79e1d1a","year":2016},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.300877Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:ddd917aa52806e5b71d6a785555b3a427d28e147a43287c0b9c254096a1ee0bd","observation_id":"1afe68c2-849a-4d38-a71f-28fa749b8153","resolution":{"observed_at":"2026-08-08T16:20:39.335747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.314590Z","title":"Mo and J","venue":null,"work_id":"783077f8-d15d-4819-b209-9c7c4cdbce4b","year":2000},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.305596Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:06f6756a33d098e4c2f93de7504f948b0a060bb0d966fcfc9e00b918feff06f2","observation_id":"8e41af2d-9a11-4b02-8e50-03665eada8c5","resolution":{"observed_at":"2026-08-08T16:20:39.319555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01017","last_updated":"2022-07-08T12:00:51Z","snapshot_observed_at":"2026-08-03T15:35:05.073940Z","submitted_at":"2022-02-02T13:21:53Z","title":"Multi-Task Learning as a Bargaining Game","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.01017","snapshot_observed_at":"2026-08-08T16:20:38.309736Z","title":"Navon, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.309736Z"},"links":{"cited_paper":"/paper/2202.01017","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:6336718f393d05c42ba35fa4a876d470c42d3a163c2fe8c10d6fffc95d87ae1c","observation_id":"9a1e5879-c521-45b6-917c-5dbe6f8d4c9c","resolution":{"observed_at":"2026-08-08T16:20:38.309736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.299209Z","title":"Penedo, Q","venue":null,"work_id":"09ce3947-6db0-45c5-8251-47104faa095a","year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.314537Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:efb1f99e6e16455a73b016055377c12e7b098430cd710a6d5ef82491c74e1499","observation_id":"0a4ba645-45b0-4ec2-b908-470ef9279f98","resolution":{"observed_at":"2026-08-08T16:20:39.303950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.283446Z","title":"Radford, J","venue":null,"work_id":"a3111ac8-2661-4af5-809e-4289e1c1d7ba","year":2019},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.318950Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:62562bd9dae31227336bafa05406e01a64a58278f3d603b69f06a79fd3d8a04c","observation_id":"e1d548c3-28ac-4e0a-95d0-46a1553ef4b7","resolution":{"observed_at":"2026-08-08T16:20:39.288553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-08T16:20:38.323545Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.323545Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:3f9949bfbf0c7bed31eb24b54dd9dc38b4becb11ca2078f4df195febedd16773","observation_id":"2ef21911-e49e-48be-ab7c-68bfb4258a3c","resolution":{"observed_at":"2026-08-08T16:20:38.323545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:38.328289Z","title":"Raffel, N","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.328289Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:a42632403e680c301979ccd7f79bbc1db7bf94a115b03d9e7e656d5089b538a4","observation_id":"79b76872-62a3-40d7-a582-b15917294a48","resolution":{"observed_at":"2026-08-08T16:20:38.328289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.257077Z","title":null,"venue":null,"work_id":"dcdd2241-e4fb-4afa-a96f-ea387a3d5720","year":2021},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.333260Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:1e27d979ed0399ec0b06873c774bb75f93464a7e5a8ec97c4441686044d0c9d2","observation_id":"d7f54b89-7261-465a-9cf9-503e944282ab","resolution":{"observed_at":"2026-08-08T16:20:39.261658Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.241334Z","title":null,"venue":null,"work_id":"72f7e703-37e9-44ff-90d0-592b0d7d9a94","year":2015},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.337868Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:eaaa3f692a5d68ce5e485ac9f767b5f6a30915efa2387c0e1539004af8b46ba0","observation_id":"fdc47634-9848-43c4-abfd-35cbbe314686","resolution":{"observed_at":"2026-08-08T16:20:39.246529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.226387Z","title":"Ruder, J","venue":null,"work_id":"8c958cf3-017d-43ef-94b8-1b5e7dbebfab","year":2019},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.342477Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:59ba0d04981f84a7ca19c381e9f39b730b7d086b2920ca17541438327962bc55","observation_id":"d8736690-d5ea-4809-bf17-54a48c7eb8bd","resolution":{"observed_at":"2026-08-08T16:20:39.230987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-08T16:20:38.347017Z","title":"Sachdeva, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.347017Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:6d9e45225b9620825db3f47e23fb8c1ab55f8d58f77e1fb34b3ba129ca6c2dcf","observation_id":"1d43c75f-11a3-48e7-8928-a35bf4795c4b","resolution":{"observed_at":"2026-08-08T16:20:38.347017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.211446Z","title":"Sener and V","venue":null,"work_id":"56259584-0be1-4d15-acf6-71120a1ab013","year":2018},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.351756Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:83cc5386fc6593591844739a87567a411cdfabcd03c79f988d3ade635ae892a6","observation_id":"403571f5-d54f-47b8-9a38-be03c2d9339b","resolution":{"observed_at":"2026-08-08T16:20:39.216383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00159","last_updated":"2024-06-06T18:46:40Z","snapshot_observed_at":"2026-08-08T04:07:59.311599Z","submitted_at":"2024-01-31T20:29:50Z","title":"Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00159","snapshot_observed_at":"2026-08-08T16:20:38.356201Z","title":"Soldaini, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.356201Z"},"links":{"cited_paper":"/paper/2402.00159","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:16e71917216d3c37bd3eeabec685566c708caf324af441859321040e7794f046","observation_id":"0c2be998-8b9a-4f80-a280-c8c336a5c1bf","resolution":{"observed_at":"2026-08-08T16:20:38.356201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-08T16:20:38.360914Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.360914Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:55d212561434016abdfc3f6e2abe5618733040068667960aa9de001955410a74","observation_id":"f9be65c8-ad75-433f-8db5-5058dfd3ef87","resolution":{"observed_at":"2026-08-08T16:20:38.360914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-04T21:50:24.483867Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-08T16:20:38.365866Z","title":"Talmor, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.365866Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:daaa5d07469b08d176ae6fa076f5f6e5826b3d020411991ffefbaa2762e8ff69","observation_id":"17d9457b-b5c7-4ec6-a3b4-61239f420115","resolution":{"observed_at":"2026-08-08T16:20:38.365866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-08-08T16:20:38.370936Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.370936Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:1b55e950012b8443b8d15e8d29a84d99a8b5cf32cca56bcf3efec049fc9e3242","observation_id":"f22ca0db-c68d-4623-9a52-b12d456b3865","resolution":{"observed_at":"2026-08-08T16:20:38.370936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-08T16:20:38.375675Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.375675Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:edf5ffebbda948f75ce620a5543d26799e1cb59617a240740103016a552cbf18","observation_id":"88a8da9a-7b5c-41d3-9d59-266cfc7d4f69","resolution":{"observed_at":"2026-08-08T16:20:38.375675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-08T16:20:38.380223Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.380223Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:20216a8214048a33577607b58cb7c9ee1110ce37b9d965a383270fa31a30af80","observation_id":"447e7f22-6ef8-4866-8fa7-81b1eeffe5ff","resolution":{"observed_at":"2026-08-08T16:20:38.380223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.195977Z","title":"Vandenhende, S","venue":null,"work_id":"a67d8a59-adf9-45da-9a44-dad6672498cf","year":2021},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.385221Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:e8c015751661327ee41eae18e612b0797bc849b2f578fbf675fe05b991aae2de","observation_id":"f1334642-6086-463b-9e70-0259f235dc81","resolution":{"observed_at":"2026-08-08T16:20:39.200772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15613","last_updated":"2024-06-28T09:22:38Z","snapshot_observed_at":"2026-07-06T18:19:25.869339Z","submitted_at":"2024-05-24T14:58:51Z","title":"Automatic Data Curation for Self-Supervised Learning: A Clustering-Based Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15613","snapshot_observed_at":"2026-08-08T16:20:38.389831Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.389831Z"},"links":{"cited_paper":"/paper/2405.15613","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:17a77b679673d0c3671c32da2b7a12f165147c5926322caf3e328e3f11c8dd9c","observation_id":"7fcbe20f-713a-4f59-aad5-012ad183fe53","resolution":{"observed_at":"2026-08-08T16:20:38.389831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:38.394565Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.394565Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:fff0dea14c51672223dffaa26a605780d8cbcca2aa0fa2ff41cfeae24812bdfa","observation_id":"86bf22b8-0dc6-4043-a6f1-8ff7c8787b75","resolution":{"observed_at":"2026-08-08T16:20:38.394565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.05874","last_updated":"2020-10-12T17:26:34Z","snapshot_observed_at":"2026-07-06T10:03:43.754666Z","submitted_at":"2020-10-12T17:26:34Z","title":"Gradient Vaccine: Investigating and Improving Multi-task Optimization in Massively Multilingual Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.05874","snapshot_observed_at":"2026-08-08T16:20:38.399019Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.399019Z"},"links":{"cited_paper":"/paper/2010.05874","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:ad76f8b459eb640e9b371379e74b4b2166d5b4ec5eb28885a16d960e65e70966","observation_id":"b60273fd-11f9-4a60-a61d-f52a6d896b45","resolution":{"observed_at":"2026-08-08T16:20:38.399019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-07-06T17:30:25.359458Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-08T16:20:38.403659Z","title":"Wettig, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.403659Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:4871fc21cc2ca0b657c69048bd843c108e6807612f00c45b2b372a8a00018a8a","observation_id":"55dfd1c6-7e30-49b7-ace6-f1c89c901824","resolution":{"observed_at":"2026-08-08T16:20:38.403659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14322","last_updated":"2023-10-16T18:43:25Z","snapshot_observed_at":"2026-07-06T16:23:26.584450Z","submitted_at":"2023-09-25T17:48:51Z","title":"Small-scale proxies for large-scale Transformer training instabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14322","snapshot_observed_at":"2026-08-08T16:20:38.408373Z","title":"Wortsman, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.408373Z"},"links":{"cited_paper":"/paper/2309.14322","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:c0034022c26f32d730a72a96db262cf731b1de47faa4a1c1f036792afcb1222b","observation_id":"2010af6c-5a83-440d-8144-4115041fd377","resolution":{"observed_at":"2026-08-08T16:20:38.408373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-08T20:21:38.269492Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-08T16:20:38.413011Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.413011Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:962ae04233db32a32a93c67ec06b9f52181efdf54b58427f6b85395f1b0ec6ba","observation_id":"b18f82e8-ea7b-42dd-b668-4d9ab07d267d","resolution":{"observed_at":"2026-08-08T16:20:38.413011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.169122Z","title":null,"venue":null,"work_id":"ae03c9aa-0740-4943-93a5-4051a0c68b78","year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.417678Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:786f8799965563d305df46155a2953323575581ce2b2dbd99da6dcf2ed268b80","observation_id":"12476dd6-b919-42df-a259-77720843e885","resolution":{"observed_at":"2026-08-08T16:20:39.174015Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.153729Z","title":null,"venue":null,"work_id":"089e3980-503a-467e-aafc-cf43aa51f028","year":2022},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.422068Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:8aa7cfc700da41543569dcc25217a3a30b406673881a51830f3109565c9cf898","observation_id":"d3bc8e8d-d6b4-4994-a9f0-578e3199c325","resolution":{"observed_at":"2026-08-08T16:20:39.158872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11934","last_updated":"2021-03-11T18:45:13Z","snapshot_observed_at":"2026-07-06T10:07:22.052360Z","submitted_at":"2020-10-22T17:58:14Z","title":"mT5: A massively multilingual pre-trained text-to-text transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11934","snapshot_observed_at":"2026-08-08T16:20:38.426348Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.426348Z"},"links":{"cited_paper":"/paper/2010.11934","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:944d4c73a48f9b16b16ca7f4d1d750efd2449be24d63a48741bb5e0777664b79","observation_id":"0bd3df9e-7d8b-44d7-a9ca-df8be45cc50c","resolution":{"observed_at":"2026-08-08T16:20:38.426348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13626","last_updated":"2022-03-08T02:18:51Z","snapshot_observed_at":"2026-08-08T00:04:26.808792Z","submitted_at":"2021-05-28T07:03:22Z","title":"ByT5: Towards a token-free future with pre-trained byte-to-byte models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13626","snapshot_observed_at":"2026-08-08T16:20:38.430971Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.430971Z"},"links":{"cited_paper":"/paper/2105.13626","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:0b4e0b77229f8bafd06d2117baff8025ce83a714365f559567be8b1823dc9f70","observation_id":"7a1b2ca3-f15d-432c-b82b-4d3bc560187b","resolution":{"observed_at":"2026-08-08T16:20:38.430971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.137746Z","title":null,"venue":null,"work_id":"8a81e69c-cbb6-43ef-b243-84df4a9ec934","year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.435717Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:a65a6722a8ce05bf81faf6d09e58f181b3bb857807216f69ff95912d7803b5bb","observation_id":"bdeffc12-87f1-4fb0-a7dd-6b16b2c8bc86","resolution":{"observed_at":"2026-08-08T16:20:39.142824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-08-08T16:20:38.440209Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.440209Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:0a0052d4ab082ca3016dd6fa05d136fb4a7003d2a5eb91a3d2b9b3365587203e","observation_id":"6573b0bb-16db-45b0-b561-b91f1d432115","resolution":{"observed_at":"2026-08-08T16:20:38.440209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.121156Z","title":null,"venue":null,"work_id":"aca6bfc3-7486-40a8-95e7-9393e39ae7e0","year":2020},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.445128Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:dd88761e3cf44e0c2deb933d26887c83f39e49fc241a0ee3da92130f153253c5","observation_id":"03962849-f2b2-4453-bb7e-f8d3426bd3a9","resolution":{"observed_at":"2026-08-08T16:20:39.126374Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-08T16:20:38.449710Z","title":"Zellers, A","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.449710Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:df405f6ae32e0ae487349c2f28b292b0bd72b8494765df12b6eefc057b59224c","observation_id":"39479523-eb42-40a3-8967-a13e0f4595a5","resolution":{"observed_at":"2026-08-08T16:20:38.449710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16788","last_updated":"2024-10-21T08:27:23Z","snapshot_observed_at":"2026-07-06T17:35:41.168780Z","submitted_at":"2024-02-26T18:01:41Z","title":"Why Transformers Need Adam: A Hessian Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16788","snapshot_observed_at":"2026-08-08T16:20:38.454661Z","title":"Zhang, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.454661Z"},"links":{"cited_paper":"/paper/2402.16788","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:95569cdd35f79417339d2fc5760428048cebc12744acdc447373439c2eeed73c","observation_id":"faaeb223-ad35-4ee3-baf9-813f5dbef9fe","resolution":{"observed_at":"2026-08-08T16:20:38.454661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.101088Z","title":"ratio,” which defined as ⟨Lj (θ),Lk(θ)⟩ ∥Lj (θ)∥2+∥Lk(θ)∥2 , between task gradients during language model pre-training over time. “ data1- data2","venue":null,"work_id":"29d9e3e8-f655-4ed9-ad9b-798d541f5312","year":null},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.459757Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:91212bc9a5ea77da1d2d20a2c0fa7009b240902d3ae02eeae2d907af3fbfbc1e","observation_id":"689bb806-2dd1-40a5-b6c1-2b897d0383f1","resolution":{"observed_at":"2026-08-08T16:20:39.109219Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":60,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 1 inbound Pith citation observation for arXiv:2502.06244."}