{"as_of":"2026-08-08T18:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0549d282eecf8080b158488c7d598a025b1c8962faacb28dcd2d4af057e42dfd","coverage":[{"denominator":91,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:51:25.097330Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03573/citation-record","integrity":"/paper/2608.03573/integrity","json":"/paper/2608.03573/citation-record.json","paper":"/paper/2608.03573"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-08T00:51:24.838386Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.838386Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:9031b83297a1af8682427b3b2d9e643dc482e29d5c88be0908266f8b09252d21","observation_id":"68c54f4a-d5d9-41dc-9fc1-ea37fa6c5f7f","resolution":{"observed_at":"2026-08-08T00:51:24.838386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.842437Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.842437Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:eb3c491d5d84a2d8058b3426ebeec2d8237fe535d6c459e18d06aa0563933dd5","observation_id":"e540975b-3755-44ed-adb4-eee6f0b51777","resolution":{"observed_at":"2026-08-08T00:51:24.842437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.845618Z","title":"Notion Blog , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.845618Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:4679dc4c4dd8c4fd06a0210c587007fe5b81b54f6c8ae9beb84a6ac47d17b8a1","observation_id":"9172b590-a96a-47f1-b0b3-e0985bd86175","resolution":{"observed_at":"2026-08-08T00:51:24.845618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.848882Z","title":"Notion Blog , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.848882Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:e3d20ec606d0daf7dd7fc96eafe1a2827a9a4ef51c8e6bf074d62bae69114189","observation_id":"009d592c-9a2c-474c-8709-cd8e53b922cf","resolution":{"observed_at":"2026-08-08T00:51:24.848882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-08T00:51:24.851939Z","title":"arXiv preprint arXiv:2502.14768 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.851939Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:20abda1df8227482760b1d5de61611550f868a3af9fe0fc7f2d39b16a8f0c749","observation_id":"68f17af8-7ccf-4e48-938b-cbb778f2c6c8","resolution":{"observed_at":"2026-08-08T00:51:24.851939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06471","snapshot_observed_at":"2026-08-08T00:51:24.855511Z","title":"arXiv preprint arXiv:2508.06471 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.855511Z"},"links":{"cited_paper":"/paper/2508.06471","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:36323ae12f5a9a00f0a30fa762f24144cf429456b614d380c5310bb639d65558","observation_id":"7da74fc9-5c31-4edd-9266-4f6cc37f89a6","resolution":{"observed_at":"2026-08-08T00:51:24.855511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.859031Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.859031Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:8410e0fa028291dbc6b32963275ea2794be3ab0d756b6f887f827495312b4d91","observation_id":"9d050213-bfa5-414b-887d-78aa2ef677e4","resolution":{"observed_at":"2026-08-08T00:51:24.859031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-08T00:51:24.862030Z","title":"arXiv preprint arXiv:2501.17161 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.862030Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:933dacdded0c95a7d2cf9111401ee9a6a5ce04bdf834ee8fe738e8433f50ebb5","observation_id":"270372db-3e7e-49ea-83bc-6355322e8c5a","resolution":{"observed_at":"2026-08-08T00:51:24.862030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.21128","last_updated":"2026-05-27T07:06:43Z","snapshot_observed_at":"2026-08-04T15:01:28.565478Z","submitted_at":"2025-09-25T13:18:57Z","title":"RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.21128","snapshot_observed_at":"2026-08-08T00:51:24.865455Z","title":"arXiv preprint arXiv:2509.21128 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.865455Z"},"links":{"cited_paper":"/paper/2509.21128","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:ef87562e187d80d148ffebc4f4190fc104b279d94bbb2b91c1f69e524fc0ec48","observation_id":"bb7986a9-0f38-4aed-8526-47d14e2458cb","resolution":{"observed_at":"2026-08-08T00:51:24.865455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05492","last_updated":"2024-06-07T15:51:08Z","snapshot_observed_at":"2026-07-06T16:29:39.982733Z","submitted_at":"2023-10-09T07:56:16Z","title":"How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05492","snapshot_observed_at":"2026-08-08T00:51:24.868703Z","title":"arXiv preprint arXiv:2310.05492 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.868703Z"},"links":{"cited_paper":"/paper/2310.05492","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:5782097d6708f64089a951e6521b75389ab8664c744aba4cfd0bc398c4c46383","observation_id":"475e09fa-8e71-49f3-842f-6c38be11a240","resolution":{"observed_at":"2026-08-08T00:51:24.868703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.871996Z","title":"2025 , school=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.871996Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:f2cc1dcf0c12c4eaa38e36984ddf9047500a0e5bd966db2547708ad7c5ac2787","observation_id":"a3b5cc92-d26b-49ef-b432-57eb6e5f6e2f","resolution":{"observed_at":"2026-08-08T00:51:24.871996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.874964Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.874964Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:6f091bf30f33997ed73b211e44557e4f15ffc428bde186bc45199a12537fb9a5","observation_id":"96fabbca-42e0-4c5a-9bf6-ebb1ae74bcb1","resolution":{"observed_at":"2026-08-08T00:51:24.874964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.877955Z","title":"Forty-first International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.877955Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:a5858444c9a975276deb2ad77d6250b9b1ab0b849676fbad8fddce6fcf6e3fb5","observation_id":"b0a38f5c-106b-452c-8fb9-329dc3164034","resolution":{"observed_at":"2026-08-08T00:51:24.877955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.880970Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.880970Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:7e4826257354f0b6a2794dde8779cf610362e840f18d63916dad574de2a97b19","observation_id":"711a6dea-54c6-46d2-8ce5-15955619d8de","resolution":{"observed_at":"2026-08-08T00:51:24.880970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-08T00:51:24.883937Z","title":"arXiv preprint arXiv:2403.13372 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.883937Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:0b4601711dbd87d8be779e7417bc306b18e569b8ffa78ab33673c862440df2d0","observation_id":"b468e741-8353-48b7-be51-fbe16876cb46","resolution":{"observed_at":"2026-08-08T00:51:24.883937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.887173Z","title":"arXiv preprint arXiv:2505.11711 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.887173Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:0fcc974e750012f942a97316e2c3d1831cf9452120c407f28fe4657785bfd839","observation_id":"f7ac2037-c10d-42e2-a7b3-704cf0f240a7","resolution":{"observed_at":"2026-08-08T00:51:24.887173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-08T00:51:24.889992Z","title":"arXiv preprint arXiv:2412.16720 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.889992Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:a257a3cac4eb9a11dd7920f98ed85a039baa5b3b47d70811f02edb9ce85f96ad","observation_id":"f534c9f5-c07d-4188-a3af-c49375af7665","resolution":{"observed_at":"2026-08-08T00:51:24.889992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.893127Z","title":"arXiv preprint arXiv:2510.00553 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.893127Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:2ed831da095a50b1fae53d16f1dcb60bb6fb03b6ddb21f9c304688bcf152091b","observation_id":"45ef809b-2384-4458-82f2-a4e384dee59d","resolution":{"observed_at":"2026-08-08T00:51:24.893127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.896219Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.896219Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:b91394f9aff15f2e4d12f16413a7d30bba4f32401310b156da57a5a137f2e104","observation_id":"234113de-6718-4f5b-9b69-bb659ea26ca7","resolution":{"observed_at":"2026-08-08T00:51:24.896219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04259","last_updated":"2025-09-04T14:38:08Z","snapshot_observed_at":"2026-08-07T12:32:15.780660Z","submitted_at":"2025-09-04T14:38:08Z","title":"RL's Razor: Why Online Reinforcement Learning Forgets Less","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04259","snapshot_observed_at":"2026-08-08T00:51:24.899233Z","title":"arXiv preprint arXiv:2509.04259 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.899233Z"},"links":{"cited_paper":"/paper/2509.04259","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:eec96c0005f09a4412ddf5f71c187b80192614ced32bbba1f404a1e25d9ac506","observation_id":"11c81482-b16b-42cc-b5cf-e67d9efc2be1","resolution":{"observed_at":"2026-08-08T00:51:24.899233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.902409Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.902409Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:8befc05d8ccd57b8e66cf7e8a45c35b352f65e586ce66f6970d6f063b8f2f06d","observation_id":"71923b72-fb19-4cd1-aa22-2eb690f3c77a","resolution":{"observed_at":"2026-08-08T00:51:24.902409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.905310Z","title":"2013 , eprint=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.905310Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:f46f4e6369cb7652928e72ac047158ba567142f0d3874d87707a98cda27e9fd0","observation_id":"f2c23186-5130-4f8c-af90-2984a31afaf1","resolution":{"observed_at":"2026-08-08T00:51:24.905310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.957091Z","title":"2025 , eprint=","venue":null,"work_id":"e2e18b62-5668-4689-a6bb-94e4c6b8255f","year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.908993Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:852a14775b8bbf0dfc726e140a89b6e4a74da2e89396c64563d615387292db0d","observation_id":"71140767-a30f-4303-83f9-ea0281e40b19","resolution":{"observed_at":"2026-08-08T00:51:25.960024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.911800Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.911800Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:1b1cad03db0a88c36ad1a53141ba1ea8e16598f68e8b714b4abe758c9012672d","observation_id":"e8335b22-ae85-4996-9a33-057bfcda0d32","resolution":{"observed_at":"2026-08-08T00:51:24.911800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.07349","last_updated":"2022-11-14T13:43:46Z","snapshot_observed_at":"2026-07-06T14:17:58.992600Z","submitted_at":"2022-11-14T13:43:46Z","title":"Finding Skill Neurons in Pre-trained Transformer-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.07349","snapshot_observed_at":"2026-08-08T00:51:24.914427Z","title":"arXiv preprint arXiv:2211.07349 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.914427Z"},"links":{"cited_paper":"/paper/2211.07349","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:c5afdc2579471eac42e161bd86d2fb7d12c29ebd4a9f1679fd6e6db950fbf4ca","observation_id":"19efbbe8-f5ee-48fc-945b-4efdc4e3cc93","resolution":{"observed_at":"2026-08-08T00:51:24.914427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11284","last_updated":"2025-01-20T05:44:01Z","snapshot_observed_at":"2026-08-06T13:30:45.600197Z","submitted_at":"2025-01-20T05:44:01Z","title":"RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11284","snapshot_observed_at":"2026-08-08T00:51:24.917563Z","title":"arXiv preprint arXiv:2501.11284 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.917563Z"},"links":{"cited_paper":"/paper/2501.11284","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:2256813333a8d56cb2b9726afe97a43c5c3394f86a33c6757bc549c4f8a361bf","observation_id":"feda317e-f4f1-4c84-b724-c765eae22b4d","resolution":{"observed_at":"2026-08-08T00:51:24.917563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.920696Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.920696Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:b4b6b81c5549ed8f4000ef8f028b3d96e330b81cea7bb2b3335bf12d50f18eae","observation_id":"70b8ca03-76d2-45bd-b9b4-a146edd8dffa","resolution":{"observed_at":"2026-08-08T00:51:24.920696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-08T00:51:24.923464Z","title":"arXiv preprint arXiv:2507.18071 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.923464Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:2574e63977847cc16887a4eca05ef4b130f654f36b9dbbd271e2d8828907b3af","observation_id":"1b4f520d-f52f-43b1-bb3c-9ce02f0269af","resolution":{"observed_at":"2026-08-08T00:51:24.923464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.926486Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.926486Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:5eb17e3a5c60c577a84c54d2593f3dbc3556befda53cd0f10a5f0e64e8559c0b","observation_id":"16f87fda-c97a-430d-b473-60434b3e0f85","resolution":{"observed_at":"2026-08-08T00:51:24.926486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16546","last_updated":"2025-08-22T17:10:37Z","snapshot_observed_at":"2026-08-06T19:53:30.514356Z","submitted_at":"2025-08-22T17:10:37Z","title":"RL Is Neither a Panacea Nor a Mirage: Understanding Supervised vs. Reinforcement Learning Fine-Tuning for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16546","snapshot_observed_at":"2026-08-08T00:51:24.929359Z","title":"reinforcement learning fine-tuning for llms , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.929359Z"},"links":{"cited_paper":"/paper/2508.16546","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:3cca70d5f40b7407cdc6777d0ba43416118b4ac7a703c29ccea1c3e7d0a3aa74","observation_id":"b7ae546c-595f-4e1e-a732-6e2679834658","resolution":{"observed_at":"2026-08-08T00:51:24.929359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.938005Z","title":null,"venue":null,"work_id":"2db81c52-3687-4561-a94e-251a7ec1ccf8","year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.932337Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:b642820c66781da360a46147245f4a8a05127fcd087b5ce77d74a3f623a9ad06","observation_id":"6ee3b23d-47c9-4d05-9d9a-702c441e85fe","resolution":{"observed_at":"2026-08-08T00:51:25.941163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.934982Z","title":"arXiv preprint arXiv:2508.11408 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.934982Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:20fb41286e8a0a548d1f1214a7881784908ce17b32625ed54e6856ff2459528b","observation_id":"da7ea94d-8785-4431-b5ad-f5af98effe21","resolution":{"observed_at":"2026-08-08T00:51:24.934982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-08T00:51:24.937566Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.937566Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:277b881cb5908c7492fb948cec2563033225266df76d426c682ab8963e4020de","observation_id":"66463944-db0e-4f81-8a74-1a8135b269ac","resolution":{"observed_at":"2026-08-08T00:51:24.937566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.940643Z","title":"arXiv preprint arXiv:2507.14783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.940643Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:24f971052368bb963a5c54023e20ad152629adb064b7f5bc2d588d5c324f7e12","observation_id":"764de3c9-cf85-4936-97b8-d44c84de81e5","resolution":{"observed_at":"2026-08-08T00:51:24.940643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.930524Z","title":null,"venue":null,"work_id":"56364636-e181-4cde-ad32-8be1eefe7d0c","year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.943161Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:c05a4e7b04ac8dc4df8a4fc040eb1cdd600e44d98b33a3fa25fc1eb1aab13aad","observation_id":"5880889f-ada6-4589-9536-bf1cd6f24903","resolution":{"observed_at":"2026-08-08T00:51:25.933261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04142","last_updated":"2025-06-04T16:33:44Z","snapshot_observed_at":"2026-08-07T21:43:19.257599Z","submitted_at":"2025-06-04T16:33:44Z","title":"Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis","version":1},"cited_work":{"arxiv_id":"2506.04142","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.04142","snapshot_observed_at":"2026-08-08T00:51:25.414858Z","title":"Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis","venue":"cs.CL","work_id":"2a5749bc-bc1e-46a5-962c-0612f4573c7f","year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.945853Z"},"links":{"cited_paper":"/paper/2506.04142","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:c4568d9c88dd30286af6abbd9e94d3c5f2d790362829bc9f5cdeb92e2c6f3714","observation_id":"f249f6e5-1491-4e43-a410-13aca663e1a2","resolution":{"observed_at":"2026-08-08T00:51:25.419952Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.948610Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.948610Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:2942f4977887ff8a82b551af1783559bd2f7eba2f435e11ef007a31b4f9400a4","observation_id":"4d23f51b-9412-441b-8f52-eee04f5eb2d9","resolution":{"observed_at":"2026-08-08T00:51:24.948610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.951367Z","title":"arXiv e-prints , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.951367Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:7bee883a7145f34db176236579d3027236a73d38ee500d5610e7c41f21259d1e","observation_id":"745e9d7f-2acd-4bb7-806e-e4293d9babc8","resolution":{"observed_at":"2026-08-08T00:51:24.951367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.954073Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.954073Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:e558630f91b18d43e6bf2b4b779395d56cd4ba5864543e2d6d568ef31d6ac8fc","observation_id":"24e4dbc1-7e97-4fd0-bd8f-3b58a041cdb2","resolution":{"observed_at":"2026-08-08T00:51:24.954073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11423","last_updated":"2025-09-02T02:55:17Z","snapshot_observed_at":"2026-08-07T15:44:36.161203Z","submitted_at":"2025-05-16T16:36:00Z","title":"When Thinking Fails: The Pitfalls of Reasoning for Instruction-Following in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11423","snapshot_observed_at":"2026-08-08T00:51:24.956984Z","title":"arXiv preprint arXiv:2505.11423 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.956984Z"},"links":{"cited_paper":"/paper/2505.11423","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:1a93307ce23da3f2be62c45c4b9c2686964ffced84eb32c33cdd400fb6b10058","observation_id":"e190c4f2-4725-41c1-a6ff-9c092fa92250","resolution":{"observed_at":"2026-08-08T00:51:24.956984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.959992Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.959992Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:7410c93d00557b42f9c7b8eeeec3699a54def05dd105bdc9d8e7377f4ed7e207","observation_id":"7f05ed9c-ec62-4b30-9b7f-37ca7a45157a","resolution":{"observed_at":"2026-08-08T00:51:24.959992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-08T00:51:24.962646Z","title":"arXiv preprint arXiv:1909.08593 , year=","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.962646Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:21c30eb0f83f56918345b56f1a8b4c9106dae11a62c8020e8c9080bdcccb8799","observation_id":"a093eb83-067c-4172-a1a6-286c9091e8d5","resolution":{"observed_at":"2026-08-08T00:51:24.962646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.965740Z","title":"arXiv preprint arXiv:2510.23451 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.965740Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:cbe4e0a2657448c2233aaedca2a6c20b8ab463bdad460cc4541bedaab9d26016","observation_id":"ea9057cc-3348-44d9-ba0d-a8fb64914c59","resolution":{"observed_at":"2026-08-08T00:51:24.965740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-08T00:51:24.968486Z","title":"arXiv preprint arXiv:2503.14476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.968486Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:317a6b76b91d5710790cf7e4186c415364b0cfc1e3406f9db26e3e2e58911002","observation_id":"7f808ad9-c7ac-4b19-b4f4-ff9731543c33","resolution":{"observed_at":"2026-08-08T00:51:24.968486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-08T00:51:24.971347Z","title":"arXiv preprint arXiv:2507.20534 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.971347Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:20ea10ab0bbe35721b6e00c6bd38da7defd4f2816b7fd36de7a4252778a1a304","observation_id":"13da6049-b004-45c3-8c9a-93018bb1f1c4","resolution":{"observed_at":"2026-08-08T00:51:24.971347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-08T00:51:24.974293Z","title":"arXiv preprint arXiv:2109.01652 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.974293Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:5c1f4c94cb8ac23ebcdb776ab6004c47615356a954059e074d1bb7b4226b7d00","observation_id":"274a4626-4b3f-42e1-81e8-c4211dc99651","resolution":{"observed_at":"2026-08-08T00:51:24.974293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00432","last_updated":"2025-10-20T14:27:09Z","snapshot_observed_at":"2026-07-06T21:50:16.465983Z","submitted_at":"2025-07-01T05:23:05Z","title":"Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00432","snapshot_observed_at":"2026-08-08T00:51:24.977379Z","title":"arXiv preprint arXiv:2507.00432 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.977379Z"},"links":{"cited_paper":"/paper/2507.00432","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:310f039aa2a4e281b3b9b3571a76d0d0239b7993d86541af5f8b4559527aa88c","observation_id":"64744e12-324e-44ba-9f40-65a2bb6ec4be","resolution":{"observed_at":"2026-08-08T00:51:24.977379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.980199Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.980199Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:957692d643fe7b11fe3ca66630ec4b63369c85ca928a9e3f7dbeb74f8b1bc9f3","observation_id":"cfa8e593-2751-444f-86c4-dd747e1b95de","resolution":{"observed_at":"2026-08-08T00:51:24.980199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.983165Z","title":"arXiv preprint arXiv:2510.19178 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.983165Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:f7a316e0485690d6716b8497f6e2d4c66e10a921a32dffbb619b33c16ecb7d8c","observation_id":"9c809825-2207-4248-b986-1e64ec13d22c","resolution":{"observed_at":"2026-08-08T00:51:24.983165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-08T00:51:24.985898Z","title":"2: Pushing the frontier of open large language models , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.985898Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:18f501473eeedfff8faf233a385a85b69b9cf87878b1f5f6090606faedcc255c","observation_id":"a2022819-1246-49c2-a20d-d370e0f34043","resolution":{"observed_at":"2026-08-08T00:51:24.985898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-08-08T00:51:24.989053Z","title":"arXiv preprint arXiv:2511.07317 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.989053Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:bba066a0e86e658672f30e2220f9cc19da8e39fa6b54d52a7b7b31cbb132a50b","observation_id":"71867253-54ed-464c-97bb-90248c9e3e5a","resolution":{"observed_at":"2026-08-08T00:51:24.989053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.991738Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.991738Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:f609507999e0a96c008a6cf413fab78334951f6e45220e41399f159e9f6b3b86","observation_id":"a246913d-eed8-4d9d-95b8-df2f8c98ef22","resolution":{"observed_at":"2026-08-08T00:51:24.991738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.900484Z","title":"2025 , url =","venue":null,"work_id":"e7adf566-8c9f-4107-bfd0-bd802075111b","year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.994352Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:24a894a3ff8618cc391f5500f94546fa65f2d5fdf2983e172c8fcd66b5d57b71","observation_id":"6296a290-b359-4605-b99c-cf693850f86e","resolution":{"observed_at":"2026-08-08T00:51:25.903509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-08T00:51:24.997044Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.997044Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:1295ef3fcb5aa6ef6f55c6dba5bbbf39ff8393e52b2a32290007d06465dddd62","observation_id":"6420f249-30c8-4e0e-ac34-9ca34ea51e94","resolution":{"observed_at":"2026-08-08T00:51:24.997044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17565","last_updated":"2025-05-13T07:43:57Z","snapshot_observed_at":"2026-08-07T15:59:30.215146Z","submitted_at":"2025-04-24T13:57:53Z","title":"DeepDistill: Enhancing LLM Reasoning Capabilities via Large-Scale Difficulty-Graded Data Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17565","snapshot_observed_at":"2026-08-08T00:51:24.999803Z","title":"arXiv preprint arXiv:2504.17565 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.999803Z"},"links":{"cited_paper":"/paper/2504.17565","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:89fe45527e1fbdc375ab138e2aa0118c55aae02808e0754768c5aa05967516cd","observation_id":"76f66b0a-8911-4d14-9334-55a992341558","resolution":{"observed_at":"2026-08-08T00:51:24.999803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.002728Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.002728Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:9ec5c298bf65fb5ac16662e0f52b1c348ec547b15d0411c61ba74f9abcaf1ab1","observation_id":"df3ba475-cc66-4b8a-9ffb-891e6bf26385","resolution":{"observed_at":"2026-08-08T00:51:25.002728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.888938Z","title":"2023 38th IEEE/ACM International Conference on Automated Software Engineering (ASE) , pages=","venue":null,"work_id":"72be01bd-1f97-49f0-8b35-60a508324d4c","year":2023},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.005420Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:43f121767f90155724782771f95dcef99ae5d27b973572c5c7609e283105d339","observation_id":"8c329527-5d4b-4c46-a22d-af845ac75ecb","resolution":{"observed_at":"2026-08-08T00:51:25.892013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-08T00:51:25.008147Z","title":"arXiv preprint arXiv:2305.20050 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.008147Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:051756f936598de0cbaedbfd711eaf0942472cec924156e53db5f79672d17dd8","observation_id":"9361a7d4-2b63-4187-9363-1051be6d3c82","resolution":{"observed_at":"2026-08-08T00:51:25.008147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.011091Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.011091Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:9e5c8ddb98221cbdb63fdc6bcaff91114ba949bfa12759fc2d17c4064e993a70","observation_id":"9a48c120-3fd5-4099-a059-871c5e3a22a5","resolution":{"observed_at":"2026-08-08T00:51:25.011091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.014006Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.014006Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:36b496891f98fc65d6cfd7447668d96005c818662bb2699829e197a072ef7c1e","observation_id":"efdddd95-982f-4daf-9c61-14879811b92e","resolution":{"observed_at":"2026-08-08T00:51:25.014006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.017043Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.017043Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:77a986a5cace99bbadb8a504e528e4d9d08cb5d15c35bfb6c7e3c2b65b2f476e","observation_id":"daab03e9-76d4-4b8a-a62f-0f4be1d86bee","resolution":{"observed_at":"2026-08-08T00:51:25.017043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.019902Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.019902Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:d7f64f988b52a63fa009d6861113d2992b369e40c5b828fa0b706580e7309eb6","observation_id":"5b6c23ea-e248-4b6e-bd5c-d74225384034","resolution":{"observed_at":"2026-08-08T00:51:25.019902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.866699Z","title":"2023 , version =","venue":null,"work_id":"683e4b0f-195b-4982-81cc-76612a68ccd6","year":2023},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.022641Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:0f89d26a6fdf5dc0dbfa7aefb0455776ad928022bb5ea546f82e9a8705e2e385","observation_id":"d1c45c70-a3fa-41a4-b4bc-aa80d8848f8f","resolution":{"observed_at":"2026-08-08T00:51:25.869420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-08T00:51:25.025149Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.025149Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:bb5d98a06cb0dac643026f4d15e8926f98e1851cb890f39c04f8f20c6baeb876","observation_id":"f778c1ea-d242-4c17-a6bb-f44267396d80","resolution":{"observed_at":"2026-08-08T00:51:25.025149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19641","last_updated":"2025-06-04T05:08:08Z","snapshot_observed_at":"2026-08-07T14:07:26.838295Z","submitted_at":"2025-05-26T07:59:36Z","title":"SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19641","snapshot_observed_at":"2026-08-08T00:51:25.027810Z","title":"arXiv preprint arXiv:2505.19641 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.027810Z"},"links":{"cited_paper":"/paper/2505.19641","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:4fcd001d05b63fdb4ed63c4265aeccb0176ca7dde069bff7a609cd9f34272e87","observation_id":"2f8860d8-de94-47b4-ac83-0f576c4dc1db","resolution":{"observed_at":"2026-08-08T00:51:25.027810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.030741Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.030741Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:7a7c6fb39dd56edcfab978919a0fa65bc76b08e6ff110105f498a06408cd27ef","observation_id":"5c7924ec-49e9-472d-8b0d-ef809e3e2859","resolution":{"observed_at":"2026-08-08T00:51:25.030741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.033447Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.033447Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:3979a7b6c6ba840e096ec389c9aaebed0a31ed8e0a5bee667a39a13f789f68b7","observation_id":"d846356e-fef5-4e2c-bb81-dcab8bd5d115","resolution":{"observed_at":"2026-08-08T00:51:25.033447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.036133Z","title":"2018 , publisher=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.036133Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:b4461dbb49b999ec122901f8203a7ffd7ba851e5a782e407ff86cbee77d0c98f","observation_id":"95efbe3e-738e-4301-8e88-cf35352831ed","resolution":{"observed_at":"2026-08-08T00:51:25.036133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.038958Z","title":"arXiv preprint arXiv:2511.08567 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.038958Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:4ca23b2dfb49042bc0c39d68fcef689ea09e2b5e8e99c1629800c42531f44e28","observation_id":"a82567e2-1149-4f66-9bd1-8d6940c54fab","resolution":{"observed_at":"2026-08-08T00:51:25.038958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.041478Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.041478Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:f3f62177b967c6231276686ec2bda3a295eeb645f4a85f76d0affa86646c8cb4","observation_id":"992b03f0-173e-4f22-af7c-5828a9d78df8","resolution":{"observed_at":"2026-08-08T00:51:25.041478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-08-08T00:51:25.044392Z","title":"arXiv preprint arXiv:2507.17512 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.044392Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:ae4fd08101ddbabd1979d7b2f6f9b375f244a9d31cd188a064b6619e96112442","observation_id":"c2ae80be-b48c-4a30-8693-dbf3e39bd428","resolution":{"observed_at":"2026-08-08T00:51:25.044392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-08T00:51:25.047158Z","title":"arXiv preprint arXiv:2506.14965 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.047158Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:e6c3da3ac301edd2b48b66fec9eae03ed1b85c23c499392d34fbfb46aac8a8fe","observation_id":"6ff86dea-41c1-47b1-9ea2-89aaca1fd3c3","resolution":{"observed_at":"2026-08-08T00:51:25.047158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.842661Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":"c8c3695e-b531-4fcc-947c-402efa2deec6","year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.050015Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:e639d4e00f5a63fa6366dad3315ca2c0d92fe7bebbdf89f3a26002fbe82738ae","observation_id":"e66d5eb6-190b-4889-a7df-0d3c10249ede","resolution":{"observed_at":"2026-08-08T00:51:25.845486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.834763Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"38a978d2-fb26-4f72-97a9-ecf1f9e3c52d","year":2024},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.052625Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:c263942c3dcf2eb58c532c33ca116aca1e9e244e54efc3e0adf206e256de30da","observation_id":"89566f01-e99a-4fe2-aa09-d5807c6082a6","resolution":{"observed_at":"2026-08-08T00:51:25.837858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.826924Z","title":"Forty-second International Conference on Machine Learning , year=","venue":null,"work_id":"b949ead3-36a8-4dc6-a828-ac3ed2935d9a","year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.055253Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:3bf13c4a72786465437f94dc516ec522f34806d244d37c7ffe37f1c189bc68dc","observation_id":"975416e0-961b-4e25-9587-d5bfc019080c","resolution":{"observed_at":"2026-08-08T00:51:25.829860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.058003Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.058003Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:789c4aa118e03c006f89ee365045d67cbb27075df3b91e7c16951a7678aba5b6","observation_id":"47e5bb23-9f6d-4127-b083-cd1a1cf26d76","resolution":{"observed_at":"2026-08-08T00:51:25.058003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-03T22:12:27.993418Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-08T00:51:25.060648Z","title":"arXiv preprint arXiv:2212.04089 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.060648Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:f9b14b930655f2852328655da0142ac7ec2f1514b2ef0d679a0d77f4a3288e85","observation_id":"556712b3-94f1-45aa-b5fb-6909f09cefe5","resolution":{"observed_at":"2026-08-08T00:51:25.060648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.063688Z","title":"Forty-first International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.063688Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:2c303c0d0866caf84d419408a640ec72d1db639bb40ac220b193e49245667aeb","observation_id":"f8209ebf-a8f4-45fe-9f2e-50e7deaccfbf","resolution":{"observed_at":"2026-08-08T00:51:25.063688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.066306Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.066306Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:036cc154d93d9f469a1c4a6e77589aba2d8a97d0cca7fc24a3b37ae98ada059e","observation_id":"9ffd96e5-6234-4689-84bd-408099ee5923","resolution":{"observed_at":"2026-08-08T00:51:25.066306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09849","last_updated":"2025-05-21T23:53:00Z","snapshot_observed_at":"2026-08-07T00:34:34.195906Z","submitted_at":"2022-12-19T20:46:43Z","title":"Dataless Knowledge Fusion by Merging Weights of Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09849","snapshot_observed_at":"2026-08-08T00:51:25.068937Z","title":"arXiv preprint arXiv:2212.09849 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.068937Z"},"links":{"cited_paper":"/paper/2212.09849","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:c8f5404654214e615f2ba829eee199fac2367f2d87be310dd8656f61a10a25da","observation_id":"1912973d-21a4-4e46-8168-a210dc0e8dfc","resolution":{"observed_at":"2026-08-08T00:51:25.068937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.807452Z","title":"2026 , eprint=","venue":null,"work_id":"cbd2de4b-5074-4924-90cc-96571ae9c047","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.071815Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:443fce1e31b87562ca9d334663c10cf92ebe034f8b7c0d38f4db34f1b29cf0ed","observation_id":"caf44552-0cef-4061-bad3-19aaea3ae23a","resolution":{"observed_at":"2026-08-08T00:51:25.810348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.799793Z","title":"2026 , eprint=","venue":null,"work_id":"1a5adede-79fb-488b-843a-a6ca77810433","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.074482Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:ee603947b1b988a53baad9b866fd5c6776edd1d4edae77f43de08060ffd01178","observation_id":"ddd4fee7-4ce1-4dc2-a313-a8d2c9ee7221","resolution":{"observed_at":"2026-08-08T00:51:25.802733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.791986Z","title":"2026 , eprint=","venue":null,"work_id":"57de0a50-5b33-403f-8a7b-6fe6437c6594","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.077067Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:bd89a06f1fd7153a38351b5185349e07b4cec3b868e000ff0e69d50a5305ab67","observation_id":"39cc38b0-c77e-4038-accc-df121c4630b7","resolution":{"observed_at":"2026-08-08T00:51:25.794796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.784065Z","title":"2026 , eprint=","venue":null,"work_id":"70e9ca65-20c2-4b17-b035-584e5ee2442a","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.079487Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:88c04cee8a710ee4dc7ba0b4250ba88dd6a16d0495f8fb76b7e33fc554069791","observation_id":"6b056ef3-3e89-4599-a46b-8c5d3df82a23","resolution":{"observed_at":"2026-08-08T00:51:25.786970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.776138Z","title":"2026 , eprint=","venue":null,"work_id":"fcaf0635-6fee-4982-947f-af991806ed0b","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.082053Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:8c6e12f912945f9aee1399b3f5259e992fbbae6a249f4a8fa06146a1bf95d613","observation_id":"82ccedf0-eeb8-4730-a59e-b833c30585a2","resolution":{"observed_at":"2026-08-08T00:51:25.778971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.768079Z","title":"2026 , eprint=","venue":null,"work_id":"0d83bbe6-9151-482e-acd2-3b28ca38dbdb","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.084604Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:c314d29f2466f8446e6c305dfec59915a25fa93686c6d823c480ab3849b471fd","observation_id":"678625fb-776c-4013-88ad-7afa773708d4","resolution":{"observed_at":"2026-08-08T00:51:25.770980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.760152Z","title":"2026 , eprint=","venue":null,"work_id":"44452995-0bae-433a-9ada-e5e12a6bd470","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.087330Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:d43b1c428f25891f1dcb553c5aeb4bdfc9f633e284255c38966c47a1fd76db2f","observation_id":"abf48d9c-71d8-4055-b9e7-41899d946b6f","resolution":{"observed_at":"2026-08-08T00:51:25.762900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.751964Z","title":"2026 , eprint=","venue":null,"work_id":"219382e8-a649-4ec4-bae3-af913f133b8a","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.089778Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:33adad0f5a3a0bdb35cb86e6d85a7378937c72907b855f8a8fec72194fe52a15","observation_id":"10ddd987-57c6-4940-a2b7-328d30167c99","resolution":{"observed_at":"2026-08-08T00:51:25.754873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.744350Z","title":"2026 , eprint=","venue":null,"work_id":"9e9701e7-c65b-456e-9c86-a830830de9df","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.092301Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:774b5b31a946b6cff2e6da0deccd8e14be23c90db649f0bba6f927017fa9af61","observation_id":"22fc5538-5170-4c1d-b216-5e3ca146df99","resolution":{"observed_at":"2026-08-08T00:51:25.747135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.735274Z","title":"2025 , eprint=","venue":null,"work_id":"177c031c-9c99-4fb1-b1ed-bdf668258136","year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.094778Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:28d3febe42c2bcadb245ee37daf48048a170186b1429cd55d52c6c54191a8f51","observation_id":"7478ca43-fb12-4840-ba87-a003ba3c8dff","resolution":{"observed_at":"2026-08-08T00:51:25.739308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.727188Z","title":"2026 , eprint=","venue":null,"work_id":"1b9c4c4b-f1e7-414a-99d6-44ddc8488246","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.097330Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:444e202f04f20c90d47ddf95e1f8b2fdc5ee817f0152f5f1f536183948985314","observation_id":"f4b5e2d6-d10d-4199-969d-945f04036517","resolution":{"observed_at":"2026-08-08T00:51:25.730046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T18:13:55.142539Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs"},"reference_resolution":{"displayed":91,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":72,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":91},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 91 of 91 outbound references and 0 inbound Pith citation observations for arXiv:2608.03573."}