{"as_of":"2026-08-16T07:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4847f85dfadf312751e09c9fd1c55d2e1d43186c50812c49b9aa61192969f1ef","coverage":[{"denominator":167,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:57:54.027500Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03092/citation-record","integrity":"/paper/2608.03092/integrity","json":"/paper/2608.03092/citation-record.json","paper":"/paper/2608.03092"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.692427Z","title":"Approximating","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.692427Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:0bd68d5a8ca21b3c0e90465279d22076176d3ddf2e1d6d40e21deb99ad0dbba1","observation_id":"b44c3712-e4fb-4d25-b042-b058b40d0c96","resolution":{"observed_at":"2026-08-15T14:57:53.692427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.697244Z","title":"Thinking Machines Lab: Connectionism , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.697244Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:81e42d9f7b4a7202b993dbdde30d37214f7973482c2f830ff1e4e019b7f7cf58","observation_id":"9d978763-eb09-4404-ac3a-ea6d751c60d3","resolution":{"observed_at":"2026-08-15T14:57:53.697244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-15T14:57:53.701026Z","title":"2601.05242 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.701026Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:ceb5e67223cf7269ad44763d4426a683fe1344220df02fcb4ce80faf46872796","observation_id":"3bc3d340-d0ad-46f6-886e-05ad422f23b4","resolution":{"observed_at":"2026-08-15T14:57:53.701026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T14:57:53.705018Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.705018Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:228763aba83fb7215cdf82888086e64ec9b6204adf53f9bdfd7606dc5bccc5d9","observation_id":"3f930e07-0f31-4a88-86bd-77b11984480b","resolution":{"observed_at":"2026-08-15T14:57:53.705018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.708487Z","title":"2017 , eprint=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.708487Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:0f6e0466e17b12a1c7a0f827290b2307e533f7b68145b3383731965d6a81d782","observation_id":"60b9bebc-e6c2-4376-a935-351d30f38d02","resolution":{"observed_at":"2026-08-15T14:57:53.708487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.711697Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.711697Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:56048ae965b778331fea258b2928426507cee9484e571619e3e1db0987a82d87","observation_id":"b4b0f2f6-ed7b-432d-b120-1e6766403ba6","resolution":{"observed_at":"2026-08-15T14:57:53.711697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.715648Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.715648Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:03e45da044461f2224e3ca21eb41d90d0e9d3880847a5f0ff0bf5e46d9c11956","observation_id":"be70df40-b56d-4ea7-a077-17a1b2023331","resolution":{"observed_at":"2026-08-15T14:57:53.715648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.719267Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.719267Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:28108cb6350840214271433f25bccd1a930213aa29465c06d4851c968a9a4b0f","observation_id":"f0787fa9-408b-4eb8-9531-1affac13a384","resolution":{"observed_at":"2026-08-15T14:57:53.719267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.722363Z","title":"NIPS Deep Learning and Representation Learning Workshop , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.722363Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:3988732966651299b5bfb24c58b81cb3cae858766bc0cc65e4900969b067598a","observation_id":"a31bca12-0bbb-4470-bd94-c9265e587d90","resolution":{"observed_at":"2026-08-15T14:57:53.722363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.725125Z","title":"International Conference on Learning Representations (ICLR) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.725125Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:706e75182994ff1dbc21cc36dc1263d35e4b749dc2a3148660199bf41a280f14","observation_id":"1c332071-41cd-4d27-a618-1b40ac4a1c61","resolution":{"observed_at":"2026-08-15T14:57:53.725125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.728125Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.728125Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:f9634a84bc675ff646316e524d2b8fc9dce0e22cdfa011a9c1d55c5f4d6cb7a1","observation_id":"66007b7a-c580-4046-af05-70c4019a05ec","resolution":{"observed_at":"2026-08-15T14:57:53.728125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.731053Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.731053Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:b7eb94036edefe9a43f24e84754ab2e82862cb1a502be5f8ceb4d004216ea7e8","observation_id":"5e772e42-ca45-4703-972f-f65ccf585771","resolution":{"observed_at":"2026-08-15T14:57:53.731053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.734494Z","title":"Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing (EMNLP) , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.734494Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:ef768030f18fc46a6ceef9cf57a277aea81a2b6efc0e91100f0c68ece64560b5","observation_id":"58fb0731-3699-499a-973e-7019f2ddc652","resolution":{"observed_at":"2026-08-15T14:57:53.734494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.737879Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.737879Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:efe8bdbbb891b0eda257e996662f04db648bc8e2f2829aa4c60532ad7929db85","observation_id":"301e8b44-978d-47bb-8ef6-e89e0d9de9b6","resolution":{"observed_at":"2026-08-15T14:57:53.737879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.740548Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.740548Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:48a172293f7e50e9af3b54aeaa78f805a8bdc218903f41586066d7d4b886246a","observation_id":"ea2d3af1-68aa-4862-81bf-184310a1320e","resolution":{"observed_at":"2026-08-15T14:57:53.740548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30406","last_updated":"2026-06-29T14:51:28Z","snapshot_observed_at":"2026-08-10T09:37:40.339025Z","submitted_at":"2026-06-29T14:51:28Z","title":"MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.30406","snapshot_observed_at":"2026-08-15T14:57:53.744202Z","title":"2606.30406 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.744202Z"},"links":{"cited_paper":"/paper/2606.30406","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:45df770b2a18f5cf175404bc0c0e53273b3f9c2cc259dd2dafe7010aa5095ac2","observation_id":"7bffd4d0-e002-4b5a-8291-bc548fcdbf54","resolution":{"observed_at":"2026-08-15T14:57:53.744202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.748401Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.748401Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:0bbe3bdcb88450e04c3d6b418c890b18260ef383bf2cb037c71fe91a33847b7f","observation_id":"1e160db9-9907-4243-9747-5cd4c6284f54","resolution":{"observed_at":"2026-08-15T14:57:53.748401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.751873Z","title":"Language Models are Super","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.751873Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:55b5cf355c177df0cca3cde506b38114788828d7866011e62637cda58a4a8f90","observation_id":"9981f875-77c8-4e0f-a65f-c41b1036962d","resolution":{"observed_at":"2026-08-15T14:57:53.751873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.755666Z","title":"International Conference on Learning Representations (ICLR) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.755666Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:6cd1c6f75055fc812f20fbb1c17c81eb349d842b60b5667b235a5ad4125cd9ca","observation_id":"f8609371-1e60-447a-afec-bf88a774d8f6","resolution":{"observed_at":"2026-08-15T14:57:53.755666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.759548Z","title":"Proceedings of the 39th International Conference on Machine Learning (ICML) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.759548Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:9c4e73cad3316ca6a2d1913c258fa91a59170b684a0ea6ce890abb75644cfaf9","observation_id":"d1c3a387-c06f-4e35-98e1-48f32b788dae","resolution":{"observed_at":"2026-08-15T14:57:53.759548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-15T14:57:53.762569Z","title":"Constitutional","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.762569Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:6de3bfd7a8254f80e29fab4cf0d493b851c26e90d83ca16cc8928e0eea9aecff","observation_id":"1bb26a02-3136-4743-be38-7b335f5a47f4","resolution":{"observed_at":"2026-08-15T14:57:53.762569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.765987Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.765987Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:90cbd4a10f90f31dae7745e32ed8748dd23b2ba4e05e1161b218c91635061e3c","observation_id":"e55ff134-a8c9-4fef-be53-5822847b22cf","resolution":{"observed_at":"2026-08-15T14:57:53.765987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.769326Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.769326Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:1b526d4679f76a5fa9578c6e63b296ee8d780949273491e6f68d1cc4f524d644","observation_id":"f469fe5c-7c2f-4362-a77f-f9cb0ec5a8f0","resolution":{"observed_at":"2026-08-15T14:57:53.769326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.772522Z","title":"Hashimoto , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.772522Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:e20e1eb3cf9f5f1a59511f62cc462e3dbfac53a4787abee1afca246de4a8cd95","observation_id":"2a04f551-0c78-48aa-bcd0-2e3b1650c66a","resolution":{"observed_at":"2026-08-15T14:57:53.772522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.775564Z","title":"Arithmetic Control of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.775564Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:9e4b01cba371a17a8a3ae4d6ac7524d66421083cb515da31da3add0856c60a3d","observation_id":"8a5ba99a-6b97-4694-a945-a9535aee84ac","resolution":{"observed_at":"2026-08-15T14:57:53.775564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.779097Z","title":"Rewarded soups: towards","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.779097Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:11d8e280e7ed07468d5db5c10a555f7752deeed4fe20d4a782a0b2db02a92e65","observation_id":"9c6e0cdb-3ef0-409f-b06d-7d3837124cd8","resolution":{"observed_at":"2026-08-15T14:57:53.779097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.782265Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.782265Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:0d27593a699faf8c20160942b57f3efcfa4dbae98997269e0343f5693acb2023","observation_id":"5911d5ed-af19-4c20-99d2-f54f52ae8c3a","resolution":{"observed_at":"2026-08-15T14:57:53.782265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.785597Z","title":"Back to Basics: Revisiting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.785597Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:2e5d27adbe6083fb0aa8dffa7ea47be6638308578cc913e73768f8350db90921","observation_id":"55315f55-352e-45fb-92d4-c8072d293dd1","resolution":{"observed_at":"2026-08-15T14:57:53.785597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.788532Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.788532Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:260cc830566ce82cd5ec9739cd3392e0a1b5b9ff2ae4b6677b330d55193db585","observation_id":"e845bf90-36b6-4458-8001-5b3997453d2c","resolution":{"observed_at":"2026-08-15T14:57:53.788532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2606.16771","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:54.683213Z","title":"2606.16771 , archivePrefix=","venue":null,"work_id":"100b07fa-5cd4-4a6c-ae2a-a7c21a6a84f5","year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.791392Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:dca4e4836f357ce70c3927d546f9bcce958394a11261c3290f230e2b0279c650","observation_id":"f21dcfbf-6f20-4b6c-b3b0-a49a4d561e47","resolution":{"observed_at":"2026-08-15T14:57:54.687922Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.25604","last_updated":"2026-05-25T08:55:16Z","snapshot_observed_at":"2026-08-13T02:57:08.151274Z","submitted_at":"2026-05-25T08:55:16Z","title":"DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2605.25604","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.25604","snapshot_observed_at":"2026-08-15T14:57:54.630924Z","title":"DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning","venue":"cs.CL","work_id":"df5e53f5-3062-46e7-b311-9b203fc04d09","year":2026},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.794931Z"},"links":{"cited_paper":"/paper/2605.25604","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:0c785056731c4ae333e876bbf030a53215fb17efb5ab9636f2c1bd1808391895","observation_id":"a56a4a33-f71d-4464-8afd-e78f8f8071ad","resolution":{"observed_at":"2026-08-15T14:57:54.634427Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.799215Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.799215Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:f98e266a11b9c6689fb2264b1c61a2e38d06eb4850b714422080dc5bf80038af","observation_id":"947a9e8c-6c31-4e97-b98e-94b3b52ea8b0","resolution":{"observed_at":"2026-08-15T14:57:53.799215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.802430Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.802430Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:eedc385ba788b19619036c6e3d23bac6a7d339e5390e96b46f1cc49cc69c3f2b","observation_id":"56257440-42c7-4d8e-8768-c59fd0c926f5","resolution":{"observed_at":"2026-08-15T14:57:53.802430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.806791Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.806791Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:62d9a89a9d1298ecc1d257c884b3f8db8049e18662928fd495bfa2aa180fa3f6","observation_id":"60362f9e-c83b-4f2e-b4c4-f50e93c95758","resolution":{"observed_at":"2026-08-15T14:57:53.806791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.809737Z","title":"Gonzalez and Hao Zhang and Ion Stoica , booktitle=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.809737Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:b1f4475656edc46f29708ba182a656ca14d527f685beb1b7d6542c16f6767791","observation_id":"1355564d-ac98-4810-a57f-0b906cb5eace","resolution":{"observed_at":"2026-08-15T14:57:53.809737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.813058Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.813058Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:d717dd3a23edae00e57707fd149f39ef47f8d8053c9201f897d9e620ca1add98","observation_id":"2dab2f60-a705-448b-a87e-589b931b20b9","resolution":{"observed_at":"2026-08-15T14:57:53.813058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.816389Z","title":"Patil and Tianjun Zhang and Xin Wang and Joseph E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.816389Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:99f3b3b898a206c149a3e22eba6f61c57dd49d3bbad3c91e03122894fa0444c9","observation_id":"b3971191-ef85-4ff8-b1c6-f11cee07edff","resolution":{"observed_at":"2026-08-15T14:57:53.816389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.820297Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.820297Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:55a54d09667af344508b2b338a1991b935300b6037cbd33a6d05f71e853c8495","observation_id":"eb7f4ffe-1f1a-4a0c-9444-fbd9de0231a0","resolution":{"observed_at":"2026-08-15T14:57:53.820297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.823262Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.823262Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:dccde9cdf681fd82087525cc646c537dfe4f5a49575b6b7e6e4587ce0aab0079","observation_id":"d237aab3-d2f0-45e2-8d98-a83959f16682","resolution":{"observed_at":"2026-08-15T14:57:53.823262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.07705","last_updated":"2026-06-05T10:00:19Z","snapshot_observed_at":"2026-08-03T12:09:42.759574Z","submitted_at":"2026-06-05T10:00:19Z","title":"SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2606.07705","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.07705","snapshot_observed_at":"2026-08-15T14:57:54.615752Z","title":"SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models","venue":"cs.LG","work_id":"a217619d-e951-47cd-8927-1939dc6ab509","year":2026},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.826235Z"},"links":{"cited_paper":"/paper/2606.07705","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:37a73ad38cea9a4a28f106baeb010114b98a7593409b5683066f2067abeaa923","observation_id":"a9c73846-1a10-4f50-9319-e3fb17d0e450","resolution":{"observed_at":"2026-08-15T14:57:54.619457Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20370","last_updated":"2024-09-30T15:06:53Z","snapshot_observed_at":"2026-08-15T21:23:20.721471Z","submitted_at":"2024-09-30T15:06:53Z","title":"The Perfect Blend: Redefining RLHF with Mixture of Judges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20370","snapshot_observed_at":"2026-08-15T14:57:53.831378Z","title":"The Perfect Blend: Redefining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.831378Z"},"links":{"cited_paper":"/paper/2409.20370","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:9e05c401cab9f13c20d67eb6c83aee964de45a867cba644f4542162cbf8b8596","observation_id":"5f1707d8-0451-4278-be2d-ea5f5f65f148","resolution":{"observed_at":"2026-08-15T14:57:53.831378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.836395Z","title":"International Conference on Learning Representations (ICLR) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.836395Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:ca4d3ddbddc79e7a00d71a8a79c4dac9367534bdd5d6b44a05ea287d5b9b4d85","observation_id":"7100e852-0073-42bc-9aef-0a21d22ff9ef","resolution":{"observed_at":"2026-08-15T14:57:53.836395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-12T23:35:58.312629Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-08-15T14:57:53.839991Z","title":"2406.16768 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.839991Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:694ae6cf2f65f0a668293118b5612096b5e16f3b8982d8fc973d59d6854dec88","observation_id":"458571d0-4753-49b3-bc5e-b90ebef85fe3","resolution":{"observed_at":"2026-08-15T14:57:53.839991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.843008Z","title":"Findings of the Association for Computational Linguistics: ACL 2024 , year=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.843008Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:56f5f4de2fa18d676850edaf07e83c0c99e8221c4323ea5b4ac082ae94c54e8d","observation_id":"b74d5406-0524-46d2-8a75-34d0a3b1ce8c","resolution":{"observed_at":"2026-08-15T14:57:53.843008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.846073Z","title":"Singh and DJ Strouse and Tuomas Sandholm and Ruslan Salakhutdinov and Anca D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.846073Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:8ebb57f698021a4f445e5d594e230ce47852128f1367d0a277c180f1cc4290cd","observation_id":"52d38c34-105f-4271-84ec-e8728d765d87","resolution":{"observed_at":"2026-08-15T14:57:53.846073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.848979Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.848979Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:4d72db1ce62dd6b6a82a4cfd30c5f857c0d7e752e42c1367283395cf1ae8945d","observation_id":"4a920b9b-be2f-48cc-8f55-8369bda27d7d","resolution":{"observed_at":"2026-08-15T14:57:53.848979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.851928Z","title":"2025 , doi=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.851928Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:e4f860473b46d598cecf11519a6ddb2a040ca661e2d84fcdc4701fbfb62cb3b3","observation_id":"42b17cf8-95dd-4af2-a4f0-cf5d12562fa7","resolution":{"observed_at":"2026-08-15T14:57:53.851928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.855105Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.855105Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:a7b4c63b1d08a4fdd5d8aafcef208440fe0260e9872b723a03bc2adcbf3f24ce","observation_id":"910b124d-5a82-4792-b21f-92dba7479cf3","resolution":{"observed_at":"2026-08-15T14:57:53.855105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.858442Z","title":"Measuring Mathematical Problem Solving With the","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.858442Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:92c43dd289b4f4c1838eefb90a24aee4994277fae1edc3ee0bd80a6634376bdf","observation_id":"b66bf340-d024-4cef-9b55-5130159e6940","resolution":{"observed_at":"2026-08-15T14:57:53.858442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.861265Z","title":"2019 , eprint=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.861265Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:ec51f3eb7e8eb5a0f5fcaa886a19cc5f31fb26761113efbaacd07da5f1b06cb2","observation_id":"7d649c44-756f-4c84-8759-1a43d032246e","resolution":{"observed_at":"2026-08-15T14:57:53.861265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.864101Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.864101Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:05dd33615bafc20b31b11ef7807e999a4bd14f3defbee44067d5ee8f07bd18bc","observation_id":"739164c7-0b3f-434f-b1dd-9d7647fb01c4","resolution":{"observed_at":"2026-08-15T14:57:53.864101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.867436Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.867436Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:040ca9e94debe763b00a38ebd2c9717bb340a0b2cfc356fa1c210da3b1118898","observation_id":"933ed797-10b5-4678-bba9-08d2b4935b00","resolution":{"observed_at":"2026-08-15T14:57:53.867436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.871011Z","title":"Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.871011Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:7b5cd56086235a9806d83c1d2acf8d7e35512c31d436455f9a1728b794040086","observation_id":"4c6525fa-6a6e-43e7-b798-c2b3bd17038b","resolution":{"observed_at":"2026-08-15T14:57:53.871011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.875132Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.875132Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:1f81f752316dadabf384562443e822097f22bd2b9e3252eae78d87b0ccae074e","observation_id":"53692ec1-9980-46a6-ac36-d69d18c923d9","resolution":{"observed_at":"2026-08-15T14:57:53.875132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.878335Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.878335Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:a87e59e88e49a49bc67f7ca6beb30586f0ca18efe38ca1c3adaf4a60a533f311","observation_id":"bc3c0ad2-cb95-434c-b0b0-3abcff808756","resolution":{"observed_at":"2026-08-15T14:57:53.878335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.882201Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.882201Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:93f8f46ffc19a715b1b85ba9c5b1178bf524347f45d65ad55e811f43def4f9d4","observation_id":"1506ac23-0a71-46b5-a02c-d10d8f928cfd","resolution":{"observed_at":"2026-08-15T14:57:53.882201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.885627Z","title":"Gonzalez and Ion Stoica , booktitle=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.885627Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:e81fc41c20a87f7a76f084a533ac0021aa8ceda5e3899b44f936cc372f8aaec3","observation_id":"d606a231-f2ae-4509-8597-e32f247ea1ee","resolution":{"observed_at":"2026-08-15T14:57:53.885627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.889122Z","title":"Machine Learning , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.889122Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:9447b83ad078beccf2cec222515983ba7353a042921edea738f7324093219f66","observation_id":"2370deaa-773b-479e-b087-935cb248bd00","resolution":{"observed_at":"2026-08-15T14:57:53.889122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.892306Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.892306Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:e1ea91764fb1390ffecb432ab42607b5f347c181534be5e13888ed1be7476341","observation_id":"4003c66c-0810-457c-b427-a3be5aa1dc7d","resolution":{"observed_at":"2026-08-15T14:57:53.892306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.895395Z","title":"Findings of the association for computational linguistics: EMNLP 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.895395Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:7103563e4f77d3e311d94782e2f80bcc32de4374b9d7dd87413210fe921ba406","observation_id":"96673f63-9191-467a-80d1-a86c82d45f75","resolution":{"observed_at":"2026-08-15T14:57:53.895395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03126","last_updated":"2023-09-15T09:24:30Z","snapshot_observed_at":"2026-08-13T10:19:08.558242Z","submitted_at":"2023-09-06T16:03:59Z","title":"Everyone Deserves A Reward: Learning Customized Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03126","snapshot_observed_at":"2026-08-15T14:57:53.898499Z","title":"arXiv preprint arXiv:2309.03126 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.898499Z"},"links":{"cited_paper":"/paper/2309.03126","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:08bd2987ea0c5f93cf0f5af42f565b860dc415d3e0d36e838e36d113484f3a27","observation_id":"fb436b5f-bffc-44f3-8219-b28e115e373f","resolution":{"observed_at":"2026-08-15T14:57:53.898499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-15T15:21:55.432655Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-15T14:57:53.902060Z","title":"arXiv preprint arXiv:2504.07491 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.902060Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:d76eb1b6da55ec528ec0beb0678ee6dc110586ff9df0e3d9d5368e6b57f3105e","observation_id":"17f84292-f9a6-42c0-938a-43315dd4d88a","resolution":{"observed_at":"2026-08-15T14:57:53.902060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.905649Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.905649Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:74fafb5e3d1dda3c433046622561834254b9e5af85290e686e5dc49185d292cb","observation_id":"5c547009-05c7-4ae9-8842-3864d34f42c6","resolution":{"observed_at":"2026-08-15T14:57:53.905649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.909368Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.909368Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:192903f355ee9326072bf880b590228ea7087b6552e01f8ce2dfa042746c3d2d","observation_id":"e7d3048e-1d8c-4e85-be5b-7b2308f1e963","resolution":{"observed_at":"2026-08-15T14:57:53.909368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.912159Z","title":"2000 , eprint=","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.912159Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:1f84e82005f5195a6db33f8811f24d7c940baead6a98697a9c7f41a62e317666","observation_id":"37c9e7be-5e37-4de4-a6ae-018e2e77da91","resolution":{"observed_at":"2026-08-15T14:57:53.912159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.916002Z","title":"1997 , publisher=","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.916002Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:318e6d41e09dd2912d10d550644437c155a8c832e07dba6d77fbf6866e917a82","observation_id":"ed62110f-f4e8-4f0a-8f43-9a5398d88936","resolution":{"observed_at":"2026-08-15T14:57:53.916002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.919633Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.919633Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:4ad0cf089cd325663d12865f40ba4e9acc9712710d398b419f548e09022be764","observation_id":"0a830bc8-5b09-4916-afbd-fc7199199291","resolution":{"observed_at":"2026-08-15T14:57:53.919633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.922992Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.922992Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:1f190f631ca9afaa02b63a1ce4112fe5b49a2065fea1a398d6f611e88258048b","observation_id":"74fe22e8-2260-483f-be44-6ee4dc7feb15","resolution":{"observed_at":"2026-08-15T14:57:53.922992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-15T14:57:53.926780Z","title":"arXiv preprint arXiv:1807.03748 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.926780Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:ecdcaf71649d33849f5e4234229c5585fe706aa137a7453d27ef79ac6845a0f9","observation_id":"ff4ac2d3-d624-4216-bc39-52052533cbe1","resolution":{"observed_at":"2026-08-15T14:57:53.926780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.930464Z","title":"2019 , eprint=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.930464Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:e02f306c1969f5bcfd8f2adf9b7e78040f1094892a9211494f3e046775811fe4","observation_id":"e8595768-a948-4f78-a4aa-69e7e79a006a","resolution":{"observed_at":"2026-08-15T14:57:53.930464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.933734Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.933734Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:ed701232e46e5559c0b95116f4e5856a775ebcb10495f9240bddb0905a301429","observation_id":"3b0a12de-5c06-49c9-b42c-d1066999ad54","resolution":{"observed_at":"2026-08-15T14:57:53.933734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.937179Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.937179Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:a10f78e34a586b1327804f4f7088cedd97300255bb6e43161af8f2adef7cbb85","observation_id":"efceb99c-e966-482d-88be-1bee64ba9100","resolution":{"observed_at":"2026-08-15T14:57:53.937179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-15T13:06:01.740558Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-08-15T14:57:53.940237Z","title":"arXiv preprint arXiv:2310.03716 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.940237Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:14323d85e98cc8c186812681d06b33dbac22fac4912797c3a8c7bb0ebcc44512","observation_id":"e1911532-51fd-466a-9c76-2074d31e8c6b","resolution":{"observed_at":"2026-08-15T14:57:53.940237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13548","last_updated":"2025-05-10T07:10:46Z","snapshot_observed_at":"2026-08-14T16:46:25.561386Z","submitted_at":"2023-10-20T14:46:48Z","title":"Towards Understanding Sycophancy in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13548","snapshot_observed_at":"2026-08-15T14:57:53.943369Z","title":"arXiv preprint arXiv:2310.13548 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.943369Z"},"links":{"cited_paper":"/paper/2310.13548","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:f7b472f6fc5a8eda1c3443f59a4447bab1d72c00347e0777c66698ff4bef8b2d","observation_id":"09f95b76-65fa-442f-af2a-decc09c41a21","resolution":{"observed_at":"2026-08-15T14:57:53.943369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-13T04:40:45.853560Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-08-15T14:57:53.946749Z","title":"arXiv preprint arXiv:2501.09620 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.946749Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:fa62ba9cf0bf917a96ce2428e5c4fb8dbf27769adfcf7fb8a99953c7b4249f9c","observation_id":"f904c68f-6879-4859-8ce7-4640b3670e3c","resolution":{"observed_at":"2026-08-15T14:57:53.946749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05199","last_updated":"2023-11-29T14:45:53Z","snapshot_observed_at":"2026-08-15T07:24:48.453806Z","submitted_at":"2023-10-08T15:14:39Z","title":"Loose lips sink ships: Mitigating Length Bias in Reinforcement Learning from Human Feedback","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05199","snapshot_observed_at":"2026-08-15T14:57:53.950455Z","title":"arXiv preprint arXiv:2310.05199 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.950455Z"},"links":{"cited_paper":"/paper/2310.05199","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:b2e3adc7c3a494f5dbe6979cf81eb81f5eb25713728b29126d3bb085cb6158f8","observation_id":"5ef0411b-074d-420d-b9bb-4b3e3314c8c2","resolution":{"observed_at":"2026-08-15T14:57:53.950455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.953858Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.953858Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:1b5d75fbc7b7fc10fbc11bff586acce5ab7f791e6c278291d3b7323d88b77137","observation_id":"90036455-6a28-4aa9-8e78-d0208b1910d2","resolution":{"observed_at":"2026-08-15T14:57:53.953858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.957789Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.957789Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:f08bfd8a53446a9d189e7d4c0edabc685a024894ded066e7ac323aa3812c95ac","observation_id":"dcdda4da-491a-432d-a3a1-4b8f546c4c3d","resolution":{"observed_at":"2026-08-15T14:57:53.957789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.961334Z","title":"Findings of the Association for Computational Linguistics: NAACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.961334Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:1912d3a53063339a0e06d240e55082a893c961ea50d3a1ecb7545d88ea900e51","observation_id":"d8724f47-7509-4199-9099-2e2d18c147e5","resolution":{"observed_at":"2026-08-15T14:57:53.961334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.964603Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.964603Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:9f66b735c65c82b5433e5788bb9f6cb86769a6edb1e44e70d7de368bf5547a39","observation_id":"783e67f2-7ba2-4956-96bd-cd9d5f43d6f6","resolution":{"observed_at":"2026-08-15T14:57:53.964603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T14:57:53.967415Z","title":"arXiv preprint arXiv:2410.21276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.967415Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:5a2186e42b1a39bfdb378f8116417a8748ee800688c149d19953256486a6c00c","observation_id":"283518ca-0f74-43ac-9f73-68e4f8110187","resolution":{"observed_at":"2026-08-15T14:57:53.967415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.970403Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.970403Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:4105f9528b9cc2ad892931948af24ce109508c6fe524ca6f639b5fe77161d769","observation_id":"c6c8126d-f837-483d-947e-fbd78482a8dd","resolution":{"observed_at":"2026-08-15T14:57:53.970403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.973324Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.973324Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:4dff8163da145a7726e7ec4023574905c3b1ab1ef0c8be27f4d7aac98e474697","observation_id":"81a4ea9b-7e5b-4972-8c5a-333a96a32c0f","resolution":{"observed_at":"2026-08-15T14:57:53.973324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.976058Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.976058Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:c49dfedb6ceb970fe5bfa476d66e2d134c9e899802fa5d863971b1f54f36d8c8","observation_id":"8f68f78d-087d-498d-8e1d-b1b9609f78ce","resolution":{"observed_at":"2026-08-15T14:57:53.976058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.979341Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.979341Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:a214da282c6240a94bd9a71e512d6d15aa4e9517cbc45fb49dd32f48a3e9d95a","observation_id":"cd26a059-5d3c-4d27-828a-4c16ff5ba1a5","resolution":{"observed_at":"2026-08-15T14:57:53.979341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.982198Z","title":"Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.982198Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:f51c01992fb7e2af5660fe18b8c306d465317a0b170c3761c2eafdf6054b52fa","observation_id":"2c52bc28-2c74-4fa0-9f45-d1f6cf46fb42","resolution":{"observed_at":"2026-08-15T14:57:53.982198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.985088Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.985088Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:cecb0410523540011f478ddd2e4644f55a77fef910d30c125eb27870b52d2720","observation_id":"8d7d7669-d088-4acb-b031-e45a426084a8","resolution":{"observed_at":"2026-08-15T14:57:53.985088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.988450Z","title":"2021 , booktitle=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.988450Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:716c9cfb8cfc3e31569ee3f1ba6840c000e71adc7b983b97b735f8c974851a69","observation_id":"6d1257dc-eee2-430c-9915-3f920322fb5b","resolution":{"observed_at":"2026-08-15T14:57:53.988450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.991165Z","title":"2019 , booktitle=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.991165Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:277b6a7068796b70cca1c251dbde792866693c03bfb7f2aab1f74c5643898600","observation_id":"98600c1f-5a41-4af8-ae8b-0c0c8d4267af","resolution":{"observed_at":"2026-08-15T14:57:53.991165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.994950Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.994950Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:09baa83ac88c92963309769ecb880cb06d04c928e2aee6e96cfc43de82fcff38","observation_id":"eaeff446-e299-471c-bef7-f32774ea6311","resolution":{"observed_at":"2026-08-15T14:57:53.994950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.998943Z","title":"The method of paired comparisons , author=","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.998943Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:7bb4c87cdba2d19834bd89cb7a157007d788926ebc98ad04b99b121ca116ba19","observation_id":"c9157bab-d55e-46d8-972f-18644528a140","resolution":{"observed_at":"2026-08-15T14:57:53.998943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:54.001963Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:54.001963Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:43a44f4bfaf4a400cee16bc3f20d4519f18165f6f6daa6607dfec5a7e67b2304","observation_id":"3671c0d6-78d4-49cf-9a2f-e02ec65f551a","resolution":{"observed_at":"2026-08-15T14:57:54.001963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:54.005398Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:54.005398Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:90d94bde4e27eff20f48d0339a171097cb4f5e8b62d018440172f244a2c055db","observation_id":"6db5d0e8-e58a-437c-85d2-fc3a6e5e6409","resolution":{"observed_at":"2026-08-15T14:57:54.005398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:54.008261Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:54.008261Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:465d1b94706adaedb81d878b91513f15bb8f45956c01d56cfd6af541b09ee035","observation_id":"8a3c386e-3536-4b72-9788-809f86b0f89b","resolution":{"observed_at":"2026-08-15T14:57:54.008261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:54.011160Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:54.011160Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:7d558cea8f78cc9269d8c64679364a91936ebce1bfc2ff1146ab8e7b662dc431","observation_id":"6661f9bc-b9bc-4d85-a316-01b58d24a03f","resolution":{"observed_at":"2026-08-15T14:57:54.011160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-15T14:57:54.014237Z","title":"arXiv preprint arXiv:2304.03277 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:54.014237Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:4e59eb944c03463e99d02aa616403fe6237702a79307687422f6fe6e322b3474","observation_id":"f7c4114e-0800-4c37-9b5e-fc611cca1038","resolution":{"observed_at":"2026-08-15T14:57:54.014237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:54.017797Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:54.017797Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:314dd0c1dd5ab3a14ea8fc506958b208704906f7008f69b8cc5126bc97b0bf4a","observation_id":"be4702e3-bdb3-4135-b817-af21f4a2d47a","resolution":{"observed_at":"2026-08-15T14:57:54.017797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:54.021547Z","title":"2017 , eprint=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:54.021547Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:783ecf514b21f4f386723d3f8f0e8b7cdb2a09df149509f527d2a6ee6d7736f0","observation_id":"1884369b-ba39-47b9-86d7-cc2fd09e02fb","resolution":{"observed_at":"2026-08-15T14:57:54.021547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:54.024618Z","title":"2017 , eprint=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:54.024618Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:f5c36dfe620231de31502ecae50611c2e7335f433733c8adeda87c3dbe3a4f91","observation_id":"a58c936d-b789-4294-8d0b-8761a1b6fc64","resolution":{"observed_at":"2026-08-15T14:57:54.024618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:54.027500Z","title":"2019 , eprint=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:54.027500Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:8e31dc07ce95be0577bc496e99dc6a7b763ae05635192692e61bc9c80300ec2d","observation_id":"9d8a1c50-2af2-488e-b1cd-26f9a98fee5a","resolution":{"observed_at":"2026-08-15T14:57:54.027500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T20:11:48.046890Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":97,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":167},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 167 outbound references and 0 inbound Pith citation observations for arXiv:2608.03092."}