{"as_of":"2026-08-06T17:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c1419351049c4185dc4d1b4722175c7176936659c89f6c13243dc63c5f128a1","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T14:53:31.878138Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.21085/citation-record","integrity":"/paper/2606.21085/integrity","json":"/paper/2606.21085/citation-record.json","paper":"/paper/2606.21085"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:54d7971f2ee225c029999846a9fe688e78ac9d7e1687e94997b67bd154845c76","observation_id":"5e56c8ae-9b97-47ef-a257-e3ab9e932fe3","resolution":{"observed_at":"2026-07-04T06:09:36.628201Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:b6359babca1ee9b139ce98b430d6dacf25a76e0713cb8ef56b80073a6d054099","observation_id":"4da55aa2-6ad8-4802-b7e0-98228f68d925","resolution":{"observed_at":"2026-07-04T06:09:36.630789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Accelerating online reinforcement learning with offline datasets,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:0535ab1f1c2e8b825c81bfcb6f3e8c7bd0d9b169e0793f82afe27d1764c8d7dc","observation_id":"cb33f670-bd87-434c-9cdb-ef1ee4dad3ec","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Offline reinforcement learning with implicit q-learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:2cfe326152047047abc3a542bffce338901e143c9c565c06efb45492c118d0e6","observation_id":"a15bbbce-6ff8-4103-8f59-f4e651534e2f","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Qt-opt: Scalable deep reinforcement learning for vision-based robotic manipulation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:19a35b7587ecccecf7e4091117ed03cec0a49512a7b08c1ad2d7aef67dc9e62d","observation_id":"6a7b4799-8310-4170-9c84-13c087906096","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"A minimalist approach to offline reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:5c88f27f572961e4cfb808cc0c97b94bd83389db7132ab0c8acf2b2ca9fbdcd5","observation_id":"6791f76b-ff93-446f-b8af-404759e7aa66","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Policy expansion for bridging offline-to- online reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:b33e4e19a2830321331579faf5fff69f9d32fc6b06232335d027a719f96c16a2","observation_id":"6c84a435-1ae6-4e59-8284-b3a2895a5301","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Bayesian design principles for offline-to-online reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:6adb9834a43841c8de5ba7511d92536aa7fc234002123bac4b9df182505a8823","observation_id":"04a7f2e6-32f9-49cf-8bd8-b433c0661fb8","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.06709","last_updated":"2021-05-07T14:03:40Z","snapshot_observed_at":"2026-07-06T09:04:43.836543Z","submitted_at":"2020-03-14T21:29:09Z","title":"FACMAC: Factored Multi-Agent Centralised Policy Gradients","version":5},"cited_work":{"arxiv_id":"2003.06709","doi":"10.48550/arxiv.2003.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2003.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep multi- agent reinforcement learning for decentralized continuous cooperative control","venue":"arXiv (Cornell University)","work_id":"87e6ae77-5995-40cd-8f19-770f64e0e089","year":2003},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"cited_paper":"/paper/2003.06709","citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:0d92a1c577a55bae64fe6bb714a123674df674e20a853313227a363192698150","observation_id":"3fdf59f5-5d5f-4c84-ae03-3b28cc7a7343","resolution":{"observed_at":"2026-07-04T06:09:36.633975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Opride: Efficient offline preference-based reinforcement learning via in-dataset exploration,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:352c727f5f805a3bacb81b520f39235d000748982a94e3895ebedb8664839223","observation_id":"3a793b8a-4899-4a34-9253-3efceb7105b2","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Batch policy learning under constraints,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:6132e997d8a42b96708941b3aabde957eceb6135d9c596c98f343bcdda37c2f7","observation_id":"3454fff4-12e0-48ac-a4e9-41f5ff6020eb","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Flow to control: Offline reinforcement learning with lossless primitive discovery,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:6ef9f72d0917f00eb217655448c4b1b16907b5e1358bf3806991cd797379b0d0","observation_id":"18438a75-e91c-4842-8308-1f619c6451a9","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Off-policy deep reinforcement learning without exploration,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:e1fb5b71d8aeb347ebe5e147415c6acce57daadc579f721480d1d0ebbbcb930d","observation_id":"648d7c2e-9240-434f-b9df-8ba1dc4e955e","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:9f776aff63327a4fc13a411dcc08b1d8222f1985409c0921076099e6c042b694","observation_id":"6993e16f-fcb4-4349-9f1d-5890129fb102","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Behavior regularized offline reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:cf41e58838568bce8951c6794d92b32c4f46f6564b0edc65baf01b52b22f0a20","observation_id":"7c801630-ff42-4b77-aeda-774471b68a88","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Critic regularized regression,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:1465b401e2b4ae3bbd2666df1bacfd289ee6b3de4212f4d6a16ba38f9a276a1b","observation_id":"87c45629-542b-458e-8fdc-8758e736f135","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Advantage-weighted regression: Simple and scalable offline reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:8425a3069df1d3094b3e47dc16845b9ec79360824f5b554b3268e07d38eb9665","observation_id":"03d9989d-ce4d-4349-812c-7da7d6a898ab","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"A survey on offline multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:fee46d198ccc83953c22e2f0b8c93730afb24863c2c816ed977ac11ebf54d2f9","observation_id":"9695e938-52a9-43c4-a9db-dde80651fe69","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Offline multi-agent reinforcement learning: Guidelines and benchmarks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:50ef5387c58e5b109ad9d33e29e0f10744c1fb927ea5791868b854a9ed8029bf","observation_id":"ba2c7537-050c-4a56-92a0-ba15e1e27f03","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Offline multi-agent reinforcement learning with knowledge distillation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:45b728c095e1282c021ec160b8c1369cce252179697b88edb4efb8dfefd7c454","observation_id":"2acc15f1-db4f-47b1-8ccc-6aee027fe0ca","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Offline decentralized multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:8bbccb556121054263fe67a65960803bc0761418563a02cfe7396ecc35539704","observation_id":"762331be-8f84-425d-af83-eccf69c2c4ba","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.15776","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:09:36.623529Z","title":"Globediff: State diffusion process for partial observability in multi-agent systems,","venue":null,"work_id":"5d39f21b-efd0-418c-8c2b-b1fefe7acd2a","year":2026},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:5d0e94eda14e38e757a4283435ff5c24560e10138ea5aa21403c86ba96fa33d1","observation_id":"426bc625-36cd-42cc-96b5-4446e1dae85f","resolution":{"observed_at":"2026-07-04T06:09:36.625245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Believe what you see: Implicit constraint approach for offline multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:61f815e120b663628d18705c3e2b79c8262701c53099153399960510abc691f2","observation_id":"9466d7ba-4cd8-44a4-ab55-7a09b5094875","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Plan better amid conservatism: Offline multi-agent reinforcement learning with actor rectification,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:74143070a1de715f0ddc44793e115f1e8abde5a170501e21717615a1a3a13d85","observation_id":"487d87dd-ba1a-4789-9a00-575b8473d661","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Counterfactual conservative q learning for offline multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:03da5ebf960b749a4722da30c6e50cb552570d9ebb30f99b4914c6ef9939b7f6","observation_id":"9a4cfc7e-10bb-4c23-b975-d17992854b68","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Offline multi-agent rein- forcement learning with implicit global-to-local value regularization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:7bc78c5a5de0a5364b8071d3047c2712d680576792b18781c314b331cbcd8ef5","observation_id":"68e56995-11cc-410d-aaeb-817cbc992a6b","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Qmix: Monotonic value function factorisation for deep multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:b020dddcba7f6fb5a556d8fa1f06f5318825c913d1fbda4fe3331d157e3af481","observation_id":"d46a85c3-6b36-40cf-8976-2b4de62608dc","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Qplex: Duplex dueling multi-agent q-learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:947f3581e6917080130c1628ecbd951803ce623c0a90036629f5d9aaa645df39","observation_id":"a11b9d84-2657-476f-a518-92bdf153ea89","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Cal-ql: Calibrated offline reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:444ddd0dd8fcc3ba8f47b4eef15321d7600630da5ec0e991feab26b9716cd495","observation_id":"1eb8af10-ba6d-463f-a3f2-bfcbee1efdb8","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Proto: Iterative policy regularized offline-to-online reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:0f75c0dd1c2123df858183d97e256eddb1fa545e92c2c3b72b07a3f32b39557c","observation_id":"868ee271-a8e6-41f7-a3dc-027c8fb10325","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Efficient online reinforcement learning with offline data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:254bc95a601b4e242179ce8d0128a395d3d61f7cea125cc837ce5e1b045a2a2f","observation_id":"8a982434-94a4-4bd5-b4be-d5fc93266f52","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Trust region policy optimisation in multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:17815ee51d7a8c56b05cb47c6019354a8b733eb97503422a5521b9edaf21b282","observation_id":"53038486-179f-4854-bc5c-385ff3cdb7d0","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"First, we incorporate the standardized public offline datasets released by the OMIGA benchmark [26]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:26d96f14ebc00720dda15b72618ffc88d5e40877a17bd2a9c68dc803194d6cbc","observation_id":"a0061c53-725e-4e4b-9428-c7d416096b13","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:3726ff42155f10602930a77fdf4644a1374fb90b2ee81251c5fa773be07c734d","observation_id":"6ed56350-bd92-47a8-97ab-c33aafd14583","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:3fa0d059d24b1d2e146529c266ea4220f5933faa94e76cf519be780d6eb98fca","observation_id":"4e75f9f9-1697-48c1-b93a-ec860bb1549a","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"To establish a rigor- ous multi-agent comparison, we extend these algorithms to their multi-agent counterparts, denoted as PEX-MA, AW AC-MA, RLPD-MA, and PROTO-MA","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:c026792d2548d3acbf306d6cb2b106ff99ef90d605bc6e2fc9b469bd80587591","observation_id":"14a89a6a-86fd-4cdd-9998-99d699ab03af","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:56:07.147471Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2606.21085."}