{"as_of":"2026-08-16T04:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb3ff0302fad90e750b83984a6b519bbfd1d0f184a680e0beea215d4e45686ea","coverage":[{"denominator":149,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:18:10.339798Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.15495/citation-record","integrity":"/paper/2501.15495/integrity","json":"/paper/2501.15495/citation-record.json","paper":"/paper/2501.15495"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:09.999335Z","title":"Demand-responsive zone gen- eration for real-time vehicle rebalancing in ride-sharing fleets,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:09.999335Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:a4b46e513a393209cf220b9fc34c40e2905b2e882daf71ab6095c2ea645fb320","observation_id":"6a0c98c5-4272-4917-9f29-3f9642cc3c71","resolution":{"observed_at":"2026-08-10T14:18:09.999335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.004039Z","title":"Demand-responsive rebalancing zone generation for reinforcement learning- based on-demand mobility,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.004039Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:109b9a1c33aa0a284ea39ce41b1956e9c91f9314524dcf7f3745bc31d5a292e8","observation_id":"e08fbf5b-0bb2-4536-9d86-880b282c53f1","resolution":{"observed_at":"2026-08-10T14:18:10.004039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.007734Z","title":"Multi-agent transfer learning in reinforcement learning- based ride-sharing systems,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.007734Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:966f5de47fe6d0e1d46a764ac5138f162074719e780561facf1bb16137bc58eb","observation_id":"1c91acdd-cd75-4442-aca9-e614cb4e6460","resolution":{"observed_at":"2026-08-10T14:18:10.007734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.011564Z","title":"Expert-free online transfer learning in multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.011564Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:50370fb7c2557cad7b0b5d71b019277fd305cc89b5c477e45539f2271eac5497","observation_id":"ed892fcf-3dd8-499d-a059-05db882c5408","resolution":{"observed_at":"2026-08-10T14:18:10.011564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.014946Z","title":"Continual model-based reinforcement learning for data efficient wireless network optimisation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.014946Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:f7500f7899ac7f1773b8199ba7189c3576249c0cb3211277611f59798c39ca7f","observation_id":"ed181d69-4862-4cbe-8430-ebf776832198","resolution":{"observed_at":"2026-08-10T14:18:10.014946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.018373Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.018373Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:80c81a468f548de74b264fcf551b21049db871b713edc8fefde93c7ff6285921","observation_id":"42a5eb0c-710c-4cce-9ed1-90a873b8adfa","resolution":{"observed_at":"2026-08-10T14:18:10.018373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T14:18:10.021792Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.021792Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:6c6249b880226e8cd71ce2bd9341dc7adeee5e2c5db0665668aa313cd058b16b","observation_id":"699949c4-b5e6-4cab-9eb5-e7141d8134e8","resolution":{"observed_at":"2026-08-10T14:18:10.021792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.04143","last_updated":"2024-05-03T15:00:50Z","snapshot_observed_at":"2026-08-14T22:23:10.894196Z","submitted_at":"2015-11-13T02:34:33Z","title":"Deep Reinforcement Learning in Parameterized Action Space","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.04143","snapshot_observed_at":"2026-08-10T14:18:10.025780Z","title":"Deep reinforcement learning in parameterized action space,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.025780Z"},"links":{"cited_paper":"/paper/1511.04143","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:7463d5a90784c05e8bd16bf456e928b034dbc1500d52e488ab36484432495431","observation_id":"9a3321a5-b8ff-4b77-8e96-fe4914d99042","resolution":{"observed_at":"2026-08-10T14:18:10.025780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.029837Z","title":"Tlc trip record data,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.029837Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:16a2de34f7905e0a88c53468dd1bebfcec4abf35ef7e3734f42e8bc271522127","observation_id":"1404a28c-05b9-46df-b685-a3120fda79a7","resolution":{"observed_at":"2026-08-10T14:18:10.029837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.033070Z","title":"Openai gym,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.033070Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:0e1b2232df20729ee883bc3ea1a81b39af5ac950fbd0bba4ccbafab628128a76","observation_id":"9b7baca7-726e-49ca-b1e7-77bf1ae47448","resolution":{"observed_at":"2026-08-10T14:18:10.033070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.036361Z","title":"Sim-to-real transfer in deep reinforce- ment learning for robotics: a survey,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.036361Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:2f81937b41fed3d2c4f0d5d1a040665307d6cffb07e858246931010dfab02f38","observation_id":"3f8a866c-f9d0-4665-b9f3-9b96d2845368","resolution":{"observed_at":"2026-08-10T14:18:10.036361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.039678Z","title":"Reinforcement learning in robotics: A survey,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.039678Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:b51810333c1aed580bf159e34588192fcffc476d5fb4dd3d0b0b7ab8285d142a","observation_id":"325a389a-7522-402c-bbc4-7f93fc5e7b98","resolution":{"observed_at":"2026-08-10T14:18:10.039678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.042876Z","title":"Survey of model-based reinforcement learning: Applications on robotics,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.042876Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:3b277fe64fe2ab21934693c52a87d333ed09bb515f455242011638120c85ad11","observation_id":"00634596-fd90-4c1f-a808-ba84026b13e7","resolution":{"observed_at":"2026-08-10T14:18:10.042876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.046245Z","title":"Reinforcement learning in economics and finance,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.046245Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:928546ab9a94db522dbbcbaa83fa93d3408715e295bab920320996898f6d6c35","observation_id":"f5bf0e7e-a2b0-433d-8201-85d1b352febf","resolution":{"observed_at":"2026-08-10T14:18:10.046245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.049478Z","title":"Recent advances in reinforcement learning in finance,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.049478Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:c2fd396601c7bbe7c7007d2fdec9a7d5eeab2da77762a1985375be7220364977","observation_id":"ec0fbc76-a09a-4657-b82c-02917fb352eb","resolution":{"observed_at":"2026-08-10T14:18:10.049478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.052720Z","title":"Multi-agent reinforcement learning for traffic light con- trol,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.052720Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:a39841648334532197991f05ba17f198efd0add856f6fdc29fc8add438c6818f","observation_id":"6f7c6211-26f0-44d2-bb5c-25cdd4670594","resolution":{"observed_at":"2026-08-10T14:18:10.052720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.056348Z","title":"Recent advances in reinforcement learning for traffic signal control: A survey of models and evaluation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.056348Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:667cb9984b06a42a305435575762af0e66184fbeee945489ccc1f9f32f626102","observation_id":"f5f0a958-8318-4ac7-880c-6ff2a4542e22","resolution":{"observed_at":"2026-08-10T14:18:10.056348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.059578Z","title":"Shared autonomous mobilityondemand: Alearning-basedapproachanditsperformanceinthepresenceof traffic congestion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.059578Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:a3a5b7a67da6640522924c42492f18da95a01f5cf71c95b644b25e94851ac09c","observation_id":"da76614e-62cd-430d-9efd-712ef8288328","resolution":{"observed_at":"2026-08-10T14:18:10.059578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.062746Z","title":"Deep reinforce- ment learning for mobile 5g and beyond: Fundamentals, applications, and challenges,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.062746Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:289f2d786e3140b48f836747909cc0b9d0f4aa8305bf784fcf20b6658ae8fa28","observation_id":"607a52bd-4bb7-4829-89ba-48ff3f4a628f","resolution":{"observed_at":"2026-08-10T14:18:10.062746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.065959Z","title":"Rl-nsb: Reinforcement learning- based 5g network slice broker,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.065959Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:4127de9ef1128799a6657d4d864e0ff99851065a677dcc85d83d38d7db29cc50","observation_id":"efc6a627-ba19-40ca-b6e5-d314dd220ffb","resolution":{"observed_at":"2026-08-10T14:18:10.065959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.069159Z","title":"Deep reinforcement learning in medical imaging: A literature review,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.069159Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:eb4606cd1af8948c806fda18425bf58bdd9f393a525e3e475c1e47069ae74590","observation_id":"54c51b7d-eadc-4f4c-bd0c-cd5ade43350c","resolution":{"observed_at":"2026-08-10T14:18:10.069159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.072273Z","title":"Reinforcement learning for intelligent healthcare applications: A survey,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.072273Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:86a3ae974494b5241332aab4561302bc90fe9a539021b112650b59f7e42bca43","observation_id":"7731bab4-5f35-48dd-8fcc-db6051f3f337","resolution":{"observed_at":"2026-08-10T14:18:10.072273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.075404Z","title":"Deep reinforcement learning in medicine,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.075404Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:d4a6592f0b7403178228e7d4184c7541e59a18da460918e54438bf8a0d395ed8","observation_id":"fb4eae29-253f-467b-9cd2-14bf125f4da7","resolution":{"observed_at":"2026-08-10T14:18:10.075404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.078598Z","title":"Literature survey of statistical, deep and reinforce- ment learning in natural language processing,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.078598Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:f795e10ac844e01f5a35a3c2b6be1d954d7e653a28d5d63f62d67f8502fa3c16","observation_id":"00d5f02e-1f89-4fbf-b24c-a7fe99857fa0","resolution":{"observed_at":"2026-08-10T14:18:10.078598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.081902Z","title":"Survey on reinforcement learning for language processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.081902Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:f4d168fb974d03a4aef1087123853176f8cd8d5e0fffa0dd7eed6f93e236d433","observation_id":"b56a1663-d4b9-473f-b4dd-060f24014161","resolution":{"observed_at":"2026-08-10T14:18:10.081902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.04671","last_updated":"2022-10-22T14:34:44Z","snapshot_observed_at":"2026-08-14T06:05:49.699878Z","submitted_at":"2016-06-15T08:20:51Z","title":"Progressive Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.04671","snapshot_observed_at":"2026-08-10T14:18:10.084938Z","title":"Progressive neural networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.084938Z"},"links":{"cited_paper":"/paper/1606.04671","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:fc6aa284a4306768baa69775bf8c4cecde16365ed13d5a724ac385506856b279","observation_id":"45c8a8b5-7834-426e-bc5a-2db24b507267","resolution":{"observed_at":"2026-08-10T14:18:10.084938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.088247Z","title":"Progress & compress: A scalable framework for continual learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.088247Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:c302af45ba0921eedde7c2b58aba4427e273e83f67643e4d83d88c6f7301007e","observation_id":"8fbe1167-f782-474b-9db2-1b348360e9f4","resolution":{"observed_at":"2026-08-10T14:18:10.088247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.091854Z","title":"Deep reinforcement learning with knowledge transfer for online rides order dispatching,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.091854Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:172f6630c77afa9b0d9d0f6e442e3d78f441772cf469d7571175a1d0b3b1a169","observation_id":"22733a5b-f1e7-4de0-a4c5-7fb80d48e2fc","resolution":{"observed_at":"2026-08-10T14:18:10.091854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.094972Z","title":"Sharing knowledge in multi-task deep reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.094972Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:eb2f88e3a792c51bec29aade0d5e685e04daf604d0e6433dee478fb09f30a158","observation_id":"197ef505-c48a-4419-aaa2-c0edd8ae7404","resolution":{"observed_at":"2026-08-10T14:18:10.094972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.098273Z","title":"Learning modular neural network policies for multi-task and multi-robot transfer,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.098273Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:9ca2b1bc367bbf2a916660fc0258d1a9a846b0f3480bc230e37b8b92f9bafe84","observation_id":"031c4951-11b4-4f91-a05a-fa74f6f12826","resolution":{"observed_at":"2026-08-10T14:18:10.098273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.02396","last_updated":"2016-06-08T04:48:49Z","snapshot_observed_at":"2026-08-14T21:53:45.014617Z","submitted_at":"2016-06-08T04:48:49Z","title":"Deep Successor Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.02396","snapshot_observed_at":"2026-08-10T14:18:10.101303Z","title":"Deep successor reinforce- ment learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.101303Z"},"links":{"cited_paper":"/paper/1606.02396","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:0c1a6c3da2b8701947c0d7b20677257e5d947d08fd40211d5cb0089dceeed9c5","observation_id":"9e1fcd72-d4b6-435c-ae00-9a15dcb03276","resolution":{"observed_at":"2026-08-10T14:18:10.101303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.105545Z","title":"Overcoming cata- strophic forgetting in neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.105545Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:7456bf03bac7b0f8e4fbca7ad73c79a88cfec47adcfaec02b28194086a4ad08b","observation_id":"1d48725b-bda9-4967-b1da-bfb917e68b86","resolution":{"observed_at":"2026-08-10T14:18:10.105545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.109453Z","title":"Towards knowledge transfer in deep re- inforcement learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.109453Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:cb49f1e14db9f4fa8be5c5fb041f88ed6c41deab24ba9321e3979be05a8e57b6","observation_id":"441fb47e-62d0-4685-a0ca-326015deff40","resolution":{"observed_at":"2026-08-10T14:18:10.109453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.112790Z","title":"Knowledge transfer for deep reinforcement learning with hier- archical experience replay,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.112790Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:4f857c8dad20d9462bf312cbed3c7e4d8b64b9af736b190b38b329af6699eff1","observation_id":"adf402fa-03d1-46ca-a924-2e4f4f1a2ecb","resolution":{"observed_at":"2026-08-10T14:18:10.112790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06295","last_updated":"2016-01-07T18:43:03Z","snapshot_observed_at":"2026-08-14T22:22:10.851051Z","submitted_at":"2015-11-19T18:38:47Z","title":"Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06295","snapshot_observed_at":"2026-08-10T14:18:10.116257Z","title":"Policy distillation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.116257Z"},"links":{"cited_paper":"/paper/1511.06295","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:766f9d7853f73d7a3159b67f4a1aac2a94b1fda753f71cfe085a2d42a27f6d07","observation_id":"694c384f-d352-4836-84d1-734bd9abb217","resolution":{"observed_at":"2026-08-10T14:18:10.116257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05855","last_updated":"2019-07-11T09:12:42Z","snapshot_observed_at":"2026-07-06T08:07:23.565614Z","submitted_at":"2019-07-11T09:12:42Z","title":"DisCoRL: Continual Reinforcement Learning via Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05855","snapshot_observed_at":"2026-08-10T14:18:10.119843Z","title":"Discorl: Continual reinforcement learning via policy distillation,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.119843Z"},"links":{"cited_paper":"/paper/1907.05855","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:e8e0585fc6070008bced1d3c9d62a940839fb8b79b3165cdd4ee459a1240bde7","observation_id":"34a9096d-79be-4982-a276-1697a6afb037","resolution":{"observed_at":"2026-08-10T14:18:10.119843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.124256Z","title":"Successor features for transfer in reinforcement learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.124256Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:fbb44bb0d26325f84f129fbf47c4e2e1b313eda9826de68a5ba89ad8b598e969","observation_id":"2dd48287-a780-4db2-b0aa-c609ad25f77e","resolution":{"observed_at":"2026-08-10T14:18:10.124256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.127567Z","title":"Deep q-learning from demonstrations,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.127567Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:1aff5dadf2b4159bfca06fd36c2f10b161d830ad78e5d48474a4d39d4050dc96","observation_id":"b7c51cff-082f-42c1-adb5-c739afc95e1a","resolution":{"observed_at":"2026-08-10T14:18:10.127567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.130920Z","title":"Transfer of samples in batch reinforcement learning,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.130920Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:a64885cb13fe8ae6af2e6844ce25d7d1c852a4bb0017522ad3991d188762a0a7","observation_id":"35d74cc1-6c84-4d6c-91bb-b936653b6e6b","resolution":{"observed_at":"2026-08-10T14:18:10.130920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.134558Z","title":"Don’t start from scratch: Leveraging prior data to automate robotic reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.134558Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:1d14e182760a739a7b2f5ec392239f4625189a8292f0f051bb05fc95691d5173","observation_id":"571b03ec-9ee2-411b-ba47-d487e87e5ad5","resolution":{"observed_at":"2026-08-10T14:18:10.134558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.137994Z","title":"Reinforcement learning agents providing advice in complex video games,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.137994Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:4a272d88b01bb671b3b53fee503be4cc4d9c7d28a031c377e85f8e4cf1c067f1","observation_id":"5105d4c1-c524-4d0c-9359-bb7d978bd534","resolution":{"observed_at":"2026-08-10T14:18:10.137994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.142107Z","title":"Uncertainty-aware action advising for deep reinforcement learning agents,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.142107Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:bf621fef64e0a29dc34393b6da392035c27eff681ed442d0e0836aa409a8b765","observation_id":"b1516f5e-39c3-4b5a-9b1e-a535107ba624","resolution":{"observed_at":"2026-08-10T14:18:10.142107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.146372Z","title":"Learning by reusing previous advice in teacher-student paradigm,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.146372Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:88a65e7cdec29ea677dc984d7ae64a0c693c9d834326c9d13e8e766e3089a953","observation_id":"9f9ab1e1-7e8a-4094-8b49-986f03b6124a","resolution":{"observed_at":"2026-08-10T14:18:10.146372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.149578Z","title":"Experience classification for transfer learning in traffic signal control,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.149578Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:0a55b9f55ddbbc073971de9e2e0cd8c6466cc1212037f1434e8987edef8ee58b","observation_id":"8d7086f2-49c8-4741-9a8d-66583dca10db","resolution":{"observed_at":"2026-08-10T14:18:10.149578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.152717Z","title":"Teaching on a budget: Agents advising agents in reinforce- ment learning,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.152717Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:616dc24adc9a6d5b4d603bb8a87baeebb66dbec0c41384f4250086f8c99d0997","observation_id":"56994210-7a67-4079-a6fe-de445c93947e","resolution":{"observed_at":"2026-08-10T14:18:10.152717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.155661Z","title":"A q-values sharing framework for multi-agent reinforcement learning under budget constraint,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.155661Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:d82ec818aeeac9870caa19f30f41fefe24cb7e5c215e88b854dcc4d4aab9dd92","observation_id":"86f2ecd5-f8c7-42b9-8207-abdf74a5ea21","resolution":{"observed_at":"2026-08-10T14:18:10.155661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.13085","last_updated":"2020-03-29T17:42:00Z","snapshot_observed_at":"2026-08-14T01:20:25.047688Z","submitted_at":"2020-03-29T17:42:00Z","title":"Parallel Knowledge Transfer in Multi-Agent Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2003.13085","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.13085","snapshot_observed_at":"2026-08-10T14:18:10.742173Z","title":"Parallel Knowledge Transfer in Multi-Agent Reinforcement Learning","venue":"cs.AI","work_id":"b194a648-57c3-4eb3-9ec3-b2e4b7391ed2","year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.158684Z"},"links":{"cited_paper":"/paper/2003.13085","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:27ff583389d44be92b06c887db6342e213a17efa88cc1f829836d0987a79e460","observation_id":"5cff5ba3-c59c-43a1-bfd4-b8cc92f00ec2","resolution":{"observed_at":"2026-08-10T14:18:10.746045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.162524Z","title":"Simultaneously learning and advising in multiagent reinforcement learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.162524Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:ac9afa2df9203ac160d1fcfe7c062c46fcfd64f1bdde724c7c8e248fe0366d7e","observation_id":"d244c424-eb72-4d70-a888-dabecaae2123","resolution":{"observed_at":"2026-08-10T14:18:10.162524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.165953Z","title":"Parallel transfer learning in multi- agent systems: What, when and how to transfer?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.165953Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:0dc7f087c1652f64f323a05e7c7749b4fa793e0dc4492ef4de6ee97a0cd96aca","observation_id":"06eadb1e-8307-4803-bc06-7c2dd7ab565a","resolution":{"observed_at":"2026-08-10T14:18:10.165953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.169241Z","title":"Knowledge transfer in multi-agent reinforcement learning with incremental number of agents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.169241Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:266385985491710cfc80d75c7d1e9dc35d680c06556bb090ae2f11ddad15b07f","observation_id":"1c803f6e-ad64-42c2-aaaa-2f76bae6034d","resolution":{"observed_at":"2026-08-10T14:18:10.169241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.172507Z","title":"Multi-agent advisor q-learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.172507Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:8e5c181aa5091c4a4aa2408615315a99fce20fb1cc33089d36b5b0716169733d","observation_id":"f504b1b7-6568-499f-a87c-3d4f622a4acb","resolution":{"observed_at":"2026-08-10T14:18:10.172507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.176436Z","title":"Teaching on a budget in multi-agent deep reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.176436Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:a6ec9c1f80b90b1f5d1a264e4a9b0b949ba926d5407a7203c1dca8df04083c97","observation_id":"37ad7085-41ba-4978-b5c7-3f10d2dfdb35","resolution":{"observed_at":"2026-08-10T14:18:10.176436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.179695Z","title":"Selectively sharing experiences improves multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.179695Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:86a07e5f66d533f82bcb90c1c6eaf63f0f0964505da231f803e3a1ce1abe33c5","observation_id":"d4c98079-fba8-4588-b897-d44c5669aaf4","resolution":{"observed_at":"2026-08-10T14:18:10.179695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.182842Z","title":"Ferber,Multi-Agent Systems: An Introduction to Distributed Artificial Intelligence, 1st ed","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.182842Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:fc98fdd6bde00cdb1382032d738b39766bd3ad38218531849db6c6790edd6a76","observation_id":"1d79fad9-d46d-4738-ace0-f81890dbee71","resolution":{"observed_at":"2026-08-10T14:18:10.182842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.186135Z","title":"Multi-agent deep reinforcement learning for large-scale traffic signal control,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.186135Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:6fae3a7781dc0c52a53c58c90d545af603497420a1356a03d0efcf747d1cc0f3","observation_id":"0548c6a8-7f8b-4c0e-9c84-860d4e112e9b","resolution":{"observed_at":"2026-08-10T14:18:10.186135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.189432Z","title":"Tar- mac: Targeted multi-agent communication,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.189432Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:9db24117543d8207d037bf76a81f899689cb3e49e744533f9ad9938ac16d9d54","observation_id":"04feef5e-efd6-4e23-ba3a-431ef247ac27","resolution":{"observed_at":"2026-08-10T14:18:10.189432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.192663Z","title":"Learning attentional communication for multi-agent cooperation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.192663Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:a6bba962d6b7dfc2304d5c3c149961f38b43f2273911bfe652203a88783855dc","observation_id":"76382438-2458-4bf8-8f9e-843887b5a65a","resolution":{"observed_at":"2026-08-10T14:18:10.192663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.195564Z","title":"⨿⌈-learning: A collaborative distributed strategy for multi-agent reinforcement learning through consensus + innovations,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.195564Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:6e81e09ba66611eb3c05e9854669a81ddf8fac0a7415f6c0fad0bf1c183fe1eb","observation_id":"58a2751a-ce89-46b3-b4e1-a8f157d8b063","resolution":{"observed_at":"2026-08-10T14:18:10.195564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.198808Z","title":"Monotonic value function factorisation for deep multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.198808Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:1e4b64f513417507a2b48adf3413d7dc70e95a191ed8c1d409f4e7572a5e099a","observation_id":"a1080e28-513e-4c70-ac68-7a316fcc628e","resolution":{"observed_at":"2026-08-10T14:18:10.198808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05296","last_updated":"2017-06-16T14:47:21Z","snapshot_observed_at":"2026-08-14T20:53:35.783079Z","submitted_at":"2017-06-16T14:47:21Z","title":"Value-Decomposition Networks For Cooperative Multi-Agent Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05296","snapshot_observed_at":"2026-08-10T14:18:10.202651Z","title":"Value-decomposition networks for cooperative multi-agent learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.202651Z"},"links":{"cited_paper":"/paper/1706.05296","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:dd2a62f83a4c833c1c623101e3c715e80768caa0495aacaf1bc151570eefcf24","observation_id":"c6a5af7c-0fda-4ddf-9af6-ac8a730233b7","resolution":{"observed_at":"2026-08-10T14:18:10.202651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.206289Z","title":"Multi-agent actor-critic for mixed cooperative-competitive environments,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.206289Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:3593cbb34614a1c66be39730bcb95ff1322c4e90e5125e90b3ada44f25b72a09","observation_id":"d45f91dc-5441-4615-a43d-4484c502e029","resolution":{"observed_at":"2026-08-10T14:18:10.206289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.209208Z","title":"Q-rts: a real-time swarm intelligence based on multi-agent q-learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.209208Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:0ee2e45dc6dc32ea8050d95b8ead9f8ce525ce5735b8ceb416ba18f3ab57e958","observation_id":"759c23a2-8062-4913-85a4-0ff1b7466526","resolution":{"observed_at":"2026-08-10T14:18:10.209208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.212019Z","title":"Multi-agent reinforcement learning: Independent vs. cooperative agents,","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.212019Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:66e740a1d00be1d755bb219f0e4d6d7e4ec5d23df8271a016b214de6787c2c84","observation_id":"2fa5d8c5-6546-47eb-adac-cc00ecebda6f","resolution":{"observed_at":"2026-08-10T14:18:10.212019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.215150Z","title":"A data-driven multi-agent autonomous voltage control framework using deep reinforcement learn- ing,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.215150Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:190b5150b8caaaebfde9929f0eecf43f087c29aaab6c2d48bbbef1ab01030980","observation_id":"620325ee-7f5e-46b6-bcbc-cea1bcde9bff","resolution":{"observed_at":"2026-08-10T14:18:10.215150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.218475Z","title":"A centralized reinforcement learning method for multi-agent job schedul- ing in grid,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.218475Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:3475fd6af08f5c7f38f3592fe1680cc026e33f5ef3b636fc8609b6657f8807d8","observation_id":"3fc523a0-a96f-4cf3-9341-f3da9143e6cb","resolution":{"observed_at":"2026-08-10T14:18:10.218475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09152","last_updated":"2019-10-21T05:07:42Z","snapshot_observed_at":"2026-08-16T00:59:06.026084Z","submitted_at":"2019-10-21T05:07:42Z","title":"A New Framework for Multi-Agent Reinforcement Learning -- Centralized Training and Exploration with Decentralized Execution via Policy Distillation","version":1},"cited_work":{"arxiv_id":"1910.09152","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.09152","snapshot_observed_at":"2026-08-10T14:18:10.721889Z","title":"A New Framework for Multi-Agent Reinforcement Learning -- Centralized Training and Exploration with Decentralized Execution via Policy Distillation","venue":"cs.LG","work_id":"76eda1c3-4531-44b5-a7be-2e7317bd1b9e","year":2019},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.222167Z"},"links":{"cited_paper":"/paper/1910.09152","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:35fa623fedcdc6d214ffbc356a304491e79bdffc2a39b439c3c455d6f8587f31","observation_id":"4c757d87-a9d3-4ca0-b4c0-7b5eacd239d5","resolution":{"observed_at":"2026-08-10T14:18:10.725830Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.225634Z","title":"Counterfactual multi-agent policy gradients,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.225634Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:11541b97cf928d45fef5bfc9d7a53bd22e658bbd195dcdba2ee20a5255a4797b","observation_id":"d832a1e3-568f-4383-8981-1f1fe0471745","resolution":{"observed_at":"2026-08-10T14:18:10.225634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.08776","last_updated":"2018-05-22T00:31:03Z","snapshot_observed_at":"2026-08-14T19:12:43.604827Z","submitted_at":"2018-05-22T00:31:03Z","title":"Scalable Centralized Deep Multi-Agent Reinforcement Learning via Policy Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.08776","snapshot_observed_at":"2026-08-10T14:18:10.228944Z","title":"Scalable central- ized deep multi-agent reinforcement learning via policy gradients,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.228944Z"},"links":{"cited_paper":"/paper/1805.08776","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:b305f8f347ea1c57734296efd7c5d3ef82a7423d1937ddb6db0b60c4a11f72bd","observation_id":"470aba8c-c5e7-40d4-8d39-472d0332c892","resolution":{"observed_at":"2026-08-10T14:18:10.228944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.232284Z","title":"Cooperative multi-agent control us- ing deep reinforcement learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.232284Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:bab0cbbe1339a39464f85cf7a2ff138a79ea0da71db842d7c1b27afa3880e00f","observation_id":"a6ce38b1-e0f3-46ec-bf5b-c005932cb6a2","resolution":{"observed_at":"2026-08-10T14:18:10.232284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-14T18:06:54.993797Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-10T14:18:10.235354Z","title":"Exploration by random network distillation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.235354Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:3905339dea755ee4a776e5b4ead28b7cbc6004edb5b59d37e6ec729d42cf98ce","observation_id":"b75ca6a5-10c4-4179-9cf1-2c6be6a66ea7","resolution":{"observed_at":"2026-08-10T14:18:10.235354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.238620Z","title":"Surprise and curiosity for big data robotics,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.238620Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:728c3f780affea7bbcbfb65e55bf460faa62b3bcb0c777a44fff460285b9189e","observation_id":"53bc8a60-7e3e-471f-b9c9-56d26b0fea33","resolution":{"observed_at":"2026-08-10T14:18:10.238620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-15T10:16:02.189582Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-10T14:18:10.241911Z","title":"Minigrid & miniworld: Modular & custom- izable reinforcement learning environments for goal-oriented tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.241911Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:dd8f465c8b374448cf128a56587d25d0a7aab672aeb540933665048265ba173f","observation_id":"47b2dff7-585a-4102-b177-11276443a59b","resolution":{"observed_at":"2026-08-10T14:18:10.241911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.246536Z","title":"Half field offense: An environment for multiagent learning and ad hoc teamwork,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.246536Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:3b1213bb78e19972a4b03ec72a076a25ec86c865e2924e6e012fd2b8ae5c1af4","observation_id":"5ebb1e5a-009f-4eb7-abce-5d041fba7d52","resolution":{"observed_at":"2026-08-10T14:18:10.246536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.249707Z","title":"Microscopic traffic simulation using sumo,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.249707Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:af03f93a53e0f918caca0c8c0f2c06b7223acc6663db8d323cd6e96693a4ff02","observation_id":"b46db65e-ac42-4f6a-accb-5bb5605ec80c","resolution":{"observed_at":"2026-08-10T14:18:10.249707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00424","last_updated":"2021-12-01T11:23:40Z","snapshot_observed_at":"2026-08-15T21:35:57.169210Z","submitted_at":"2021-12-01T11:23:40Z","title":"Multi-Agent Transfer Learning in Reinforcement Learning-Based Ride-Sharing Systems","version":1},"cited_work":{"arxiv_id":"2112.00424","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.00424","snapshot_observed_at":"2026-08-10T14:18:10.685690Z","title":"Multi-Agent Transfer Learning in Reinforcement Learning-Based Ride-Sharing Systems","venue":"cs.LG","work_id":"bd7d2147-b6da-457b-88d2-d52f984f1560","year":2021},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.252833Z"},"links":{"cited_paper":"/paper/2112.00424","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:8d7d16f18870509d0295121bd46cf75a09ae8db33867fa36c95569ed36ca2847","observation_id":"832cbb6c-2e75-4c66-bbca-8a8e7bd811ef","resolution":{"observed_at":"2026-08-10T14:18:10.689291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.256379Z","title":"Markov decision processes,","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.256379Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:79310ff9e48d11436beec6c34f4b3646ee39a942dda9343c92c966efdb9658b2","observation_id":"2f490b55-b72f-4849-9b8c-6f691c75e321","resolution":{"observed_at":"2026-08-10T14:18:10.256379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.259603Z","title":"Planning and acting in partially observable stochastic domains,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.259603Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:657c3b2fe1ff768263c4c5a0cdc53d30a8dd2189c84bce1111998434d7a3c165","observation_id":"8e4ebb8a-6dca-424b-a59d-cbb3a245e405","resolution":{"observed_at":"2026-08-10T14:18:10.259603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.262686Z","title":"Actor-critic algorithms,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.262686Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:acdfc7d0606d6ccd1ffa30503a2c772abeabc6a13230c8f7e6426fad475648e8","observation_id":"8c4de07c-1c0a-4d45-b617-84b41cb0e53c","resolution":{"observed_at":"2026-08-10T14:18:10.262686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.265864Z","title":"Q-learning,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.265864Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:162ebfacbb77686e77bcb282647f8152a35d7c7730a119ddb4feaa3aae4f9622","observation_id":"4692160c-3cc6-4631-8dd1-23464ef9df83","resolution":{"observed_at":"2026-08-10T14:18:10.265864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.269012Z","title":"Robot juggling: implementation of memory-based learn- ing,","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.269012Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:9b8c261abb97d77cdafb4ee60dee33fd8ecb2c68afb06513af13786dfadf659b","observation_id":"c53620a2-f281-4b18-b8b9-fae676464604","resolution":{"observed_at":"2026-08-10T14:18:10.269012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.272585Z","title":"Automatic programming of behavior-based robots using reinforcement learning,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.272585Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:fad39cbd778a0a6a8386f0add77d1ff507159a097c9877431d98e9d33ea87673","observation_id":"8e0c0091-c059-47b7-b285-95b301435c30","resolution":{"observed_at":"2026-08-10T14:18:10.272585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.276181Z","title":"Q-learning for robot control,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.276181Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:8071cebf30e7124216f410464adfe6b291b3ab3767a86564d5e2468f4c208979","observation_id":"f76d3bc4-be1b-43b6-b1ec-aa7f5472507e","resolution":{"observed_at":"2026-08-10T14:18:10.276181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:11.270010Z","title":"Reinforcement learning in the multi-robot domain,","venue":null,"work_id":"b766bfa0-a3b6-4334-9ce6-992c0ac77edc","year":1997},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.279367Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:7fbb21c466440fd2d72bffccb3493142f5d8410f9a405fa211c5da131bbd916b","observation_id":"94360eb1-4b54-499a-9513-c5879251e338","resolution":{"observed_at":"2026-08-10T14:18:11.274584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:11.260470Z","title":"A reinforcement learning algorithm to train a tetris playing agent,","venue":null,"work_id":"19e86155-f911-42ce-9141-17fcfcd04d97","year":2014},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.282380Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:f90993cd0bbc96c5125514f898b67b095b7fc8f5cad5043d5e41c6bde4d14985","observation_id":"66b2b87a-1793-4c70-9692-6c888d12a2cf","resolution":{"observed_at":"2026-08-10T14:18:11.263849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:11.240412Z","title":"Predicting how people play games: Reinforcement learning in experimental games with unique, mixed strategy equilibria,","venue":null,"work_id":"c02e1793-3e7e-47ea-9c28-ff702531fc8d","year":1998},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.288444Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:03e4fec056ccec9c706871f999dff30b503cdff7b614da946a1b82c213b1f82a","observation_id":"6e49f258-b376-44f5-a63c-5a15c1acda90","resolution":{"observed_at":"2026-08-10T14:18:11.244018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:11.229713Z","title":"Samod: Shared autonomous mobility-on-demand using decentralized reinforcement learning,","venue":null,"work_id":"4260f245-effb-47ca-8dca-d6f143fce04b","year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.291917Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:59e835561ab2db3dd7b0bbf84fe9e85fbc4248cf2bc72af69b9a234f5de9ab16","observation_id":"f0485a4c-911d-4ec0-854f-08934e250a9f","resolution":{"observed_at":"2026-08-10T14:18:11.233740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-10T14:18:10.295070Z","title":"Openai gym,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.295070Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:941e1ea382fb93ee1c8622f878194f97afeafef9cfcb95c71bcafaabc267ad13","observation_id":"883c408c-091c-4ef3-a2e8-12159b0a0a04","resolution":{"observed_at":"2026-08-10T14:18:10.295070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.298719Z","title":"Challenges of real-world reinforcement learning: definitions, benchmarks and analysis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.298719Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:3355dfd567521173e7d7848775eaf10a08a52b0c31e78bdebcd8d3f7947a6ca4","observation_id":"6f9c0699-c3b3-4655-90cf-44ae3c0a8bb0","resolution":{"observed_at":"2026-08-10T14:18:10.298719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.12901","last_updated":"2019-04-29T18:40:15Z","snapshot_observed_at":"2026-08-14T16:39:48.171461Z","submitted_at":"2019-04-29T18:40:15Z","title":"Challenges of Real-World Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.12901","snapshot_observed_at":"2026-08-10T14:18:10.301792Z","title":"Challenges of real-world reinforce- ment learning,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.301792Z"},"links":{"cited_paper":"/paper/1904.12901","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:15537a80141cae38a3dc1d302a89a1e421793dc2a5b579f32610de99ec465c04","observation_id":"5f899039-aa5a-45fa-ad51-79e825135256","resolution":{"observed_at":"2026-08-10T14:18:10.301792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:11.214421Z","title":"A logical calculus of the ideas immanent in nervous activity,","venue":null,"work_id":"d6e79604-7186-456b-91a4-a49c86c563d0","year":1943},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.305665Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:35d86ad9a8416f33f4704d5bdf8faadb31efb6e980db4b093400b1a4eb88a75e","observation_id":"d03c0437-ccad-44f8-b4c6-4cc0bd2c1ef8","resolution":{"observed_at":"2026-08-10T14:18:11.217977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:11.204368Z","title":"Learning representations by back-propagating errors,","venue":null,"work_id":"00fcbd1e-ed4e-4018-b8c4-fe7083bb803f","year":1986},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.308854Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:19795fe1fd685ee649f2ae8edd60f07886d24e5ef1c97f5a705e322aa0084f8a","observation_id":"6ce00d39-522c-4f92-bde4-805f679238c6","resolution":{"observed_at":"2026-08-10T14:18:11.208320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:11.195062Z","title":"State-of-the-art in artificial neural network applications: A survey,","venue":null,"work_id":"da928360-ef6e-4c96-b7d8-087be12cb1fe","year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.312176Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:379004f26bd62921dfb4dbeb76b8e2eacd531d8c374d4a67a88c65867105a134","observation_id":"e74f122b-9219-42a4-8302-b34da831fa8b","resolution":{"observed_at":"2026-08-10T14:18:11.198404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:11.185705Z","title":"Deep sparse rectifier neural networks,","venue":null,"work_id":"3ff5cf02-39bc-4b4b-9d00-dc83db61366e","year":2011},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.316410Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:b55c1cb0e471a96da72f0c0a6590a42208725f58b2f5f6efde3da005c58188ab","observation_id":"1ed8d16c-2386-45c9-9e8c-db2408a33eb2","resolution":{"observed_at":"2026-08-10T14:18:11.188953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.320101Z","title":"A fast learning algorithm for deep belief nets,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.320101Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:db1cfbc7e629aa58a508162b9113456db359d0b005d05fadf345a1f6f2a0084c","observation_id":"8d7b48dc-7135-4b2b-9de0-d3779058a52b","resolution":{"observed_at":"2026-08-10T14:18:10.320101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.323268Z","title":"Gradient-based learning applied to document recognition,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.323268Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:01c861ed0be6fa980489403a67e534cfe10bbeeef4d2ebc3a601ec6183e9da7d","observation_id":"66fa8eec-40a1-4935-8f92-ac7e22c45826","resolution":{"observed_at":"2026-08-10T14:18:10.323268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:11.164533Z","title":"Probabilistic interpretation of feedforward classification network outputs, with relationships to statistical pattern recognition,","venue":null,"work_id":"2bf1dcc6-9a39-4c27-ac52-9e076c410b87","year":1990},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.326885Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:b28307ef1b3f480a1939af837ac0185d489097bbc05435a657472650631c1168","observation_id":"f745f936-bbd5-4818-aef6-f6230f8406d3","resolution":{"observed_at":"2026-08-10T14:18:11.168231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.5701","last_updated":"2012-12-22T15:46:49Z","snapshot_observed_at":"2026-08-15T00:34:41.793608Z","submitted_at":"2012-12-22T15:46:49Z","title":"ADADELTA: An Adaptive Learning Rate Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.5701","snapshot_observed_at":"2026-08-10T14:18:10.330135Z","title":"Adadelta: an adaptive learning rate method,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.330135Z"},"links":{"cited_paper":"/paper/1212.5701","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:e31b4bcc0cfb3a5958f1be6dee640ebe553ba67d9e6c47d35906a783ccc16ae6","observation_id":"4a2f7359-ec79-46c3-b98b-fa579d5e17c6","resolution":{"observed_at":"2026-08-10T14:18:10.330135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-10T14:18:10.333581Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.333581Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:80434fc714024b1f3b313f3d682392367dff45234c5156574aaa8339110495a1","observation_id":"ed1a3776-d9a4-4d46-9732-281119dbf755","resolution":{"observed_at":"2026-08-10T14:18:10.333581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.336725Z","title":"Neural networks for machine learning lecture 6a overview of mini-batch gradient descent,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.336725Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:e92e66fda5a76fd8e0b5a22f37ab50d763a6be5592262b24ec9f2aee6142c4e4","observation_id":"02ce3934-0ac4-4cbe-9579-9fa65c048ccb","resolution":{"observed_at":"2026-08-10T14:18:10.336725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.339798Z","title":"Deep learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.339798Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:9e320e62640f272b1d96b9d1d823fdcee2a99b43499e0ce1ebb2cf00be7d1e24","observation_id":"38a82ada-787a-4f85-86dd-d7709c296283","resolution":{"observed_at":"2026-08-10T14:18:10.339798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":88,"verified_exact":3,"verified_fuzzy":9},"total_outbound_references":149},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 149 outbound references and 0 inbound Pith citation observations for arXiv:2501.15495."}