{"as_of":"2026-08-18T11:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:891804b9ce7196833a3cdad876e89fdec4b20259e7ca3f6bfde6271204d730cc","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:02:50.937962Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.11099/citation-record","integrity":"/paper/2411.11099/integrity","json":"/paper/2411.11099/citation-record.json","paper":"/paper/2411.11099"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.450025Z","title":"Decentralized multi-agent deep reinforcement learning in swarms of drones for flood monitoring","venue":null,"work_id":"54dead75-5ba1-47f3-b6c3-87a72716dadd","year":2019},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.816034Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:3cfeea8599f8e76a042fa482a592c2af52e620a56b4de4e5773ffc24028cf289","observation_id":"72d251e7-2bb1-4349-9f65-efd38b2e125a","resolution":{"observed_at":"2026-08-12T19:02:51.452627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.442556Z","title":"Decentralized control of quadrotor swarms with end-to-end deep reinforcement learning","venue":null,"work_id":"023b805e-dce2-4d60-8094-540c6805188d","year":2022},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.819467Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:4b7382e06fb30eeee5f1c0bd8149c0a223f73ec3ad29539faf4dec78b0e3e7bb","observation_id":"57261a35-1a77-42b1-a1f8-afc421fc9a77","resolution":{"observed_at":"2026-08-12T19:02:51.445297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.433813Z","title":"Opportunities for multiagent systems and multiagent reinforcement learning in traffic control","venue":null,"work_id":"b66a3270-49a7-4c69-9bc9-729270b796e1","year":2009},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.822233Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:7cc01ddba8fcdccd7bf1552380eb6b59d780a669004809ecd32310ceba89e36a","observation_id":"3d477659-2268-42e6-9aa9-59a678f415a2","resolution":{"observed_at":"2026-08-12T19:02:51.437131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:50.825257Z","title":"Superhuman ai for heads-up no-limit poker: Libratus beats top professionals","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.825257Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:975fce3829217f71f4c3c1a729908e744b6c56bcf5b6e7434110d848854f0445","observation_id":"f1fe5dcb-5ac1-47db-8a02-1a0b1c86d927","resolution":{"observed_at":"2026-08-12T19:02:50.825257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:50.828554Z","title":"Deep reinforcement learning in a handful of trials using probabilistic dynamics models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.828554Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:e618b69f589f8bdfa903b2024698b7857cef6251a09bf8ae8fc09e272cb159bb","observation_id":"26b1deee-693b-4e3b-8f42-3461600259e3","resolution":{"observed_at":"2026-08-12T19:02:50.828554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.06709","last_updated":"2021-05-07T14:03:40Z","snapshot_observed_at":"2026-08-16T11:38:20.937051Z","submitted_at":"2020-03-14T21:29:09Z","title":"FACMAC: Factored Multi-Agent Centralised Policy Gradients","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.06709","snapshot_observed_at":"2026-08-12T19:02:50.831537Z","title":"Deep multi-agent reinforcement learning for decentralized continuous cooperative control","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.831537Z"},"links":{"cited_paper":"/paper/2003.06709","citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:c12aa26d6776c15179c2fc280ca91d08c89106c94e9af0f4cc5c0505df67ccb4","observation_id":"d05c8313-ede0-4df6-bfe9-d8ed70b62c87","resolution":{"observed_at":"2026-08-12T19:02:50.831537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1605.07127","last_updated":"2017-03-08T01:07:15Z","snapshot_observed_at":"2026-08-15T18:28:49.065735Z","submitted_at":"2016-05-23T18:28:15Z","title":"Learning and Policy Search in Stochastic Dynamical Systems with Bayesian Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.07127","snapshot_observed_at":"2026-08-12T19:02:50.834956Z","title":"Learning and policy search in stochastic dynamical systems with bayesian neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.834956Z"},"links":{"cited_paper":"/paper/1605.07127","citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:f1aece7e265a9b1095b5aea885fff9dbfefdc1c1bda28a87cef9632358005206","observation_id":"2bc4d3b8-fecd-41aa-9329-0572a11feec0","resolution":{"observed_at":"2026-08-12T19:02:50.834956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:50.838105Z","title":"Learning to communicate with deep multi-agent reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.838105Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:1e087b5831186d6bd5bb9b97e9e8f0c05775f0e06117a43b2d83b771f4c00c12","observation_id":"9f2a5d52-d1ab-4360-997b-3474b1b5178b","resolution":{"observed_at":"2026-08-12T19:02:50.838105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:50.840726Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.840726Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:640c50fa0c10a2bb942432a6bd3420b7af9d260f449bf6405e16dc7e29b42d40","observation_id":"253004a3-3f35-48b4-8924-eea47b4436e7","resolution":{"observed_at":"2026-08-12T19:02:50.840726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.411380Z","title":"Uneven: Universal value exploration for multi-agent reinforcement learning","venue":null,"work_id":"7521e3ca-8cd5-4dc3-a342-5d58b0c6835f","year":2021},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.843311Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:4f803b4db99c4fd6beb77004d03f695450cbb76bca0bf9cb140cb3b8873c2c9f","observation_id":"b09c1bca-cda0-4783-bced-1b1e04acfc49","resolution":{"observed_at":"2026-08-12T19:02:51.414338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.403043Z","title":"A survey of learning in multiagent environments: Dealing with non-stationarity","venue":null,"work_id":"42423244-b13b-41b6-8638-7d6a24df88c0","year":2017},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.845499Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:dfae60a179add97a18e9d158dff518b36317261c7fa21328081e96c18f8561cd","observation_id":"66319e40-e65c-4364-aab4-73d23abc5cb6","resolution":{"observed_at":"2026-08-12T19:02:51.405993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.394600Z","title":"I2q: A fully decentralized q-learning algorithm","venue":null,"work_id":"d48462d8-bce8-492b-9ec1-241138c63ab4","year":2022},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.847732Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:d8431e4cacc1ce5f0ca9ede2cea3c5f9eb3c707b5590d70be73f07c64b46ebac","observation_id":"d7e7c90c-d383-4bd5-9e30-fee9876f8e8d","resolution":{"observed_at":"2026-08-12T19:02:51.397683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:50.849913Z","title":"What uncertainties do we need in bayesian deep learning for computer vision? Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.849913Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:a89db68ea5c961903d21bfd3f20220ae72ae1f3b3a15d934ad159d98acca4727","observation_id":"5c411b02-7e39-4cb0-bf6b-d0a2aada98d7","resolution":{"observed_at":"2026-08-12T19:02:50.849913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:50.852126Z","title":"Simple and scalable predictive uncertainty estimation using deep ensembles","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.852126Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:02d3d6ed0e91bee5fcdf8cd24e45de57400adce50aa87452ecaf12abef1a1b8f","observation_id":"12cca604-5929-4333-9beb-2c192a5ffc4d","resolution":{"observed_at":"2026-08-12T19:02:50.852126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.376110Z","title":"An algorithm for distributed reinforcement learning in cooperative multi-agent systems","venue":null,"work_id":"27045a54-c0eb-484f-a7da-2d36367e4cbe","year":2000},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.854498Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:be552bd850ba35604161813b970d604b3eaac6adab27f9ed347b9edcaf2aa31f","observation_id":"d6d90c6b-4a4d-4bea-9318-a30f84f3b249","resolution":{"observed_at":"2026-08-12T19:02:51.380153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.367102Z","title":"Solving homogeneous and heterogeneous cooperative tasks with greedy sequential execution","venue":null,"work_id":"d07d13cb-e457-496d-982a-c013cb4a6346","year":2024},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.857146Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:d0726aac291b5ca8445d1d3586da940b915de3d5acb27fb2825b26c00e419584","observation_id":"21c22cbf-69d6-47ac-b469-763ee94c2cd0","resolution":{"observed_at":"2026-08-12T19:02:51.370306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:50.859294Z","title":"Multi-agent actor-critic for mixed cooperative-competitive environments","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.859294Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:316307c3296cb9ffc257305cf25daea220da4b630a180280e96152d6785a8702","observation_id":"a850375b-5929-4165-a91b-7639c631c786","resolution":{"observed_at":"2026-08-12T19:02:50.859294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.353727Z","title":"Hysteretic q-learning: an algorithm for decentralized reinforcement learning in cooperative multi-agent teams","venue":null,"work_id":"1ecb79a8-02d5-48e0-bdac-d66711c1116d","year":2007},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.861937Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:d1cf86bf6de3f0def6e07f0489b8a67cb703ad7c0a2cf91bd9bc9c6a6cd7b417","observation_id":"db37c27d-fe6f-4d6b-a197-84f7a2344afc","resolution":{"observed_at":"2026-08-12T19:02:51.356655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.344933Z","title":"Independent reinforcement learners in cooperative markov games: a survey regarding coordination problems","venue":null,"work_id":"1c37a11d-69b9-45c0-ac28-bec8d34da455","year":2012},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.864580Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:10df6c76e768be2764786f9470bca90fccfba2638b7848d14e1deaefbf67d6eb","observation_id":"7c248329-1e89-43f5-89f0-38ba86288171","resolution":{"observed_at":"2026-08-12T19:02:51.348192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.336126Z","title":"Deep exploration via bootstrapped dqn","venue":null,"work_id":"fa53a96c-fec1-430f-a01c-582a94499fe1","year":2016},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.869836Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:71beb3794bcf254ba7a2372de7ecac80f8b3dce08336e3412292623a1ecd89cc","observation_id":"701cad7e-da14-4fe5-ac1e-deea4d84aed4","resolution":{"observed_at":"2026-08-12T19:02:51.339002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.05096","last_updated":"2019-05-07T09:34:03Z","snapshot_observed_at":"2026-08-14T18:28:47.727469Z","submitted_at":"2018-09-13T15:46:55Z","title":"Negative Update Intervals in Deep Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1809.05096","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.05096","snapshot_observed_at":"2026-08-12T19:02:51.177794Z","title":"Negative Update Intervals in Deep Multi-Agent Reinforcement Learning","venue":"cs.MA","work_id":"b7f9a3d5-5bf3-465b-aac8-741280894bb4","year":2018},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.872930Z"},"links":{"cited_paper":"/paper/1809.05096","citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:d9e4cfcb5b1191df443995af965f1f5cceb29ea481e781af3638c1a2a6d2e010","observation_id":"b301c3ff-e77a-4cbe-bccb-d715a47f91ac","resolution":{"observed_at":"2026-08-12T19:02:51.181171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.327975Z","title":"The analysis and design of concurrent learning algorithms for cooperative multiagent systems","venue":null,"work_id":"f86f318a-8797-44b6-a9d7-84f80c47f846","year":2007},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.876083Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:4f0c3f0e9593c6138099a6580e3c2caf69d7dfb2fbf20f1c1cd42fd14cc5a9b3","observation_id":"e39c91a2-a02c-4551-a808-27884d86b190","resolution":{"observed_at":"2026-08-12T19:02:51.330797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.319771Z","title":"Biasing coevolutionary search for optimal multiagent behaviors","venue":null,"work_id":"4f636629-765a-4310-ae4f-bd90a46602e7","year":2006},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.878684Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:098b2a5742e50c6367f2d5e71dba14713787d62b76f10e23ce273930457a4efb","observation_id":"c73bb3eb-2cf8-4b5e-8a27-9cca2c31ce0e","resolution":{"observed_at":"2026-08-12T19:02:51.322597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.311630Z","title":"QMIX : Monotonic value function factorisation for deep multi-agent reinforcement learning","venue":null,"work_id":"d33a9511-409d-4405-84e4-3ad73d14154c","year":2018},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.881343Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:15b1d62b687b6df1e9517bb3963254e5f71b9267ba49fd6620114bc56a3dde3c","observation_id":"9dbfb156-17b4-4692-9c2b-732954e7d223","resolution":{"observed_at":"2026-08-12T19:02:51.314344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.302732Z","title":"Weighted qmix: Expanding monotonic value function factorisation for deep multi-agent reinforcement learning","venue":null,"work_id":"095d48d8-abc9-4955-8c39-ec2d0155f432","year":2020},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.883933Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:b87c051c7a2aa517d581be9fde1a81484aeaf4d9b6ea644109c4e92aae0de0fc","observation_id":"94d80098-1ecc-42c1-8edd-4dbcab3f8bc3","resolution":{"observed_at":"2026-08-12T19:02:51.305956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:50.886689Z","title":"Monte Carlo statistical methods, volume 2","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.886689Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:7758ec26d3a8215271c7212aaf9dfbf54f7d806cdb50e2321c1d2d305d1bf020","observation_id":"5c9c8afc-ee6d-4c4f-8a05-f71ba4094d66","resolution":{"observed_at":"2026-08-12T19:02:50.886689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11277-021-08362-6","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:50.956433Z","title":"Sahraoui, M","venue":null,"work_id":"90ed2eab-31a9-41a8-8a3b-8778d45d43ab","year":2021},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.889334Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:dd28d1c0cdba6146f9486e0976425e259eac8c950af9e4f122df8d0dc0dc1053","observation_id":"d9f1adbf-ade2-4182-9951-8e1ebbc70782","resolution":{"observed_at":"2026-08-12T19:02:50.960269Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.289762Z","title":"Planning to explore via self-supervised world models","venue":null,"work_id":"72f39090-86cb-43d8-9493-fc164f367099","year":2020},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.892203Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:357ac10d3fbb3c5af7ab07056566fdb3dbcf872a9f36f2f0c2c40020345f7892","observation_id":"c766bd39-b8c6-4f60-9cc6-262f82d7d60e","resolution":{"observed_at":"2026-08-12T19:02:51.292694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.03295","last_updated":"2016-10-11T12:09:03Z","snapshot_observed_at":"2026-08-14T21:35:45.210326Z","submitted_at":"2016-10-11T12:09:03Z","title":"Safe, Multi-Agent, Reinforcement Learning for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.03295","snapshot_observed_at":"2026-08-12T19:02:50.894967Z","title":"Safe, multi-agent, reinforcement learning for autonomous driving","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.894967Z"},"links":{"cited_paper":"/paper/1610.03295","citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:dccf4f87fd0353585bceeea82d8e5dc40d66dbaaa0d758cedf1dd6990ba51203","observation_id":"b658dd84-9677-499e-bdec-cc87e4438fda","resolution":{"observed_at":"2026-08-12T19:02:50.894967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02733","last_updated":"2024-09-23T16:43:25Z","snapshot_observed_at":"2026-08-16T16:10:44.612430Z","submitted_at":"2022-12-06T03:41:08Z","title":"CURO: Curriculum Learning for Relative Overgeneralization","version":3},"cited_work":{"arxiv_id":"2212.02733","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.02733","snapshot_observed_at":"2026-08-12T19:02:51.158111Z","title":"CURO: Curriculum Learning for Relative Overgeneralization","venue":"cs.LG","work_id":"b27f10f5-13f2-4e92-ad29-1d93c79ae7bb","year":2022},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.898138Z"},"links":{"cited_paper":"/paper/2212.02733","citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:80a4c7b07accbe4dfbc4eaba68c5f31923f10d907ac5d79b6dea624c3c529b61","observation_id":"e89b844a-6ce9-48c8-89dc-13ba3e2f842b","resolution":{"observed_at":"2026-08-12T19:02:51.162373Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:50.900982Z","title":"Qtran: Learning to factorize with transformation for cooperative multi-agent reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.900982Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:300fc50c769a44a410a6049ff7382de0a5a9703cc0cf44c03b0afa24a1bf17cb","observation_id":"e58a1369-5a43-4c75-8588-7ed33cf1fc03","resolution":{"observed_at":"2026-08-12T19:02:50.900982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:50.903553Z","title":"Lectures on parametric optimization: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.903553Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:0481fbd8d831589ecc45faf33382e16cff235cd67f8b1db73d1c8a4f794362ca","observation_id":"6257f265-875c-483e-aca8-2c1362057803","resolution":{"observed_at":"2026-08-12T19:02:50.903553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.270634Z","title":"A fully decentralized surrogate for multi-agent policy optimization","venue":null,"work_id":"690a9bc4-d260-403d-9f47-50030d901afb","year":2023},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.906223Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:ceca40bb2e4206e3413634b7e6cbce613f015cff66a564719e5cb12fccd6629f","observation_id":"f49fef85-120a-4fa9-8d88-4b18567286a0","resolution":{"observed_at":"2026-08-12T19:02:51.273828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.260200Z","title":"Exploit reward shifting in value-based deep-rl: Optimistic curiosity-based exploration and conservative exploitation via linear reward shaping","venue":null,"work_id":"9d975a34-1a72-486e-af16-736e3aaadb0b","year":2022},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.908920Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:2ed0c7467d64805f7d9d266940e29243c39b0465768a9cbebb75d6220766e9ae","observation_id":"fa267891-e6d2-41ea-b754-9f44bec6948d","resolution":{"observed_at":"2026-08-12T19:02:51.263879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.250059Z","title":"Multi-agent reinforcement learning: Independent vs","venue":null,"work_id":"88c4a69f-7a05-4b48-a9ed-f2cd76e3068b","year":1993},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.912537Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:9fc8ad7dbc9f9ba9dbd3dc86ba2d0f40449de721a26f68e39d167a25bf8329f2","observation_id":"18c1f776-6e84-4c0c-aa5e-71197a4dd426","resolution":{"observed_at":"2026-08-12T19:02:51.253083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.241689Z","title":"Multi-agent deep reinforcement learning-based trajectory planning for multi-uav assisted mobile edge computing","venue":null,"work_id":"7327ad7f-6b44-4293-a71e-678b75f7385e","year":2020},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.915438Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:bb63cc912c15a6b000553f61cb7411be67bb88eb41b77cc79bfd2b6ad611b4f8","observation_id":"23201714-95c8-48f9-b119-170794099c0f","resolution":{"observed_at":"2026-08-12T19:02:51.244685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.233402Z","title":"Lenient learning in independent-learner stochastic cooperative games","venue":null,"work_id":"92118765-68a8-4b99-8e9b-a791a7af4f36","year":2016},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.918218Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:70f06075b82b939a5c994e5e92bc33fd534f73cd51a38c3f28a6aaf6d52208c5","observation_id":"9debfa1b-c21c-4a10-ab2f-55d3760cef5a","resolution":{"observed_at":"2026-08-12T19:02:51.236459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09817","last_updated":"2018-04-25T22:03:27Z","snapshot_observed_at":"2026-08-14T19:21:51.728428Z","submitted_at":"2018-04-25T22:03:27Z","title":"Multiagent Soft Q-Learning","version":1},"cited_work":{"arxiv_id":"1804.09817","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.09817","snapshot_observed_at":"2026-08-12T19:02:51.146713Z","title":"Multiagent Soft Q-Learning","venue":"cs.AI","work_id":"04a28c00-7cd1-4447-901e-974150f3c166","year":2018},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.920797Z"},"links":{"cited_paper":"/paper/1804.09817","citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:7c13379804d93ac5ca1e71a6082578775c58b1cbf06fe92eb819d3e2f45fb02a","observation_id":"2a0cc246-8bda-41a2-9881-b2d6d38cdd58","resolution":{"observed_at":"2026-08-12T19:02:51.150058Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.225838Z","title":"An analysis of cooperative coevolutionary algorithms","venue":null,"work_id":"6f710660-59b7-49c0-969f-46be2ed15877","year":2004},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.923914Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:2d4d00feba544e291d2b8bbab0f7956acfb49d1482e6d97bec6ac2451b31a142","observation_id":"0e30e6ec-ad04-41e5-be26-db7c23e96791","resolution":{"observed_at":"2026-08-12T19:02:51.228257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-08-16T18:24:08.228597Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-08-12T19:02:50.926448Z","title":"Uncertainty weighted actor-critic for offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.926448Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:309a97714c7efa3b86b4eadd59cd0ada986e49a6d082d6fda5ce9a560266dc6c","observation_id":"c7714f3f-054e-41d6-b19f-15301083ebf4","resolution":{"observed_at":"2026-08-12T19:02:50.926448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.218273Z","title":"Learning multi-agent coordination for enhancing target coverage in directional sensor networks","venue":null,"work_id":"3db1d494-1f8f-42b0-baca-bbff86360d9a","year":2020},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.929065Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:2f3001dcb378c06de54ebdf79382d33c4394b69119f628ea496f36d007f95677","observation_id":"baad5374-9635-4b6f-80d0-27b18ba0bbbc","resolution":{"observed_at":"2026-08-12T19:02:51.220966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:50.931292Z","title":"The surprising effectiveness of ppo in cooperative multi-agent games","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.931292Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:e5bab64acebfcda2a56e53dbb50f513cf88495aa27ade4919d5df8a115b166ea","observation_id":"6d5c0fa9-3be5-4485-8e7b-c5b38728aa6b","resolution":{"observed_at":"2026-08-12T19:02:50.931292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2294.2023","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.127574Z","title":null,"venue":null,"work_id":"b3d1a4a5-08a8-40f9-abbd-f6fc01d6d2c2","year":2023},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.933532Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:0538a3c7c4b149b43822aa67de4036b569f1bf0a404999f2b54968006120b6cd","observation_id":"6257f696-f919-422d-a40c-a81bc2672f00","resolution":{"observed_at":"2026-08-12T19:02:51.131717Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:02:51.203758Z","title":"Smarts: An open-source scalable multi-agent rl training school for autonomous driving","venue":null,"work_id":"8b1b79bb-6635-4da8-8708-63aa0b2483be","year":2020},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.935751Z"},"links":{"citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:4e4b1b552a13fbdc60062e33157cb0a8255e742c1f41aaf8ad7cea6a33b756b6","observation_id":"161b8611-60a8-4713-b66f-16235487f7b7","resolution":{"observed_at":"2026-08-12T19:02:51.207029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08975","last_updated":"2024-10-18T10:14:58Z","snapshot_observed_at":"2026-08-16T17:13:57.346196Z","submitted_at":"2022-03-16T22:39:46Z","title":"A Survey of Multi-Agent Deep Reinforcement Learning with Communication","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08975","snapshot_observed_at":"2026-08-12T19:02:50.937962Z","title":"A survey of multi-agent reinforcement learning with communication","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.937962Z"},"links":{"cited_paper":"/paper/2203.08975","citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:faae86686e491e24a7a1cd384240b4f159c2c625acd1007864bdd86a8564c650","observation_id":"15ce17ea-bca8-44f1-92d6-9bbf30194d75","resolution":{"observed_at":"2026-08-12T19:02:50.937962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":5,"verified_fuzzy":24},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2411.11099."}