{"as_of":"2026-08-11T05:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b40d47e3b02f31614098e432a3a5c0ce3efd884814743fd7ab61eda81984421","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T04:16:54.807723Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.03506/citation-record","integrity":"/paper/2502.03506/integrity","json":"/paper/2502.03506/citation-record.json","paper":"/paper/2502.03506"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1906.02138","last_updated":"2019-06-05T16:56:54Z","snapshot_observed_at":"2026-07-06T07:58:12.570715Z","submitted_at":"2019-06-05T16:56:54Z","title":"Exploration with Unreliable Intrinsic Reward in Multi-Agent Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1906.02138","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.02138","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploration with Unreliable Intrinsic Reward in Multi-Agent Reinforcement Learning","venue":"cs.AI","work_id":"95882227-f4d0-4c15-8436-a6c8a9bec34a","year":2019},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"cited_paper":"/paper/1906.02138","citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:8f6e50a2e8130397a5816cbf48f3bad94a59e53cbb007520b94103438d06d381","observation_id":"8d4aad54-5a9c-494e-81d3-b7f10e0e85e7","resolution":{"observed_at":"2026-05-23T04:17:30.943737Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The dynamics of reinforcement learning in cooperative multiagent systems","venue":null,"work_id":"ba4d8095-2622-4050-8607-b338234fcba3","year":1998},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:fb0f30d70dcb7fc9302807360ae2d48e4cf462d0b2dd701de06203a0c3ea7d64","observation_id":"28fa6271-c188-44fe-a5cc-1d07c8c45d4a","resolution":{"observed_at":"2026-05-23T04:17:31.801505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stabilising expe- rience replay for deep multi-agent reinforcement learning","venue":null,"work_id":"85245414-f334-4cfd-a67c-8cedb0f99da0","year":2017},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:d3135b9079afe75a5a89b9753283995771a932a0b7fe3e524d62ac25a2685d34","observation_id":"440c6bfa-76f0-4343-82ec-77bd178c0ebd","resolution":{"observed_at":"2026-05-23T04:17:31.746411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Counterfactual multi-agent policy gradients","venue":null,"work_id":"6c88bf02-a61b-4090-ba3c-ebe3c314160e","year":2018},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:4e8d76509dc49611081f7133e78da394dab35a512a556e856b36bf568de12b9d","observation_id":"3e3b0115-ad2a-446b-9b21-6580b0aea4c6","resolution":{"observed_at":"2026-05-23T04:17:31.785800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cirs: Bursting filter bubbles by counterfactual interactive recommender system","venue":null,"work_id":"27ccfd16-8363-4ef4-8aba-d2a595d39f16","year":2023},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:a4cacedd4395d02eb491b6de6103297a330b68b16afc129910c9b956ecaa1334","observation_id":"ccf0af2c-98b7-43a9-9fd1-183ba17c465e","resolution":{"observed_at":"2026-05-23T04:17:31.789834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sampling efficient deep reinforcement learning through preference- guided stochastic exploration","venue":null,"work_id":"2514a963-9e20-4923-94b2-842ba96081be","year":2023},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:46f6dfde664c3bbc5027cd128008f169880b0845f585c47778ef0aa43aeee663","observation_id":"503cfa3a-9b97-4e47-be70-8eec28cc4376","resolution":{"observed_at":"2026-05-23T04:17:31.797050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Actor- attention-critic for multi-agent reinforcement learning","venue":null,"work_id":"3d5e7a1c-18e5-475d-af16-5aadfb342c8a","year":2019},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:a6bb2c51d79f1bebe38fbf49933e169daeb7dc2dce1eb600389e37fd53af9126","observation_id":"eb549330-d5c8-4138-9a51-50d80196d2d5","resolution":{"observed_at":"2026-05-23T04:17:31.793459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.02732","last_updated":"2020-06-04T09:43:52Z","snapshot_observed_at":"2026-08-10T02:41:48.949349Z","submitted_at":"2020-06-04T09:43:52Z","title":"A Maximum Mutual Information Framework for Multi-Agent Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2006.02732","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.02732","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A maximum mutual infor- mation framework for multi-agent reinforcement learning","venue":null,"work_id":"819ed36d-aec6-465e-852c-3a61f8d43ce5","year":2020},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"cited_paper":"/paper/2006.02732","citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:b2e19d6623742c81539de1d0a874d9de521b3ef03120a3fe9356e72b8882faf1","observation_id":"2fff0a42-23cb-4797-acc6-6e8a5edbce07","resolution":{"observed_at":"2026-05-23T04:17:30.928004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-agent reinforcement learning for traffic signal control: A cooperative approach","venue":null,"work_id":"52e8ca81-0b2c-4aa3-b50d-3acd433895b7","year":2023},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:7ffd576d91d8a59ed3a3791a675cfb08caa31ef57fb8cae139e3b0f33ad43b75","observation_id":"892fa9bd-5464-416a-969e-728259483c98","resolution":{"observed_at":"2026-05-23T04:17:31.734601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A unified game- theoretic approach to multiagent reinforcement learning","venue":null,"work_id":"600576d5-b15d-430b-bfc0-6df289a6298d","year":2017},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:185380c532445acecc8500ac7894eec9acfb47dec147d273cee0e64335b4860e","observation_id":"aae924d3-e707-4255-91fb-fc0d536bdac8","resolution":{"observed_at":"2026-05-23T04:17:31.781804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimistic value instructors for co- operative multi-agent reinforcement learning","venue":null,"work_id":"ef9de4e3-cd27-440a-aef4-f3e8f16483e6","year":2024},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:100168e4406f9ed6501201a59a28308754048c2748794832a7cb6833266509c8","observation_id":"5f3e2173-aa79-455d-8cf5-0d511a204eec","resolution":{"observed_at":"2026-05-23T04:17:31.778040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Markov games as a framework for multi-agent reinforcement learning","venue":null,"work_id":"10c70178-0c13-4898-80ab-0e16437d3d09","year":1994},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:d4b02675d32b8f841b6e1ef41a6df36e4cab0847d1635a79483cf044b701de18","observation_id":"baf7b414-d434-4504-abaf-5e089e76c9e6","resolution":{"observed_at":"2026-05-23T04:17:31.742587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cooperative exploration for multi-agent deep reinforcement learning","venue":null,"work_id":"d21fe4ad-c6a8-4b8c-8d2d-05fccf60da26","year":2021},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:bcfa10295b5eb6ff455a1e0994d3f41aefb0ebad3034fe10d279eaff351021ee","observation_id":"5debd818-3b4c-473a-aac7-db4c96854143","resolution":{"observed_at":"2026-05-23T04:17:31.774269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi- agent actor-critic for mixed cooperative-competitive envi- ronments","venue":null,"work_id":"b96dccf0-2b1e-4ec5-9fbd-7139ca0360c1","year":2017},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:ca24978746929e02376fd1fd88df9b96e2dcc6645c3fd277727d982f617d5bf6","observation_id":"aed44080-2486-40ba-ab85-1b01755c96a4","resolution":{"observed_at":"2026-05-23T04:17:31.738504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06319","last_updated":"2020-06-14T19:43:28Z","snapshot_observed_at":"2026-07-06T07:21:24.277262Z","submitted_at":"2018-12-15T16:31:19Z","title":"Likelihood Quantile Networks for Coordinating Multi-Agent Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"1812.06319","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.06319","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Likelihood quantile networks for coordinating multi-agent reinforcement learning","venue":null,"work_id":"3f1f42e7-82ad-44fd-8952-19e0ea0e69b8","year":2018},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"cited_paper":"/paper/1812.06319","citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:ba585240e4380c9ab63815c6df9f5f5542d2f33561823d9f19f811804328f0ed","observation_id":"598393ff-2c5b-4228-b744-c825964102a1","resolution":{"observed_at":"2026-05-23T04:17:30.933279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07869","last_updated":"2021-11-09T10:42:04Z","snapshot_observed_at":"2026-08-09T21:21:10.717989Z","submitted_at":"2020-06-14T11:22:53Z","title":"Benchmarking Multi-Agent Deep Reinforcement Learning Algorithms in Cooperative Tasks","version":4},"cited_work":{"arxiv_id":"2006.07869","doi":"10.48550/arxiv.2006.07869","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking multi-agent deep reinforcement learn- ing algorithms in cooperative tasks","venue":"arXiv (Cornell University)","work_id":"ffcc70b2-bfb7-4e18-a3a9-c4614c3bc974","year":2006},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"cited_paper":"/paper/2006.07869","citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:25da42b46e72bc0971b1b005e86b67d99c599f4a9c719973057055280bd3c2b9","observation_id":"d1922028-8854-4da9-97d6-ebce5426a694","resolution":{"observed_at":"2026-05-23T04:17:30.907248Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Residual q-networks for value function factorizing in multiagent reinforcement learning","venue":null,"work_id":"44dc3a63-7ff6-497d-98e3-f029d840f639","year":2022},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:8fb8bf7baeb1ce7fec97ac3cc690ebcb021c04637ccb9eeeb8e38a3286e9d4b6","observation_id":"7382ba68-2bbd-47a7-8697-4572e85afe5e","resolution":{"observed_at":"2026-05-23T04:17:31.770631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04043","last_updated":"2019-12-09T07:26:52Z","snapshot_observed_at":"2026-08-10T17:28:09.498763Z","submitted_at":"2019-02-11T18:43:53Z","title":"The StarCraft Multi-Agent Challenge","version":5},"cited_work":{"arxiv_id":"1902.04043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1902.04043","snapshot_observed_at":"2026-07-04T19:30:07.613613Z","title":"S., Farquhar, G., Nardelli, N., Rudner, T","venue":null,"work_id":"2f26b259-cf76-40f3-b027-6946ef7763c8","year":1902},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"cited_paper":"/paper/1902.04043","citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:104f2d875e6f13fa5b26fca4313d3ecadfced77d28aabea4aa246a83c35f31ae","observation_id":"5e9f1047-0c1b-4787-80cc-b805414b23a1","resolution":{"observed_at":"2026-05-23T04:17:30.922080Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.03295","last_updated":"2016-10-11T12:09:03Z","snapshot_observed_at":"2026-08-03T05:49:14.071341Z","submitted_at":"2016-10-11T12:09:03Z","title":"Safe, Multi-Agent, Reinforcement Learning for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"1610.03295","doi":null,"metadata_source":"pith","pith_arxiv_id":"1610.03295","snapshot_observed_at":"2026-07-03T12:38:07.204958Z","title":"Safe, Multi-Agent, Reinforcement Learning for Autonomous Driving","venue":"cs.AI","work_id":"07a2fd5a-1c96-4cb5-882a-57c789ddbf89","year":2016},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"cited_paper":"/paper/1610.03295","citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:4013013d14f06d926bcdd3c26d69a232a152388971e1567ea06d1a3bf09602bc","observation_id":"3bb3f69d-8882-48fa-9ba7-10376295c472","resolution":{"observed_at":"2026-05-23T04:17:30.956610Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Resq: A residual q function-based approach for multi-agent reinforcement learning value factoriza- tion","venue":null,"work_id":"4355f6e9-ad55-4ac9-87a2-0b3edfcee70d","year":2022},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:3f2fa315fb20edc966b7324818c6e4e01978b8cc1218f5431f8196505ff263e8","observation_id":"6cf9922e-8d22-403d-a9fa-cc4706fea37d","resolution":{"observed_at":"2026-05-23T04:17:31.758213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qtran: Learn- ing to factorize with transformation for cooperative multi- agent reinforcement learning","venue":null,"work_id":"08348f9b-ef71-41e9-a111-07d071a564c2","year":2019},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:72be381af6d61ce4954eaaf43237f7ccdf4b6f9d675a1bee3031ae8c79f1fc97","observation_id":"78741196-64ef-4eec-86db-bf3de7557ce7","resolution":{"observed_at":"2026-05-23T04:17:31.762226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dfac framework: Factorizing the value function via quantile mixture for multi-agent distribu- tional q-learning","venue":null,"work_id":"76edf6a6-7ae2-4843-bbed-8f7678c10849","year":2021},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:886846fcb3dc4f0ebc52defb76f6ab4b327ef4d908d9442c48def90f5f601e33","observation_id":"58ef8e98-0c50-44e1-ab79-74985af328e2","resolution":{"observed_at":"2026-05-23T04:17:31.766472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05296","last_updated":"2017-06-16T14:47:21Z","snapshot_observed_at":"2026-07-06T05:47:10.770104Z","submitted_at":"2017-06-16T14:47:21Z","title":"Value-Decomposition Networks For Cooperative Multi-Agent Learning","version":1},"cited_work":{"arxiv_id":"1706.05296","doi":null,"metadata_source":"pith","pith_arxiv_id":"1706.05296","snapshot_observed_at":"2026-07-04T19:30:07.924598Z","title":"Value-Decomposition Networks For Cooperative Multi-Agent Learning","venue":"cs.AI","work_id":"97c129f4-4b12-4e2d-a662-3431772ad2f6","year":2017},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"cited_paper":"/paper/1706.05296","citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:95881040aecc90845b46eb26dbe8f129593b4392985abd5ce8ce0f43ae5fbd8e","observation_id":"8ffdbc16-ac46-4810-a962-23a104ba1e77","resolution":{"observed_at":"2026-05-23T04:17:30.912295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05512","last_updated":"2019-10-12T07:14:33Z","snapshot_observed_at":"2026-07-06T08:28:58.131087Z","submitted_at":"2019-10-12T07:14:33Z","title":"Influence-Based Multi-Agent Exploration","version":1},"cited_work":{"arxiv_id":"1910.05512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.05512","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Influence-based multi-agent explo- ration","venue":null,"work_id":"3aab8645-bf8b-4962-bbc2-60a58cc65b4b","year":2019},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"cited_paper":"/paper/1910.05512","citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:2f4fcd2707cab4ea7fe26649196955122cba83e513db172dd8f0b0f751ea3692","observation_id":"33a79463-f57b-475e-b3ad-20b001c51f8c","resolution":{"observed_at":"2026-05-23T04:17:30.949668Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.01062","last_updated":"2021-10-04T01:36:59Z","snapshot_observed_at":"2026-08-11T01:56:41.794818Z","submitted_at":"2020-08-03T17:52:09Z","title":"QPLEX: Duplex Dueling Multi-Agent Q-Learning","version":3},"cited_work":{"arxiv_id":"2008.01062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2008.01062","snapshot_observed_at":"2026-07-04T12:59:52.045601Z","title":"Qplex: Duplex dueling multi-agent q-learning","venue":null,"work_id":"39d9765a-eb72-4658-b5e1-d5c40ad2db08","year":2020},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"cited_paper":"/paper/2008.01062","citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:d2a1c3100b272b5f6c5c3d6d1f7284461e2b256fcdd7e864ed72e93964094790","observation_id":"152f135b-43f8-4049-9623-59100e86958d","resolution":{"observed_at":"2026-05-23T04:17:30.938525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"En- hancing collaboration in multi-agent reinforcement learn- ing with correlated trajectories","venue":null,"work_id":"7bcad6c2-eebf-4451-81b3-8eb56e955a03","year":2024},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:c766e10e019e62a9f89e23674fe84fe6940664b5e25621916ecabcd289eea763","observation_id":"47e915b9-1ee9-4749-a7a4-76832870e21d","resolution":{"observed_at":"2026-05-23T04:17:31.810003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fully decentral- ized multi-agent reinforcement learning with networked agents","venue":null,"work_id":"ca2c65e6-b808-4ec0-8e13-5318369b64b6","year":2018},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:c99cb9c1d94ef334248f5d4c86d45e326ccc2c9b630a123f0c465b63327fa871","observation_id":"3bf41391-8c21-4374-937f-80f6536a38ff","resolution":{"observed_at":"2026-05-23T04:17:31.806131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Condi- tionally optimistic exploration for cooperative deep multi- agent reinforcement learning","venue":null,"work_id":"e5fc8881-18a7-4b1e-ae37-51a20d361530","year":2023},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:c3065b3717ee94570e791bb14838a9f7f241becc891d1c9bf46a05aff3317dbb","observation_id":"871cbf58-fcba-4061-823a-0f2f95f7812e","resolution":{"observed_at":"2026-05-23T04:17:31.754518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qdap: Downsizing adaptive policy for cooperative multi-agent reinforcement learning","venue":null,"work_id":"c42c2c20-9a47-4d91-9180-8c8664ebb6f4","year":2024},"citing_paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:54.807723Z"},"links":{"citing_paper":"/paper/2502.03506"},"observation_digest":"sha256:4c26b8ae82bc73a3454ddc25c32a6144f3ca20c7ba643702fbb9dc9533accdda","observation_id":"a4484c9f-959e-48e1-9f12-df838671ca77","resolution":{"observed_at":"2026-05-23T04:17:31.750422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.03506","last_updated":"2026-05-04T09:30:33Z","latest_version":2,"primary_category":"cs.MA","snapshot_observed_at":"2026-07-06T20:31:50.759186Z","submitted_at":"2025-02-05T12:06:54Z","title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":8,"verified_fuzzy":20},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2502.03506."}