{"as_of":"2026-08-17T15:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee0bcfc86a30bd4cfce4d54ea3fef1e30370555448f3b39fcb00d22e3b6c4b8c","coverage":[{"denominator":152,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:06:35.668035Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.12753/citation-record","integrity":"/paper/2608.12753/integrity","json":"/paper/2608.12753/citation-record.json","paper":"/paper/2608.12753"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.195886Z","title":"2020 , publisher=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.195886Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:0fe5be310c805b2543c902767a60b8c1c7a88afca9ba67f31fc686937e5c8b55","observation_id":"badda87a-aa63-496b-9f84-9aafbe6eebd0","resolution":{"observed_at":"2026-08-16T00:06:35.195886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.201329Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.201329Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:96ff95beef570b55b90ed7bce4e429b86f5fc9fc091e62111c6f84f74aea89cf","observation_id":"5306fead-73ee-4bbb-9836-8da0e6eae3ed","resolution":{"observed_at":"2026-08-16T00:06:35.201329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.206002Z","title":"2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.206002Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:d4d5bf06a778d8fce985cdc0259c3d1aff746c4bb9dbd4b7b2654b98bf580bdc","observation_id":"6f6b76eb-73f5-4848-925b-7342b910b81a","resolution":{"observed_at":"2026-08-16T00:06:35.206002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.210594Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.210594Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:c8b1565e0b7d04d2235520515a3be338319a4d2ba1b1734c545f3d51aaf7c755","observation_id":"707b6eab-8dee-4737-a9ff-744d2a693dd5","resolution":{"observed_at":"2026-08-16T00:06:35.210594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.215165Z","title":"IEEE Transactions on Automatic Control , volume=","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.215165Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:6e4eb9d29919e4a01371b1938faed120fd48d62a7476862e4c12e64aeca60578","observation_id":"d535b898-f8c5-406d-8085-798a1ef61a3c","resolution":{"observed_at":"2026-08-16T00:06:35.215165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.219876Z","title":"Annals of Applied Probability , pages=","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.219876Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:d053a4384a6ab31e25be07c343c1ed2b9aaa039dc280a6bd13a29fb885ece3eb","observation_id":"8c4c3dcc-b6b8-4b2d-adb4-405e3c434fb0","resolution":{"observed_at":"2026-08-16T00:06:35.219876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.224484Z","title":"Advances in applied mathematics , volume=","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.224484Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:e1363dce2a7e967ba8b997b9e8de8ac6d951f1816715afae5fdfc183118a4491","observation_id":"1c8e814f-3996-423b-9b46-7c16c68a5e4f","resolution":{"observed_at":"2026-08-16T00:06:35.224484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.229401Z","title":"IEEE Transactions on Information Theory , volume=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.229401Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:0ae24630d0dfadb633acc366afdde3f6a3cccc68eb827fbff17c526727dc13f5","observation_id":"2dd27044-3bfa-40c4-b012-382670731fcf","resolution":{"observed_at":"2026-08-16T00:06:35.229401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.234671Z","title":"1988 , institution=","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.234671Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:2a6c0f20ebe7d789bdef1a136cdbfa3d7edc2d050689108f96418f96d03fb80c","observation_id":"82ffb743-3e94-4b97-8726-e3ced01282f1","resolution":{"observed_at":"2026-08-16T00:06:35.234671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.239161Z","title":"2018 , publisher=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.239161Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:80d18867171e30fd3d37f05f6867657780a46e101f2dc18d34ea573250d66c1b","observation_id":"0518c517-c4b2-4fdc-b89f-de353cd14230","resolution":{"observed_at":"2026-08-16T00:06:35.239161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.243913Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.243913Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:c29711bf1229e9a90fd71bf63052c102f87947cb521a478f325e7e36d743369d","observation_id":"314e6fcf-b4d0-41ac-a67c-7fb9328dabf8","resolution":{"observed_at":"2026-08-16T00:06:35.243913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.248403Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.248403Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:95d635988d8b9e9be1f6266f37dc2b86019a5d4f0c3c9711659765ea32cefb5f","observation_id":"7014bc98-3b68-4e80-b261-9bb54713a667","resolution":{"observed_at":"2026-08-16T00:06:35.248403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.253365Z","title":"IEEE Journal of Selected Topics in Signal Processing , volume=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.253365Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:e5d32f79546f87d79c4eb30b7df7a771fa870c89e88bd26a9b2e05bc1251481d","observation_id":"c3c683be-3bef-4d67-9a35-33743b21a744","resolution":{"observed_at":"2026-08-16T00:06:35.253365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.257900Z","title":"Joint European Conference on Machine Learning and Knowledge Discovery in Databases , pages=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.257900Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:948de6bb871dc3c3b5e500facc567fa202097ff5cda18fc2585790f45553f662","observation_id":"ff196522-0fef-4d4c-bb44-74297161a60b","resolution":{"observed_at":"2026-08-16T00:06:35.257900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.262437Z","title":"IEEE Transactions on Wireless Communications , volume=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.262437Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:8b8586d6550c90d2a6c177213eef0b1d64650b4d301c816fceee9b61ad89ae03","observation_id":"3f282eec-ee42-4f13-9913-212c2ac6df18","resolution":{"observed_at":"2026-08-16T00:06:35.262437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.266918Z","title":"Algorithmic Learning Theory , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.266918Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:7cb861cb8bfad2cf2ca0dbddf91f2e00adddb8a28856a1c485d6e72936d4046c","observation_id":"9c53a552-c104-455c-88a8-ac0ca3b985fa","resolution":{"observed_at":"2026-08-16T00:06:35.266918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.271433Z","title":"2011 , publisher=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.271433Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:f1098213bb956c4b73d22a3111a6a2b5132c129ea98ea3d38cbc4b85ab571870","observation_id":"b48c356d-a80d-4c14-a11d-00883f5874bb","resolution":{"observed_at":"2026-08-16T00:06:35.271433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.275830Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.275830Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:653061f1de703dc6dd06a4ff89d91b8449b2de82f936540daef3d4c3c7cbe43c","observation_id":"c01e68e2-99f3-4673-ae5e-946956698f00","resolution":{"observed_at":"2026-08-16T00:06:35.275830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.280426Z","title":"International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.280426Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:52d6bf075f8abdc9059f13d75f17bb0f32d45888cb8b243d1568c446221d9b1a","observation_id":"909e423d-3606-4e6a-b242-45d93f94088b","resolution":{"observed_at":"2026-08-16T00:06:35.280426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.285565Z","title":"International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.285565Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:c5bea7b699f458078374e57b20dbc1340ab7db82f1fb53bd60ff5c6e93f29cad","observation_id":"4d9d90ea-30b4-485b-ae2d-3acaf06dec85","resolution":{"observed_at":"2026-08-16T00:06:35.285565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.290130Z","title":"IEEE Transactions on Signal Processing , volume=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.290130Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:e8289f136dfd877e814fae21f650437eb8b2050b53c95abee36104660cbcaa82","observation_id":"f3bbaa03-ad88-425c-a6f6-7eb239548e8f","resolution":{"observed_at":"2026-08-16T00:06:35.290130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.294419Z","title":"IEEE Journal on Selected Areas in Communications , volume=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.294419Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:7139f22b793800f1ac826baf22c72f3f84e0387504d230f5d4449e7734751468","observation_id":"efff38e7-ae50-41ac-9516-4da11d7a41dd","resolution":{"observed_at":"2026-08-16T00:06:35.294419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.298854Z","title":"IEEE Transactions on Control of Network Systems , volume=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.298854Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:e217e09236c5442514d90b0cf47254e55638bfeac83892b5feb04d7585956772","observation_id":"7dd5d52f-08af-4517-a0f5-28ffbd0a7de5","resolution":{"observed_at":"2026-08-16T00:06:35.298854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.303356Z","title":"IEEE/ACM Transactions on Networking , volume=","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.303356Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:db44b36dd4d1a56b291efef789547dde4f6eca770ddd43dccd2102b2f4d696a6","observation_id":"1def6370-f6c6-4315-a29e-d7f49cce9860","resolution":{"observed_at":"2026-08-16T00:06:35.303356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.308017Z","title":"Machine learning , volume=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.308017Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:ab1f6e9015e5c3a7c812d44b59e98cc9e2075dd7acacbd16276ee39f74e39d6e","observation_id":"068423d8-f86f-46f6-94d1-8896ba6f7a5a","resolution":{"observed_at":"2026-08-16T00:06:35.308017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.312467Z","title":"American Economic Review , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.312467Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:44be0eeeadac3e1729065900e24c3ff01a1237ae72542b0c7a34b7156fd2ffa2","observation_id":"4d8e7701-a2f6-40be-bb14-00e19bf3ec7c","resolution":{"observed_at":"2026-08-16T00:06:35.312467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.317264Z","title":"Journal of Economic Theory , volume=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.317264Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:a47c1faf2d9ee14a1510384a6fc8fe4a0d1f23ff014e4723929fefa20891deac","observation_id":"f1f679d1-0ff4-433d-ad73-87b1acfb4e14","resolution":{"observed_at":"2026-08-16T00:06:35.317264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.321887Z","title":"Econometrica , volume=","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.321887Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:592b881e2b158b06fcf4a19e3ef6e983947caddc92e72b9dc6d715886825a6e8","observation_id":"1f7ba88b-9f9e-4932-9e50-a7555348c089","resolution":{"observed_at":"2026-08-16T00:06:35.321887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.326647Z","title":"Economics essays , pages=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.326647Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:928f2f62839791c71e3dbfdf6366ecc50a1da9b04e9468aea8e61da1c4f4e0f0","observation_id":"97c9355f-a7b6-4641-805b-58be34154d8d","resolution":{"observed_at":"2026-08-16T00:06:35.326647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.331166Z","title":"2013 , publisher=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.331166Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:cacb9e68487c3abe281838e16f1905eacc1d8b93df0f4a83cc463a083ed09b23","observation_id":"86c43e78-5941-4d9a-8160-593033c6f5eb","resolution":{"observed_at":"2026-08-16T00:06:35.331166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.335547Z","title":"1998 , publisher=","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.335547Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:6ea6bb2624d3a9fddf3e65e6d8893a8f11899c8b9fae80cdb6d86e7831b375be","observation_id":"dba8408e-1038-4c32-bc08-a90159818fe8","resolution":{"observed_at":"2026-08-16T00:06:35.335547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.340343Z","title":"2006 , publisher=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.340343Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:6acb606ef3b28193dfdc2885c922f1bf14e383db0b03f17f1a49e71d2a8fd727","observation_id":"6114b205-6737-4d36-85c9-341f810b0781","resolution":{"observed_at":"2026-08-16T00:06:35.340343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.345550Z","title":"2004 , publisher=","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.345550Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:d463eb034a1bfd46b19658b995504b89faf5bb26c258ccece75f84c150d2906a","observation_id":"6b7356fb-e1fe-4eac-8315-af31f0a75555","resolution":{"observed_at":"2026-08-16T00:06:35.345550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.350519Z","title":"Management science , volume=","venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.350519Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:48bb2873a1f51d59173f88e4d94821d262d1101e4a3adb3869ad9b70daf622fe","observation_id":"5816420e-176e-46f9-a932-23303ae6e65e","resolution":{"observed_at":"2026-08-16T00:06:35.350519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.355040Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.355040Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:b0fce00355964a1765fd55e517bce023ca72c02ce3218349dd12f7e28ee5d531","observation_id":"8188a948-d023-4449-bddf-9d0b1c211457","resolution":{"observed_at":"2026-08-16T00:06:35.355040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.360108Z","title":"IEEE Transactions on Signal Processing , volume=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.360108Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:511f3de328352db78fee68012ef723f82e548a3f1836f1b83f5078a9e7bedf26","observation_id":"798ebf40-19dd-489b-b132-3d59b8ade1fe","resolution":{"observed_at":"2026-08-16T00:06:35.360108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04468","last_updated":"2019-10-24T13:19:01Z","snapshot_observed_at":"2026-08-14T18:16:49.394746Z","submitted_at":"2018-10-10T11:46:20Z","title":"Decentralized Cooperative Stochastic Bandits","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04468","snapshot_observed_at":"2026-08-16T00:06:35.364938Z","title":"arXiv preprint arXiv:1810.04468 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.364938Z"},"links":{"cited_paper":"/paper/1810.04468","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:4e1c51eaedce2ea87358314250926d230596ae961a992a636869b8804a36d2e9","observation_id":"3d05d1fe-8d96-436c-bbc3-1c46d457afdc","resolution":{"observed_at":"2026-08-16T00:06:35.364938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.370579Z","title":"2019 IEEE 60th Annual Symposium on Foundations of Computer Science (FOCS) , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.370579Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:e1f407ed4caa37ced2e0478e3c60a65b2dfdd17777a560f33d95607e237a6df7","observation_id":"341efd43-e1dc-4c73-a96f-b84c554aba57","resolution":{"observed_at":"2026-08-16T00:06:35.370579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.375552Z","title":"2020 IEEE 61st Annual Symposium on Foundations of Computer Science (FOCS) , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.375552Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:29f6b0414acc545b5fe8bfeb21e6064e733d32e77dab5e87218e36d70d91bff2","observation_id":"56108f52-f084-44a7-8ad6-48d8f1986d55","resolution":{"observed_at":"2026-08-16T00:06:35.375552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.380570Z","title":"IEEE Journal on Selected Areas in Information Theory , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.380570Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:e7bf542672b690580fbeb9594edadb808d18b28844bab5def78279368165c9b7","observation_id":"bea023b5-fb85-496b-99b8-86f55d548b24","resolution":{"observed_at":"2026-08-16T00:06:35.380570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.03818","last_updated":"2021-09-07T18:18:58Z","snapshot_observed_at":"2026-08-16T17:58:14.759316Z","submitted_at":"2021-09-07T18:18:58Z","title":"Online Learning for Cooperative Multi-Player Multi-Armed Bandits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.03818","snapshot_observed_at":"2026-08-16T00:06:35.385808Z","title":"arXiv preprint arXiv:2109.03818 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.385808Z"},"links":{"cited_paper":"/paper/2109.03818","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:abdf47dcdf78e62dcea8a43c11dbf1ef642a89421e32cc33a2efd656544e8cdc","observation_id":"169bb85b-f715-4ed6-9f71-f912737d1132","resolution":{"observed_at":"2026-08-16T00:06:35.385808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.390931Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.390931Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:a7291153b6a3f343ec49663f4a9051af5c781e5233f2961f928ab0e0fb806c5f","observation_id":"e57b4ce3-f770-4dd2-bbc2-cae5b9ba229f","resolution":{"observed_at":"2026-08-16T00:06:35.390931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.396758Z","title":"Conference on Learning Theory , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.396758Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:ae11ca2ee1412d59548afdbc1cd9dff41cc2ce5bc8316fbe2bca4d7b858420fc","observation_id":"5962df21-5d2d-4fad-a5da-0157aeca2daa","resolution":{"observed_at":"2026-08-16T00:06:35.396758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06210","last_updated":"2023-11-10T17:55:44Z","snapshot_observed_at":"2026-08-16T14:44:17.394429Z","submitted_at":"2023-11-10T17:55:44Z","title":"Optimal Cooperative Multiplayer Learning Bandits with Noisy Rewards and No Communication","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06210","snapshot_observed_at":"2026-08-16T00:06:35.401617Z","title":"arXiv preprint arXiv:2311.06210 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.401617Z"},"links":{"cited_paper":"/paper/2311.06210","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:2b4a8c4a34a709aee705fc9decccb8a75445279c9d5db3123c28d2ed2015774a","observation_id":"9e5c7185-99ba-44e1-8684-5d060dfbaf9c","resolution":{"observed_at":"2026-08-16T00:06:35.401617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.407550Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.407550Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:d9a13fbab692cb1c07416512149b8b44596bdda4bc8bb728249030f2af4f8f5c","observation_id":"7e119872-59a6-4962-ae3b-19377aaeb859","resolution":{"observed_at":"2026-08-16T00:06:35.407550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.412623Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.412623Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:36d32cb89768bd058885e4ac2817f61feeb9a506166cad87aabff58e8363b832","observation_id":"dad003c7-d494-4a0b-be54-44402aae77b1","resolution":{"observed_at":"2026-08-16T00:06:35.412623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.417604Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.417604Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:3757bf28a30d13bf589fd4cbd396e52f0e6c5894f65f0f2f317081e6276f29b1","observation_id":"baa843f6-92af-4744-8999-c40b5f536a90","resolution":{"observed_at":"2026-08-16T00:06:35.417604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.423079Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.423079Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:7a0cf4e9460404c4c99164d65e156e1c96e6bed03f04bdf22c492dc94f4705ac","observation_id":"14557dea-7ffe-495d-b53e-c82f88d0b4c6","resolution":{"observed_at":"2026-08-16T00:06:35.423079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.428732Z","title":"Algorithmic Learning Theory , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.428732Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:9a7c221f1664c5c6e6896c403a4395e308aae7833677b40fe015cac1c9fb3985","observation_id":"395e5a95-383b-4fc2-acf5-874fec679aae","resolution":{"observed_at":"2026-08-16T00:06:35.428732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.433285Z","title":"IEEE Transactions on Automatic Control , volume=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.433285Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:4f6dcdca99ca83ec6355b5acb759a2ea2f4d714301228481f144836837560175","observation_id":"379770b4-0d06-4da4-bbb5-ea94ca5f2cbc","resolution":{"observed_at":"2026-08-16T00:06:35.433285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.438034Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.438034Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:277d0758a2ff09600500c4a2d9f9bb863a43611218af2a2277636db60a319e09","observation_id":"9f0dcace-cef0-4495-9a6a-cb4e68f752b7","resolution":{"observed_at":"2026-08-16T00:06:35.438034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.442710Z","title":"2017 IEEE International Conference on Robotics and Automation (ICRA) , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.442710Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:465e4f55f633bedca0d5cdc1a8b5bd1ba44f3006cb842fe2597d6946ba08f4a6","observation_id":"67bd8f59-8814-43cd-8d5c-493dd478f390","resolution":{"observed_at":"2026-08-16T00:06:35.442710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.447726Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.447726Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:d36783cb89bcf5646edd661783cd9b4295cc013d556e8808913903e4d72e87ba","observation_id":"903f5a5a-1390-4bd8-94bc-1121c60a6956","resolution":{"observed_at":"2026-08-16T00:06:35.447726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.452531Z","title":"arXiv preprint arXiv:2502.16387 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.452531Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:c38283e2a7b55a8a891aeccb2fa3e51713683024e01df84eea11ae065ff7bf58","observation_id":"78c1e34b-bbbe-4cc1-b12f-4f93875196d8","resolution":{"observed_at":"2026-08-16T00:06:35.452531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17625","last_updated":"2025-02-24T20:20:06Z","snapshot_observed_at":"2026-08-16T12:55:35.650522Z","submitted_at":"2025-02-24T20:20:06Z","title":"Instance-Dependent Regret Bounds for Learning Two-Player Zero-Sum Games with Bandit Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17625","snapshot_observed_at":"2026-08-16T00:06:35.457448Z","title":"arXiv preprint arXiv:2502.17625 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.457448Z"},"links":{"cited_paper":"/paper/2502.17625","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:ccf393ad3c69969ba5a70c49719fec4d7f5b6083bfbf60aa61618868787fab74","observation_id":"a5b7a6fa-ae09-471d-b6e5-d7896b1e8a3d","resolution":{"observed_at":"2026-08-16T00:06:35.457448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02825","last_updated":"2025-03-04T17:49:24Z","snapshot_observed_at":"2026-08-16T12:53:07.536820Z","submitted_at":"2025-03-04T17:49:24Z","title":"On Separation Between Best-Iterate, Random-Iterate, and Last-Iterate Convergence of Learning in Games","version":1},"cited_work":{"arxiv_id":"2503.02825","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.02825","snapshot_observed_at":"2026-08-16T00:06:36.220563Z","title":"On Separation Between Best-Iterate, Random-Iterate, and Last-Iterate Convergence of Learning in Games","venue":"cs.LG","work_id":"fd34f232-cd0f-401d-a6f6-69fca95b028d","year":2025},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.462593Z"},"links":{"cited_paper":"/paper/2503.02825","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:200fb08cf6da590a982c00cd8beb5b0b797c177b2c1000a0152ba244d176f645","observation_id":"1f23b533-8fda-4f35-bfbd-3f2ee0b2cdaa","resolution":{"observed_at":"2026-08-16T00:06:36.227275Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12529","last_updated":"2025-06-18T16:11:36Z","snapshot_observed_at":"2026-08-16T12:57:28.381251Z","submitted_at":"2025-02-18T04:32:52Z","title":"Alternating Regret for Online Convex Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12529","snapshot_observed_at":"2026-08-16T00:06:35.467512Z","title":"arXiv preprint arXiv:2502.12529 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.467512Z"},"links":{"cited_paper":"/paper/2502.12529","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:fbfc6c68cb906567c56a317cddeb9dad8c0cbaff4b4a12cd98974da80b3d01b1","observation_id":"5dcc6597-4e72-4197-9811-8d3ca080daee","resolution":{"observed_at":"2026-08-16T00:06:35.467512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.472555Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.472555Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:9be1428abdf153b922e7ab1532fd8ce6af2d028c47b420ce4a4ec2639152295d","observation_id":"1bded3ff-37c6-4eae-ab45-181093ac2bf3","resolution":{"observed_at":"2026-08-16T00:06:35.472555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12528","last_updated":"2025-02-20T01:16:02Z","snapshot_observed_at":"2026-08-16T12:57:28.471722Z","submitted_at":"2025-02-18T04:32:51Z","title":"Contextual Linear Bandits with Delay as Payoff","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12528","snapshot_observed_at":"2026-08-16T00:06:35.477335Z","title":"arXiv preprint arXiv:2502.12528 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.477335Z"},"links":{"cited_paper":"/paper/2502.12528","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:ef409f773526f2c1b58ab7100ccc694c0e207ed19474a50788ffef4fab956b09","observation_id":"5422f714-5292-4c8c-8c5f-90e667f0d117","resolution":{"observed_at":"2026-08-16T00:06:35.477335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07120","last_updated":"2025-02-16T19:18:39Z","snapshot_observed_at":"2026-08-15T11:06:18.184638Z","submitted_at":"2024-12-10T02:23:44Z","title":"Corrupted Learning Dynamics in Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07120","snapshot_observed_at":"2026-08-16T00:06:35.482262Z","title":"arXiv preprint arXiv:2412.07120 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.482262Z"},"links":{"cited_paper":"/paper/2412.07120","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:f700fbfadb10c8346ecc98958f94a7a69263d9dd927f6dc22403818d44a06cce","observation_id":"4169f2de-cbab-4ec7-be4c-bb9a02ba21ad","resolution":{"observed_at":"2026-08-16T00:06:35.482262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.487604Z","title":"The Thirty Sixth Annual Conference on Learning Theory , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.487604Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:342cd3a2232be0454d500b18a3c4f51a3a86e90e5adcfcaa23cf2aacea6fcee9","observation_id":"cb454c1e-e73f-4811-a991-b5b96c404de1","resolution":{"observed_at":"2026-08-16T00:06:35.487604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07637","last_updated":"2024-05-14T08:10:15Z","snapshot_observed_at":"2026-08-16T13:53:13.938662Z","submitted_at":"2024-05-13T10:51:01Z","title":"Near-Optimal Regret in Linear MDPs with Aggregate Bandit Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07637","snapshot_observed_at":"2026-08-16T00:06:35.491992Z","title":"arXiv preprint arXiv:2405.07637 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.491992Z"},"links":{"cited_paper":"/paper/2405.07637","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:1b77ee2acb7665cb0febe064006d4129ef84cf9707122e57429a77aa084b1487","observation_id":"b049526e-fcdc-4347-9ce8-1a1841ba4193","resolution":{"observed_at":"2026-08-16T00:06:35.491992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.496598Z","title":"Algorithmic Learning Theory , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.496598Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:ff7736c8fff077ba06d8f96d91ad3004ba5f9f2de7f79e778bf8b8df284513f5","observation_id":"f602e061-3d64-4f3e-9b19-ab1b163e166c","resolution":{"observed_at":"2026-08-16T00:06:35.496598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.03295","last_updated":"2016-10-11T12:09:03Z","snapshot_observed_at":"2026-08-14T21:35:45.210326Z","submitted_at":"2016-10-11T12:09:03Z","title":"Safe, Multi-Agent, Reinforcement Learning for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.03295","snapshot_observed_at":"2026-08-16T00:06:35.501573Z","title":"arXiv preprint arXiv:1610.03295 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.501573Z"},"links":{"cited_paper":"/paper/1610.03295","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:c4a5c306e66742a81c2ae1bec55420a332ed33922619f60e2adcc48ea55114e0","observation_id":"84671e26-f77c-4319-80b2-80f91e55b7a4","resolution":{"observed_at":"2026-08-16T00:06:35.501573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.506755Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.506755Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:b565ac180609f115888854bf260573cfe26d54e7bb45dd91782cfcc86f70f523","observation_id":"b15c2a2e-c510-4e7f-8fe3-fbdf9e09ade8","resolution":{"observed_at":"2026-08-16T00:06:35.506755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.511301Z","title":"nature , volume=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.511301Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:7ec219275f3c9f77a14e8e9bc15f11c0a76c69ae2aa1e4fd4e4c5f541e6d79be","observation_id":"2dc8295c-eac4-463d-90b5-8c7fee912941","resolution":{"observed_at":"2026-08-16T00:06:35.511301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.515696Z","title":"nature , volume=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.515696Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:30df78abc6ab6d217e3e42386db14d0f453a8d46dc9b80e83414455f3393473a","observation_id":"97e4dbca-55f8-455e-8b14-d0a7b13ce43c","resolution":{"observed_at":"2026-08-16T00:06:35.515696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.520510Z","title":"The International Journal of Robotics Research , volume=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.520510Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:d033cf5d33a240f62b00260c20edf7b662ebfd36939c6a478886093fa85880a0","observation_id":"3b9a6b78-7e68-48a7-9762-ae2693906b21","resolution":{"observed_at":"2026-08-16T00:06:35.520510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-16T00:06:35.525391Z","title":"arXiv preprint arXiv:1509.02971 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.525391Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:05ca2dbc505d7036cc06f3aba874e04c1c418f37f9a6da5d2dd66ec6786e93ae","observation_id":"dd82304b-5eaf-48a9-a670-cc8be2f742a6","resolution":{"observed_at":"2026-08-16T00:06:35.525391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.530528Z","title":"Science , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.530528Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:097372f783ca59475c4e144f5f004a842e5b9f46f69c207edc54ff1b7f8788f5","observation_id":"b53d6174-9846-4571-91da-faff8ea9ac3b","resolution":{"observed_at":"2026-08-16T00:06:35.530528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.535494Z","title":"nature , volume=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.535494Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:81a89b3090a18362c7616455f10169cc404b44b97cf980c38999a33ed5293b5a","observation_id":"088888d1-a8d7-4f9c-a952-acc388cf86b6","resolution":{"observed_at":"2026-08-16T00:06:35.535494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.540261Z","title":"IEEE Transactions on Systems, Man, and Cybernetics, Part C (Applications and Reviews) , volume=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.540261Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:21cefb9ca67ae6e822b1c39a480bff133dc7c40f1f054f1958f2d23579a23780","observation_id":"6d07789a-ef41-42c3-9406-28fa48332474","resolution":{"observed_at":"2026-08-16T00:06:35.540261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.545138Z","title":"Transportation Research Part C: Emerging Technologies , volume=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.545138Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:e62e46976dc05f202cd2b7b9f9934e156e5519a381a05ccd16ba0b6a1c045432","observation_id":"8348ff8d-1795-4211-b64e-e99196d7ed65","resolution":{"observed_at":"2026-08-16T00:06:35.545138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.549734Z","title":"Computer networks , volume=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.549734Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:12b0f6fff58ba07c59fbfef02635ac11956048a5ce2c86ca6379444a613fd792","observation_id":"5562bc88-939c-4335-9364-d6bc97e8dba5","resolution":{"observed_at":"2026-08-16T00:06:35.549734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.554276Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.554276Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:6a450b0e3d16a5618080a9b8edc01a3a9cba5b85653b11971420320413df2965","observation_id":"443e4fe6-7125-4635-b885-620b4bed17ca","resolution":{"observed_at":"2026-08-16T00:06:35.554276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.559153Z","title":"IEEE Transactions on Systems, Man, and Cybernetics-Part A: Systems and Humans , volume=","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.559153Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:84973f3e2f7425f898e90e8faaabde40e4f402e3cab158ca52ffe93e45833cd0","observation_id":"5a6880a7-26b3-46d2-9948-586283b8cd44","resolution":{"observed_at":"2026-08-16T00:06:35.559153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.564114Z","title":"IEEE Transactions on robotics and Automation , volume=","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.564114Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:44528abfc90ed4ac061d8c3c04a8bf5fdfa4e3cf08195ed05cc277b788541ff6","observation_id":"d3ed634a-f6af-4f0a-bf00-519e89158f8f","resolution":{"observed_at":"2026-08-16T00:06:35.564114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.568346Z","title":"Automatica , volume=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.568346Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:b0b452f9be58f09d782e89040740cac7f36e9a19fed714abc532e7bcbf522f02","observation_id":"2f085ab2-3838-4aef-b473-8a6a8a243fe8","resolution":{"observed_at":"2026-08-16T00:06:35.568346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.572907Z","title":"Cognitive Systems Research , volume=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.572907Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:7a7a7419db90b306228469aaf2e0f6ce7b00a3e9e7a3e5e238ac2c9db85e135d","observation_id":"c1d18032-65d3-4941-859e-29fc146e32e5","resolution":{"observed_at":"2026-08-16T00:06:35.572907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.03037","last_updated":"2017-02-10T01:48:40Z","snapshot_observed_at":"2026-08-17T00:56:32.664514Z","submitted_at":"2017-02-10T01:48:40Z","title":"Multi-agent Reinforcement Learning in Sequential Social Dilemmas","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.03037","snapshot_observed_at":"2026-08-16T00:06:35.577420Z","title":"arXiv preprint arXiv:1702.03037 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.577420Z"},"links":{"cited_paper":"/paper/1702.03037","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:846b7b2a704e168c34be771716d9a002002b1b65484d7f3727949d769119781c","observation_id":"5c215af9-b8d6-4c60-ad90-7f1f6c77c190","resolution":{"observed_at":"2026-08-16T00:06:35.577420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.582493Z","title":"TARK , volume=","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.582493Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:e1b88a155bbdd08ae74f485421b59181c32800af6605549c219247d3883506a1","observation_id":"c834d973-a31f-4c9a-80d8-c4537793becf","resolution":{"observed_at":"2026-08-16T00:06:35.582493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.586997Z","title":"IEEE Transactions on Automatic Control , volume=","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.586997Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:c87bfe3b7950da6e87753881950c0628ce6203d1aae6930358d443ae3a2ec644","observation_id":"18e6ed14-dd52-4bcb-b6d7-4c487a50b4a8","resolution":{"observed_at":"2026-08-16T00:06:35.586997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.591517Z","title":"Proceedings of the IEEE , volume=","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.591517Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:37e3c09400db34e0d712d7d02ca9c06e38aaa53c77325db25b0f74f62e281c02","observation_id":"05f2b152-17ae-433c-920d-9232f4f6c460","resolution":{"observed_at":"2026-08-16T00:06:35.591517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.596200Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.596200Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:d5ca87dace425bfd6970e475e809a67b5d0c0f8f5662e17bf4b6257a3891447c","observation_id":"cc28cb0f-ca1f-46d7-a818-f76dcc1dfd04","resolution":{"observed_at":"2026-08-16T00:06:35.596200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.600638Z","title":"2008 , publisher=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.600638Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:aacd88b05b9d5441baf1279dab61b90d5b4e3bdec7a52b8fe9d841f198461fdf","observation_id":"eae2e29b-b1a3-44a6-b659-df1d5905aec2","resolution":{"observed_at":"2026-08-16T00:06:35.600638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.335076Z","title":"2013 , publisher=","venue":null,"work_id":"d0223082-15de-44fe-b341-d53e799d345e","year":2013},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.605234Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:bcaa7d4c530dde588f1e316f96bd45b2a0ae8916c11c9ef769181e965cdc78a4","observation_id":"b787d9f8-cb4c-4971-bf86-ed1e0570fc9d","resolution":{"observed_at":"2026-08-16T00:06:37.339488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.00899","last_updated":"2018-05-22T11:23:55Z","snapshot_observed_at":"2026-08-14T19:49:22.503760Z","submitted_at":"2018-02-03T02:56:54Z","title":"Learning Parametric Closed-Loop Policies for Markov Potential Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.00899","snapshot_observed_at":"2026-08-16T00:06:35.609869Z","title":"arXiv preprint arXiv:1802.00899 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.609869Z"},"links":{"cited_paper":"/paper/1802.00899","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:006d3386d61252ebe7b3ee5b48cf2580a9622eb941969c4abead9d029731f91d","observation_id":"367536a7-7fb8-43e1-844d-68401a11f4bf","resolution":{"observed_at":"2026-08-16T00:06:35.609869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.317987Z","title":"IEEE Transactions on Signal Processing , volume=","venue":null,"work_id":"2e119183-3cdb-43a2-843b-67e5802ddff8","year":2016},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.614692Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:a10dd22625ebc344b7b1fa4b29667593646abea26e9a730fcf781aadcd567412","observation_id":"3022df4d-592a-4c7b-8e6c-025dc0303014","resolution":{"observed_at":"2026-08-16T00:06:37.322747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.302582Z","title":"International conference on machine learning , pages=","venue":null,"work_id":"34dc286f-9689-4225-9f3e-f94ffc2544ef","year":2018},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.619854Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:00a409a8bec57e656efc24a621c89100b70a0baf411aed92423a44c4f995fc55","observation_id":"87919b18-d553-49a4-90fc-6db8637b29ce","resolution":{"observed_at":"2026-08-16T00:06:37.307228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.199514Z","title":"IEEE Transactions on Signal Processing , volume=","venue":null,"work_id":"c2bad1f6-7c61-4152-942e-ab08a675dfe0","year":2013},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.624249Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:6e3b33bec33a22ea560eb7fb20e9f3b68f54105bb48f104e8320bf706cad0e50","observation_id":"578eaf5a-070e-497b-99b4-b808f4f6be68","resolution":{"observed_at":"2026-08-16T00:06:37.246711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.184991Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"48c2fac1-5fed-45c0-979a-1eb7a797ecd7","year":2019},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.628571Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:338d8636e9774fde5922559cd4ad3a8325f4eb8fe2b0c81c88af5561dc6ff975","observation_id":"83223d6a-cea6-4f3e-bce5-672ee564da42","resolution":{"observed_at":"2026-08-16T00:06:37.189613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.169442Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"5f1d58f4-124e-4616-8b7c-66ee81ff7da8","year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.633095Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:3c37ae40d6893325eff659333219c6719f6fecf205f190fc28189cb05b0e5fc8","observation_id":"f34b193f-3dbb-4a69-a683-bccfe36d4a89","resolution":{"observed_at":"2026-08-16T00:06:37.174083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.637333Z","title":"Machine learning proceedings 1994 , pages=","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.637333Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:80ac616f9830bb6287137c4366cc2bea6ca3db0fa09cd7241dd9d7ed801474f1","observation_id":"649b881d-164b-45d7-9cde-dab55de65587","resolution":{"observed_at":"2026-08-16T00:06:35.637333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.143842Z","title":"IEEE Transactions on Automatic control , volume=","venue":null,"work_id":"f6609a83-d844-48c3-9397-6e77a86f6cb5","year":2003},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.641496Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:74c0a9bf1394a5f39f5fa537dc73fa77a10b1079f28bfffdb1682c3a20dde0f6","observation_id":"802249ee-6387-42e6-877e-6541772bc021","resolution":{"observed_at":"2026-08-16T00:06:37.148651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.129762Z","title":"2008 , publisher=","venue":null,"work_id":"5fb53e62-9104-46e3-99bd-2495ff29754f","year":2008},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.645877Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:17bce0bfc3104ae6687bb73528406e5ebe681d1fc17eea1849a7e53b1f59ed4f","observation_id":"9370ee92-0194-4d3e-acbb-236614ec5fbe","resolution":{"observed_at":"2026-08-16T00:06:37.134097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.114425Z","title":"Learning for Dynamics and Control , pages=","venue":null,"work_id":"7e054f2c-9373-4307-a529-8a52c9b7fc70","year":2020},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.650479Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:135e9b859b5097eab5e5e0139aff638da97af737161ea0e12d828c8c4deafc02","observation_id":"3c279b31-47c6-42a2-9808-18ecc5b47267","resolution":{"observed_at":"2026-08-16T00:06:37.119344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.655042Z","title":"Journal of machine learning research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.655042Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:0064498b4dbc48bd8cf0d61611e004a4fea03277b8c52b9ddf036159495236ec","observation_id":"490b0cdb-7d83-42da-89fc-5903e5a3cd4a","resolution":{"observed_at":"2026-08-16T00:06:35.655042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.085032Z","title":"ICML , volume=","venue":null,"work_id":"097b6a8e-53d2-4986-adda-047c54c48201","year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.659359Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:a71bc45b157b32a4b3ed3a44244e713bc9639b869fd567c4920986fcb4faa5f1","observation_id":"99f6bc8b-feda-4adf-8fef-20c1fb9cb088","resolution":{"observed_at":"2026-08-16T00:06:37.089874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.069377Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"5227b62c-e6d1-4ed1-95ed-c2985c52159c","year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.663661Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:6002c974d916b173d5b3f2451cd44dcc382fd40daa5366adf64ddecf0358c671","observation_id":"1efa6af2-3c5d-42ec-8f74-e972f98097a4","resolution":{"observed_at":"2026-08-16T00:06:37.073827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.053982Z","title":"IEEE Transactions on Automatic Control , volume=","venue":null,"work_id":"e125fd45-eeab-4b24-8ea2-909141e34430","year":2021},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.668035Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:bed1a3babd3adc1b4a2014a888dae735360060bf7b1ca222083a74e1aaac005d","observation_id":"746a5953-c470-4a59-846d-6654f26cbf1a","resolution":{"observed_at":"2026-08-16T00:06:37.058983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T23:10:56.374888Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":87,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":152},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 152 outbound references and 0 inbound Pith citation observations for arXiv:2608.12753."}