{"as_of":"2026-08-18T18:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3c0ba403e6ecc1d501767f1165840a9f927f76b3eeb175ba8ff0523ef4a691d5","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:34:32.435835Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.15856/citation-record","integrity":"/paper/2506.15856/integrity","json":"/paper/2506.15856/citation-record.json","paper":"/paper/2506.15856"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.956966Z","title":"Threshold bandits, with and without cen- sored feedback","venue":null,"work_id":"28c422d4-765a-41c4-bdeb-9aa643de6d10","year":2016},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.291625Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:af63d1e2a05692d4d7eb307601755569c7518dea794fa838ea90ce765f28a46f","observation_id":"8f531a07-aa77-45b2-b60b-98872ecd42d3","resolution":{"observed_at":"2026-08-15T19:34:32.962137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.753859Z","title":"Asymptotically efficient adaptive allocation rules","venue":null,"work_id":"cff79441-2ac2-43ae-9e49-a63919ef8795","year":1985},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.370030Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:0a4d4f8a4ac684c8960372221eb881387da85d3d260b97a0dd8d2e6411caed0c","observation_id":"e3315ede-c7fb-4eaa-813a-db83957c31df","resolution":{"observed_at":"2026-08-15T19:34:32.759844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.711782Z","title":"On distributed cooperative decision-making in multiarmed bandits","venue":null,"work_id":"95089f5f-2c2e-4fe8-bc0a-7cf6eeba53c3","year":2016},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.381352Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:e002852d4e6a398602580f61724234946675edb63b002f6fc59c644c48be51f9","observation_id":"8665debe-a4a6-4909-9f16-b3ce5c53a68b","resolution":{"observed_at":"2026-08-15T19:34:32.717408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.693343Z","title":"Social imitation in coopera- tive multiarmed bandits: Partition-based algorithms with strictly local information","venue":null,"work_id":"481c2179-230f-46b5-8a1b-26fc9d48b8c7","year":2018},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.386557Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:e97988e3ad9e2da74271654bee87a4d62c821ad731a6ce3bd149b93ec195afeb","observation_id":"b747bd04-cc0f-4a93-b293-898c383c476c","resolution":{"observed_at":"2026-08-15T19:34:32.699203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.657647Z","title":"Bandit algorithms","venue":null,"work_id":"5ab37cca-179d-4e04-87fc-50d8fc5159e7","year":2020},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.397080Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:372fe26fd4a7bd6ecd0fa0e1aaedefee3b170895b11f68a7b04b14422535b6e8","observation_id":"cd592c1f-edc7-412c-a330-3b2c5d319825","resolution":{"observed_at":"2026-08-15T19:34:32.662968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04468","last_updated":"2019-10-24T13:19:01Z","snapshot_observed_at":"2026-08-14T18:16:49.394746Z","submitted_at":"2018-10-10T11:46:20Z","title":"Decentralized Cooperative Stochastic Bandits","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04468","snapshot_observed_at":"2026-08-15T19:34:32.413143Z","title":"Decentralized coopera- tive stochastic bandits","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.413143Z"},"links":{"cited_paper":"/paper/1810.04468","citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:554ff10315ad7c4012ead922408a7ef9efd3de89b3775deba96ced0b06cda3ab","observation_id":"5c40fdaa-0b59-461e-84b6-268bd0b0a603","resolution":{"observed_at":"2026-08-15T19:34:32.413143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.596839Z","title":"Multi-player bandits–a musical chairs approach","venue":null,"work_id":"9266ccdc-2ed9-41a7-894d-9c929964268b","year":2016},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.418683Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:aea8c386828c8f8f9ab4ed3492c62d03c6c7f5edba5acca990293742c55d75af","observation_id":"49cdaa70-c173-42a8-b78c-6b395fcafe73","resolution":{"observed_at":"2026-08-15T19:34:32.602166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.577415Z","title":"Balanced and incentivized learning with limited shared information in multi-agent multi-armed bandit","venue":null,"work_id":"3b7812b5-e810-4b8b-8992-13cbca4a6c57","year":2024},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.424466Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:73349eecc51b80b26c5aba6fe333627380607d3fbfd2b6f148d7061b8547223d","observation_id":"d14454d1-750a-49ed-9977-7134ddc88cbd","resolution":{"observed_at":"2026-08-15T19:34:32.583749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.13502","last_updated":"2022-04-28T13:46:59Z","snapshot_observed_at":"2026-08-16T17:03:56.517329Z","submitted_at":"2022-04-28T13:46:59Z","title":"Multi-Player Multi-Armed Bandits with Finite Shareable Resources Arms: Learning Algorithms & Applications","version":1},"cited_work":{"arxiv_id":"2204.13502","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.13502","snapshot_observed_at":"2026-08-15T19:34:32.486176Z","title":"Multi-Player Multi-Armed Bandits with Finite Shareable Resources Arms: Learning Algorithms & Applications","venue":"cs.LG","work_id":"6fd10327-db15-41ce-86eb-30c9d3d3b810","year":2022},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.435835Z"},"links":{"cited_paper":"/paper/2204.13502","citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:f0c50283abe255a00cc6cae98825f1d80c15a19cd1aa4d1c801c40886c4fc326","observation_id":"f02470dc-7acb-4bc4-843f-e619ae8530c0","resolution":{"observed_at":"2026-08-15T19:34:32.496701Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.771937Z","title":"Decentralized learning for multiplayer multiarmed bandits","venue":null,"work_id":"f79b65de-faa8-49c9-96c5-a9a4c7182bee","year":2014},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":1979,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.363727Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:18f16e6cc486b438f58ec13cf0351ed0b81b28762b58aba693df4af0f13f612f","observation_id":"8ea434fa-7a54-46c3-bbbb-cf86ae413172","resolution":{"observed_at":"2026-08-15T19:34:32.777775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.730664Z","title":"Bayesian algorithms for decentralized stochas- tic bandits","venue":null,"work_id":"8b3036e5-1b97-4964-88f2-6ef98a4e0130","year":2021},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":1985,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.375617Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:6588a9d2ccc4374bb75254829265c1a98f7541a22d771438334e696ec23d1660","observation_id":"fb96419b-bb2d-4651-8f75-64a72f6de0ff","resolution":{"observed_at":"2026-08-15T19:34:32.737730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.902901Z","title":"Finite-time analysis of the multiarmed bandit problem","venue":null,"work_id":"2696f756-0354-4f3a-b775-2af8fd2fb03e","year":2002},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":1995,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.310131Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:a07f3cdd854a1ab79dd856fe56a9a63431f7544fbc51d12310dfe7a2456d6da3","observation_id":"ba844463-ca94-48d4-9eff-2e95db99653a","resolution":{"observed_at":"2026-08-15T19:34:32.908689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.884752Z","title":"Communicating with unknown teammates","venue":null,"work_id":"e13ceba0-16c9-430e-a54a-368edb36b062","year":2014},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.315741Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:0a1aa811efda651b821b9b7f10dec417a305a9b1ac282f49402aaec625d69729","observation_id":"c09d8a75-f1d4-42f5-9713-31f83bdecde9","resolution":{"observed_at":"2026-08-15T19:34:32.889492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.615047Z","title":"Decentralized heterogeneous multi- player multi-armed bandits with non-zero rewards on collisions","venue":null,"work_id":"c0ae22d8-30bc-4bca-bd19-ff0fde554292","year":2021},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.408346Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:1691c7414eb35c634c6d951035ca89f6dd7fcf964337ed797d2f49e9078843b5","observation_id":"6a4e4c08-f5c3-4fac-83ca-ef26f51c5649","resolution":{"observed_at":"2026-08-15T19:34:32.621530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.810640Z","title":"Coordinated versus decentralized exploration in multi- agent multi-armed bandits","venue":null,"work_id":"0b5eacaa-f138-4fdb-81b2-07982bd2de54","year":2017},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.345834Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:8ef589bd5fe8bc3215dceebfa0dcd528e7335117a7b002c25bcec81a1ed5e403","observation_id":"8f2f8cbd-1210-40cf-af60-0ef5947bc0e0","resolution":{"observed_at":"2026-08-15T19:34:32.816167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.866323Z","title":"Game of thrones: Fully distributed learning for multi- player bandits","venue":null,"work_id":"e7ce8ba4-9baa-42b6-b0ba-e70e5c28427b","year":2021},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.321499Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:bb12bd9e71410206b4f0274c5b41492e4ae871f5f4ea140c88191fa598c0b6a7","observation_id":"b08c4370-9e0b-49cf-8dca-188470a98880","resolution":{"observed_at":"2026-08-15T19:34:32.872045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.939379Z","title":"Multi-agent multi-armed bandits with limited communication","venue":null,"work_id":"a862e935-5d14-4f91-a125-b24b1e5eb294","year":2022},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.298686Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:96b8bb21ce5223d6f2bb7b88ecd9a8a807a4d5894f96e91d4cfe3a63a5d3c91f","observation_id":"5b6723f9-ee7f-4168-a16f-7adedc730406","resolution":{"observed_at":"2026-08-15T19:34:32.945226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06210","last_updated":"2023-11-10T17:55:44Z","snapshot_observed_at":"2026-08-17T18:34:33.921452Z","submitted_at":"2023-11-10T17:55:44Z","title":"Optimal Cooperative Multiplayer Learning Bandits with Noisy Rewards and No Communication","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06210","snapshot_observed_at":"2026-08-15T19:34:32.352464Z","title":"Optimal cooperative multiplayer learning bandits with noisy rewards and no communication","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.352464Z"},"links":{"cited_paper":"/paper/2311.06210","citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:835d7671fcf32614e7bda18808fb8dbedd2f9fc559c38c31c9b37a3b16b108ca","observation_id":"bf4a7aca-b7d9-4bdf-874d-60d88e9f27d5","resolution":{"observed_at":"2026-08-15T19:34:32.352464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.675461Z","title":"Distributed cooperative deci- sion making in multi-agent multi-armed bandits","venue":null,"work_id":"6507056b-4998-49a2-baec-f739d74d9621","year":2021},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.392058Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:d4a5cc1278cb5ab226e5f49602165b1ef8cd8bfdcc636fc35a7918b98f557708","observation_id":"47774e1c-d879-4c1c-aff5-dd156cc021d3","resolution":{"observed_at":"2026-08-15T19:34:32.680991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.829547Z","title":"Regret analysis of stochastic and nonstochastic multi-armed bandit problems","venue":null,"work_id":"13cd76e3-f3f8-4236-ab93-5dcb57a122e3","year":2012},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.335859Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:64883022838a25172df79a6a02fc3f0a8e9cacb1eb1453fa6fec9a626ce8a3f6","observation_id":"90557fa2-6e8d-48d5-8601-8cda7787345a","resolution":{"observed_at":"2026-08-15T19:34:32.836025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.635552Z","title":"Distributed learning in multi-armed bandit with multiple players","venue":null,"work_id":"c7926ce4-7697-4dd2-9210-9b1a8674352b","year":2010},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.403849Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:4e30dd846b507e56d9014dd14930d4fadb3c86fdee8c8419abc62362262780dc","observation_id":"d3d053b0-c22d-45ca-89d6-a455e00d2949","resolution":{"observed_at":"2026-08-15T19:34:32.642473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.848486Z","title":"Sic-mmab: Synchronisation involves communi- cation in multiplayer multi-armed bandits","venue":null,"work_id":"21656a44-db14-420c-b526-0b34842d8a94","year":2019},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.329919Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:e317523351ac0eb4b10f98fbaa578cff6be62c1be3765e61f9dc8e700bc1f1e1","observation_id":"91536ef5-ece8-4479-ab15-46bfc395934a","resolution":{"observed_at":"2026-08-15T19:34:32.854327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.920804Z","title":"Gambling in a rigged casino: The adversarial multi-armed bandit problem","venue":null,"work_id":"4fdabad5-8be8-46e5-8f5c-85b4e2be12b8","year":1995},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.304700Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:6fbea4eada1a07c0bc33634bf0bc79ab04f290b81ceae37886540b7c5eee3c1e","observation_id":"a34af3d0-ca81-4a36-9627-b9c04d7eb125","resolution":{"observed_at":"2026-08-15T19:34:32.926264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.791297Z","title":"Bandit processes and dy- namic allocation indices","venue":null,"work_id":"45b78068-ef81-4050-91a5-2a9190164fac","year":1979},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.358412Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:bf8137c3daa2fdec43d212b8427aede8346f8035e269bc65bf148bf55667be42","observation_id":"cc8474a5-2653-49c6-9c2c-a885495b03b1","resolution":{"observed_at":"2026-08-15T19:34:32.798230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:34:32.557929Z","title":"Ad hoc autonomous agent teams: Collaboration without pre-coordination","venue":null,"work_id":"cff225db-67d8-43b2-9821-130da86e1afb","year":2010},"citing_paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T19:34:32.430106Z"},"links":{"citing_paper":"/paper/2506.15856"},"observation_digest":"sha256:2c04a92daa0685f4b2a062d3631804e4e120b85724a4726e306d6f53b314e274","observation_id":"c3dfcf2b-268f-495b-9187-afdcc8ccd723","resolution":{"observed_at":"2026-08-15T19:34:32.564075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.15856","last_updated":"2025-06-18T20:04:43Z","latest_version":1,"primary_category":"cs.MA","snapshot_observed_at":"2026-08-15T19:28:23.100194Z","submitted_at":"2025-06-18T20:04:43Z","title":"Learning to Coordinate Under Threshold Rewards: A Cooperative Multi-Agent Bandit Framework"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2506.15856."}