{"as_of":"2026-08-17T21:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd09f87167e6020fdf4a4df49989e7a6084a37292ed2adfa67bef506eef54ade","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T21:36:02.340129Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.15053/citation-record","integrity":"/paper/2511.15053/integrity","json":"/paper/2511.15053/citation-record.json","paper":"/paper/2511.15053"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:35:58.479380Z","title":"Multiagent deep reinforcement learning for large-scale traffic signal control,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T21:35:58.479380Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:7db2648190be9c809ebfdd143a64266da8d661c0cf663e00ff2b88890b89d821","observation_id":"202f774e-7096-4356-8161-fbac868d4dc5","resolution":{"observed_at":"2026-08-03T21:35:58.479380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:35:58.564487Z","title":"Large-Scale traffic signal control using a novel multiagent reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T21:35:58.564487Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:406139ec6d9746c215eca2fac566a646706b110dd45a95dc81fea9909b905390","observation_id":"d13c1a4a-3f71-417a-a326-9f89467e8d72","resolution":{"observed_at":"2026-08-03T21:35:58.564487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:35:58.675686Z","title":"Applications in traffic signal control: a distributed policy gradient decomposition algorithm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T21:35:58.675686Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:a9772dcc5991739c0321d4f2f8895d1ec1e55f95db835b97636d015d5057cedf","observation_id":"c33e2ac0-400b-4c72-92b7-d082f667f0a2","resolution":{"observed_at":"2026-08-03T21:35:58.675686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:35:58.753478Z","title":"Deep reinforcement learning for joint channel selection and power control in D2D networks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T21:35:58.753478Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:7e972d15b4ee211df5a7a94d54f974d772afda77eab34431385d5dbc851611c7","observation_id":"e140e33f-ce4c-4ac2-952d-cf8a50967564","resolution":{"observed_at":"2026-08-03T21:35:58.753478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:35:58.872074Z","title":"Power allocation in multiuser cellular networks: Deep reinforcement learning approaches,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T21:35:58.872074Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:d87255a803bd38c0c73c30b8cc987422b8977ea168cb91e77e4445431cf8f7fd","observation_id":"a9b90cb7-8e76-446c-9042-fbcb52c5ffac","resolution":{"observed_at":"2026-08-03T21:35:58.872074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:35:59.114391Z","title":"Reinforcement learning based recommender systems: a survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T21:35:59.114391Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:d12357736c31325702fdd70462ab26a4a48698a3955a0a4187e9cc46b196f421","observation_id":"6551d4cf-8a2c-49a9-bedf-daf6412588db","resolution":{"observed_at":"2026-08-03T21:35:59.114391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:35:59.256275Z","title":"A survey on reinforcement learning for recommender systems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T21:35:59.256275Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:97ef1682ba63fecdae254cd52e2e5f1e66681fb789d9f72ec07279b9b743899a","observation_id":"f42c7288-b59c-461e-9a3a-cdf6b359ac81","resolution":{"observed_at":"2026-08-03T21:35:59.256275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:35:59.447940Z","title":"Distributed reinforcement learning algorithm for dynamic economic dispatch with unknown generation cost functions,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T21:35:59.447940Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:3c1025a69e3a2937f2b3fbb8049a2661265a4305ee41d8d240c659bd35bcddd4","observation_id":"bbdec37a-c4dd-44c0-bd48-4230259fe7d2","resolution":{"observed_at":"2026-08-03T21:35:59.447940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:35:59.566929Z","title":"DistributedQ-learning-based online optimization algorithm for unit commitment and dispatch in smart grid,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T21:35:59.566929Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:dfc4b514dfc4d7988b5d13c811269708cfb1f3b60777607533ca88caeb9f1ac1","observation_id":"6b88c68d-1cd0-41ee-ad15-76f428da4d4e","resolution":{"observed_at":"2026-08-03T21:35:59.566929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:35:59.625353Z","title":"Distributed Q-learning algorithm for dynamic resource allocation with unknown objective functions and appli- cation to microgrid,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T21:35:59.625353Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:6d9306afda82a8834ded5e7a52be2ec0c2cb15905a05d82c5913383950718a12","observation_id":"9f5a3812-2028-42cd-a30c-b04df87ab78c","resolution":{"observed_at":"2026-08-03T21:35:59.625353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.03295","last_updated":"2016-10-11T12:09:03Z","snapshot_observed_at":"2026-08-14T21:35:45.210326Z","submitted_at":"2016-10-11T12:09:03Z","title":"Safe, Multi-Agent, Reinforcement Learning for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.03295","snapshot_observed_at":"2026-08-03T21:35:59.678018Z","title":"Safe, multi- agent, reinforcement learning for autonomous driving,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T21:35:59.678018Z"},"links":{"cited_paper":"/paper/1610.03295","citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:da071ebc0f1c909658957794d177cbe027fff0f8048c8cfa3ea7e14a635fc766","observation_id":"f0196251-46f1-488b-ab98-d0effe1a17b4","resolution":{"observed_at":"2026-08-03T21:35:59.678018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:35:59.750224Z","title":"Con strained reinforcement learning has zero duality gap,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T21:35:59.750224Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:9e221608882b8bda823298fefd7f7ba5b7be932d6846ef7084920498f40ce019","observation_id":"c0a90f67-1924-48f4-870c-66dba815b9eb","resolution":{"observed_at":"2026-08-03T21:35:59.750224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:35:59.837240Z","title":"Safe policies for reinforcement learning via primal-dual meth- ods,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T21:35:59.837240Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:e943a6cbab661c6d7538cb754630c701507130c59bdffbcf308ff2ebaf356b51","observation_id":"76579216-ff66-4fe1-8d2f-1364ca164127","resolution":{"observed_at":"2026-08-03T21:35:59.837240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:36:00.008474Z","title":"State augmented constrained reinforcement learning: overcoming the limita- tions of learning with rewards,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T21:36:00.008474Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:1fd20e4d5eba89b9a73060277dff8eb966c1da4d3dfbf8904ecb634d51351442","observation_id":"507e94b4-2379-41f4-885b-6244e5451ab2","resolution":{"observed_at":"2026-08-03T21:36:00.008474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:36:00.133026Z","title":"Probabilistic constraint for safety-critical reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T21:36:00.133026Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:b8fcfa41db659ae0b778a9ae00a53bbc26bd2d03b2d5a71cb33709867aca1a9d","observation_id":"a3cbf48b-7b5b-4b1a-9a0c-5931cbdb46fb","resolution":{"observed_at":"2026-08-03T21:36:00.133026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:36:00.282863Z","title":"A review of safe reinforcement learning: methods, theories, and applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T21:36:00.282863Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:4fb3e31684e94e4ee79a77ce3a216617bb9aad5d74936b2cfa53461def2e7c88","observation_id":"a944c460-4235-4e10-9049-9b4bea9313bc","resolution":{"observed_at":"2026-08-03T21:36:00.282863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:36:00.410675Z","title":"Provably efficient safe exploration via primal-dual policy optimization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T21:36:00.410675Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:8e777d5f202defe1d206fdd88c03e833165a8d5be74fa3003de8218ed72f3c80","observation_id":"27dbf847-1a01-46c4-991f-c00a01771f26","resolution":{"observed_at":"2026-08-03T21:36:00.410675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:36:00.504081Z","title":"A dual approach to constrained markov decision processes with entropy regularization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T21:36:00.504081Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:b0b30450c08287ab60662be6998f2d908c4f142db70543fbafa63fd208aba77c","observation_id":"ef70a023-d5fe-4faf-88a2-7ef0bb92289c","resolution":{"observed_at":"2026-08-03T21:36:00.504081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:36:00.635532Z","title":"Policy-based primal-dual methods for convex constrained markov decision processes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T21:36:00.635532Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:8683f8ee232cd19fe7ce4a4e59c8e5100358641f17e5af5b528db1dffec0dc3a","observation_id":"a3f90b93-a4ed-4bdc-ab33-7b00d208e04e","resolution":{"observed_at":"2026-08-03T21:36:00.635532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:36:00.879344Z","title":"Decentralized policy gradient descent ascent for safe multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T21:36:00.879344Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:7699ab87819b7d467522a62f8a16d5cb36953585d4e1f4d8c6783c6a091818b3","observation_id":"34992d50-10d7-4009-a6e8-284b92ae6abb","resolution":{"observed_at":"2026-08-03T21:36:00.879344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:36:00.998076Z","title":"Scalable primal- dual actor-critic method for safe multi-agent RL with general utilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T21:36:00.998076Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:9e4112c636fcfd5586c96db59c4ddb2b634f30d982ea0f42b39f06ae91067c76","observation_id":"4cc5165f-3152-4e34-96ae-8dc5aaf7b2c0","resolution":{"observed_at":"2026-08-03T21:36:00.998076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:36:01.124870Z","title":"Scalable reinforcement learning of localized policies for multi-agent networked systems,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T21:36:01.124870Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:40b908e906e3cf8690d36167d8becea348e819043367ed9aa158f3955a25af1d","observation_id":"11f0d457-b2ef-49fc-bac6-1c8e13c3703c","resolution":{"observed_at":"2026-08-03T21:36:01.124870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:36:01.195030Z","title":"Solving a class of non-convex min-max games using iterative first order methods,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T21:36:01.195030Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:35a1a7e2c11567119121c60d12beb32a8fc8d2e43e9c61bffcfa373ff470b4b9","observation_id":"51f2b191-18ba-4928-9712-df6d1be8f032","resolution":{"observed_at":"2026-08-03T21:36:01.195030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:36:01.293994Z","title":"Policy gra- dient methods for reinforcement learning with function approximation,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T21:36:01.293994Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:e5aefe8013a22a51fa903b7f923234007246ac0be7a8e7df3dcc1081b0e0d512","observation_id":"471f8719-292f-41e7-a22c-eec62f550c55","resolution":{"observed_at":"2026-08-03T21:36:01.293994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:36:01.359589Z","title":"Distributed optimization over time-varying directed graphs,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T21:36:01.359589Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:4ba33d6cb8b5f51e5aeedd1cb48b9484075142cdc7b449ab767d922bbf2d5af7","observation_id":"07ed2a0c-8741-4788-bb33-d73021d81a1b","resolution":{"observed_at":"2026-08-03T21:36:01.359589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17401","last_updated":"2025-03-03T18:28:42Z","snapshot_observed_at":"2026-08-16T13:15:19.360211Z","submitted_at":"2024-09-25T22:20:11Z","title":"Zeroth-Order Policy Gradient for Reinforcement Learning from Human Feedback without Reward Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17401","snapshot_observed_at":"2026-08-03T21:36:01.483861Z","title":"Zeroth-order policy gradient for reinforcement learning from human feedback without reward inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T21:36:01.483861Z"},"links":{"cited_paper":"/paper/2409.17401","citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:30b6d9c80aa32d9a5b0f05fd347a02a101a243b9cf1a8816f8838a0e59ada666","observation_id":"fd4d33d2-afbe-4190-931c-843e0bbb0e49","resolution":{"observed_at":"2026-08-03T21:36:01.483861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:36:01.650932Z","title":"ϕ-update: a class of policy update methods with policy convergence guarantee,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T21:36:01.650932Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:2410b4aa30136de0cdb63d76e2056c3330c3cf15ea1eb2cc2231a5ae1adcb978","observation_id":"53ab3935-7daa-4efc-a47d-36a7d9d5a556","resolution":{"observed_at":"2026-08-03T21:36:01.650932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:36:01.788485Z","title":"Distributed stochastic subgra- dient projection algorithms for convex optimization,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T21:36:01.788485Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:b76e62598205d091d2641133d63aa17f2d305eaa4b6e3035ebcd3a77293fcf13","observation_id":"9d16c18a-1f07-4271-b429-0b7fddc57f83","resolution":{"observed_at":"2026-08-03T21:36:01.788485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:36:01.921096Z","title":"Yeh,Real Analysis: Theory of Measure and Integration","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T21:36:01.921096Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:8438d2506f6b2a8ea3cccfe1301e233cdd2b5941ff0ae093bfe4e72367f4fac6","observation_id":"2f22a796-18e1-43b1-9b1f-bb53375b693e","resolution":{"observed_at":"2026-08-03T21:36:01.921096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:36:02.149243Z","title":"Global convergence of policy gradient methods to (almost) locally optimal policies,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T21:36:02.149243Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:3dd8683a9a44d431b7ebd8a5e6845696e3f0b43ac1087b331da9b82ba5ba7fb9","observation_id":"e6a694b7-2513-4fc3-8b3a-58335de94770","resolution":{"observed_at":"2026-08-03T21:36:02.149243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:36:02.340129Z","title":"Given that the proof procedure is strikingly analogous to that of Case (i), it is omitted for brevity.2 G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T21:36:02.340129Z"},"links":{"citing_paper":"/paper/2511.15053"},"observation_digest":"sha256:577afc7805f13207f9e72292479e9fb9e03c24e5aff95a1921d9df7fcf801c0e","observation_id":"6e7dcbf5-7854-4ae8-a71f-9cafcc0e60c2","resolution":{"observed_at":"2026-08-03T21:36:02.340129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.15053","last_updated":"2026-07-31T07:42:57Z","latest_version":3,"primary_category":"cs.MA","snapshot_observed_at":"2026-08-08T05:00:45.638761Z","submitted_at":"2025-11-19T02:46:26Z","title":"Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2511.15053."}