{"as_of":"2026-08-09T03:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:770ed1c14f5d3d06032da688dac0a11808c51f3775eae749fc0f93a22baae407","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-25T21:17:28.832301Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.25526/citation-record","integrity":"/paper/2606.25526/integrity","json":"/paper/2606.25526/citation-record.json","paper":"/paper/2606.25526"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"In: International Conference on Machine Learning, pp","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:506036bd48034730eaaeadab85567539bfac5cc2cd52dd6df933e459cde03043","observation_id":"6b45067e-eff9-4101-a366-75840814ead9","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:10b7c9960dc766db7e41f864a0740a3a9ec09bd256c515b818bf3388287b132d","observation_id":"081a4368-3940-4d0d-b334-364f9e32731a","resolution":{"observed_at":"2026-07-04T19:30:07.610025Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"In: International Conference on Learning Representations (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:73d67a310bbe805d50edb74e25c860c4ceb189b90abde5660d2d7a4009a5c47e","observation_id":"d110a2c1-6cf4-4362-b53b-90fa480d5a73","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"The Journal of Machine Learning Research21(1), 7234–7284 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:4868d3f56fc012acb319ab723d0c00c8f8dcabf9b2c6bb43fd81583f3d41f9d8","observation_id":"202a086b-79e2-43eb-a267-286f5187da70","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"Advances in neural information processing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:dbb079124ae601c572b9e9a04764e44eba074b45d9e26d49ccc263d689ca9936","observation_id":"c70f578c-41db-43cd-a757-e387554a43c7","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.09533","last_updated":"2020-11-18T20:29:59Z","snapshot_observed_at":"2026-08-06T15:48:23.562152Z","submitted_at":"2020-11-18T20:29:59Z","title":"Is Independent Learning All You Need in the StarCraft Multi-Agent Challenge?","version":1},"cited_work":{"arxiv_id":"2011.09533","doi":"10.48550/arxiv.2011.09533","metadata_source":"arxiv_reference","pith_arxiv_id":"2011.09533","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., Gupta, T., Makoviichuk, D., Makoviychuk, V ., Torr, P","venue":"arXiv (Cornell University)","work_id":"74cea5c0-e9e0-4389-9a11-5c905c1db3e8","year":2011},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"cited_paper":"/paper/2011.09533","citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:a2c3696383125f5883bb4a710c4916f82bbf46e82b4775917dbed669d30e3744","observation_id":"ef5355c4-7fd3-44a2-91fb-08055c8b5910","resolution":{"observed_at":"2026-07-04T19:30:07.596579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"Advances in Neural Information Processing Systems35, 24611–24624 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:727ed4001aa1b5c556bc6f814615a3c2ffcb2280e2a129ced6ddeb8febf79a60","observation_id":"57ae7e59-881e-41da-a366-7b67e4fae686","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"Advances in neural information processing systems33, 5527–5540 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:4840529f828c48fa1f5559bf3faea152f0e85a566eba7e7d74e69ed13305ee1e","observation_id":"d0477c5c-04a3-475f-8ca9-6d16aa313ea7","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"In: International Con- ference on Learning Representations (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:01463e637dc07e60478edf873d4a9369b9006978efbc071d3289e781ceab02e4","observation_id":"cca2e325-ab9a-49b3-b088-3e086cbbddb8","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"In: International Conference on Machine Learning, pp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:9c23b12808a458062e84a45caf1c450bb0360b60f6dcc94a5dabdefe4f3dcf05","observation_id":"af68f09f-19b0-4cd0-8ddc-64cf6cba99ae","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence, vol","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:d2a9f9505711406223b2b20db1f91d1f4e5d5a36174e3ea77ebaea71a848547e","observation_id":"344996c8-efe8-4f74-b1e2-985b9130ecb2","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"In: International Conference on Learning Representations (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:9e787853271cd8dd32376d610e7b31c8ee224d0f2e846c2e62eb2bd27cfb8605","observation_id":"4c690da5-698d-4fbc-a0af-0a9dcdc76f00","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.09183","last_updated":"2019-03-11T20:17:29Z","snapshot_observed_at":"2026-07-06T05:53:08.086224Z","submitted_at":"2017-07-28T10:49:41Z","title":"A Survey of Learning in Multiagent Environments: Dealing with Non-Stationarity","version":2},"cited_work":{"arxiv_id":"1707.09183","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.09183","snapshot_observed_at":"2026-07-05T06:00:43.849924Z","title":"A Survey of Learning in Multiagent Environments: Dealing with Non-Stationarity","venue":"cs.MA","work_id":"b84216cf-59cc-4716-8c58-fcfdd7218613","year":2017},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"cited_paper":"/paper/1707.09183","citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:889a32e2669c275f7c3c57eed9802403ea059d93bc12f7a6dc969031426a37c8","observation_id":"1cb1eea1-b308-4ea9-b4fe-07034c582e38","resolution":{"observed_at":"2026-07-04T19:30:07.592132Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"Advances in Neural Information Processing Systems35, 16509–16521 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:da99b23a9adc374aaa0cea991787fd71b51e134fa97e0fb9d38b9e26be8786d5","observation_id":"e39db308-939c-4c0e-b727-21b694d1c6a4","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"In: Proceedings of the 40th International Conference on Machine Learning, vol","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:add72398c2718a0d569aa4747a9c03beb240d31d1a1d9a56396514947c4d2290","observation_id":"9b2eeeb1-963f-4da9-9de6-166efad42d45","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"In: International Conference on Learning Representations (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:f175eb0c2b7d2c4020f80155404df4cfdf4eaf923b26abb4b291be97306a4aad","observation_id":"6a78b47f-b8f3-4dc1-ae06-122fe7d14509","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"Advances in Neural Information Processing Systems34, 12208–12221 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:cbe5b865e2856b5916ab814887df0230e6ba18699c04dfd574c87ed122b0b8b9","observation_id":"81d129e0-2fd9-49dd-bb0a-7f64b5207bde","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"In: 2012 IEEE/RSJ International Conference on Intelligent Robots and Systems, pp","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:1096ba10544e90c6b3d5568e20bb96cb47a23725b04557d13be4b5eacbbafd7d","observation_id":"f533fb55-fe2b-49c2-bd15-cf3793ef68b1","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"Advances in Neural Information Processing Systems34, 26437–26448 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:9217e421999724a71870a550f3f1ac40ff4c3c9f918f31a56f61e4194f3d0625","observation_id":"f5b3ae74-7ac5-4cc4-84ec-1b071287dffb","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"Advances in neural information processing systems32(2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:39b1d992fe902e07b623522886b20f3d3956e1da9f0a7b36b02c4fa3a201a446","observation_id":"6b9f5360-f391-4140-9275-3cdc57d47d9d","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13799","last_updated":"2022-09-01T03:43:25Z","snapshot_observed_at":"2026-07-06T12:02:01.569473Z","submitted_at":"2021-10-26T15:56:57Z","title":"Neural PPO-Clip Attains Global Optimality: A Hinge Loss Perspective","version":4},"cited_work":{"arxiv_id":"2110.13799","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.13799","snapshot_observed_at":"2026-07-04T19:30:07.606033Z","title":"arXiv preprint arXiv:2110.13799 , year=","venue":null,"work_id":"7b5599df-da32-4cc8-b157-db011273f56a","year":2021},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"cited_paper":"/paper/2110.13799","citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:1e85f12da85000c481e1d1567f206267ceacfea23dc807b5eabc351c8772f22f","observation_id":"fb52bd12-3557-4508-8120-10976269fba7","resolution":{"observed_at":"2026-07-04T19:30:07.607563Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"In: Proceedings of the Nineteenth International Conference on Machine Learning, pp","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:95cd577aad8b61eb1b0b44b5021be43d19a1d9f7145487e1b7a658e6fadbd93e","observation_id":"cfa13852-eb11-4d7d-b145-5950e759a4f2","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"In: Proceedings of the 34 AAAI Conference on Artificial Intelligence, vol","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:8ca1a5963314dd07275eb51ffeeed965f9d0d49df6be5d05802c85448001167e","observation_id":"3cc91ded-77f3-47a8-ab08-45cda041c5ac","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07869","last_updated":"2021-11-09T10:42:04Z","snapshot_observed_at":"2026-07-06T09:28:53.031338Z","submitted_at":"2020-06-14T11:22:53Z","title":"Benchmarking Multi-Agent Deep Reinforcement Learning Algorithms in Cooperative Tasks","version":4},"cited_work":{"arxiv_id":"2006.07869","doi":"10.48550/arxiv.2006.07869","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking multi-agent deep reinforcement learn- ing algorithms in cooperative tasks","venue":"arXiv (Cornell University)","work_id":"ffcc70b2-bfb7-4e18-a3a9-c4614c3bc974","year":2006},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"cited_paper":"/paper/2006.07869","citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:c7a2c79d8c9f3d78436131fd6892cc5440d70871aa5f1031bb7decfe6e60e70d","observation_id":"e311621e-b17b-4d73-ae61-dd336cf0c76e","resolution":{"observed_at":"2026-07-04T19:30:07.589674Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"Transactions on Machine Learning Research (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:300b58b8c08089597d7615e6034e1a1eeb6f3796c40d3d064bebfa0c3c4ef3fa","observation_id":"0b956c29-dace-4739-a5c3-f9f2956407ac","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.06709","last_updated":"2021-05-07T14:03:40Z","snapshot_observed_at":"2026-07-06T09:04:43.836543Z","submitted_at":"2020-03-14T21:29:09Z","title":"FACMAC: Factored Multi-Agent Centralised Policy Gradients","version":5},"cited_work":{"arxiv_id":"2003.06709","doi":"10.48550/arxiv.2003.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2003.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep multi- agent reinforcement learning for decentralized continuous cooperative control","venue":"arXiv (Cornell University)","work_id":"87e6ae77-5995-40cd-8f19-770f64e0e089","year":2003},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"cited_paper":"/paper/2003.06709","citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:a8051a3c8bf9dc52acf30b2c2f0e923924db9ba1bef9891ffd0f9309b48ddef2","observation_id":"c0b0c554-dee5-4b5d-9566-b958c3a26a3b","resolution":{"observed_at":"2026-07-04T19:30:07.599725Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04043","last_updated":"2019-12-09T07:26:52Z","snapshot_observed_at":"2026-08-09T00:58:24.558416Z","submitted_at":"2019-02-11T18:43:53Z","title":"The StarCraft Multi-Agent Challenge","version":5},"cited_work":{"arxiv_id":"1902.04043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1902.04043","snapshot_observed_at":"2026-07-04T19:30:07.613613Z","title":"S., Farquhar, G., Nardelli, N., Rudner, T","venue":null,"work_id":"2f26b259-cf76-40f3-b027-6946ef7763c8","year":1902},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"cited_paper":"/paper/1902.04043","citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:7d6e8b19cd85917dbac7c339f0304575626671d562fa780389e2b2ef8049fa98","observation_id":"9395ea3d-2d17-4909-b2b8-ddebff0f6c08","resolution":{"observed_at":"2026-07-04T19:30:07.614931Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"Journal of Machine Learning Research25(32), 1–67 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:99904d13c71b222e87ce9cbbd8980e19134d3b9c9b9fd3ac459f801b2a77b7ff","observation_id":"0d02a4e9-d44e-4bc8-8949-982c2760b064","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"Proceedings of the national academy of sciences114(13), 3521–3526 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:b8977a1ae286664248eecb2d3cff89d0fca2804a576428d76cd58e389cfc06da","observation_id":"d8807a59-f697-48f9-9f45-c7ff58acf8bd","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"IEEE Transactions on Neural Networks and Learning Systems (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:907f9d2db36ad86aa4b766c321c1cd5a88b7316f1147d7e9c3625b69c58ed19e","observation_id":"959bbcdd-7c7a-4448-ae56-0d1c8bcd3177","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02793","last_updated":"2022-02-10T07:08:47Z","snapshot_observed_at":"2026-08-07T18:54:17.552613Z","submitted_at":"2021-10-06T14:17:09Z","title":"Multi-Agent Constrained Policy Optimisation","version":2},"cited_work":{"arxiv_id":"2110.02793","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02793","snapshot_observed_at":"2026-07-04T19:30:07.600849Z","title":"arXiv preprint arXiv:2110.02793 (2021)","venue":null,"work_id":"dd88565a-4054-4899-b39c-424804aeccdf","year":2021},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"cited_paper":"/paper/2110.02793","citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:0cc780d6a17752f5489619cc56b6ed43eac1124bd15a6fe602ed90aeeb359635","observation_id":"dbd9fe14-791d-41a0-a134-a41219cda2c3","resolution":{"observed_at":"2026-07-04T19:30:07.602226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"In: International Conference on Machine Learning, pp","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:7604698cb2b0c8ca8af544fb31c856cf9f604434b35522a97f97ba00a8835395","observation_id":"b68e7cfd-eafb-4dda-b757-7aa3507cba34","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"In: International Conference on Machine Learning, pp","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:04e739300a398734dd20534b97069d4ab53a7ed50735a0645be5f2ef641e61a1","observation_id":"8f49671a-167e-493a-87a9-1ee90f45b5ec","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"Advances in neural information processing systems 29(2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:16594dd5125bb56eb62b12ec6a0b180e2d1ad6b1072ee0dc836a3c3c877934a9","observation_id":"f8ca9ee7-b34a-48c8-b977-662d778cd1d8","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"Advances in Neural 35 Information Processing Systems34, 13458–13470 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:f2d68ef97c8ad4fed89e48daa0c70c6b77f4517aadb0a094aa10ffdb7e765666","observation_id":"15b98025-7d42-4040-b4c7-e9744dc19410","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"In: The Eleventh International Confer- ence on Learning Representations (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:bdd64c5cb27b57191425c5f130d359d08011d875959f08d96cbae023e212e611","observation_id":"b5584e8d-19dd-4c61-8afd-9e0ae4990794","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"In: Proceed- ings of the 17th International Conference on Autonomous Agents and MultiAgent Systems","venue":null,"work_id":null,"year":2085},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:f35cbae1e4d507b5e8fd4fe6a7f1c41198f7758d73837a2e04ac28bfdb12d83c","observation_id":"54fc2b56-a0ac-4865-85e6-66d9825432f9","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07798","last_updated":"2017-05-22T15:06:25Z","snapshot_observed_at":"2026-07-06T05:43:40.624942Z","submitted_at":"2017-05-22T15:06:25Z","title":"A unified view of entropy-regularized Markov decision processes","version":1},"cited_work":{"arxiv_id":"1705.07798","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.07798","snapshot_observed_at":"2026-07-09T22:56:37.739931Z","title":"A unified view of entropy-regularized Markov decision processes","venue":"cs.LG","work_id":"80b2d2e4-f964-4515-9237-cb45fb9435e3","year":2017},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"cited_paper":"/paper/1705.07798","citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:59cd48a8f817d85003f2129c5370c99e0d73b7fb2f62faefba1b9d79a5a7c5c0","observation_id":"f2109b79-44ed-46e2-b8c9-20eb78192180","resolution":{"observed_at":"2026-07-04T19:30:07.604839Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"Mathematical programming 198(1), 1059–1106 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:c04967ed4237c48e46581f024ece5faa9f675c78e8302455bc32d535ee2d4cf7","observation_id":"25b37762-775e-409e-89b2-322c9752f19e","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"SIAM-Society for Industrial and Applied Mathematics, Philadelphia, PA, USA (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:ec6b4cbf7966cc92ed3c0698e2b3231b1976f47f933fd8b89cdc21a53c778f84","observation_id":"48fc81a1-f672-4791-82d0-21e6ab3f41fd","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:17:28.832301Z","title":"The Journal of Machine Learning Research22(1), 4431–4506 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:2857657486885faf384ad9fc8f529666a06918b77eb605f3381d057b647e2180","observation_id":"1276ca49-ae62-47a4-86a5-8145d237f1a2","resolution":{"observed_at":"2026-06-25T21:17:28.832301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06440","last_updated":"2018-10-14T22:54:38Z","snapshot_observed_at":"2026-08-05T07:10:19.910840Z","submitted_at":"2017-04-21T08:33:59Z","title":"Equivalence Between Policy Gradients and Soft Q-Learning","version":4},"cited_work":{"arxiv_id":"1704.06440","doi":"10.48550/arxiv.1704.06440.url:https://arxiv.org/abs/1704.06440","metadata_source":"pith","pith_arxiv_id":"1704.06440","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Equivalence Between Policy Gradients and Soft Q-Learning","venue":"cs.LG","work_id":"4ce87d9d-fea7-4dba-b8e0-412ce7c0417f","year":2017},"citing_paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-25T21:17:28.832301Z"},"links":{"cited_paper":"/paper/1704.06440","citing_paper":"/paper/2606.25526"},"observation_digest":"sha256:71f842ea9af0bf3bcd05708bd1d65b3a7e76c86d1ac3b05debb216abc80fdcbd","observation_id":"d22bef29-31a7-4ef7-a9c1-3be7f32bb2cc","resolution":{"observed_at":"2026-07-04T19:30:07.612436Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.25526","last_updated":"2026-06-24T08:05:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T08:43:32.910783Z","submitted_at":"2026-06-24T08:05:11Z","title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":32,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2606.25526."}