{"as_of":"2026-08-16T17:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0c4704808fe6a44aec2f429380fe7f0d562c2d94597a6fafdca67e9cd7d302a","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T15:31:05.521816Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.01022/citation-record","integrity":"/paper/1908.01022/integrity","json":"/paper/1908.01022/citation-record.json","paper":"/paper/1908.01022"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1613/jair.1.11366","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.561257Z","title":"Johnson, and Mykel J","venue":null,"work_id":"aa312bfa-3f7f-47d9-9122-54ba1c580a1f","year":2019},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.310320Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:b64bd63ee94b8be687c11c405a40a4789b4ab93b8a8a12085a095d464d2e0485","observation_id":"65b0b90a-3e02-49e0-95da-dcb52ce62544","resolution":{"observed_at":"2026-08-14T15:31:05.566753Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:06.170746Z","title":null,"venue":null,"work_id":"0413cb3f-8957-4660-a501-2a00de04d564","year":2013},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.316614Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:baaccb7142a4f0f7d8f0c11eb91223e58c38e6e0aae114acb0914c8c7e4b9250","observation_id":"2abd25d9-1d41-4b62-b7a1-cba858270789","resolution":{"observed_at":"2026-08-14T15:31:06.175089Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:06.157323Z","title":null,"venue":null,"work_id":"bf9926d5-4276-4207-a080-d677dd7c9e69","year":2002},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.323044Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:cc60814cca9a45f2e9460969b649d587898d98f7f5369286e1f6e83f3eb09781","observation_id":"c3f3bea2-e71a-45a9-b433-67b050cac5b1","resolution":{"observed_at":"2026-08-14T15:31:06.162235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:06.144052Z","title":null,"venue":null,"work_id":"3fda7d40-fd2c-41ec-982f-c831e77911b4","year":2008},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.328023Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:9c6c848b88e953c2fc49be640daeed8b5a361cae4d12f392f0e250741d25af88","observation_id":"b11fd6d3-dd02-4198-b51f-42c40520d513","resolution":{"observed_at":"2026-08-14T15:31:06.148539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.07289","last_updated":"2016-02-22T07:02:58Z","snapshot_observed_at":"2026-08-14T22:21:43.095256Z","submitted_at":"2015-11-23T15:58:05Z","title":"Fast and Accurate Deep Network Learning by Exponential Linear Units (ELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.07289","snapshot_observed_at":"2026-08-14T15:31:05.334928Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.334928Z"},"links":{"cited_paper":"/paper/1511.07289","citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:e107d11598e1bd74d9590bc9191c0c495e073f6545b583ddbb2ee5be7b2ab034","observation_id":"9e36de8c-4caf-4d17-8afe-26f0fa00b6f9","resolution":{"observed_at":"2026-08-14T15:31:05.334928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:06.129925Z","title":null,"venue":null,"work_id":"97d7a7d7-6a76-4555-8fb6-42707154864a","year":2016},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.340214Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:491bfbe6447fd45ead215238a8b3034ee778b71e30abb3a6060d5fac8ed77fa7","observation_id":"390e912c-f17c-4e01-83da-bf9735861889","resolution":{"observed_at":"2026-08-14T15:31:06.134754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:06.116279Z","title":null,"venue":null,"work_id":"4beabf32-3cf0-4dea-b7d2-79d205f1de94","year":2018},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.346065Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:aa626ec5ae5d8779adcfb1d057b8bcaec7be5a44848cfb0cc6800f087c75bcbc","observation_id":"31080e64-0030-4af8-9554-dd8f96dbe302","resolution":{"observed_at":"2026-08-14T15:31:06.120944Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.07564","last_updated":"2018-06-22T10:19:00Z","snapshot_observed_at":"2026-08-14T19:43:46.108087Z","submitted_at":"2018-02-21T13:39:28Z","title":"Clipped Action Policy Gradient","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.07564","snapshot_observed_at":"2026-08-14T15:31:05.351418Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.351418Z"},"links":{"cited_paper":"/paper/1802.07564","citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:893edfa7dd7da881fdbae558501dd219ac6d660d98efeae5284294ea870fe240","observation_id":"cbcaafa7-d455-418d-8f95-a939dcbc5237","resolution":{"observed_at":"2026-08-14T15:31:05.351418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:06.102996Z","title":null,"venue":null,"work_id":"62d1286d-c0c3-41c4-96bc-4fafe0b560d4","year":2017},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.358713Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:b0a8a3f17b28c4b2b5eb0b11968b4d49ff61ea6ebf90460eecbd2d2712641142","observation_id":"a7b9d074-431a-4ed1-9a19-397a40aca2d9","resolution":{"observed_at":"2026-08-14T15:31:06.107449Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:06.087991Z","title":null,"venue":null,"work_id":"597cf875-7ecb-4af9-8373-2e373ace7d53","year":2004},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.364252Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:9dff7cb153e79e924d6a39f94aebcecb9a5f8eca9eadfdd894c6d7c76bde34dd","observation_id":"77bfb7dd-02fe-43fc-aa02-000d6e612255","resolution":{"observed_at":"2026-08-14T15:31:06.093176Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.09183","last_updated":"2019-03-11T20:17:29Z","snapshot_observed_at":"2026-08-14T20:44:41.468688Z","submitted_at":"2017-07-28T10:49:41Z","title":"A Survey of Learning in Multiagent Environments: Dealing with Non-Stationarity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.09183","snapshot_observed_at":"2026-08-14T15:31:05.371369Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.371369Z"},"links":{"cited_paper":"/paper/1707.09183","citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:dab62404b318763a896a4974eaaf8be6064c4a776548b661ad3734df27680781","observation_id":"95fa0923-ad83-4470-9988-dab739bc888e","resolution":{"observed_at":"2026-08-14T15:31:05.371369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.375880Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.375880Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:af2d869a33a69b13a096bdc160cde08e2f9f7159c163faa3ee6bf7c3b8b19a29","observation_id":"32cf939a-3c82-4e49-8946-0fa8e015955c","resolution":{"observed_at":"2026-08-14T15:31:05.375880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:06.061324Z","title":null,"venue":null,"work_id":"9fde84ed-4347-4596-afcc-f3c85a5e9f84","year":2018},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.380130Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:319f6404f569de0a097e672e3f6359c140637f8bc46282f5a60853b652eba10c","observation_id":"8f3f02ff-79d9-4035-8c09-03ce77149e4e","resolution":{"observed_at":"2026-08-14T15:31:06.067606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-14T15:31:05.384134Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.384134Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:c4eb351fe31dd78a0765f97d8f66b24090805ad390f18e575c90c9987bdc0422","observation_id":"32931c9f-8002-4bc8-8fd4-ebd9481ddb33","resolution":{"observed_at":"2026-08-14T15:31:05.384134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:06.045838Z","title":null,"venue":null,"work_id":"d3b56348-99f2-41ad-9e0d-8130bb93c545","year":2015},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.388898Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:83d0d4e2ac7de77901fd9e0d6a5e7a19c00845b0f00da15663ac29e67bdb9111","observation_id":"3720ba56-e903-4da3-bbfe-a3d0ea01153d","resolution":{"observed_at":"2026-08-14T15:31:06.050520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:06.031592Z","title":null,"venue":null,"work_id":"804d25d1-9db5-4e68-96d7-2186ef5df684","year":2018},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.392726Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:fede5f58a563f2a374c918e242be360b18fc7bb3879222b52b14506aaaac06fe","observation_id":"367d1e24-2482-48c5-a289-cfcb8691f10a","resolution":{"observed_at":"2026-08-14T15:31:06.035364Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:06.017972Z","title":null,"venue":null,"work_id":"1e774d62-2f21-48d9-ac38-e5b4cf2bdfd6","year":2018},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.396605Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:0ba8675f71ad0c8aa7247af893aec7f8d21d76e340321fbc2db69789f8fcef19","observation_id":"e6754999-4130-47a4-b56f-fe4a4e9ab889","resolution":{"observed_at":"2026-08-14T15:31:06.022486Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.402129Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.402129Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:e05407a03c6f2550db44ba97970cf158a47669422e5d8d70080190e5d23f8e67","observation_id":"25514841-e649-49eb-a425-5ff16000293e","resolution":{"observed_at":"2026-08-14T15:31:05.402129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.983051Z","title":null,"venue":null,"work_id":"26db454f-6d39-4605-a48a-19fa28f785d2","year":2019},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.411482Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:0207aca373b143a0ef57811c2a77d6d63f028681ca06b10a66a1da3cad76f8a9","observation_id":"317920fb-7582-45ea-9fc8-1f12ddfbb102","resolution":{"observed_at":"2026-08-14T15:31:05.987246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.968726Z","title":null,"venue":null,"work_id":"8e15a3ce-c5fb-4f10-928e-3d70bfc59359","year":2018},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.415148Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:a71d51aa5a9736a9a5ee916c308f10932a340da2eb5257a6f0ba83d6883ac379","observation_id":"2515a4c3-9227-4b91-af23-521c1ba2ff2c","resolution":{"observed_at":"2026-08-14T15:31:05.973456Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.953501Z","title":null,"venue":null,"work_id":"75ac7cd8-b2d1-4b21-b70d-53c44a810794","year":2008},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.418822Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:843b6d979e89f7035f70c694a595e78f247bd03b956542c4aa961ab6874ba729","observation_id":"fff15ea5-9d5e-40f3-be5d-e30aadbc7c29","resolution":{"observed_at":"2026-08-14T15:31:05.957429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.940531Z","title":null,"venue":null,"work_id":"c273a440-f017-4187-96f5-3b5b0065381c","year":2013},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.422232Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:196b181771c8a5c6de24f7f408b4c4d19c825b85c6040df668638e4d20c4d1c2","observation_id":"a8344aac-f8b1-42e0-9db0-9a715a16d13f","resolution":{"observed_at":"2026-08-14T15:31:05.944517Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.925611Z","title":null,"venue":null,"work_id":"0ae48d1b-7a90-4432-b484-5787fdab14a6","year":2016},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.426347Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:95a00e945661d6eaf4d30f10f97a746efff415a09616c4926dfb6cbd5e2316ae","observation_id":"89d0028c-8ae7-42f3-9dae-0dd1ba801994","resolution":{"observed_at":"2026-08-14T15:31:05.929995Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.911787Z","title":null,"venue":null,"work_id":"a6aaca6e-88eb-4b8f-b4a3-4b1edf02c31f","year":2019},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.429813Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:47e53977b7b4a91263699b2f60c53bd20255645f20c17089556ab99abf9c4fcf","observation_id":"f9d723fa-679b-4101-ba09-bc228dbe0f23","resolution":{"observed_at":"2026-08-14T15:31:05.916570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.11485","last_updated":"2018-06-06T17:58:09Z","snapshot_observed_at":"2026-08-14T19:30:41.502606Z","submitted_at":"2018-03-30T14:23:39Z","title":"QMIX: Monotonic Value Function Factorisation for Deep Multi-Agent Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.11485","snapshot_observed_at":"2026-08-14T15:31:05.435396Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.435396Z"},"links":{"cited_paper":"/paper/1803.11485","citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:7aadd042485a62fb09f4f5b98a3aa358d50a8b94e16ec427fb8be40b08a0ba68","observation_id":"d80faefe-d94e-4247-907e-f12844b09d40","resolution":{"observed_at":"2026-08-14T15:31:05.435396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.897238Z","title":null,"venue":null,"work_id":"52af06c2-7215-423e-84a6-611e15bd0c9a","year":2008},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.439753Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:2d11f3dd54df90caf53bd50b82a435500f64c74434d9ae11e4b7b8456e8a363f","observation_id":"cee04415-5860-4db5-a79d-4f347956314c","resolution":{"observed_at":"2026-08-14T15:31:05.901447Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.443913Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.443913Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:7b8f52a9d23c4034de03afb5ddf0cbd0502b5f59352556c0228bf4e15a6d4df8","observation_id":"c12ff084-751d-4dd2-84a8-2d52dcc6b8e2","resolution":{"observed_at":"2026-08-14T15:31:05.443913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.452852Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.452852Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:6067a80dc07f3657d55bad213c7e8dc325c63e80375b8a78219d54a0f66b250f","observation_id":"1c33cf1f-9f28-4881-81d1-1df3056d797e","resolution":{"observed_at":"2026-08-14T15:31:05.452852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.461962Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.461962Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:755d0793d7f3492bb930159cf63c9938a8738bfd3bc88ed702cf3ca8db73fb37","observation_id":"3a596216-928c-4a0b-9e78-04139c97f911","resolution":{"observed_at":"2026-08-14T15:31:05.461962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.813609Z","title":null,"venue":null,"work_id":"07b315b0-0df3-4f47-886e-90b755b7f979","year":2011},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.471601Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:ca5fdbcbf724c4ff355a80b7b302001c7e7a98c08a3e1b1e381f34970cc6bde7","observation_id":"56e5fd1e-a936-41b0-8b26-a7f7442ea947","resolution":{"observed_at":"2026-08-14T15:31:05.818430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.801029Z","title":null,"venue":null,"work_id":"1cd0ea70-ca54-480b-a359-7b7336674713","year":2018},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.476887Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:bbee587388bae37e8d84307affb4af8cc225d9267ccc2a0e100712d3f72bf380","observation_id":"86865a61-7c71-4f0d-b72a-c520e833a3cc","resolution":{"observed_at":"2026-08-14T15:31:05.805674Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.786273Z","title":null,"venue":null,"work_id":"686c5fd1-9f42-4790-b47f-a287d006a17f","year":2000},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.481402Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:aa4e2e8db23a02021239c3b66eb6cac75a6b35ff52eb2eb1a83fb827b10e405c","observation_id":"ef9503ff-9247-442c-9534-86bfd7386253","resolution":{"observed_at":"2026-08-14T15:31:05.790913Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-14T15:31:05.466656Z","title":"arXiv preprint arXiv:1707.06347 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.466656Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:f757468636dfbd956cc65b4bfac100aedfc64cc11c2dcf0e26063b9aa235f0a2","observation_id":"01eef5a0-2d6b-4956-b49b-91a666d4146e","resolution":{"observed_at":"2026-08-14T15:31:05.466656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14471","last_updated":"2021-10-26T06:06:31Z","snapshot_observed_at":"2026-08-13T21:28:14.747299Z","submitted_at":"2020-09-30T06:42:09Z","title":"PettingZoo: Gym for Multi-Agent Reinforcement Learning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14471","snapshot_observed_at":"2026-08-14T15:31:05.493756Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.493756Z"},"links":{"cited_paper":"/paper/2009.14471","citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:4fb0b0c391cd1ddcabec5b17e7432cacb72794aeae50326d0420e5c40ca8e4bb","observation_id":"94e8f63d-5a69-4f53-b82c-520e8c7c1adb","resolution":{"observed_at":"2026-08-14T15:31:05.493756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.13625","last_updated":"2023-10-31T05:06:10Z","snapshot_observed_at":"2026-08-10T13:45:07.842716Z","submitted_at":"2020-05-27T20:14:28Z","title":"Revisiting Parameter Sharing in Multi-Agent Deep Reinforcement Learning","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.13625","snapshot_observed_at":"2026-08-14T15:31:05.499450Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.499450Z"},"links":{"cited_paper":"/paper/2005.13625","citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:dd9871f6009b31304b8f8524df849e98c9271dc4e592b7f2387af57b49efc7dd","observation_id":"1369fbe1-dc29-407e-846b-67a129431d07","resolution":{"observed_at":"2026-08-14T15:31:05.499450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.749115Z","title":null,"venue":null,"work_id":"b0759d57-fdf4-4321-8dee-01f47a54c421","year":2002},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.506160Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:08bd2d6040435a4d1677ac51719c03514a02c8b7c2569f024fe0038bfeb21947","observation_id":"d17a4c03-1a2a-4d9f-b905-e33d00b3d7a6","resolution":{"observed_at":"2026-08-14T15:31:05.754955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.767664Z","title":null,"venue":null,"work_id":"07b99860-a8ae-42bf-93f9-aba571657068","year":2005},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.487612Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:16619fbc29f6e41684bcce760f6ae7501c1c02664d32912940aee967d6035ffd","observation_id":"9ddddd13-3209-49eb-ac6d-e6f38885c044","resolution":{"observed_at":"2026-08-14T15:31:05.772770Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.722639Z","title":null,"venue":null,"work_id":"642f77e6-cd14-4394-9fb5-3cea476a0643","year":1992},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.516684Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:038475af78b85e8d34cf8679e01db249807f75196250a069515288094e0f2d63","observation_id":"41b53b4a-d3e6-475f-97e7-f9b154727802","resolution":{"observed_at":"2026-08-14T15:31:05.728186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.706619Z","title":"∑︁ u π(u| s𝑡, θ)· 𝑛∑︁ 𝑖=1 𝑞π(s𝑡, u)∇𝜃𝑖 log𝜋𝑖(𝑎𝑖|𝜏𝑖,𝑡,𝜃𝑖) # = Eπ","venue":null,"work_id":"3ff37080-f93c-44cf-aa7d-f54eda5d134e","year":2002},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.521816Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:cd6760f084edd25ffe64ef47d290f730d6165efa81d6952e7954ac09fe8ba21a","observation_id":"2709a228-c544-464b-bf22-7d02fea8d23b","resolution":{"observed_at":"2026-08-14T15:31:05.710236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.510597Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.510597Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:ef41042f3ef25ae39226317697af40476ab8f7b461ed82ce6ee933f2efdcd66f","observation_id":"9a3b754f-7ca8-43d6-b5d7-bae40ef791ec","resolution":{"observed_at":"2026-08-14T15:31:05.510597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.872069Z","title":"In International Conference on Machine Learning (ICML)","venue":null,"work_id":"62d2a0d2-8d9d-4074-9897-7e9a61a58529","year":null},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.448376Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:8d88c02daa122c29a41fead320231b2c2655f08b249d7ec94715889c6685dc25","observation_id":"7d9c4ee0-fbdf-4f9c-87c5-9a2b2759cfc8","resolution":{"observed_at":"2026-08-14T15:31:05.876700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.840794Z","title":"In International Conference on Learning Representations","venue":null,"work_id":"b3767e5a-e801-4954-b8c6-d3850213fc89","year":null},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.457531Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:d2ae25984f5e9ff8ac927bb22caffc68c16dedf82fec32afb59ac649f1272f01","observation_id":"181958b0-4945-4f8d-b794-b7216c44b7cf","resolution":{"observed_at":"2026-08-14T15:31:05.855426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:05.997613Z","title":"In Advances in Neural Information Processing Systems (NIPS)","venue":null,"work_id":"c14d30d9-6c1b-4b54-a757-e590fa5eaf45","year":null},"citing_paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning","version":4},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-14T15:31:05.406555Z"},"links":{"citing_paper":"/paper/1908.01022"},"observation_digest":"sha256:409417a2649b6d1d21fccf223254b034e84387b94ab6f5d05babe29fe7bf5b00","observation_id":"010840c6-7b1b-4124-a893-4d5449536316","resolution":{"observed_at":"2026-08-14T15:31:06.001974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.01022","last_updated":"2021-01-04T20:16:46Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T03:25:34.484111Z","submitted_at":"2019-08-02T19:20:29Z","title":"Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:1908.01022."}