{"as_of":"2026-08-11T08:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:472060a3756baec8b5f0cfaac486db497246847324af27112825fea488ff3b97","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:42:33.315453Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T01:58:48.241542Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13727","snapshot_observed_at":"2026-07-12T01:58:48.241542Z","title":"Scalable safe multi-agent rein- forcement learning for multi-agent system,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03512","last_updated":"2026-07-03T17:38:17Z","snapshot_observed_at":"2026-08-06T06:00:28.817452Z","submitted_at":"2026-07-03T17:38:17Z","title":"High-Precision Formation Control for Heterogeneous Multi-Robot Systems via Hierarchical Hybrid Physics-Informed Deep Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T01:58:48.241542Z"},"links":{"cited_paper":"/paper/2501.13727","citing_paper":"/paper/2607.03512"},"observation_digest":"sha256:3443c4e5c73ea18a6e4db0cc4710715367ff370258fd4265d925f3c9103543ab","observation_id":"0f220bbd-6724-4ea3-bb7c-f7b51849ea26","resolution":{"observed_at":"2026-07-12T01:58:48.241542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.13727/citation-record","integrity":"/paper/2501.13727/integrity","json":"/paper/2501.13727/citation-record.json","paper":"/paper/2501.13727"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.706054Z","title":"Constrained policy optimization","venue":null,"work_id":"6e166d16-c44a-4cac-83af-6fd9f240d16a","year":2017},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.202823Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:164867859ff4735cb958661b5a8e1e17a7621d45f82eb13183aa516e490efb19","observation_id":"b3c110ce-d129-4def-ab48-464b8d88cc69","resolution":{"observed_at":"2026-08-10T15:42:33.709776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.691586Z","title":"Learning transferable cooperative behavior in multi-agent teams","venue":null,"work_id":"ad9cb115-a8b5-4fe7-b6e0-8c462e9dcb1a","year":2020},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.207399Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:d0315722edf23d98498b59c37b81b7ec66bf56412f0a519701f17744c61441f2","observation_id":"247f7d00-5d7f-4ef9-8468-e4f1f4da5963","resolution":{"observed_at":"2026-08-10T15:42:33.696572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.674620Z","title":"Safe learning in robotics: From learning-based control to safe reinforcement learning","venue":null,"work_id":"a6ec6488-2bcd-4991-a64c-62165404d3e8","year":2022},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.211019Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:9a7a02191514ea0d8fa9e71f5e325284c8b9c294e720ab527d9016da9a85d0ff","observation_id":"fecf5c0e-12be-4748-80b6-2d97106ff844","resolution":{"observed_at":"2026-08-10T15:42:33.679075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.661065Z","title":"Drqn-based 3d obstacle avoidance with a limited field of view","venue":null,"work_id":"4e85c14b-653f-44ba-81b0-7eb27380ab26","year":2021},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.214769Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:53c6c6f70f270932309a65068ece1ab8b2ae006fdc1c46badf0baca731b969d8","observation_id":"b51738e4-cdc8-421b-a621-f56e76a6c044","resolution":{"observed_at":"2026-08-10T15:42:33.665771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.648917Z","title":"Safe rlhf: Safe reinforcement learning from human feedback","venue":null,"work_id":"9e2debb2-6ba2-4bfc-b1a2-29aa50c10205","year":2024},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.218775Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:1ca110ce651096eadd8c3c701bb7448e0cf04e60e4273982e8df1faf8133a84b","observation_id":"62b65941-6f06-44f2-9c4e-99f3c5b48195","resolution":{"observed_at":"2026-08-10T15:42:33.652865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.637739Z","title":"Safe multi-agent reinforcement learning for multi-robot control","venue":null,"work_id":"7fd08b27-2c8c-404c-9bd0-f13113ce227e","year":2023},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.222544Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:bd623ba77f8948d44e65f87a641dee0f95d4505231c28ab3acc5bee5b8aba2e1","observation_id":"31728b7e-2816-4e2a-93f3-4a31ac5411cd","resolution":{"observed_at":"2026-08-10T15:42:33.641650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.625985Z","title":"Scalable communication for multi-agent reinforcement learning via transformer-based email mechanism","venue":null,"work_id":"684677ed-d680-41c9-9d0b-3800ecbc9a1d","year":2023},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.226434Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:cb36b1bd389a3025866198ead97837496cd31294850b3b33e93142b51a3ee120","observation_id":"197b62d4-6670-4e47-9843-8cd07326c57f","resolution":{"observed_at":"2026-08-10T15:42:33.630075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.230135Z","title":"Long short-term memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.230135Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:27c28dbb8b7568d4b43f5c4e6a12e6f5c560ad82f3a5f8647ca33eeabfaff3e8","observation_id":"2a51c528-284b-4c45-a2dc-a13c61f7efc5","resolution":{"observed_at":"2026-08-10T15:42:33.230135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.603478Z","title":"Collision avoidance and navigation for a quadrotor swarm using end-to-end deep reinforcement learning","venue":null,"work_id":"6b33f856-8362-4fda-90a3-efb2068791be","year":2024},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.233955Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:34c2292332dfbfce23aaf833f60f2f58fb31ef642c568de5f6fbb8c049a880d0","observation_id":"04850b18-228f-4e7a-a0e3-f2d44c3be83b","resolution":{"observed_at":"2026-08-10T15:42:33.607387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.591210Z","title":"Graph convolutional reinforcement learning","venue":null,"work_id":"b60da2d3-5331-4191-91fc-310ddc776c01","year":2020},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.237486Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:3fb0272a907b6385fa43708eef11fee13e98bd310ba9b2504bb58a4d57d69df6","observation_id":"c4689a2f-b261-4ccb-aff5-082cf0b1838b","resolution":{"observed_at":"2026-08-10T15:42:33.595414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.579504Z","title":"Semi-supervised classification with graph convolutional networks","venue":null,"work_id":"5326be1f-e0b3-494e-9744-905a425a065a","year":2017},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.240963Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:80fb635b804f5d0d2542302e0194e33e688eb215d2768d7b95444bf821a2bac1","observation_id":"9416445e-cbed-4af1-9b8e-cf6d3f0bc66a","resolution":{"observed_at":"2026-08-10T15:42:33.583704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.566647Z","title":"Trust region policy optimisation in multi-agent reinforcement learning","venue":null,"work_id":"747e08c2-f13e-4da4-82b4-456b40c1c110","year":2022},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.244813Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:475d82b6ad4229f14465c9f5c37895d591220bde84a7ab334e8cfb3b4bb8490a","observation_id":"deccf4ed-a799-4387-bb9b-84db804f8ad2","resolution":{"observed_at":"2026-08-10T15:42:33.571672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.555005Z","title":"Cmix: Deep multi-agent reinforcement learning with peak and average constraints","venue":null,"work_id":"c9b7a85c-5389-480d-bf9a-6239866a3110","year":2021},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.248325Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:68eaa629b12107eb680d8fc2454e0eaa1565ea0b64de16068e947f2d0ef0fcd4","observation_id":"b9e737b9-35cb-4eb4-a5d0-ef257bbd5dc6","resolution":{"observed_at":"2026-08-10T15:42:33.558989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.543822Z","title":"Multi-agent actor-critic for mixed cooperative-competitive environments","venue":null,"work_id":"f8d7f1c8-5ba8-4c70-9cc1-287c52c81b46","year":2017},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.251664Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:69fa3fd60b52de931e3206e4735df7e0501067d53f918a909c5308d395db6ed8","observation_id":"463dc400-d9da-4470-aea6-a03698ee8d04","resolution":{"observed_at":"2026-08-10T15:42:33.547687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.530479Z","title":"Deep learning for safe autonomous driving: Current challenges and future directions","venue":null,"work_id":"e3c7ed5d-61c9-43a4-8fc5-9cc48d7ad2a7","year":2020},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.255554Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:0a48ffed40452460445329a43925d28c0c7a9fb8236bed054ec1f7c33f737301","observation_id":"c78f18e3-2e42-4dec-8301-4402589ead52","resolution":{"observed_at":"2026-08-10T15:42:33.534443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.518621Z","title":"Scalable multi-agent reinforcement learning through intelligent information aggregation","venue":null,"work_id":"5bfccc36-796f-405f-b4dd-5ed31e2eb321","year":2023},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.259166Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:bcef657368249c37f420d65b94c876f4b9a93ed825d284140876133fd50c1e28","observation_id":"9cbd690d-4e16-42ea-8bcc-faa99229538c","resolution":{"observed_at":"2026-08-10T15:42:33.522874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.506422Z","title":"A concise introduction to decentralized POMDPs , volume 1","venue":null,"work_id":"4979c054-464a-4efe-997c-051c4f8a4979","year":2016},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.262802Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:0eb8033f89ed3a1cc1f19d0286f5c57fa753bb9d35f6ca272c0dbb994591e2f1","observation_id":"46e0a22d-d97d-4ec0-9304-e80b70c6980d","resolution":{"observed_at":"2026-08-10T15:42:33.510938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04737","last_updated":"2019-06-11T09:42:00Z","snapshot_observed_at":"2026-08-01T21:07:35.425706Z","submitted_at":"2019-06-11T09:42:00Z","title":"Dealing with Non-Stationarity in Multi-Agent Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04737","snapshot_observed_at":"2026-08-10T15:42:33.266206Z","title":"Dealing with non-stationarity in multi-agent deep reinforcement learning","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.266206Z"},"links":{"cited_paper":"/paper/1906.04737","citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:5f5bd387140b024638de4fe396c176285808cbab48fb175e361e1b7331440a06","observation_id":"757a0885-56dc-49e2-b780-42628ca23c2b","resolution":{"observed_at":"2026-08-10T15:42:33.266206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.494723Z","title":"Monotonic value function factorisation for deep multi-agent reinforcement learning","venue":null,"work_id":"342dc438-7e98-4311-9bb0-055921c55aab","year":2020},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.270098Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:1967b121f25ee45caa6b7d8b9c9cd2140c0f56fb713eab74ea437d24d8eec848","observation_id":"040f8e5b-c53b-4426-ba0d-511f051134f9","resolution":{"observed_at":"2026-08-10T15:42:33.498727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-07T14:18:01.067346Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-10T15:42:33.274421Z","title":"Benchmarking safe exploration in deep reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.274421Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:e828c6205bd0b2cec2dd3cf58b0ff1908a61134a8e7c79ff6f4002ae4ac27074","observation_id":"512aa79d-cd0c-4e7e-a916-740147faf020","resolution":{"observed_at":"2026-08-10T15:42:33.274421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-09T23:04:15.431743Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-10T15:42:33.278141Z","title":"High-dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.278141Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:e2a75a633bce056b9b33845fac8c1c15ba1eb8f233325b6c0d0ebe59e785ed19","observation_id":"b96014ec-1f09-498d-aaf6-32e0bc00b692","resolution":{"observed_at":"2026-08-10T15:42:33.278141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-07-06T04:09:39.172428Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-10T15:42:33.281942Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.281942Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:2e16a45fb9b9792433855177d7fe9293abdef9f1c5e6ce25d1463a9adb708f9f","observation_id":"908368f2-f73b-4d7d-b9e8-13ab0fe776b2","resolution":{"observed_at":"2026-08-10T15:42:33.281942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.482440Z","title":"Masked label prediction: Unified message passing model for semi-supervised classification","venue":null,"work_id":"978a6fbc-2b3f-4466-889a-4c513f28dcd1","year":2021},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.285636Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:6211ffbad0ec97160df51f054b4792074e0be19c50b8e180d6a801342a0b2c38","observation_id":"a9bc3ede-9b43-4fd9-9957-e816f3560f63","resolution":{"observed_at":"2026-08-10T15:42:33.486300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.470185Z","title":"Learning multiagent communication with backpropagation","venue":null,"work_id":"ae9815e1-bceb-48a7-83c1-589995fcd8ac","year":2016},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.289266Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:e06b12a6f6f2b0bf3177274de752b247b4e531801a98f8d67d9c5fef6fcf86d7","observation_id":"fb0e634b-12e5-479e-862b-a4e87210f6a6","resolution":{"observed_at":"2026-08-10T15:42:33.474377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.457143Z","title":"Relative distributed formation and obstacle avoidance with multi-agent reinforcement learning","venue":null,"work_id":"216a8f3f-618f-4c4b-a850-a7dc623b507d","year":2022},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.293009Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:91203af3336e25272481be019a68228850497511bcada0aae765ff80164e283d","observation_id":"760187a1-3036-47da-9699-d97f6bf33771","resolution":{"observed_at":"2026-08-10T15:42:33.461247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.444929Z","title":"The surprising effectiveness of ppo in cooperative multi-agent games","venue":null,"work_id":"8383aea6-b196-4d7a-beee-a85bc708abd3","year":2022},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.296827Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:431e8013d9716cbda09fa5f01d48259999f688a9c407561a237213e46a2e2072","observation_id":"3db52748-8219-4071-aa0d-1c598580f139","resolution":{"observed_at":"2026-08-10T15:42:33.448848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.433077Z","title":"Attention-based reinforcement learning for real-time uav semantic communication","venue":null,"work_id":"7d411d25-e9cf-4bd2-9f89-62e04f7e7156","year":2021},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.300375Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:192331a5bf3915393030d03cb319a3db229bae1462f51d55acc5591fa7b7465a","observation_id":"4b4f57d8-16a7-4510-ba0d-676016dd04a3","resolution":{"observed_at":"2026-08-10T15:42:33.437154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.421156Z","title":"A survey of multi-agent deep reinforcement learning with communication","venue":null,"work_id":"bc4ab838-3382-420f-a8e1-b9b958521519","year":2024},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.304387Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:180ead0eaa256f2b869d76368ae81a70268fde05f9d873d40a606e75f224daf5","observation_id":"16e2c2fd-c0f7-4e7a-9a45-7870a63f5901","resolution":{"observed_at":"2026-08-10T15:42:33.425535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01465","last_updated":"2019-12-02T16:00:20Z","snapshot_observed_at":"2026-08-01T19:44:03.464325Z","submitted_at":"2019-10-03T13:40:46Z","title":"Reducing Overestimation Bias in Multi-Agent Domains Using Double Centralized Critics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01465","snapshot_observed_at":"2026-08-10T15:42:33.307887Z","title":"Reducing overestimation bias in multi-agent domains using double centralized critics","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.307887Z"},"links":{"cited_paper":"/paper/1910.01465","citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:34c25ae27d808060eacbc5c8c5dd6350836f38a7050673744d53706e19f68601","observation_id":"60dd8506-e42c-4a1b-932b-02233dff5179","resolution":{"observed_at":"2026-08-10T15:42:33.307887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.407560Z","title":"Settling the variance of multi-agent policy gradients","venue":null,"work_id":"f2f54561-8dc3-4200-8e52-775256b3c1e7","year":2021},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.311765Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:864d7309469b54f4a0b0cb8b3df1e661e0bc9f81a83373d83fe769aa98048c8f","observation_id":"2038acb6-4e53-4feb-8c36-cd29e2a5739a","resolution":{"observed_at":"2026-08-10T15:42:33.413186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:42:33.315453Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.315453Z"},"links":{"citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:e9b4d87c3bab6cdd95b785a92a4a6dc92bde6b7c77e4d4ec6cb78548101956ac","observation_id":"26675881-98b1-4dee-9305-8bfe0b9012de","resolution":{"observed_at":"2026-08-10T15:42:33.315453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","latest_version":2,"primary_category":"cs.MA","snapshot_observed_at":"2026-08-10T18:15:43.040827Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2501.13727."}