{"as_of":"2026-08-19T18:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb2f91c24d8458816d1ccc1731d4bd0caa611dee91187eb38bc5adf18eb7bce3","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:37:51.203051Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18433/citation-record","integrity":"/paper/2505.18433/integrity","json":"/paper/2505.18433/citation-record.json","paper":"/paper/2505.18433"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T14:37:49.595626Z","title":"M., Lee, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.595626Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:6c16132b6d58296a94b0c678a051c6b2e136669317ee3184b46f11ee4bbdb95e","observation_id":"46a68390-421d-49d1-9370-1eac56f40bb0","resolution":{"observed_at":"2026-08-07T14:37:49.595626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:51.800990Z","title":"how do I threaten others?","venue":null,"work_id":"a5d58298-51cc-4bef-b88d-813aab09b465","year":2024},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.203051Z"},"links":{"citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:113f260e7a131d02b7782f12e946aefd53ed4eaa8995c7c6de1aef9d8d7b99c4","observation_id":"ef881c85-c3de-4cea-8d50-00d201ca72a2","resolution":{"observed_at":"2026-08-07T14:37:51.871455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:52.423484Z","title":"∥E h δt,l2 (W ∗ t )ψi t,l2 Ft,l1 i − E ˆAdv(s, a; W ∗ t )ψθi t (s, ai) ∥ Ft # =2 ( 1 + γ 1 − γ + 1)rmax + 2ϵcritic · E","venue":null,"work_id":"864a9080-787f-4d0c-bbb9-7d7351f96472","year":2019},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.788819Z"},"links":{"citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:144e2fd31c07a2c53b45af9c110ba36bac765226ff69f6649161ea34db1afa07","observation_id":"2f8f0faf-52cd-4820-8589-704c567821b1","resolution":{"observed_at":"2026-08-07T14:37:52.462204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.10486","last_updated":"2023-06-18T06:22:04Z","snapshot_observed_at":"2026-08-16T15:23:04.301463Z","submitted_at":"2023-06-18T06:22:04Z","title":"On the Global Convergence of Natural Actor-Critic with Two-layer Neural Network Parametrization","version":1},"cited_work":{"arxiv_id":"2306.10486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.10486","snapshot_observed_at":"2026-08-07T14:37:51.578817Z","title":"On the Global Convergence of Natural Actor-Critic with Two-layer Neural Network Parametrization","venue":"cs.LG","work_id":"01c66673-f295-4020-a52c-fab3ba1bf2d8","year":2023},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.978040Z"},"links":{"cited_paper":"/paper/2306.10486","citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:c05c563c1a64ebcb4c84295c03ed5b25da1c9fc83e19106f220073ed217bbc6f","observation_id":"4f2d4312-4f5a-4c2d-b944-14296e41961b","resolution":{"observed_at":"2026-08-07T14:37:51.686242Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:51.957273Z","title":"To handle token inputs of variable length, we apply zero-padding to each critic input","venue":null,"work_id":"f3214d56-38df-44fd-ad65-03cee1c17e11","year":2023},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.107253Z"},"links":{"citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:90153ab098e0566e081f99df5ec05c23dec347a89bc2d3432a0054a8a518b6d6","observation_id":"489fd0ce-9c06-4eb2-913e-fbdd859e8013","resolution":{"observed_at":"2026-08-07T14:37:52.026075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07001","last_updated":"2025-08-09T14:39:27Z","snapshot_observed_at":"2026-08-08T10:08:32.820588Z","submitted_at":"2025-08-09T14:39:27Z","title":"Consensus-based Decentralized Multi-agent Reinforcement Learning for Random Access Network Optimization","version":1},"cited_work":{"arxiv_id":"2508.07001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.07001","snapshot_observed_at":"2026-08-07T14:37:51.369926Z","title":"Consensus-based Decentralized Multi-agent Reinforcement Learning for Random Access Network Optimization","venue":"cs.NI","work_id":"3042c2c1-5582-47a5-a9bf-fb01b04c2db4","year":2025},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.157860Z"},"links":{"cited_paper":"/paper/2508.07001","citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:88ae9151396d4389351cdd868dd3dd750feea86d00154250a3613be1a0a91bee","observation_id":"0119de7c-346a-44c3-9f95-bc1992000288","resolution":{"observed_at":"2026-08-07T14:37:51.427489Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:53.103533Z","title":null,"venue":null,"work_id":"ce5fd511-e751-428e-bb53-00a0fbcb1cb0","year":2022},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.312276Z"},"links":{"citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:21098cfb9cb4818b72d1da08e8408e880329622bd0235264578c9bc252fdc0e1","observation_id":"bea09f7e-dc5b-4e1d-a4b5-97fd6b65d0a2","resolution":{"observed_at":"2026-08-07T14:37:53.176273Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:52.935239Z","title":"and Hu, M","venue":null,"work_id":"a6b9e908-5204-4887-82eb-53623931f859","year":2021},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.386417Z"},"links":{"citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:88136d2082d7523db6aa0855c3d444e2fdc743f7ced5233b64d6a30d798aab74","observation_id":"e4e62907-22b9-41d1-9c2b-62daafb75e67","resolution":{"observed_at":"2026-08-07T14:37:53.033616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:52.560218Z","title":"This shows that µ(·) is the stationary distribution ν(·) under kernel ePπθ and the proof is complete","venue":null,"work_id":"d776e8b8-92b0-42d6-ab7b-a4b221588da3","year":2018},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.713670Z"},"links":{"citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:cd17c53627a325a0cb24e8e6b3484f6fdb004f575b78262b0f0e9e7b26f0d0d0","observation_id":"58a7b01a-3f0e-4346-9f4e-ff821e6e8c61","resolution":{"observed_at":"2026-08-07T14:37:52.636746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:52.263862Z","title":null,"venue":null,"work_id":"4ceedc08-3dfd-47b6-8c1e-648267ce67fd","year":1999},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.903345Z"},"links":{"citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:1a48d2a99208daca82892a619f3f211dcaaa407bb8e31595699d4d0d22fab85f","observation_id":"04730589-14b8-4750-a1e4-9422399e38ec","resolution":{"observed_at":"2026-08-07T14:37:52.369370Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:53.430752Z","title":null,"venue":null,"work_id":"9533591b-fc69-4654-ab53-4a50778dded2","year":2019},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.880124Z"},"links":{"citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:31ca43e693507aa0ae4ccaec07843b6e7dc39358b251ff29b20d210b5ed602f5","observation_id":"feb4dd64-dd48-4c20-9cc1-d061b7f7e99b","resolution":{"observed_at":"2026-08-07T14:37:53.493998Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.07842","last_updated":"2018-02-21T23:14:44Z","snapshot_observed_at":"2026-08-14T19:43:31.539745Z","submitted_at":"2018-02-21T23:14:44Z","title":"Convergent Actor-Critic Algorithms Under Off-Policy Training and Function Approximation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.07842","snapshot_observed_at":"2026-08-07T14:37:50.128557Z","title":"C., Hoang, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.128557Z"},"links":{"cited_paper":"/paper/1802.07842","citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:7e1fbbe87406802a7b2d4ed743a9518356afdbc74ee127f1da58dccfbb4e16f6","observation_id":"80b18d47-1fa3-434a-94ef-4d9db26a8185","resolution":{"observed_at":"2026-08-07T14:37:50.128557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:53.249142Z","title":"P., Littman, M","venue":null,"work_id":"db5ccece-f7cd-43d2-a1cc-193cc2e6c4aa","year":1996},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.067698Z"},"links":{"citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:563c5315c2035f8e97ee64a5c9fc19db26ac34b81a2132941a4f269d39a9ac9d","observation_id":"eeed37a9-e4e7-42af-9f55-a2ad88a69fba","resolution":{"observed_at":"2026-08-07T14:37:53.324972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-07T14:37:49.719868Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.719868Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:c8e400a81e6e47ff1f9c6bd6bd546db36ed772ae9569abea13a70c201a1242d2","observation_id":"31e4b1dc-e949-4db6-ae92-ac91011c0ef7","resolution":{"observed_at":"2026-08-07T14:37:49.719868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03557","last_updated":"2020-05-08T02:06:12Z","snapshot_observed_at":"2026-08-16T13:48:41.926654Z","submitted_at":"2020-05-07T15:42:31Z","title":"Non-asymptotic Convergence Analysis of Two Time-scale (Natural) Actor-Critic Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.03557","snapshot_observed_at":"2026-08-07T14:37:50.547041Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.547041Z"},"links":{"cited_paper":"/paper/2005.03557","citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:ee33277f3385a02d76cd44f41ddec93cc33c5f00794d5abe80c5db82ffbce797","observation_id":"35f8e9cf-80a4-4bcb-9073-2f4fe6170e35","resolution":{"observed_at":"2026-08-07T14:37:50.547041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:52.762732Z","title":null,"venue":null,"work_id":"fe4a9107-2e89-4f52-a1d9-79d7f4e5cbef","year":2021},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.672319Z"},"links":{"citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:1da9e57f85a3c1b5ed56857b5becd227a79a620773bd3fbc468c322d4d18ef7b","observation_id":"39a0b930-2f27-460e-9304-dc823c6fe3be","resolution":{"observed_at":"2026-08-07T14:37:52.834453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.02532","last_updated":"2017-04-08T20:04:03Z","snapshot_observed_at":"2026-08-19T03:36:21.853521Z","submitted_at":"2017-04-08T20:04:03Z","title":"Deep Reinforcement Learning framework for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.02532","snapshot_observed_at":"2026-08-07T14:37:50.230383Z","title":"N., Vinyals, O., Senior, A., and Sak, H","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.230383Z"},"links":{"cited_paper":"/paper/1704.02532","citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:d333b1be20f6ecc00ba67cee5630fdb56a67ba26c6b5dfe5c8fecab146c60eef","observation_id":"6c4beec6-2389-4943-9809-ad2e33beae03","resolution":{"observed_at":"2026-08-07T14:37:50.230383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:53.765992Z","title":null,"venue":null,"work_id":"74a58bd3-cc26-4263-951a-f8e0448abe14","year":2024},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.649145Z"},"links":{"citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:93e16f5cfa7b4726cfdb2327d1be93861c76c4a40314ac5cc0e0fa390808226e","observation_id":"953aad2d-8336-4120-adc9-57ec058fc692","resolution":{"observed_at":"2026-08-07T14:37:53.866601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-07T14:37:50.634794Z","title":"M., and Lazaric, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":748,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.634794Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:d7061d00145870e9d61db68154a0b22776ca1cf285f8971f749d0baee10c1082","observation_id":"dcf521a0-b708-4b1f-8818-2aa335a7b53d","resolution":{"observed_at":"2026-08-07T14:37:50.634794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:52.101639Z","title":null,"venue":null,"work_id":"d999a86b-acc9-47ea-80a7-7455554f7e94","year":2024},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.000974Z"},"links":{"citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:3a0f85d171053176c2fc35fdbdcd329a3975895bdae7153e8e2b53423791a769","observation_id":"4963354b-2683-465d-a8aa-e67098507826","resolution":{"observed_at":"2026-08-07T14:37:52.183943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-17T14:40:56.015819Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-08-07T14:37:50.431221Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":4344,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.431221Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:751b811ea65c0f3232f38633e1b703650ab7f5d6553fc9cce3b7da331260c837","observation_id":"cb628c24-4853-460c-a3d4-056fa4cffffd","resolution":{"observed_at":"2026-08-07T14:37:50.431221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:53.614414Z","title":"Feriani, A","venue":null,"work_id":"8a279a1d-bde9-4070-8a34-3e0662cc1ad7","year":2021},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":9869,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.803146Z"},"links":{"citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:5491173fbf8cf7e084210ba38ac3297a35287f426083ac528242eae6c1e22cee","observation_id":"a9c98cd0-fecb-4ba1-90e3-a3bc7e013b32","resolution":{"observed_at":"2026-08-07T14:37:53.684537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2505.18433."}