{"as_of":"2026-08-04T11:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:63446b74c58dff4266e7b560c6780defeee5a9b926e8160493a8ce5f4d1f1f3a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:39:32.181171Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T18:45:00.587178Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.10090","last_updated":"2026-07-04T05:19:25Z","snapshot_observed_at":"2026-07-09T23:17:08.002707Z","submitted_at":"2023-11-16T18:58:43Z","title":"JaxMARL: Multi-Agent RL Environments and Algorithms in JAX","version":6},"cited_work":{"arxiv_id":"2311.10090","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10090","snapshot_observed_at":"2026-07-07T02:17:02.673620Z","title":"Jaxmarl: Multi-agent rl environments and algorithms in jax","venue":null,"work_id":"2a3824b2-3a1e-4362-be0b-b58a12ec06d0","year":2024},"citing_paper":{"arxiv_id":"2502.12272","last_updated":"2026-04-30T11:57:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T19:16:37Z","title":"Learning to Reason at the Frontier of Learnability","version":6},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-23T02:41:21.571824Z"},"links":{"cited_paper":"/paper/2311.10090","citing_paper":"/paper/2502.12272"},"observation_digest":"sha256:6da9c5d958bc0207f348580303eb8faad4eb0641197d3c0b7421449869df80b6","observation_id":"8d6e0c89-2840-4822-a6f3-7c0dbb8d85cb","resolution":{"observed_at":"2026-07-07T02:17:02.673620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10090","last_updated":"2026-07-04T05:19:25Z","snapshot_observed_at":"2026-07-09T23:17:08.002707Z","submitted_at":"2023-11-16T18:58:43Z","title":"JaxMARL: Multi-Agent RL Environments and Algorithms in JAX","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10090","snapshot_observed_at":"2026-08-02T21:30:17.439093Z","title":"arXiv:2311.10090 [cs]","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.20141","last_updated":"2026-05-28T15:55:29Z","snapshot_observed_at":"2026-08-04T06:27:14.421909Z","submitted_at":"2026-02-23T18:53:09Z","title":"Recurrent Structural Policy Gradient for Partially Observable Mean Field Games","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T21:30:17.439093Z"},"links":{"cited_paper":"/paper/2311.10090","citing_paper":"/paper/2602.20141"},"observation_digest":"sha256:c7e81d8bc54975d5af53a413f10e0a599fd162b6a65b8238b55aebf212079676","observation_id":"54fc791e-7b69-4d75-9263-9d6fdf4a8ce5","resolution":{"observed_at":"2026-08-02T21:30:17.439093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10090","last_updated":"2026-07-04T05:19:25Z","snapshot_observed_at":"2026-07-09T23:17:08.002707Z","submitted_at":"2023-11-16T18:58:43Z","title":"JaxMARL: Multi-Agent RL Environments and Algorithms in JAX","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10090","snapshot_observed_at":"2026-08-02T18:45:23.125183Z","title":"Jaxmarl: Multi-agent rl environments in jax","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-03T15:50:59.564009Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.125183Z"},"links":{"cited_paper":"/paper/2311.10090","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:84cff7d2d724b501a6703939a104dc89c492533c649693bb6613d179d622746e","observation_id":"ec434f3f-33f7-441b-a989-de607ede3ee9","resolution":{"observed_at":"2026-08-02T18:45:23.125183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10090","last_updated":"2026-07-04T05:19:25Z","snapshot_observed_at":"2026-07-09T23:17:08.002707Z","submitted_at":"2023-11-16T18:58:43Z","title":"JaxMARL: Multi-Agent RL Environments and Algorithms in JAX","version":6},"cited_work":{"arxiv_id":"2311.10090","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10090","snapshot_observed_at":"2026-07-07T02:17:02.673620Z","title":"Jaxmarl: Multi-agent rl environments and algorithms in jax","venue":null,"work_id":"2a3824b2-3a1e-4362-be0b-b58a12ec06d0","year":2024},"citing_paper":{"arxiv_id":"2605.20255","last_updated":"2026-05-25T19:49:33Z","snapshot_observed_at":"2026-07-31T01:34:30.871692Z","submitted_at":"2026-05-18T12:02:41Z","title":"Multi-Agent Reinforcement Learning for Safe Autonomous Driving Under Pedestrian Behavioral Uncertainty","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T08:16:06.101467Z"},"links":{"cited_paper":"/paper/2311.10090","citing_paper":"/paper/2605.20255"},"observation_digest":"sha256:ea7ea05f052b2f8185886a9d3e1cfa92383ef2eec29861d74abc6bc58ea31d48","observation_id":"a35becdb-4c4b-4a1e-94d2-42474c00f678","resolution":{"observed_at":"2026-07-07T02:17:02.673620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10090","last_updated":"2026-07-04T05:19:25Z","snapshot_observed_at":"2026-07-09T23:17:08.002707Z","submitted_at":"2023-11-16T18:58:43Z","title":"JaxMARL: Multi-Agent RL Environments and Algorithms in JAX","version":6},"cited_work":{"arxiv_id":"2311.10090","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10090","snapshot_observed_at":"2026-07-07T02:17:02.673620Z","title":"Jaxmarl: Multi-agent rl environments and algorithms in jax","venue":null,"work_id":"2a3824b2-3a1e-4362-be0b-b58a12ec06d0","year":2024},"citing_paper":{"arxiv_id":"2605.20255","last_updated":"2026-05-25T19:49:33Z","snapshot_observed_at":"2026-07-31T01:34:30.871692Z","submitted_at":"2026-05-18T12:02:41Z","title":"Multi-Agent Reinforcement Learning for Safe Autonomous Driving Under Pedestrian Behavioral Uncertainty","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:15.177901Z"},"links":{"cited_paper":"/paper/2311.10090","citing_paper":"/paper/2605.20255"},"observation_digest":"sha256:80ec9308f8379cfcb9a500e73cc6936b7c046bd16954586b8a37a36b8ea5ae71","observation_id":"484bde7f-451f-4547-aabe-3ef1e0edc9c8","resolution":{"observed_at":"2026-07-07T02:17:02.673620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10090","last_updated":"2026-07-04T05:19:25Z","snapshot_observed_at":"2026-07-09T23:17:08.002707Z","submitted_at":"2023-11-16T18:58:43Z","title":"JaxMARL: Multi-Agent RL Environments and Algorithms in JAX","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10090","snapshot_observed_at":"2026-08-03T04:39:32.181171Z","title":"doi:10.48550/arXiv.2311.10090 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-04T10:34:47.530958Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":264,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:32.181171Z"},"links":{"cited_paper":"/paper/2311.10090","citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:01de0363c40df58f4cbb907b120a85bd9d661808e8934b223c6d3e7203259193","observation_id":"89a1d97a-2b21-464b-90cb-0e25441f4a72","resolution":{"observed_at":"2026-08-03T04:39:32.181171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.10090/citation-record","integrity":"/paper/2311.10090/integrity","json":"/paper/2311.10090/citation-record.json","paper":"/paper/2311.10090"},"outbound":[],"paper":{"arxiv_id":"2311.10090","last_updated":"2026-07-04T05:19:25Z","latest_version":6,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-09T23:17:08.002707Z","submitted_at":"2023-11-16T18:58:43Z","title":"JaxMARL: Multi-Agent RL Environments and Algorithms in JAX"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2311.10090."}