{"as_of":"2026-08-18T17:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8e55a1dbfe400ebf562c599c65a023793720879fba61fa59cac3aca7a5d4e7d","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:29:29.088194Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T16:46:43.051694Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:07:30.774365Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"cited_work":{"arxiv_id":"2505.01336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.01336","snapshot_observed_at":"2026-07-03T01:07:30.774365Z","title":null,"venue":null,"work_id":"b5a23d9c-0989-492e-b9c4-2c154bcf5c7e","year":2025},"citing_paper":{"arxiv_id":"2606.09039","last_updated":"2026-06-08T05:10:16Z","snapshot_observed_at":"2026-08-12T13:53:59.219866Z","submitted_at":"2026-06-08T05:10:16Z","title":"Agent Economics: An Entropy-Controlled Pluralistic Alignment Framework for Preventing Artificial Hivemind in Autonomous Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T16:46:43.051694Z"},"links":{"cited_paper":"/paper/2505.01336","citing_paper":"/paper/2606.09039"},"observation_digest":"sha256:5b5101a233b24fb593d8800f97468babf682c2f53dfb227c0a9ec6433233a13e","observation_id":"62b6628d-e11e-4d08-b5f7-7514e69c5c9b","resolution":{"observed_at":"2026-07-03T01:07:30.775656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.01336/citation-record","integrity":"/paper/2505.01336/integrity","json":"/paper/2505.01336/citation-record.json","paper":"/paper/2505.01336"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:28.765436Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.765436Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:cb942eaa12052c00a7d15f952fc14425617733780488d478dfcb1a77c4f30f87","observation_id":"ca492feb-432c-4c8f-96e3-dc41bea62bd5","resolution":{"observed_at":"2026-08-16T04:29:28.765436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.339680Z","title":"V., Christianos, F., and Sch\\\"afer, L","venue":null,"work_id":"f4aec283-ad19-4559-921d-606ae5fc031f","year":2024},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.771536Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:3a9d784d03bd76e743c6e1cc66742b432cf9d132ff60d8dcca122509abe54860","observation_id":"7c05293f-56c5-44ed-b56f-4377013ccee7","resolution":{"observed_at":"2026-08-16T04:29:30.345556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.323733Z","title":"and Arjun, C","venue":null,"work_id":"80d975d5-509a-44f8-b585-aff990197bc6","year":2017},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.776666Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:f4497a96ff08ade4ee586929f6a97be015119101ddb51fbe5cfb16152150a857","observation_id":"442054a2-802e-400d-b188-4a8fc295c02d","resolution":{"observed_at":"2026-08-16T04:29:30.329348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.306000Z","title":"R einforcement L earning and optimal control , volume 1","venue":null,"work_id":"c5857fdf-3e14-484b-b583-38651e121a03","year":2019},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.781172Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:1fbe34c5231b31977f25c4c5c51794908214e510cee640a1e5bf249817f5ac9d","observation_id":"b0dcdf61-ee8b-41e4-ba82-1bc4e1fddb09","resolution":{"observed_at":"2026-08-16T04:29:30.311344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.290401Z","title":"Explore, discover and learn: Unsupervised discovery of state-covering skills","venue":null,"work_id":"0b09ed4d-14b4-4fb2-9425-59885b99c1bc","year":2020},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.785925Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:ea6d3b78086cc661e7d065754e3f46912b9c05fec1caa15de5d84c17495ce01c","observation_id":"8767bd1b-5fb0-44b7-a5fa-b7344f9cf7bd","resolution":{"observed_at":"2026-08-16T04:29:30.295380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.275154Z","title":"Society of agents: Regret bounds of concurrent thompson sampling","venue":null,"work_id":"32fa68f0-63d0-4f69-a0de-2a3a3ceba720","year":2022},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.790738Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:9a9859d19198c60aa985fe159ff724c7e9fd2b71fa8f0d70f2e2f72bc65b5ed0","observation_id":"24508e34-9fad-4231-8791-804c060cdbca","resolution":{"observed_at":"2026-08-16T04:29:30.280452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.260180Z","title":"and Van Roy, B","venue":null,"work_id":"0ecfafe9-cbe3-4975-aad8-9748b3734eb6","year":2018},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.795406Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:02fa96b01ef0f8ebc857fed95e5c35162c73053d1fd20b0dcd245c4b3130fe49","observation_id":"be4888aa-63c9-47c8-85e0-54bceac65384","resolution":{"observed_at":"2026-08-16T04:29:30.264759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.244766Z","title":"Scalable coordinated exploration in concurrent R einforcement L earning","venue":null,"work_id":"0f09d752-076e-4fc0-98f8-9b2dff9849f3","year":2018},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.800463Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:1f295e69d52256ec6f223c3fbd573a0d64e0247063156d7edace06d3be6ce857","observation_id":"5927f593-ea4b-40a5-bd94-b042b5e19d74","resolution":{"observed_at":"2026-08-16T04:29:30.249764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.01561","last_updated":"2018-06-28T06:54:39Z","snapshot_observed_at":"2026-08-14T19:48:45.374287Z","submitted_at":"2018-02-05T18:47:30Z","title":"IMPALA: Scalable Distributed Deep-RL with Importance Weighted Actor-Learner Architectures","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.01561","snapshot_observed_at":"2026-08-16T04:29:28.804806Z","title":"Impala: Scalable distributed deep-rl with importance weighted actor-learner architectures","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.804806Z"},"links":{"cited_paper":"/paper/1802.01561","citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:2c41ceb5e40cece91e58fba4e5af818e25fb9d5335aac8ae364d782bcec80c9c","observation_id":"ad9b63cb-1e3f-4587-baf6-afcdd49338fa","resolution":{"observed_at":"2026-08-16T04:29:28.804806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:28.809663Z","title":"Diversity is all you need: Learning skills without a reward function","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.809663Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:4ff810efe3fa9ad4a5ca8a0ec87af230054d02ba4a64c4dcd1accd51bb154874","observation_id":"ccac4690-6024-44aa-91ef-15b4aa5c0a28","resolution":{"observed_at":"2026-08-16T04:29:28.809663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.219854Z","title":"A universal and generative physics engine for robotics and beyond, December 2024","venue":null,"work_id":"6f85a1cd-cdf9-49ff-a28b-fc46bce77806","year":2024},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.814285Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:bbb3d4f1a884e0eb8385af7fbfb5675b3389caa81a4e6d34d40ce193176802a6","observation_id":"631da63b-cc94-4f3e-85ed-3824832fbdda","resolution":{"observed_at":"2026-08-16T04:29:30.224744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.205348Z","title":"J., and Wierstra, D","venue":null,"work_id":"cfb2d544-a526-43b6-8d4c-d93fd3042c1d","year":2017},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.819124Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:5593118f7e9d57bc20e3eb2eafcbcd9122c7de460423d34f27afc698fe32cb23","observation_id":"84608f49-bb27-40fc-a011-e3cf7e6b0f60","resolution":{"observed_at":"2026-08-16T04:29:30.209778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.191115Z","title":"and Brunskill, E","venue":null,"work_id":"d85c539d-4d3f-4636-a8cc-5f36a333c983","year":2015},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.823563Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:b3ed7f746f3d45c3a79e87d6e52b6b3ac07d3ca6b66c7afb9a47beb1ee1796d4","observation_id":"20c7bb2f-47f4-46e3-872e-75141856a2a3","resolution":{"observed_at":"2026-08-16T04:29:30.195551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.02055","last_updated":"2021-01-07T12:57:27Z","snapshot_observed_at":"2026-08-16T18:53:56.436032Z","submitted_at":"2021-01-06T14:15:07Z","title":"Geometric Entropic Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.02055","snapshot_observed_at":"2026-08-16T04:29:28.828026Z","title":"D., Azar, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.828026Z"},"links":{"cited_paper":"/paper/2101.02055","citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:e6bb5aeec7886ddcb24abd854b457db7a241f720394f5123c1f473ed61f30de6","observation_id":"410f6f64-dc13-4be9-adfa-c97010a11851","resolution":{"observed_at":"2026-08-16T04:29:28.828026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.175928Z","title":"Fast task inference with variational intrinsic successor features","venue":null,"work_id":"87c4d3b8-69e9-452b-8146-90cf6a8309e1","year":2019},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.832808Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:c667137e144328f5044cdbc2cdf48ab619e1eb0b35d8623e6c4762677d547089","observation_id":"b33cc9f7-785c-462e-b89b-de9ae0f64318","resolution":{"observed_at":"2026-08-16T04:29:30.180566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.161019Z","title":"Provably efficient M aximum E ntropy E xploration","venue":null,"work_id":"ba020989-9f1b-4a54-a88c-576c7b9a6e37","year":2019},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.837239Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:8ec5bb9aa98626e11f3667f9d1178cda96599da1e987b88584c5b6f57edd7694","observation_id":"6e23c389-2c9e-480e-94c1-cf53ae4df2e6","resolution":{"observed_at":"2026-08-16T04:29:30.165815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.146281Z","title":"Wasserstein unsupervised R einforcement L earning","venue":null,"work_id":"80dad507-8d30-4dd8-9520-ac7d136d5616","year":2022},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.841415Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:e991cbae9a89eb063b04fbbd61670534ad52827fdfdd4888ed3104c334cfa019","observation_id":"e231ee68-daf4-4532-a6db-29f25decab31","resolution":{"observed_at":"2026-08-16T04:29:30.150762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12778","last_updated":"2024-08-18T16:30:44Z","snapshot_observed_at":"2026-08-18T17:00:43.931204Z","submitted_at":"2023-04-25T13:01:21Z","title":"Loss- and Reward-Weighting for Efficient Distributed Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2304.12778","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.12778","snapshot_observed_at":"2026-08-16T04:29:29.542931Z","title":"Loss- and Reward-Weighting for Efficient Distributed Reinforcement Learning","venue":"cs.LG","work_id":"67926e8a-2b64-45ef-9b79-846da1b24323","year":2023},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.845714Z"},"links":{"cited_paper":"/paper/2304.12778","citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:67ba80a66f18ff6b282ac24a96c856e1a7bcce5805476353e062db0c11f5ca95","observation_id":"700919e1-78cf-4856-9741-3e2861274449","resolution":{"observed_at":"2026-08-16T04:29:29.548348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.131410Z","title":"K., Lehnert, L., Rish, I., and Berseth, G","venue":null,"work_id":"a005bddf-5cb5-441f-a124-f7f10528056f","year":2023},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.851414Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:be0d3b2daf1fd18d5cbcf33b76e4eea2f954edd5f6dcfa21293b80f7cbfaae1f","observation_id":"adf1ecaa-1123-4e01-a13c-0a7459e1f5ee","resolution":{"observed_at":"2026-08-16T04:29:30.135987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.02907","last_updated":"2020-01-09T10:13:57Z","snapshot_observed_at":"2026-08-18T17:00:32.289679Z","submitted_at":"2020-01-09T10:13:57Z","title":"Population-Guided Parallel Policy Search for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2001.02907","doi":null,"metadata_source":"pith","pith_arxiv_id":"2001.02907","snapshot_observed_at":"2026-08-16T04:29:29.521636Z","title":"Population-Guided Parallel Policy Search for Reinforcement Learning","venue":"cs.LG","work_id":"495db691-42f2-4d13-b618-9184dc44dba0","year":2020},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.856035Z"},"links":{"cited_paper":"/paper/2001.02907","citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:fed0c44f006c47cd4a22e60a8bbba0b70f5da604e0da94b5e78edbad76182d53","observation_id":"fb1c490d-26f8-4afe-b448-b7175d4e1b90","resolution":{"observed_at":"2026-08-16T04:29:29.526743Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.116487Z","title":null,"venue":null,"work_id":"9aa013ea-1a6d-4813-9c9f-0de1f382ea8f","year":2001},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.860884Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:c5732b70b9dbda5e3e4e4974d4b0c8c4149f00aad313abc252abeb6775c404b0","observation_id":"9e4d0888-f228-4415-9791-320f393bb227","resolution":{"observed_at":"2026-08-16T04:29:30.121170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.101228Z","title":"Accelerating R einforcement L earning with value-conditional state entropy exploration","venue":null,"work_id":"f883b158-f926-4c25-90f2-508196ea2f51","year":2023},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.865256Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:6ef33d83aec12c1596dbf51e2d6950ce654a365f4cb0b50cea79c66a2c15bc7b","observation_id":"8ebfee3f-53a6-49c0-9fe3-f1d5fb195c2d","resolution":{"observed_at":"2026-08-16T04:29:30.106493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05274","last_updated":"2020-02-28T16:02:59Z","snapshot_observed_at":"2026-08-14T16:16:38.304748Z","submitted_at":"2019-06-12T17:57:02Z","title":"Efficient Exploration via State Marginal Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05274","snapshot_observed_at":"2026-08-16T04:29:28.869980Z","title":"Efficient exploration via state marginal matching","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.869980Z"},"links":{"cited_paper":"/paper/1906.05274","citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:305cf794f04065a0157a6ba82d734100375380db9f906776100a72c743bebb7f","observation_id":"54cdb562-1d2d-499e-86c5-5bae2341e4d6","resolution":{"observed_at":"2026-08-16T04:29:28.869980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-16T04:29:28.874852Z","title":"Offline R einforcement L earning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.874852Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:913b16a7fb1aaa3cf590138caf6c45afe571525042f1cb172def5358f2dce067","observation_id":"bfb851c1-619c-4524-b13b-c107124b809d","resolution":{"observed_at":"2026-08-16T04:29:28.874852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.02195","last_updated":"2021-11-01T11:32:15Z","snapshot_observed_at":"2026-08-18T17:00:30.484212Z","submitted_at":"2021-06-04T00:55:03Z","title":"Celebrating Diversity in Shared Multi-Agent Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.02195","snapshot_observed_at":"2026-08-16T04:29:28.879668Z","title":"Celebrating diversity in shared multi-agent R einforcement L earning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.879668Z"},"links":{"cited_paper":"/paper/2106.02195","citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:9e8db5e9c29f46edee55a625fec464ea295295833dea904c8f46c2d2ba43081f","observation_id":"f30d5404-31a0-4c8a-b3dd-5222ee451711","resolution":{"observed_at":"2026-08-16T04:29:28.879668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.085517Z","title":"and Abbeel, P","venue":null,"work_id":"c04f479c-8a9c-4df3-bb7d-266916d1087b","year":2021},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.884373Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:230665b4132ce7b05a28621f248afcd567588dd41ebf8f7ad65f305a83decf04","observation_id":"381b6ca6-b901-4fed-b096-b4310bb9f20e","resolution":{"observed_at":"2026-08-16T04:29:30.090691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.069597Z","title":"and Abbeel, P","venue":null,"work_id":"45c6a100-aeb0-490d-9270-fbf266b3be86","year":2021},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.888942Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:aa4bb47d2d45c05ca2e72954c93721a39131027e568206f0843c386b58b9c49e","observation_id":"00c63628-2022-463f-9ee1-6125090490ad","resolution":{"observed_at":"2026-08-16T04:29:30.074719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.054662Z","title":"Trajectory diversity for zero-shot coordination","venue":null,"work_id":"eb8d2eff-475b-4b2e-93dc-c6fce1106ec2","year":2021},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.893458Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:b1cef88c4ddcf47170a55d42e42664491b87ada9eaade3c200506d9ea82d2fe1","observation_id":"1669513c-5c48-4074-ab47-a93c752dc7cc","resolution":{"observed_at":"2026-08-16T04:29:30.059593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.038974Z","title":"M., Papini, M., Faccio, F., and Restelli, M","venue":null,"work_id":"b9e4bdb4-c193-467b-b9f7-e82c2cac7787","year":2018},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.897937Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:6b02c022a096939515995b2db24eb9b16b115d34423cdeb33e6cb8517686f857","observation_id":"2337ec25-9ad9-4e2a-97d7-85543a5f3c36","resolution":{"observed_at":"2026-08-16T04:29:30.044573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-17T17:19:33.060917Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-16T04:29:28.902425Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.902425Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:9c5b9e1c19f5a9966abae1eab60bc82f313411db59cb6632b7e420dcfc3c89be","observation_id":"8e8d49e2-8214-4e3f-886c-a05d68e3c7d1","resolution":{"observed_at":"2026-08-16T04:29:28.902425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.023057Z","title":"Unsupervised R einforcement L earning via state entropy maximization","venue":null,"work_id":"deebc7a3-af9f-4114-8728-364e696c6e8d","year":2023},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.907084Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:9606f6c922164c9d66c4d2d601a8be1fbf0e1eb001c2781a7562d538431d0523","observation_id":"4dd64824-9afb-42a6-a3a9-820edc4199de","resolution":{"observed_at":"2026-08-16T04:29:30.027791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:30.006906Z","title":"and Restelli, M","venue":null,"work_id":"7c411e1c-2f40-4dd3-92bd-18afd1238bd2","year":2020},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.911527Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:8b49db9492ce3d38fec156fb5c238d12362e0f00f2f414034a14d984c0d257a4","observation_id":"c1b5b60c-2dcf-46eb-87f8-946da5754912","resolution":{"observed_at":"2026-08-16T04:29:30.012116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:28.915760Z","title":"Task-agnostic exploration via policy gradient of a non-parametric state entropy estimate","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.915760Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:e94944de53fea56eecbe9eecf46b5da98808b067ec3a48640c83c1374bb2d7b4","observation_id":"f05f4f26-f52f-4f02-80ba-3fd46273acaf","resolution":{"observed_at":"2026-08-16T04:29:28.915760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.980865Z","title":"The importance of non- M arkovianity in maximum state entropy exploration","venue":null,"work_id":"7aaaed2a-6896-4e6c-9862-ce601a5bcafb","year":2022},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.920381Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:ec0cfdc381e4ca0f2cacf077d6ed27cd16d3bcf1ac0ebe47759ac8e86a9542bd","observation_id":"f0d93829-4340-404d-b6b5-67ea4ffaaed5","resolution":{"observed_at":"2026-08-16T04:29:29.986481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.964266Z","title":"Unsupervised R einforcement L earning in multiple environments","venue":null,"work_id":"22313dbc-b424-4416-a266-6ef432ef9652","year":2022},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.925008Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:41509bfb3d9521a5e865cf8cac24587a81be69f2ac163a28a098099a23ee3f1e","observation_id":"319df50d-cafd-4c7b-a2ad-0700c50e894a","resolution":{"observed_at":"2026-08-16T04:29:29.969379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01511","last_updated":"2023-01-27T11:13:06Z","snapshot_observed_at":"2026-08-16T17:23:54.237943Z","submitted_at":"2022-02-03T10:47:10Z","title":"Challenging Common Assumptions in Convex Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.01511","snapshot_observed_at":"2026-08-16T04:29:28.929321Z","title":"D., Bartolomeis, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.929321Z"},"links":{"cited_paper":"/paper/2202.01511","citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:6607d30e28f168489fdc2da1b507e672eb018102b2031c8fb0957bf8c0ada10f","observation_id":"d8ecfc0b-ebf7-46d8-9cf5-35557721fe12","resolution":{"observed_at":"2026-08-16T04:29:28.929321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15623","last_updated":"2023-11-07T10:35:45Z","snapshot_observed_at":"2026-08-18T17:00:27.459437Z","submitted_at":"2022-05-31T09:05:58Z","title":"k-Means Maximum Entropy Exploration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15623","snapshot_observed_at":"2026-08-16T04:29:28.934756Z","title":"and Cook, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.934756Z"},"links":{"cited_paper":"/paper/2205.15623","citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:087c101d1f1ca658900eef5106cae54ab0e817d1715b8a919706a7ccb179e74d","observation_id":"a118b8e0-5b65-45ff-a551-1ed96f472978","resolution":{"observed_at":"2026-08-16T04:29:28.934756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.949258Z","title":null,"venue":null,"work_id":"bcebad3b-b669-4471-9763-c17a76465601","year":2021},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.939384Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:a249de3a29e85decf201c71ff8e10a239becb5cb23c6b1860c1ed7c5b779d6b0","observation_id":"34c4d2cd-5236-4528-9057-1d65a3854a46","resolution":{"observed_at":"2026-08-16T04:29:29.954062Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.02710","last_updated":"2019-03-07T03:28:41Z","snapshot_observed_at":"2026-08-18T17:00:25.451863Z","submitted_at":"2019-03-07T03:28:41Z","title":"Concurrent Meta Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.02710","snapshot_observed_at":"2026-08-16T04:29:28.943694Z","title":"B., Chinnaobireddy, V., Wu, Y., and Salakhutdinov, R","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.943694Z"},"links":{"cited_paper":"/paper/1903.02710","citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:457821f83221a7d8007599c76b1c75130049e42eb5360cca4921954a5e615d73","observation_id":"d87d4dec-a701-44a3-813a-d81bd69a865f","resolution":{"observed_at":"2026-08-16T04:29:28.943694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.934039Z","title":"HIQL : Offline goal-conditioned RL with latent states as actions","venue":null,"work_id":"8eeb6e8e-4a89-4f0c-a16a-f9760b6554e0","year":2023},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.948378Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:fb7c58b9d88eff129bf9d35936bef313fe613d78067b9ddc37f333db64e2e87f","observation_id":"508ff0a1-307a-4be4-a8b1-303c9fc0f474","resolution":{"observed_at":"2026-08-16T04:29:29.938749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.918868Z","title":"and Schaal, S","venue":null,"work_id":"be7a41e8-743f-4885-b458-88d9be6729cc","year":2008},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.952742Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:89cadc07c5dd69312e36ba65844891c36d26213ec41cd9b010969131e77696cf","observation_id":"3644ba89-373a-4b6c-b323-db3fdea8d32d","resolution":{"observed_at":"2026-08-16T04:29:29.923554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.903042Z","title":"An analysis of ensemble sampling","venue":null,"work_id":"b2e38174-6045-43b7-8842-6f33d4c61358","year":2022},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.956978Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:84a3dc448d2d4bd88c1d0cedb17ee397cb21d6e6d09bd90470502c2d5a5c7fdd","observation_id":"24a44d1d-7862-45b8-82fa-6a21b3432a41","resolution":{"observed_at":"2026-08-16T04:29:29.907757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:28.961581Z","title":"Learning to walk in minutes using massively parallel deep reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.961581Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:1c669763dad9b7697f11858c0331c48340d65f5a4b8ff477ac89f07076ee752e","observation_id":"7a3abb51-b38d-49aa-8d35-1a606652953c","resolution":{"observed_at":"2026-08-16T04:29:28.961581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.877364Z","title":"Trust region policy optimization","venue":null,"work_id":"bc0a9a4f-8426-46f4-8974-a2a063dd2f6f","year":2015},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.966203Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:71ed28e826eeac728c521459cad4e8a77a98a3cb64a94443ae7f63cf560be702","observation_id":"1a8e8614-9e5c-4fcb-8cda-30e1ae8cc530","resolution":{"observed_at":"2026-08-16T04:29:29.882223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.861915Z","title":"State entropy maximization with random encoders for efficient exploration","venue":null,"work_id":"8f380b7b-2c19-4fdd-9506-06371838621d","year":2021},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.970864Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:d145832697673c44ced6eef7b38dbabb7951789b6cd29d1cf2419d51de39be48","observation_id":"7c54071f-5b65-4ec7-a1a9-0040851163ae","resolution":{"observed_at":"2026-08-16T04:29:29.867018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:28.975187Z","title":"Dynamics-aware unsupervised discovery of skills","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.975187Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:c947071b64b6a1887f9872ed2445a8e9ada1d8941b01055cc1871e16c36f5b33","observation_id":"6c9bc1fe-9d7a-447a-a502-e9874d2a06eb","resolution":{"observed_at":"2026-08-16T04:29:28.975187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.836505Z","title":null,"venue":null,"work_id":"f1f4683e-1f3d-4606-b4fa-6686ab9a082a","year":2007},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.979713Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:0b3496dfd874e1a6e2342a67a6b8b3bb3093971a09c054f260a5ab75986206cb","observation_id":"43523bc6-6786-4f8a-9aa6-6f291f39d1e0","resolution":{"observed_at":"2026-08-16T04:29:29.841672Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.820907Z","title":null,"venue":null,"work_id":"d602d374-3f41-43b4-9a90-865cd540f835","year":2018},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.984338Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:498e70adcfbd4d94b20fb7e56a29134c16b722657118882ace9a2670162a8295","observation_id":"f01d4c75-0225-4ad6-ac46-52d719b4ac67","resolution":{"observed_at":"2026-08-16T04:29:29.825358Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.805462Z","title":"S., McAllester, D., Singh, S., and Mansour, Y","venue":null,"work_id":"d5bb4787-4afd-42ff-b27e-b05fdce53e7f","year":1999},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.988909Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:5440b53c7aa04687ac4988ccb0a81b912f23308a5120996fe2c84cd155181bc3","observation_id":"fe535f67-6aab-4617-8ea6-fcf22be2fea7","resolution":{"observed_at":"2026-08-16T04:29:29.810632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.790921Z","title":"and Lazaric, A","venue":null,"work_id":"cbf75496-4d04-4df3-a1b4-94f817ca2b81","year":2019},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.993368Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:93b46534168aebc1407410202786733b3e7b2dd5d405b30bb57d15b10a338e87","observation_id":"a477bf22-3305-47b1-8b65-bb744fcedb81","resolution":{"observed_at":"2026-08-16T04:29:29.795543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.775462Z","title":"Active model estimation in M arkov decision processes","venue":null,"work_id":"bd03701b-ffb6-42ba-a46e-aebacc460410","year":2020},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:28.998058Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:da79ee9aa754c5970850013e18cacfc2076c796001f636cdd909d916ece11e55","observation_id":"0efeffdb-c49c-442a-beb5-a4d2a14523f4","resolution":{"observed_at":"2026-08-16T04:29:29.780828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.760071Z","title":"Fast rates for maximum entropy exploration","venue":null,"work_id":"f0e3f7d8-7050-4a65-b043-56a46535ed36","year":2023},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.002489Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:07fa68428a1b993160a7d97a5324c9720201f83b15ef7bba5cd6ada7bceabfea","observation_id":"dd573194-a187-4920-84d0-10133ca38b2d","resolution":{"observed_at":"2026-08-16T04:29:29.765242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.007066Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.007066Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:c5b30e2bfb507ca0a45ef0f82d81bce7fd15c0a3859007899a866b2a0caf793e","observation_id":"a7487554-9280-464e-83ad-fe9a4bfd6e25","resolution":{"observed_at":"2026-08-16T04:29:29.007066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-08-13T22:24:37.672685Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-16T04:29:29.011405Z","title":"U., Cola, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.011405Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:42df07249a38de7926bfda6bbf4e3dbd7eca62f11a4e84ad7bc892a12db51283","observation_id":"f6043888-fd26-4ac9-a448-85f7032defab","resolution":{"observed_at":"2026-08-16T04:29:29.011405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05512","last_updated":"2019-10-12T07:14:33Z","snapshot_observed_at":"2026-08-13T20:09:25.360973Z","submitted_at":"2019-10-12T07:14:33Z","title":"Influence-Based Multi-Agent Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.05512","snapshot_observed_at":"2026-08-16T04:29:29.016121Z","title":"Influence-based multi-agent exploration","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.016121Z"},"links":{"cited_paper":"/paper/1910.05512","citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:049a39d4e0aea93cb32c34db68726a5dd4cd1ecc2dea6a5d49c50d79a49bcf7d","observation_id":"67d76fbb-6241-447f-b2b3-c5af0fe0560e","resolution":{"observed_at":"2026-08-16T04:29:29.016121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.020821Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.020821Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:076864b2150fc9290580801baf7b8b8b71b1d31de01d4be15b83ce647a5d7816","observation_id":"419a58b6-b38b-4577-ae9d-6b20ca4b6553","resolution":{"observed_at":"2026-08-16T04:29:29.020821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.734725Z","title":null,"venue":null,"work_id":"b2519ed0-6e8b-4c68-abb7-d46392a736a8","year":1992},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.025113Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:3827483d1de3cc2c7cd0fc30cd5807cd84f1333a630e7a2dadee74535eb1b296","observation_id":"e8974b0d-cb13-4b18-bf95-88db0defa618","resolution":{"observed_at":"2026-08-16T04:29:29.739292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.718743Z","title":"Population-based diverse exploration for sparse-reward multi-agent tasks","venue":null,"work_id":"abb2a310-a5f2-476c-a82b-b0c9581c6585","year":2024},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.029559Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:a96c24d2c7533542ed97684a4db0bda3c21b05617c78f686145c49b387e8e8a6","observation_id":"b5a195f6-1de4-4931-8acc-f362fb4e0adb","resolution":{"observed_at":"2026-08-16T04:29:29.723697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.703615Z","title":"and Spaan, M","venue":null,"work_id":"c280013f-0c09-4304-b715-9ef812c8cad0","year":2023},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.034092Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:4e8ff3ab2b7d4b7980c97050844db99512cd3b5d9db2dcc837f5b7acb07cb609","observation_id":"03a1d753-8ef3-4cf1-b2c8-148186f68d0d","resolution":{"observed_at":"2026-08-16T04:29:29.708284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.688239Z","title":"R einforcement L earning with prototypical representations","venue":null,"work_id":"b9c6a94a-c228-4992-a5a9-3757e4e0f50b","year":2021},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.038640Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:dc0462d591375ff77e907723e3612236ff553ff02a4bafbda09c255db7f23b23","observation_id":"354d8296-3654-4e7a-9132-a03d030263e8","resolution":{"observed_at":"2026-08-16T04:29:29.692984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.13425","last_updated":"2022-04-05T19:24:13Z","snapshot_observed_at":"2026-08-18T17:00:30.806909Z","submitted_at":"2022-01-31T18:39:27Z","title":"Don't Change the Algorithm, Change the Data: Exploratory Data for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.13425","snapshot_observed_at":"2026-08-16T04:29:29.043072Z","title":"Don't change the algorithm, change the data: Exploratory data for offline R einforcement L earning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.043072Z"},"links":{"cited_paper":"/paper/2201.13425","citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:bd2256841895c8129754af3ccfacc71f4521b791cdd2b980839034414aca3142","observation_id":"accd675a-482e-40c2-9d2e-ef92edfc12ce","resolution":{"observed_at":"2026-08-16T04:29:29.043072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13521","last_updated":"2023-02-03T16:05:26Z","snapshot_observed_at":"2026-08-18T17:00:33.404991Z","submitted_at":"2022-05-26T17:40:52Z","title":"Discovering Policies with DOMiNO: Diversity Optimization Maintaining Near Optimality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13521","snapshot_observed_at":"2026-08-16T04:29:29.047457Z","title":"Discovering policies with DOM i NO : Diversity optimization maintaining near optimality","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.047457Z"},"links":{"cited_paper":"/paper/2205.13521","citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:ac1ecf2d4237630a1eba2a3aba3792e49440a5d7797d61c174208e2ca002fbf2","observation_id":"eba2651a-d5a2-4c6f-9bae-d6a0b32b0f93","resolution":{"observed_at":"2026-08-16T04:29:29.047457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.671094Z","title":"How to explore with belief: state entropy maximization in POMDP s","venue":null,"work_id":"a993f960-5f8f-4b03-bda0-4c3a4cc6b4a2","year":2024},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.052058Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:3f8d766d9d81e6f0fbb64002957e587f3e4ef89cdba4772b62672dd1409fb906","observation_id":"db2ca706-03be-4702-91b3-d8dcccd0a42e","resolution":{"observed_at":"2026-08-16T04:29:29.677136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.654701Z","title":"The limits of pure exploration in POMDP s: When the observation entropy is enough","venue":null,"work_id":"0b2d577a-8add-410d-a70d-f72cd4b8ae13","year":2024},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.056465Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:f16f7f1cae16c93548a908bffc2d2f67209c09caa746514dc1f611e87cc34b4e","observation_id":"8c3f4dc1-a483-4cfe-8e7d-49428c0338f8","resolution":{"observed_at":"2026-08-16T04:29:29.659608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.08365","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.277006Z","title":"Towards principled multi-agent task agnostic exploration","venue":null,"work_id":"0d14dcb8-3630-4c5f-b1c4-8c3ed5c7a649","year":2025},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.061039Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:bd4de4d14e7b5d5d8b0447f8ddef00d2f33994379bc96c1fe4ef980087fe3607","observation_id":"4f3f94fc-c073-4c0b-aea5-98ddbf45f2c2","resolution":{"observed_at":"2026-08-16T04:29:29.284977Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.638994Z","title":"Exploration by maximizing R \\'e nyi entropy for reward-free RL framework","venue":null,"work_id":"5c0c0d89-528f-4eef-bc83-b15e27f61712","year":2021},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.065346Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:b1b0c9187983dfc2c6e837f758f8b117dd49502d994e0e430040a95d05c5859b","observation_id":"8cfecac6-f400-427b-90c5-710bbf30a69b","resolution":{"observed_at":"2026-08-16T04:29:29.644476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02083","last_updated":"2023-09-27T11:53:46Z","snapshot_observed_at":"2026-08-18T00:08:31.652913Z","submitted_at":"2023-01-05T14:42:39Z","title":"Self-Motivated Multi-Agent Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02083","snapshot_observed_at":"2026-08-16T04:29:29.069855Z","title":"Self-motivated multi-agent exploration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.069855Z"},"links":{"cited_paper":"/paper/2301.02083","citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:45b84057633fad31e17271055692f32b39e1bc29f4daf91240a567a20d2ea2e1","observation_id":"2a4ad8dc-c69f-4fc0-9e65-6c5744d7e3d0","resolution":{"observed_at":"2026-08-16T04:29:29.069855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.623781Z","title":"E., and Russell, S","venue":null,"work_id":"82b9ef11-1157-4866-80b4-c35154097171","year":2021},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.074764Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:344fae50f5239cc5878fb0ca016aab84a56400ead9ecdac205db346e020767ad","observation_id":"0130ca62-48bc-410c-846a-db2b1bfe9ff4","resolution":{"observed_at":"2026-08-16T04:29:29.628691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11701","last_updated":"2022-06-27T05:15:20Z","snapshot_observed_at":"2026-08-18T17:00:41.763049Z","submitted_at":"2021-12-22T07:19:36Z","title":"Maximum Entropy Population-Based Training for Zero-Shot Human-AI Coordination","version":3},"cited_work":{"arxiv_id":"2112.11701","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.11701","snapshot_observed_at":"2026-08-16T04:29:29.125699Z","title":"Maximum Entropy Population-Based Training for Zero-Shot Human-AI Coordination","venue":"cs.AI","work_id":"668c2982-5561-4be2-a157-39dbe187c0ce","year":2021},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.079126Z"},"links":{"cited_paper":"/paper/2112.11701","citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:65ae6d944879c913bcbac2cf4f7426212087b9b39fcc47b8e391c1c0d1f90286","observation_id":"1f3ddb2f-05cf-414a-a3a4-0afefb1430ba","resolution":{"observed_at":"2026-08-16T04:29:29.132849Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.608198Z","title":"No prior mask: Eliminate redundant action for deep reinforcement learning","venue":null,"work_id":"63aab5d2-3639-4c9b-8e46-344a1078e85e","year":2024},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.083845Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:2700d998da77662e81fbe371d8143df151326064c38cf5473633fb82beb7874e","observation_id":"f33d6a82-a37c-4136-ba20-0af3af6df307","resolution":{"observed_at":"2026-08-16T04:29:29.613868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:29:29.592100Z","title":"Explore to generalize in zero-shot RL","venue":null,"work_id":"99bf2c77-2d89-477c-a1c1-554ffb8f4f84","year":2023},"citing_paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-16T04:29:29.088194Z"},"links":{"citing_paper":"/paper/2505.01336"},"observation_digest":"sha256:d516844d13a9fd1e74929578ba21e647f4f2f04dd8cfd5214c82ca706dbdbb91","observation_id":"1fa9708d-ec70-4202-bb55-7396abcb5535","resolution":{"observed_at":"2026-08-16T04:29:29.597053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.01336","last_updated":"2025-06-24T10:24:23Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T00:52:02.556101Z","submitted_at":"2025-05-02T15:08:17Z","title":"Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":4,"verified_fuzzy":41},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 1 inbound Pith citation observation for arXiv:2505.01336."}