{"as_of":"2026-08-06T20:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f4c238c702cf7225cf325de74b47606ee9a0b34a524515e2a93504d3f789b908","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T10:59:44.092482Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T00:41:12.498785Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.03962","snapshot_observed_at":"2026-08-02T00:41:12.498785Z","title":"Using reward uncertainty to induce diverse behaviour in reinforcement learning.arXiv preprint arXiv:2606.03962, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14962","last_updated":"2026-07-16T13:14:21Z","snapshot_observed_at":"2026-08-06T18:22:32.478125Z","submitted_at":"2026-07-16T13:14:21Z","title":"Multi-Axis Max@K Reinforcement Learning for Representative Diversity in Text-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T00:41:12.498785Z"},"links":{"cited_paper":"/paper/2606.03962","citing_paper":"/paper/2607.14962"},"observation_digest":"sha256:33156002f2d25dabbd45ba751c4e74c48b8a655cbbd190c05b752a724118b776","observation_id":"f00ee3cd-ecd5-47ae-b844-71a294de6562","resolution":{"observed_at":"2026-08-02T00:41:12.498785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.03962/citation-record","integrity":"/paper/2606.03962/integrity","json":"/paper/2606.03962/citation-record.json","paper":"/paper/2606.03962"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Mastering the game of","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:b05566af7fdddf59c9b62a531e09ca12b7d7413c6a6c42579ecac5fdc06a3f71","observation_id":"e0334e11-9b62-407c-b3cc-2954d0fccbbb","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Olympiad-level formal mathematical reasoning with reinforcement learning , journal =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:0abfed0f7f17aadb1d7e65dc75876acbb921f199053b679465cd9f5e1e2629bd","observation_id":"e45bb1cd-831d-425a-b45b-f220c994391c","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Pawan and Dupont, Emilien and Ruiz, Francisco J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:a5b81e9b2c8e789ae87b12b388d7a0e345c86252b7da6ff30748f83f92a8afa0","observation_id":"3852df05-fc32-4efe-a773-0cec3f69c399","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Proceedings of the International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:751b53f84b29763b66e483a576bb1a66ccd6eb5df653546ab599651f1aa5828a","observation_id":"6489a272-e33b-45e0-9453-591bcc1db965","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Proceedings of the International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:32cacc5e9fd7092b1b5cba38692391a7ae7176fba6364dfd55a8c77bde4ade68","observation_id":"7a376905-93aa-405b-9ddc-d4c3f25ecbf5","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"McLean and Peter Norgaard and Zahra Shamsi and David Smalling and James Thompson and Subhashini Venugopalan and Brian P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:cad7abfca427cd594086a786414ac261c69bf9495fcb54bbdf82d7cf58748dc7","observation_id":"7b0d20fa-b12c-4f5e-b204-bf548fb277f6","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Proceedings of the International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:c6f71f4d799da96a4c809a494877a21487216ff02525c5e542fec3c2b106af8b","observation_id":"ce6e45ad-4ac9-435d-a34f-78fe5e155754","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Proceedings of the International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:4977e22feb95575a71ddbc3a9974218c90d447cf935be89bc1fd1a96ccb78a63","observation_id":"7dfd984b-fe57-47f4-b7c2-b521c0ef9031","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Proceedings of the International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:f4273edf54cdaeb1955f224f519a3b95fddbf261c04dd379a0c04836b2af1c01","observation_id":"67e969d6-5bd3-466c-a9de-6b15e93ef6be","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:c3025e2ae3e167d2fdbd538d7ba101f0b000d4d6d65010986de22b5b6a102328","observation_id":"0c7b5a01-b716-44b9-8fcd-a2d95a688f2f","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Proceedings of the International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:aca5cad736fa1094631b13e26c866a880bf806e48cff1311b7ed3497f92c2f01","observation_id":"adb501ea-c47d-4479-9437-d7ec066e45e0","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02534","last_updated":"2025-09-02T17:38:47Z","snapshot_observed_at":"2026-08-05T11:30:06.956863Z","submitted_at":"2025-09-02T17:38:47Z","title":"Jointly Reinforcing Diversity and Quality in Language Model Generations","version":1},"cited_work":{"arxiv_id":"2509.02534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02534","snapshot_observed_at":"2026-07-04T21:00:08.446955Z","title":"Jointly reinforcing diversity and quality in language model generations","venue":null,"work_id":"8405556c-8f03-4c5d-b431-dc9d044e390b","year":2025},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"cited_paper":"/paper/2509.02534","citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:0e9eaa3d916d0b29d06f894c7fb2b4d981174c042ded9d070d6a65f1aab6207c","observation_id":"eed184b3-4317-4ac5-a57b-07e48e8baf58","resolution":{"observed_at":"2026-07-02T02:26:26.270305Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Proceedings of the International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:ae2c7c7796293e829ae7c37604964315f222ac9330b14d403ca1d0eac8e0ece4","observation_id":"15d71f0b-372a-442e-85e9-ac7a4cd61ee3","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:5db9e610997619a67dd3e1501b7701f00fe7c3ac2ffd692733c27852514cb4cd","observation_id":"27db969e-c4c6-4309-b5a9-a67756535c29","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:f08f8a13b01ac06ef2975023a8c06d045494f7a175d63e3f4c52b7b23ed62d03","observation_id":"dfd8f3b6-8b46-45f0-9a40-85f04ca4f540","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"and Barto, Andrew G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:1c35f2f288d51bd5c76a0dea7ec07d91b01ef9a337b75596d0f38e2da6c1d738","observation_id":"7855d5a1-25be-4149-8ee8-2971df240daa","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Machine Learning , volume=","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:089d3e594d7d6f263d7b10b281cf6d789e5af655afff6a9e2ed6d30439c98881","observation_id":"e65eeebe-823e-45b5-9657-9d69c31413e0","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:f904d871fdcd0ff0e3dd6dfdb9365bf4e24052ccb4c1e1589348ffd3c535a30b","observation_id":"b5a0d56f-637c-443a-9683-c59102396a16","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Proceedings of the International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:46a6c183aa26c6ccc62337cad4be41d5f2e45c68ec6d33a80664bc31079b1229","observation_id":"61c54d98-d33b-45b6-9284-e24b1263093e","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"2016 , publisher=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:28a889b2bfeb9f33f8deb0f39b724f87f289e100a727c33930fd0be91e6fff4b","observation_id":"dedab193-fbce-4fea-8ec7-c995c64eda08","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Machine learning , volume=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:5e6f2d353311bbacc8bc906db989014fb5132ea369497ca11224a64e84df2e67","observation_id":"db1085b1-fb21-481a-8012-8bea94ad6acd","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:a29b023f98bee20a8c4838a85ac8fb9175a3f4e2a4ebc9e93b4cc897442d4d4a","observation_id":"d3d330d4-2cf5-413a-8bcb-ffada8b3737b","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Autonomous Agents and Multi-Agent Systems , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:d84e8dc9709b2a157bfc3cb95b16ad58647548b7b9858bb10c5e76da7d2adb09","observation_id":"1338b182-987f-4a36-af92-1ce7dab2f49d","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:4158075fd40ff80a368a936b94ff3fe602b82d6fbd5f59972efd765e617e30ed","observation_id":"573d8d2f-e6df-47e2-b109-84b54bda503f","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Proceedings of the International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:17b690e01a0299960836fc1577545ac0ecd441d08980b2510e364fd99961b363","observation_id":"ffe32597-7c30-4bcc-ad63-5f96221ca80e","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Linearly-solvable","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:a7a9d28887cce3bc7621900c5318848949eacb1db06c7b746a6edf5c9138e717","observation_id":"1f384100-3b5f-406d-a9ea-d6331cb995e3","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:a7cfe2cc6b1280e32101636da25c0c2a708ecf9f51487b086d569e46e2482f2a","observation_id":"53760e6c-6f37-49e2-8b2d-45e69df3cc0a","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Proceedings of the International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:ff53a09ed527e8fd89847573439561479fb91c796496070853a22f7f00353e82","observation_id":"1e7972be-9860-42a0-bbce-959b60eb6f4a","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Journal of Artificial Intelligence Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:9ef3dc25ba0be08f00e07270b462fdc78d63ea259f964a2bb796ae36d618eded","observation_id":"30eb67e9-ea52-4e5a-9714-48c48c925c33","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Constrained","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:edb0848c55fe19177d2fe2988a68d27f4c25b239ac75d724a65eade998916f9f","observation_id":"7bca290c-4c68-4815-8e66-ad8da3569fcd","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:82f887474d3c5ba86db11ee02c4a9324185b91c6d08f197f62cb610df0668925","observation_id":"67c51fed-1526-40bc-8877-8aba06aafeb8","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:0d5bb560d7a588c11a4228386eacd985edab769f4c7977de42e899e307c2600f","observation_id":"86e49675-bf1a-41d3-88a2-b52ea730fd48","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Deep reinforcement learning with attention for slate","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:31d5c353491d22c5bce68be593b620daacff9dbb0e512282bc50849a610daeb5","observation_id":"b517656e-46fa-4cd3-a0b7-6e915d970682","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Non-deterministic policies in","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:198e4fcc894678687187a924b5462d9868f75fd1232cf4c5b61dfc7b638842cf","observation_id":"81faf75b-b6b4-4bcf-929e-00d8c7fe7c1c","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:a2ffb1527efa8edb759396319bc70012c7949edb0764711b163cc7d814cd8f7d","observation_id":"92735ab3-27bb-4e44-8519-a8f4cacdfaa8","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:a0a62a4e2ca32f6433eeff4e5623b61fe1ed38c01b7943497354eebdfe15ef60","observation_id":"976fc8c1-8753-4c1a-a043-f1644897b69f","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Proceedings of the International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:3e1dfb365e892775644802f70aab25eed4f3619e6f34a3672253282f8cb8fd5d","observation_id":"c97bffd0-4573-4712-99bf-fad58e629c7b","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:34e2c5c15f2234652a621e17bc7a07d96789cecf11eb900cb6539558765940e4","observation_id":"236f4585-8999-4734-a020-1bfd9b421313","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Journal of Artificial Intelligence Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:85505b518228a26f8877a8d870be43d214159e0e266af490960e52c408ec7db2","observation_id":"f36f5ef8-d9ed-4bb8-a715-ffb991e69e4f","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.08518","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:30:00.250324Z","title":"Breaking the bias barrier in concave multi-objective reinforcement learning.arXiv preprint arXiv:2603.08518, 2026","venue":null,"work_id":"26b3985c-fd0f-4db2-9b8c-1fb8ed08ffb4","year":2026},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:9304a55a2b914286a0188fda12723ecef55b2be0407db0f4f707f625d7a14915","observation_id":"c34d1c6c-0005-47c5-b351-39242b233fb6","resolution":{"observed_at":"2026-07-02T02:26:26.264707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Puterman , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:5257b13812f32c6dce5a3ae06c6a7939b67b5de6a7aaf8ffa7ac7b255f4c4b20","observation_id":"811acb8f-5fcf-4baf-a79b-076a3b99727d","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Understanding the effects of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:ad6198c4e4378d2b42f733a1fa3145f15ac7de837aa717cf59852a262254cf71","observation_id":"d9610089-cf61-4c86-bd8d-8d3f6f0d92db","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Proceedings of the Conference on Language Modeling , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:a657581a46cd8aced8dd793a4ab5681697a2b7e524698195cf208e1311d3fe5b","observation_id":"a2f3ba32-a4b8-45d9-991a-fc0364310cbb","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Findings of the Association for Computational Linguistics , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:476aa6733a13c6f41f8b42b1db785e88f6b005e68f2b3815f8da7386d49913de","observation_id":"4cf23039-e341-4bd6-a438-1e0c2e23ad2e","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:086a452fa6142f4ad5a6d26ccf4d2fab36b12dbc66de47fc4c693225980316d5","observation_id":"705db951-4606-4573-bf38-ddfe0b6182c0","resolution":{"observed_at":"2026-07-02T02:26:26.263139Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-06T10:12:18.959183Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":"2412.01951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-07-03T14:08:21.732193Z","title":"Self-improvement in language models: The sharpening mechanism","venue":null,"work_id":"7f90ec4b-7277-4b8a-b651-135711d76650","year":2024},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:39906f56383100c53364c39d63d380d7de92d82b40f7e103bd89326804f910c6","observation_id":"70c40a63-4681-4129-b016-7a5f5524e943","resolution":{"observed_at":"2026-07-02T02:26:26.274337Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:56dd3b6a5fa827d924caf951f699ed48665f6213d93f5ca13bf87d4d8f7ada43","observation_id":"ea32348d-caf9-4294-ab34-c6e84837953d","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"The Price of Format: Diversity Collapse in","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:aaab1350943445406bc48d1e5d68ec91899fc3cc67baf6859b9852bf30e8164c","observation_id":"eae08f34-3010-46fa-ad0c-1cd933c7f1af","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15096","last_updated":"2024-10-19T13:07:52Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T13:07:52Z","title":"GDPO: Learning to Directly Align Language Models with Diversity Using GFlowNets","version":1},"cited_work":{"arxiv_id":"2410.15096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15096","snapshot_observed_at":"2026-07-02T02:26:26.265862Z","title":"arXiv preprint arXiv:2410.15096 , year=","venue":null,"work_id":"91a45119-81c3-489b-a058-65a8f246a640","year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"cited_paper":"/paper/2410.15096","citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:bbb34d280e1a9d95a9c3db5bd00980ca54e51b6bde4289f4e77796faf55b30f2","observation_id":"d05c2bf4-0263-483e-b282-2603445e5f7b","resolution":{"observed_at":"2026-07-02T02:26:26.267568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Echo chamber:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:4ac5d45c80901dbfaf6d3b1eefa4c44a7ab07beaa0cb33c12b8c21ab5933e278","observation_id":"6199598d-34af-48db-b9cc-5f268c67d7da","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Evaluating the diversity and quality of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:2ffceb57ef193f59123c6e5f3a70d52f2b6609e635d417f23b32366bc92ab7c2","observation_id":"fea41adb-636c-42c9-bc97-8d1d2d431f5e","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Proceedings of the Conference on Language Modeling , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:667883a18e9d2c82e8a3ba7bdebcf931f6379161453559887a997bffd684c760","observation_id":"f596246d-22af-416f-895e-dd629f01857b","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-04T22:59:12.129500Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:539da7bf0fe6799ac7e5a7599c4f0c1023fc3c3820c49f9891e064419694df18","observation_id":"cfbde808-e086-48c3-a262-22ea20a23115","resolution":{"observed_at":"2026-07-02T02:26:26.262089Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10760","last_updated":"2022-10-19T17:56:10Z","snapshot_observed_at":"2026-07-06T14:07:50.468967Z","submitted_at":"2022-10-19T17:56:10Z","title":"Scaling Laws for Reward Model Overoptimization","version":1},"cited_work":{"arxiv_id":"2210.10760","doi":"10.48550/arxiv.2210.10760","metadata_source":"pith","pith_arxiv_id":"2210.10760","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Reward Model Overoptimization","venue":"cs.LG","work_id":"0fb09554-8ce6-4366-8b78-f426e318fcfd","year":2022},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"cited_paper":"/paper/2210.10760","citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:d50ca5e85127c735681e6b1c5f253978386b55e378bdc5d6f6271b0d7d7e51f3","observation_id":"667d9f4a-7019-4c70-9708-3f3afa185015","resolution":{"observed_at":"2026-07-02T02:26:26.254040Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.501616+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.501616+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Confronting reward model overoptimization with constrained","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:1b4d7189ea6e138660776155238c67e85174458b4bf24412d13049a80356b42e","observation_id":"b99aa16b-fa0b-4d8f-b728-17abc074ddde","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:ed7ac6fa97a2aff025cf992479cad8e0e24bdf7d42dc71be457479184e2f2e93","observation_id":"c020c849-0d17-4732-bfa9-f0fef9ee6f5a","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Reinforcement Learning from Human Feedback , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:66a8fa2ab217b65d4e734e17ae69a9b5507d5013cded098c194f62c357a98d37","observation_id":"26cdedd0-ebde-4041-a6aa-bd650efed26f","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:3bab00f90d12e50c79a2df022889094ceb81b02d227f86ce740abf439dddca03","observation_id":"c0f7609d-a8bc-41dd-95d2-f5f4a645a7a8","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Connection Science , volume=","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:e287023a2fe971a25e8117aa88a4e80429c67f6e38fc01d5165947325ec5f4e5","observation_id":"72b3dd61-e719-4e44-a141-63f72523ef95","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:0a1ca28c30a9b344eaa8bcc5da6ad26526cae06cd718832948930322af27a980","observation_id":"418ffb64-0b84-4508-b25e-3dd79e5f5eaf","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Proceedings of the International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:42aaccbe1cd9bac2f16f76854f407a5abb82b81203be625806c95e2e7e172881","observation_id":"eff136d7-53a4-4553-bdae-1e23a966afa6","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Proceedings of the International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:cf255794503c7e69fbfee682594cde9cd46cc254c8d49da49e874431beb4e569","observation_id":"8d9a7028-8681-4ad7-8ff2-d04c7770397e","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Proceedings of the International Conference on Autonomous Agents and Multiagent Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:18be13ba12050482bf77d6a2ace67f49d9641195f657c34172173e3b4a584c46","observation_id":"2810ed06-b5de-4fca-aff9-45e36ddfa698","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Econometrica: Journal of the Econometric Society , pages=","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:37cadd920b02691b46f4cc4e9742f398251aa1872c9b887a7cabcee1d4b062d6","observation_id":"9c15bfe4-f859-45d7-8123-8d6053a75c8e","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"ASTIN Bulletin: The Journal of the IAA , volume=","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:52cd8569359e149edbc938f7bd554cf4ebe81872a8a5f0d736a63dd0b7e59fc8","observation_id":"d528fea6-74a0-4412-86b2-f21ad98c71a3","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Proceedings of the International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:dc1b7b6e90b43c838ade110fc29609f850f0daac180c36f046125b4ca9b0134d","observation_id":"4fc18bd8-eed4-4d15-a8ba-6b586d9b9c0a","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Journal of Risk and Uncertainty , volume=","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:02baed0407cfacf7cf37f3112616f3fc7fa0969f2a20c1ef86d22157c9509fdd","observation_id":"9724549f-f14c-4e93-ae09-517b4296fa44","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Algorithms for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:883468087b495064916aa1cf4332ceade2c46a2e342d04c209ca5dcf2376ba13","observation_id":"802f5a39-6813-4310-9354-ff1eaa4c83c4","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"2023 , publisher=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:77089f521fb26c079b3e259593aa80abb3401bf64b52d7a45e3cb9556639397a","observation_id":"a2b11b09-263f-459d-8442-ddc6818f722a","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22817","last_updated":"2026-05-21T17:59:26Z","snapshot_observed_at":"2026-08-03T22:38:52.410175Z","submitted_at":"2026-05-21T17:59:26Z","title":"Vector Policy Optimization: Training for Diversity Improves Test-Time Search","version":1},"cited_work":{"arxiv_id":"2605.22817","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.22817","snapshot_observed_at":"2026-07-02T02:26:26.267423Z","title":"Vector Policy Optimization: Training for Diversity Improves Test-Time Search","venue":"cs.LG","work_id":"dbd2f48b-bb6f-43ff-82a6-daf3bc45381a","year":2026},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"cited_paper":"/paper/2605.22817","citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:ba148c836600375ed67c305b516c0c12ef43209031b4778548347398a6498922","observation_id":"5d121a0b-282e-4202-8ea4-1789258df642","resolution":{"observed_at":"2026-07-02T02:26:26.268801Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05868","last_updated":"2026-04-07T13:28:09Z","snapshot_observed_at":"2026-08-02T07:08:59.060388Z","submitted_at":"2026-04-07T13:28:09Z","title":"Understanding Performance Gap Between Parallel and Sequential Sampling in Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2604.05868","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.05868","snapshot_observed_at":"2026-07-02T02:26:26.270056Z","title":"Understanding Performance Gap Between Parallel and Sequential Sampling in Large Reasoning Models","venue":"cs.CL","work_id":"78749c3b-3ed8-4655-9e49-4e416853e27a","year":2026},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"cited_paper":"/paper/2604.05868","citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:3574d060da9841985e74039c69b1548e5a072241a9508bdcaed4ca1dd17928f1","observation_id":"2d05cf72-4630-4938-8084-8db171440a36","resolution":{"observed_at":"2026-07-02T02:26:26.271488Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"1999 , publisher=","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:504f5c18aae541ea2005769d09a0223fa8012f32c1d5fc81e78ff4a77790e309","observation_id":"bc6feaca-5886-4535-b64d-a54fb8296fdd","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"2005 , publisher=","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:72d1aa345742c36cc23379496465a6ab705ab32bfa1fb649b1fcdb154a02e1e8","observation_id":"57127b27-6417-47b6-9f2d-50e374c11071","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"On the relationship of the","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:488310121758c5eaa246b4aafa6f1737c687ffa2dba8f63f819ebfe8f484ae1a","observation_id":"ad36887f-4794-485e-82b8-7d84536772be","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"An interactive weighted","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:f043516dee6693c053aa6a4fc870f5f81caf0e6a4a3719a4c1f329a0a461676f","observation_id":"785ee7b0-1d97-4914-9cc6-d8a87c38b02e","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:48da1dedf45fffeba8b329ea5f904627f68dfd601e9c6d747dfcc189c5e8e373","observation_id":"af0544fb-9c70-4c10-b64e-c73f02244130","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Operations Research , volume=","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:6d285e03b3ed29f6f4a00371d7c2073ab91403a74225248fa0f74f9cd1e74144","observation_id":"42378077-b10f-4161-bc3a-660a8cf29e06","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"A closer look at drawbacks of minimizing weighted sums of objectives for","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:24e9ad201b2d89bc7782ccf7763d0bbd1df94f006b639243633dcd7529795055","observation_id":"26849ec4-ff07-4541-809c-b200b5ebcc8b","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:4457ba34f1e263e20a635ad4ff9ae31504724421cf1d8bbedadce569bdeb98e5","observation_id":"ac7670c0-4525-4cc1-83ae-cb29ae6eae9a","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:b62f0e8ce1a55edd1522da9fd4083e661bc53cb74aee4e76d649d60166b59c1c","observation_id":"1ed99b1c-8414-4362-ac42-858bdf6bee93","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"SIAM Journal on Mathematics of Data Science , volume=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:1a9ad665b7d212ae692f7d4d9ff2e6b63e92e65e93ef81e365b5528ef64f8c4b","observation_id":"bdf27403-d3c4-4a86-a1f9-011577fed60a","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:ab253cc75d0559953a4d705b11ae54f84610414b52ef4ce4421927e6c898352c","observation_id":"a38ed160-5879-4eda-ab21-471431aaceff","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"IEEE International Symposium on Information Theory (ISIT) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:8d386c1a310275e47733203b53c2c04341deac660c911b1a1fdb26a52c482d92","observation_id":"a30a4ca8-69d1-40fa-a405-9bf7058e7367","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:59:44.092482Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:dbdeb45cef0c959dddfbb2c7f968156e3625d0eda9aac826ac582cd62005fb20","observation_id":"ab7d5905-79dd-4331-9aee-44d33c9043c2","resolution":{"observed_at":"2026-06-28T10:59:44.092482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":75,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 1 inbound Pith citation observation for arXiv:2606.03962."}