{"as_of":"2026-08-04T07:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:240bd4f169046f8097ce3d4797e6b84cab0c8118f8399239d4beaefa47eba7ca","coverage":[{"denominator":137,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:32:00.321628Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21120/citation-record","integrity":"/paper/2607.21120/integrity","json":"/paper/2607.21120/citation-record.json","paper":"/paper/2607.21120"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.875467Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.875467Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:b793d32f86fc8f75a086aaeaf354b95805c34fba7714b431e06fedf46a074006","observation_id":"0d576ef1-3c54-46f8-a215-e8038d754ee2","resolution":{"observed_at":"2026-08-01T08:31:59.875467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.941266Z","title":"Proceedings of the Annual Allerton Conference on Communication Control and Computing , volume=","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.941266Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:158a1d6ae4fddccaf92890b60e850eb2a0505407cc0b101c31f9328fd5596793","observation_id":"89ad0822-cd39-4f62-bac3-f86e9da0ee78","resolution":{"observed_at":"2026-08-01T08:31:59.941266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.959455Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.959455Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:48b308984a2ea8dd46f7c5bb6c0e3d6d26291315e9de832b4304a79ed5b36f22","observation_id":"168953f0-6a32-417d-bfcd-af6ae6f6bfb4","resolution":{"observed_at":"2026-08-01T08:31:59.959455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.963579Z","title":"Encyclopedia of optimization , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.963579Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:ec9df9eae984ddb569f85f3ecb4b83d60b9754e1f82f817a62e990e76d143520","observation_id":"6d845c01-746b-47f1-966e-0e53d0ecfa61","resolution":{"observed_at":"2026-08-01T08:31:59.963579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.967274Z","title":"SIAM Journal on Control and Optimization , volume=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.967274Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:62901e9e6dadc67d8ee9f4cb88cafea5bc06a11af40d8d503e7cda274e1236f4","observation_id":"6ff913ef-2cd1-485a-bcec-5f5a53f633a8","resolution":{"observed_at":"2026-08-01T08:31:59.967274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.971140Z","title":"2014 , publisher=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.971140Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:da8177f71e46c3b9d4826e51308104896d1e4f1a50864698a65e3ee14c5ed237","observation_id":"4eca9edb-f705-4c12-a22e-f817c376c717","resolution":{"observed_at":"2026-08-01T08:31:59.971140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.975224Z","title":"Icml , volume=","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.975224Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:5019b5310fe81a88c03d89d1f54adcf3cbaf40279cee4cdd72387f1c587df641","observation_id":"3e2ea393-700c-429f-b70d-b14199f9460f","resolution":{"observed_at":"2026-08-01T08:31:59.975224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.979031Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.979031Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:dee38dadc6613d0d9856dd1f333b1bfab69be98027edae5d79f972f13ff79ecd","observation_id":"24a885e4-2027-424b-92da-172acff2bafe","resolution":{"observed_at":"2026-08-01T08:31:59.979031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.982648Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.982648Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:fb685dbc1c47c7e231ac6d9fc6198ec693d06144f8b4f901fb46b5164e59d69b","observation_id":"f6a10bb8-6774-4bda-b855-17cafc65cb99","resolution":{"observed_at":"2026-08-01T08:31:59.982648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.986192Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.986192Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:e450267b2d5b9ec35fce94d9cc5cd3372b674138574f982ca3c404ad567a3a55","observation_id":"6b71877e-3f6a-4bd5-9b98-d137d54281ef","resolution":{"observed_at":"2026-08-01T08:31:59.986192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.990312Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.990312Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:8e8d4ead6534d2c952d0b657deba52cd33be2141e3f0ea45eeafdaf70e0fbd90","observation_id":"263ee092-3e03-4062-9e9e-909c61b4999c","resolution":{"observed_at":"2026-08-01T08:31:59.990312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.993871Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.993871Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:9eaf6c73cf16b673dc7077e518c31500cfba89ee8752a6c1000a0ce4decb9dd3","observation_id":"627abe0b-a60c-4105-9d41-fe90cd31776b","resolution":{"observed_at":"2026-08-01T08:31:59.993871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.997344Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.997344Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:7eec04c672fdbaecc92c893d39a5d46c1bbd130fcf65eda26b4b590733687376","observation_id":"556e2d44-e21e-49a4-ba99-62f0046628ea","resolution":{"observed_at":"2026-08-01T08:31:59.997344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.000811Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.000811Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:a5102efe8d4eb6b3a7ec4d6632f3058ee07c57be1c4613394586ea05114ec633","observation_id":"eecf4f26-7b8a-49dc-afb4-a778e941ba38","resolution":{"observed_at":"2026-08-01T08:32:00.000811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01224","last_updated":"2017-07-10T14:38:10Z","snapshot_observed_at":"2026-08-03T09:09:34.456991Z","submitted_at":"2016-11-03T23:21:32Z","title":"Sample Efficient Actor-Critic with Experience Replay","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01224","snapshot_observed_at":"2026-08-01T08:32:00.004541Z","title":"arXiv preprint arXiv:1611.01224 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.004541Z"},"links":{"cited_paper":"/paper/1611.01224","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:cf1c8ba8623822e276c08c49cf03d60aeb749beaa1397dcc15ef7b487be9bdee","observation_id":"ce7949ea-bda8-440d-a757-12be68097a8b","resolution":{"observed_at":"2026-08-01T08:32:00.004541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.008754Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.008754Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:35eaa35f724845efd8fb0c7d41f1b4557d15d6d4ec47e38d1e4b2b4cae37bfc1","observation_id":"5828abeb-c244-4eba-a000-1ce396dc76fe","resolution":{"observed_at":"2026-08-01T08:32:00.008754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.012890Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.012890Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:a24d069cbff465f11d8e7bb6104ea8a1dbe015c572113df218543ac627a82cde","observation_id":"a3b671b8-9caa-4f00-93d4-481db103dd08","resolution":{"observed_at":"2026-08-01T08:32:00.012890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-01T08:32:00.017066Z","title":"arXiv preprint arXiv:1506.02438 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.017066Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:b0d3c47a0212b772c39a361afb55aa8dbdedf60b665868c181193a83359253a9","observation_id":"2884477e-9bd9-4fb4-bfe4-a28089b53237","resolution":{"observed_at":"2026-08-01T08:32:00.017066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-01T08:32:00.021033Z","title":"arXiv preprint arXiv:2403.03950 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.021033Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:bb5585e4e3900e8fc9a0a6fb98a5189bea2f1ae822bf4be1f48f82cdd24a3e49","observation_id":"703baa5e-1d4f-4cce-8642-aff5faab71a4","resolution":{"observed_at":"2026-08-01T08:32:00.021033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.024971Z","title":"Proceedings of the IEEE international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.024971Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:e2f28666bb19bcef63f58188dfb7a453d105c5851090df787cb3619693cddeb8","observation_id":"37065787-596c-4cad-b56d-92035bd7440e","resolution":{"observed_at":"2026-08-01T08:32:00.024971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12073","last_updated":"2023-08-01T08:47:59Z","snapshot_observed_at":"2026-07-06T15:29:57.940337Z","submitted_at":"2023-05-20T03:22:43Z","title":"GELU Activation Function in Deep Learning: A Comprehensive Mathematical Analysis and Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12073","snapshot_observed_at":"2026-08-01T08:32:00.028650Z","title":"arXiv preprint arXiv:2305.12073 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.028650Z"},"links":{"cited_paper":"/paper/2305.12073","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:8cddcd14450b948bf084167ab1fe051ddc865a05ea6a76793fbc9d8e856cc9b1","observation_id":"aa85a5ad-22b0-4ee4-9e59-76013191138f","resolution":{"observed_at":"2026-08-01T08:32:00.028650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.032638Z","title":"Proceedings of the fourteenth international conference on artificial intelligence and statistics , pages=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.032638Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:da183d514787960b33c42d2f4b574339765e8a3e183d471cb3a906cc1aee6611","observation_id":"c1400866-df0a-416e-bec8-1c231eeca9c0","resolution":{"observed_at":"2026-08-01T08:32:00.032638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00781","last_updated":"2024-04-30T22:52:33Z","snapshot_observed_at":"2026-07-06T17:53:44.044640Z","submitted_at":"2024-03-31T19:57:38Z","title":"Addressing Loss of Plasticity and Catastrophic Forgetting in Continual Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00781","snapshot_observed_at":"2026-08-01T08:32:00.036570Z","title":"arXiv preprint arXiv:2404.00781 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.036570Z"},"links":{"cited_paper":"/paper/2404.00781","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:b080d0c8a35383c0c7de67763c2f9df2e23e2ca93e289786056cb72c1f6f552e","observation_id":"e686bb41-4f0c-49ee-879c-b9acad96b0a8","resolution":{"observed_at":"2026-08-01T08:32:00.036570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.040297Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.040297Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:a819f673e1b88c170e96376e0d52cfb9ad5bb8e1bd966f4ac74f8d1ece0eb963","observation_id":"fed7bf0b-d4ad-40d7-b057-4cfa2823bd23","resolution":{"observed_at":"2026-08-01T08:32:00.040297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.043776Z","title":"Artificial Intelligence Review , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.043776Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:889b39b4c84aadf016dbc5738877d02116bb83fd8fcb5a1c4abef0a993643f52","observation_id":"fbbc1e17-b9c6-487b-b32b-7988d58fc7a3","resolution":{"observed_at":"2026-08-01T08:32:00.043776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.047292Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.047292Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:910b0ca7f2bc4cfa8bae97b68b3ff5ddb74226324fa2c61de058dc24a70eb998","observation_id":"09311152-f594-4260-a631-5809fb057196","resolution":{"observed_at":"2026-08-01T08:32:00.047292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.050748Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.050748Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:86a0c90bb354b78e90ffaa89314dfb9e07605a6bed7bd84064156965c97416b6","observation_id":"e636a94a-449c-4a02-be9c-bcf9eb6cd3b3","resolution":{"observed_at":"2026-08-01T08:32:00.050748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.054368Z","title":"Conference on Lifelong Learning Agents , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.054368Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:c83fb6b7e1c9f31086e9de0d6fbc82741c6150322649cf7dce63fa043ca58d0f","observation_id":"ce1e0e09-7922-4495-858d-3e8361cc5aef","resolution":{"observed_at":"2026-08-01T08:32:00.054368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.057772Z","title":"Deep Reinforcement Learning Workshop NeurIPS 2022 , year=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.057772Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:f94a7ddffb13c18fe5de01e11dd3f608db57a922a74a6d1aaf68865bf135fab4","observation_id":"1aafc077-d9d7-4034-b4fb-f57b39db3ec5","resolution":{"observed_at":"2026-08-01T08:32:00.057772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02596","last_updated":"2025-02-04T09:13:43Z","snapshot_observed_at":"2026-07-06T18:25:22.852874Z","submitted_at":"2024-06-01T05:55:15Z","title":"Slow and Steady Wins the Race: Maintaining Plasticity with Hare and Tortoise Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02596","snapshot_observed_at":"2026-08-01T08:32:00.061250Z","title":"arXiv preprint arXiv:2406.02596 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.061250Z"},"links":{"cited_paper":"/paper/2406.02596","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:f2fa1593db09178b4ed22222326080f7b4b5954a379090607f3be29c7975f104","observation_id":"0165518d-d6da-4831-8f33-afa3515f3912","resolution":{"observed_at":"2026-08-01T08:32:00.061250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01151","last_updated":"2022-01-03T22:38:41Z","snapshot_observed_at":"2026-08-04T05:15:36.285412Z","submitted_at":"2021-06-02T13:41:02Z","title":"Towards Deeper Deep Reinforcement Learning with Spectral Normalization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.01151","snapshot_observed_at":"2026-08-01T08:32:00.065224Z","title":"arXiv preprint arXiv:2106.01151 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.065224Z"},"links":{"cited_paper":"/paper/2106.01151","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:15ca54783ea32ecfb4bfc4c3b72b9fc29f6f22a32347f142336abe2f7244a55c","observation_id":"7f1d3b6c-9580-4f56-88e8-49c6ba2b11b2","resolution":{"observed_at":"2026-08-01T08:32:00.065224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.05605","last_updated":"2024-03-25T10:20:18Z","snapshot_observed_at":"2026-08-03T12:33:55.627333Z","submitted_at":"2019-02-14T21:05:50Z","title":"CrossQ: Batch Normalization in Deep Reinforcement Learning for Greater Sample Efficiency and Simplicity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.05605","snapshot_observed_at":"2026-08-01T08:32:00.068959Z","title":"arXiv preprint arXiv:1902.05605 , volume=","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.068959Z"},"links":{"cited_paper":"/paper/1902.05605","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:03f5d297d9dfd1c1d3b085e65467c5aadd728ae8876a1b9248e589d406b2054f","observation_id":"a9aed3e1-703b-4f9f-b7f4-13b961551d02","resolution":{"observed_at":"2026-08-01T08:32:00.068959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01800","last_updated":"2024-07-01T20:58:01Z","snapshot_observed_at":"2026-08-02T19:39:12.627194Z","submitted_at":"2024-07-01T20:58:01Z","title":"Normalization and effective learning rates in reinforcement learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01800","snapshot_observed_at":"2026-08-01T08:32:00.072591Z","title":"arXiv preprint arXiv:2407.01800 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.072591Z"},"links":{"cited_paper":"/paper/2407.01800","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:7d7543dc00e2444379b9927506711d30e474a89a19da106824bd2399872a2889","observation_id":"2ee1e8fa-4456-4f22-a346-809c2d6cfcd4","resolution":{"observed_at":"2026-08-01T08:32:00.072591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03167","last_updated":"2015-03-02T20:44:12Z","snapshot_observed_at":"2026-07-06T04:08:54.419941Z","submitted_at":"2015-02-11T01:44:18Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.03167","snapshot_observed_at":"2026-08-01T08:32:00.076211Z","title":"arXiv preprint arXiv:1502.03167 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.076211Z"},"links":{"cited_paper":"/paper/1502.03167","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:527aabefb9b3a99aeec8ca6282dcd5701075e91ddb2b474626f82aeb15e21408","observation_id":"e3fea54b-8c24-4758-b7bc-6a3619950a96","resolution":{"observed_at":"2026-08-01T08:32:00.076211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.079790Z","title":"Neurocomputing , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.079790Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:c90722d28508e95ef3e4801920e3566c5d1badfcf2b6b612889fc3fe473ef104","observation_id":"2fbe75f2-7baf-41c0-a207-17914736a68f","resolution":{"observed_at":"2026-08-01T08:32:00.079790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.083170Z","title":"Neural Networks , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.083170Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:eced0137c407ae8ed748901d3ba36bed7996e5e7650a87fa7ed771d2e30db529","observation_id":"f194f467-42d2-4ee8-827b-b6aebe2545d3","resolution":{"observed_at":"2026-08-01T08:32:00.083170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.086518Z","title":"international conference on machine learning , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.086518Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:1d05f0b0953fe2c8b9a1367eace2dc1c0c001919a91be58415056591bdb0ee17","observation_id":"ce9b018b-db8a-4e07-af70-6a92758acf30","resolution":{"observed_at":"2026-08-01T08:32:00.086518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05941","last_updated":"2017-10-27T17:45:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-10-16T18:05:45Z","title":"Searching for Activation Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.05941","snapshot_observed_at":"2026-08-01T08:32:00.090181Z","title":"arXiv preprint arXiv:1710.05941 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.090181Z"},"links":{"cited_paper":"/paper/1710.05941","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:9b36adc1803bf81add93d638090a7eb0ec1b30fd30cdd4f3a1fc20da57857f7d","observation_id":"7b6cfe6a-fb6c-4254-baed-806059435fd6","resolution":{"observed_at":"2026-08-01T08:32:00.090181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08681","last_updated":"2020-08-13T05:42:12Z","snapshot_observed_at":"2026-07-06T08:16:16.271286Z","submitted_at":"2019-08-23T06:22:06Z","title":"Mish: A Self Regularized Non-Monotonic Activation Function","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08681","snapshot_observed_at":"2026-08-01T08:32:00.094258Z","title":"arXiv preprint arXiv:1908.08681 , year=","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.094258Z"},"links":{"cited_paper":"/paper/1908.08681","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:66f06e91d2f872adc521b4d3713b58c32ce62bac237edf1a564830908f5c60c5","observation_id":"69e7ea55-825c-44ec-94bc-4b07c8d6d11b","resolution":{"observed_at":"2026-08-01T08:32:00.094258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.07289","last_updated":"2016-02-22T07:02:58Z","snapshot_observed_at":"2026-07-06T04:37:28.029641Z","submitted_at":"2015-11-23T15:58:05Z","title":"Fast and Accurate Deep Network Learning by Exponential Linear Units (ELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.07289","snapshot_observed_at":"2026-08-01T08:32:00.098155Z","title":"arXiv preprint arXiv:1511.07289 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.098155Z"},"links":{"cited_paper":"/paper/1511.07289","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:5bcaf54401785ef1c6d2d58cdad30e813192e5c030f3fa60543b48e944819200","observation_id":"5f94e844-33cd-492e-abc0-801dc1a6dc51","resolution":{"observed_at":"2026-08-01T08:32:00.098155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.101828Z","title":"Neural networks , volume=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.101828Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:3a5d781e4705131786f3ffe605a1690d31a6030c301c90b8a17254ba789bf99e","observation_id":"0f8e689c-d8b4-4d65-93eb-53e3a72cd5d4","resolution":{"observed_at":"2026-08-01T08:32:00.101828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-01T08:32:00.105363Z","title":"arXiv preprint arXiv:1606.08415 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.105363Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:d636df370f4d3f7dc862419ff85654326931d781ee468c71ad886a0c5d2fea9a","observation_id":"361a3a9c-fa6a-4465-a9cd-af8c0e53c58f","resolution":{"observed_at":"2026-08-01T08:32:00.105363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.108946Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.108946Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:9979f800411038b8fb73828e037481657c511de32a8dae66996ef6d5790f8f4f","observation_id":"95f13796-f1e7-413d-a342-83d370c15dd5","resolution":{"observed_at":"2026-08-01T08:32:00.108946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.112314Z","title":"Proceedings of the 27th international conference on machine learning (ICML-10) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.112314Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:36f10ee4f5785e94f44f9f4c6252a1223d1246637e2c6c5e81c6455bea83d947","observation_id":"1501f658-0aeb-4008-83b8-7faf5dee7618","resolution":{"observed_at":"2026-08-01T08:32:00.112314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.115769Z","title":"Neural networks: Tricks of the trade , pages=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.115769Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:81c59b6d5ccdce925cb99c880df9a7579411008a3a6699002c0f879092198fa9","observation_id":"1aec2436-cccf-40cf-bc03-d43699e1fd0a","resolution":{"observed_at":"2026-08-01T08:32:00.115769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07550","last_updated":"2022-09-15T18:08:48Z","snapshot_observed_at":"2026-08-04T05:50:16.407408Z","submitted_at":"2022-09-15T18:08:48Z","title":"Human-level Atari 200x faster","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07550","snapshot_observed_at":"2026-08-01T08:32:00.119566Z","title":"arXiv preprint arXiv:2209.07550 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.119566Z"},"links":{"cited_paper":"/paper/2209.07550","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:65f82ad7f77b8783da91128f7fe21eec0cd64b0cc6a7a6febe57ad36613261ad","observation_id":"0760b783-0412-496b-b2b4-4389fc49f94d","resolution":{"observed_at":"2026-08-01T08:32:00.119566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.123537Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.123537Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:db71b78e404e97c76cae3aaa62a015d40b4c6875825e7a0016f0f54e6cdab539","observation_id":"13f1f862-a35b-4335-9da9-aea52dd2bd38","resolution":{"observed_at":"2026-08-01T08:32:00.123537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.127013Z","title":"Architecture , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.127013Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:2a00df591b205a86de5d933abc639d139a2e6842105b87c7d5dc925cc1574b51","observation_id":"134d768b-fcb2-454a-93de-23f4b2d7c7b7","resolution":{"observed_at":"2026-08-01T08:32:00.127013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.130583Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.130583Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:5c5c72dbbb4479aa46b96a5207dfbadc8c34932fd079933a0e961c1e5170d763","observation_id":"0d006a61-58a3-465c-bdb6-9bbb8ba0591f","resolution":{"observed_at":"2026-08-01T08:32:00.130583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.134095Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.134095Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:af28687cabd8dd6226becd8b9b71952e7f2b5e82686117efec97f554ffbeb0e0","observation_id":"822c9805-a5e3-4477-a1aa-446857be4522","resolution":{"observed_at":"2026-08-01T08:32:00.134095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.137830Z","title":"Journal of Artificial Intelligence Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.137830Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:5c77b8ec2528161c1bafcffc9c54eb5ed4034817802cad17eeff6120c56245b4","observation_id":"c7f76e2d-c5d0-4b56-aa6e-a1c8e71175e7","resolution":{"observed_at":"2026-08-01T08:32:00.137830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.141273Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.141273Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:dfb529b2d9ed29ebb94de29eae61bb5bc0c531864440c82a5a98df9e181a11a8","observation_id":"f3da6a7e-36b6-4c0f-80ae-bd353f47048b","resolution":{"observed_at":"2026-08-01T08:32:00.141273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.144667Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.144667Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:b2e9d2d864df77a9eb88927d06a0795f7d05e85cb64c28d8fdee174299bf0033","observation_id":"f71ec251-39bd-45e5-95ec-ecc982358084","resolution":{"observed_at":"2026-08-01T08:32:00.144667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.148174Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.148174Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:abf79c4bec7b73ea083cda9bc760e407ea800c6ae07d4713192c052f7064ab60","observation_id":"ff361e76-87f1-41bc-b688-c99bdd2178aa","resolution":{"observed_at":"2026-08-01T08:32:00.148174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.152574Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.152574Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:97e6df6b6f2629ad52cca8039e946f95fcc1f2223934a968baf49ea46747be3b","observation_id":"9a5444a1-2a89-4c0d-9622-82af275e4a0b","resolution":{"observed_at":"2026-08-01T08:32:00.152574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.156266Z","title":"Nature , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.156266Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:60ca537323b08b4483b9e5e42ae2eb97b3e31cb0140be32e51f1c8c66a2e700c","observation_id":"ab3afdb4-f463-40a6-892e-669252d517b1","resolution":{"observed_at":"2026-08-01T08:32:00.156266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.159791Z","title":"Proceedings of the national academy of sciences , volume=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.159791Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:1df28f9111213971a170b45923e83b18034e06efb44d2f013409900ce6225b9d","observation_id":"955943a4-07ea-4bd6-bf5a-c4fd2dc28a64","resolution":{"observed_at":"2026-08-01T08:32:00.159791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.163313Z","title":"Trends in cognitive sciences , volume=","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.163313Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:bf353054602afd3b9c8d3873f879f85ba51eb217aa47a6d4fc13f3fa1acea32b","observation_id":"940a953d-5fd4-40d4-a9c8-5eaa08987692","resolution":{"observed_at":"2026-08-01T08:32:00.163313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.167011Z","title":"Psychology of learning and motivation , volume=","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.167011Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:cbe0b86c45a4e3ab0d8da64b1f2ab5c65cac6f18e21e3db02ccdfee0f0af6a9f","observation_id":"61e57539-d895-4a47-a24c-5b280cef3086","resolution":{"observed_at":"2026-08-01T08:32:00.167011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.170733Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.170733Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:58b1c2d3f8c2c5ae1e0100e4c453a2530371fa85a0eaec25931d8eda7dddc05c","observation_id":"cce3e59a-081f-44df-b8ed-6f7323e379ab","resolution":{"observed_at":"2026-08-01T08:32:00.170733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18762","last_updated":"2024-02-29T00:02:33Z","snapshot_observed_at":"2026-07-06T17:37:09.952632Z","submitted_at":"2024-02-29T00:02:33Z","title":"Disentangling the Causes of Plasticity Loss in Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18762","snapshot_observed_at":"2026-08-01T08:32:00.174220Z","title":"arXiv preprint arXiv:2402.18762 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.174220Z"},"links":{"cited_paper":"/paper/2402.18762","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:d7dc25381fece326c0c2ce84679645b7428b0d1ac062583fb8b01515ad3a129c","observation_id":"3b5d458b-1063-4dcb-bccc-c51a77e9e722","resolution":{"observed_at":"2026-08-01T08:32:00.174220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-07-06T07:15:51.575438Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-01T08:32:00.178072Z","title":"arXiv 2018 , author=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.178072Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:277fe57be1956f0e483a7e6c57270c3892051dc3162d43260baaa94487038140","observation_id":"5349a75b-0367-4be7-99c1-a8f420d5ca75","resolution":{"observed_at":"2026-08-01T08:32:00.178072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.182117Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.182117Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:321f40cf0df817c209dc07f664e79fcd1a6f7316a76b6c292f41c729aa82a194","observation_id":"9b2aa3fc-01cd-4289-94fb-86e6066690e7","resolution":{"observed_at":"2026-08-01T08:32:00.182117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.185583Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.185583Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:3d58e9a6038ca8e310601268ecf08ba1b15ecb684f39ef69b62fe594807f7f25","observation_id":"5bab5f36-7dde-4bc5-a4e4-7b791a3a692e","resolution":{"observed_at":"2026-08-01T08:32:00.185583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.189692Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.189692Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:ffde540abab1b08cd45f876e761963ef170bc1e9b9769efbcd80f4f1c43b96d3","observation_id":"3e77d4dc-1893-4572-8978-e232590ec55e","resolution":{"observed_at":"2026-08-01T08:32:00.189692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.193919Z","title":"1982 , publisher=","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.193919Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:e08a43a206ec3dc04ca094eeeb15bad9d6e92b3b1a2740158e00686f0ab7c5fc","observation_id":"f905dd73-dbce-46dd-8aaa-709414ac1df3","resolution":{"observed_at":"2026-08-01T08:32:00.193919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.198037Z","title":"The Sciences , volume=","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.198037Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:bd0ce157e10e731d9e065e2c00c1649e7f2b530e11396e2e3f113c1d034570e4","observation_id":"a20e86a1-d6c4-4a00-bf3f-c9228f381985","resolution":{"observed_at":"2026-08-01T08:32:00.198037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17688","last_updated":"2024-05-22T16:19:38Z","snapshot_observed_at":"2026-08-04T05:54:35.989942Z","submitted_at":"2023-10-26T17:59:06Z","title":"Managing extreme AI risks amid rapid progress","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17688","snapshot_observed_at":"2026-08-01T08:32:00.201622Z","title":"arXiv preprint arXiv:2310.17688 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.201622Z"},"links":{"cited_paper":"/paper/2310.17688","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:a2325646ee9c8fc6d95d023cf890b019e0361c47f4c3bbe42f5c4a69a072cf73","observation_id":"54eb23d0-d9fa-4f13-9709-8c3b56151020","resolution":{"observed_at":"2026-08-01T08:32:00.201622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.205545Z","title":", author=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.205545Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:2336e23b163f880a41a5332efc97ed293aef8c50623101cf7b3d6b4b8fdcee91","observation_id":"9293439a-c9d3-4ab8-8e3f-40efcd7078d9","resolution":{"observed_at":"2026-08-01T08:32:00.205545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.208882Z","title":"Conference on robot learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.208882Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:b5f94506125e6b6a66f9d1b68d04c3f46abe3318366fa0309421cab68cb15e40","observation_id":"df4aadff-d7cd-439b-b8bf-498d0f0bb0c0","resolution":{"observed_at":"2026-08-01T08:32:00.208882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.212934Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.212934Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:d6e6fd44665bbab298424ffb353286efd1e22b7b485499091ba176cde04641e5","observation_id":"1de3e3fb-fa70-4b25-adea-d7ade3043892","resolution":{"observed_at":"2026-08-01T08:32:00.212934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.216413Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.216413Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:57780e9ead787b1c7b287b20f003f2a8a02342b4f8131f65c8b7a163bfc13087","observation_id":"b3e32f87-a441-4263-809c-a4a3d86656f3","resolution":{"observed_at":"2026-08-01T08:32:00.216413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.03698","last_updated":"2020-08-04T04:07:27Z","snapshot_observed_at":"2026-07-06T07:38:07.496179Z","submitted_at":"2019-03-08T23:32:17Z","title":"Skew-Fit: State-Covering Self-Supervised Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.03698","snapshot_observed_at":"2026-08-01T08:32:00.219755Z","title":"arXiv preprint arXiv:1903.03698 , year=","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.219755Z"},"links":{"cited_paper":"/paper/1903.03698","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:987db8cc8f696943562353e82b722e7324877e6713e232d347cadf036f81efbe","observation_id":"872d3749-4388-436a-9ef2-e6857443b901","resolution":{"observed_at":"2026-08-01T08:32:00.219755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.223730Z","title":"The 10th International Conference on Autonomous Agents and Multiagent Systems-Volume 2 , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.223730Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:26d48ab05bdc3e9921a7fb38974a5389dd6bf59d4c03448174eb4d0caab94bdc","observation_id":"a5828539-3fc5-4a2d-a8b3-61d5b956d002","resolution":{"observed_at":"2026-08-01T08:32:00.223730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.227892Z","title":"IJCAI , volume=","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.227892Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:8c23d258db9754f0ee131c1691c9c137de663c9da978c14f73dca57b3b440a9b","observation_id":"28ed6931-b683-4459-9251-8af966a5ae8a","resolution":{"observed_at":"2026-08-01T08:32:00.227892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.231483Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.231483Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:cf4e373f67e521743bb39ad1b29f5866e4ee9438e2560a43adc49f7d31aba95a","observation_id":"29671395-2eda-4062-ac0f-869e1d2100a9","resolution":{"observed_at":"2026-08-01T08:32:00.231483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.235004Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.235004Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:da759022d7eccf0039be44101da62202b300e1607c681865dbd9841f3ef9c8b3","observation_id":"fabaea2b-a096-4435-85e9-743e34db4f37","resolution":{"observed_at":"2026-08-01T08:32:00.235004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.238701Z","title":"1988 , publisher=","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.238701Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:e10567a338dd4cf2d372cdd29288567ade9ee0394e4c642fe22465348e951535","observation_id":"a1c8e256-683b-4ecb-80f0-580dca024ff5","resolution":{"observed_at":"2026-08-01T08:32:00.238701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.242507Z","title":"arXiv preprint arXiv:2401.12963 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.242507Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:a5942abe110b419698ed6e9aa3d93ca7508c5d3a28232d8ff720154393bc2dde","observation_id":"03bddbdd-0e0b-48df-8155-1c1800180def","resolution":{"observed_at":"2026-08-01T08:32:00.242507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.246419Z","title":"Foundations and Trends","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.246419Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:ef12b99bb96d03f3d4df29aba3b9f8dedd12c0566d81197cef1211eeaacdd0c5","observation_id":"9c5a4008-b189-42fc-a473-e01a54a376d4","resolution":{"observed_at":"2026-08-01T08:32:00.246419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.250330Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.250330Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:b53008537e42ed245f7b11a6fed9cdbb6be560572f1d9d0af9752822ed6febbd","observation_id":"a20579ec-c3f1-41cf-a8c7-4fcd1674e705","resolution":{"observed_at":"2026-08-01T08:32:00.250330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-01T08:32:00.254106Z","title":"arXiv preprint arXiv:1312.5602 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.254106Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:b40a33a858fd47dc2d8acc1e111bac9ac4f254b1eb6b14d6108b25d5a51741ce","observation_id":"60afc1df-3fcf-4008-a02c-480292e4773c","resolution":{"observed_at":"2026-08-01T08:32:00.254106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.258113Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.258113Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:16847ef86c65f331abc25e1536765e6ca83f41b3f5a5e3e8e77b631a131d8505","observation_id":"4b6b982a-b5a7-4997-b16f-8443704ff472","resolution":{"observed_at":"2026-08-01T08:32:00.258113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.07528","last_updated":"2020-02-11T00:56:50Z","snapshot_observed_at":"2026-07-06T08:22:16.362093Z","submitted_at":"2019-09-17T00:17:02Z","title":"Emergent Tool Use From Multi-Agent Autocurricula","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.07528","snapshot_observed_at":"2026-08-01T08:32:00.261730Z","title":"arXiv preprint arXiv:1909.07528 , year=","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.261730Z"},"links":{"cited_paper":"/paper/1909.07528","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:982ce4c871b6f551150be8d4a243ef4fddad7b155e9cc3885fe3a49abdeb6066","observation_id":"15c762ce-cbed-484b-9ce4-2bd1bccc9165","resolution":{"observed_at":"2026-08-01T08:32:00.261730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.265399Z","title":"Artificial Intelligence , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.265399Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:ef5ce48cc081b4bba28777ae1730789ac1934b5926a22309493e9a3d9c40fac9","observation_id":"2be6bcf7-f9f2-41ec-a4d5-13da87948a77","resolution":{"observed_at":"2026-08-01T08:32:00.265399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.268821Z","title":"Artificial General Intelligence: 4th International Conference, AGI 2011, Mountain View, CA, USA, August 3-6, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.268821Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:df3c6de7822698c1bef34363f10cc03eecbe4676d5ce8920f13f36a2adbcb535","observation_id":"1061a391-ed08-4731-953d-9dafce161790","resolution":{"observed_at":"2026-08-01T08:32:00.268821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.272475Z","title":"2016 , publisher=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.272475Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:608d800c4d2b8d567893ce50ed884264ce5ab945fbb9f6c74c6516681fdd3ab6","observation_id":"7606a3c0-30d9-4f89-b430-a2bc481791c9","resolution":{"observed_at":"2026-08-01T08:32:00.272475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.276036Z","title":"2018 , publisher=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.276036Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:ebde0e68efac0d226029c8ff315b20069c5980057d69ac7d80600e9f426f4160","observation_id":"1eb059e8-0796-49fb-a654-29e0d6b39291","resolution":{"observed_at":"2026-08-01T08:32:00.276036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.279641Z","title":"Artificial intelligence safety and security , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.279641Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:2285864876b97b979a57694d823207194e9d719334cc2b7edcb71a3abc19b070","observation_id":"ee961421-1064-4aa3-a697-2f377c46547e","resolution":{"observed_at":"2026-08-01T08:32:00.279641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.283336Z","title":"2017 , publisher=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.283336Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:38c68a0d7cd4ff21e0182d498c605c15e2e118073b2b26b737955bb4284c5c7c","observation_id":"53298e9f-92e3-463e-ba98-c3f06e25e72c","resolution":{"observed_at":"2026-08-01T08:32:00.283336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.09883","last_updated":"2017-11-28T17:40:36Z","snapshot_observed_at":"2026-07-31T19:22:34.165724Z","submitted_at":"2017-11-27T18:57:13Z","title":"AI Safety Gridworlds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.09883","snapshot_observed_at":"2026-08-01T08:32:00.287868Z","title":"arXiv preprint arXiv:1711.09883 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.287868Z"},"links":{"cited_paper":"/paper/1711.09883","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:4abb17a3a8c010cd5798342490a756f30dd2ef7ac04ee6e71ee61db5c36db80e","observation_id":"ec5365c9-ff96-483e-9d42-16b574ccc378","resolution":{"observed_at":"2026-08-01T08:32:00.287868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.291888Z","title":"2019 , publisher=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.291888Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:88b76def703c37e27ed7e51606acbc37932c153bfcaa98f670cc42cef885c9b1","observation_id":"9bb48be5-96cf-42bf-ae44-b9f427458deb","resolution":{"observed_at":"2026-08-01T08:32:00.291888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.295444Z","title":"Global catastrophic risks , volume=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.295444Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:23464e524ddf9dcd9ad8ecb984f6c8c257c9ca1a35a2ed659f809f8d10fad29b","observation_id":"9673b897-fbf1-46db-8c1e-78c51b7eee10","resolution":{"observed_at":"2026-08-01T08:32:00.295444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.299191Z","title":"Road vehicle automation , pages=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.299191Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:bee031b2961fa005197e508348302a30e2ba8214aac4796f43d2fcd1c9fbb1ef","observation_id":"16b3f2d2-41c9-432c-bbbd-af638e9c4a59","resolution":{"observed_at":"2026-08-01T08:32:00.299191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.303287Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.303287Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:2053f859a1aa9046f95ee297a6e33d8329ce20217bd64288105cf6eac4e23047","observation_id":"3457083a-a7bc-47d0-b118-90ca9cd88342","resolution":{"observed_at":"2026-08-01T08:32:00.303287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-01T08:32:00.307147Z","title":"arXiv preprint arXiv:1606.06565 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.307147Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:1b273335ae6f79ea976574dbfb81abd12b7a47bbdb9af91e99631602aeecbe21","observation_id":"0c386f22-0c3d-4de4-b447-e946b142f27d","resolution":{"observed_at":"2026-08-01T08:32:00.307147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.310932Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.310932Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:5ad4ccd1c35bbbb2fe94e7b461f373e67f1b8957f47a4c364aeff1a87dd460ce","observation_id":"b9183977-9950-4e78-9b5a-21aaac9b632f","resolution":{"observed_at":"2026-08-01T08:32:00.310932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.314338Z","title":"Science , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.314338Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:da825eefc877047ca9ee84806c1c9ece17a2e91a569a1e4539baf58257c50203","observation_id":"297e3ac7-aa16-4b16-8413-29e82563c011","resolution":{"observed_at":"2026-08-01T08:32:00.314338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.318171Z","title":"Conference on robot learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.318171Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:10caf1f1a47c64d358dbae61968a301e40082077e66b6dbdd2d2ce8247adefde","observation_id":"d7f05819-c79a-4064-a650-7a7036c51ad2","resolution":{"observed_at":"2026-08-01T08:32:00.318171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.321628Z","title":"The International Journal of Robotics Research , volume=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.321628Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:3354df75ade22ef57af79ccc9b8eff568e9648061c9bd16b79e88d597b43cf7d","observation_id":"57340d75-440f-4cd2-ac37-e662ef3b1303","resolution":{"observed_at":"2026-08-01T08:32:00.321628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T22:10:31.355027Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":137},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 100 of 137 outbound references and 0 inbound Pith citation observations for arXiv:2607.21120."}