{"as_of":"2026-08-08T17:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:de8dc390b78b7351e2e69d845252c3b2fc1a530fda34807d70a8a57ac3774a8e","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:29:46.948522Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.15011/citation-record","integrity":"/paper/2505.15011/integrity","json":"/paper/2505.15011/citation-record.json","paper":"/paper/2505.15011"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:50.002718Z","title":null,"venue":null,"work_id":"4ce55ffc-025c-42ac-9cb4-b0c55a227a5f","year":2019},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:43.685469Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:7d3c8c902f76fcbf817aa25a6c03c0c7e3cd4538d4dba3640dc7ad41a87fecf5","observation_id":"f2332345-46e5-4552-bc79-0810f28a4cfc","resolution":{"observed_at":"2026-08-07T15:29:50.068590Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10676-006-0004-4","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:47.831299Z","title":null,"venue":null,"work_id":"b713a6f7-673c-4920-a878-cee27e6b9920","year":2005},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:43.728897Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:a569667b2697438ee8a19bee84696617185ee679ea77647ff5d97fa9f5fe6c44","observation_id":"92fa9ca6-4ed9-4ec6-96f3-23a674c10e81","resolution":{"observed_at":"2026-08-07T15:29:47.879679Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:49.938013Z","title":null,"venue":null,"work_id":"3aa3a279-9056-4e6f-a136-3186fe3a0374","year":2018},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:43.806848Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:f8594a130cd971359533f2d384267c26c77cc45361f33a8412c639969ffe60ee","observation_id":"e9adfc80-a04d-4a0a-b6eb-05e92ec58a40","resolution":{"observed_at":"2026-08-07T15:29:49.965780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:43.877217Z","title":"2011.Machine Ethics","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:43.877217Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:91bb708a1161d48eee9b627a3680ba5a912509b0accfe3e783cf5d44170e21aa","observation_id":"b63afe19-0577-4c95-b520-50dbdd65545d","resolution":{"observed_at":"2026-08-07T15:29:43.877217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10994-023-06311-2","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:47.702249Z","title":null,"venue":null,"work_id":"f411f93c-5aec-420c-86ba-bcde58122688","year":2023},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:44.051349Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:77bdc63b15049da188a21d7d9173fd3cfb6d9cc52fcf902cabee749a1f51b791","observation_id":"27251b20-f90f-4d83-99ab-cf5909d59cde","resolution":{"observed_at":"2026-08-07T15:29:47.757610Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:49.850955Z","title":null,"venue":null,"work_id":"129e7c02-a664-49fd-8808-1400927fa0b7","year":null},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:44.103805Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:707da3bffdf7a3674014bb08d06cf57bbc8f7089da2b661abdb316ce8292f0a6","observation_id":"5d31ef8c-32c7-4f81-bebc-032c5f01fb53","resolution":{"observed_at":"2026-08-07T15:29:49.885469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:49.793486Z","title":null,"venue":null,"work_id":"4114dca6-150c-4289-9d81-f67d2022afbb","year":2023},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:44.273364Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:67b209d75b35857844c813c8bf1bbf33ef6cb43f620b0ce2fa0700fb5c620744","observation_id":"d1ed2666-4d6f-4b88-a99b-c05226295133","resolution":{"observed_at":"2026-08-07T15:29:49.819983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.10295","last_updated":"2019-07-09T09:57:23Z","snapshot_observed_at":"2026-07-06T05:49:17.299252Z","submitted_at":"2017-06-30T17:56:19Z","title":"Noisy Networks for Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.10295","snapshot_observed_at":"2026-08-07T15:29:44.411449Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:44.411449Z"},"links":{"cited_paper":"/paper/1706.10295","citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:29ad3f2cd62409b2bb0f92866e8ecdb370a5817860d0e67ca3fdb34485bd0da5","observation_id":"7c782612-e9c2-4935-8399-85d73ef4f1c9","resolution":{"observed_at":"2026-08-07T15:29:44.411449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:44.541245Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:44.541245Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:a39301764ecb00ef7f42f89ab21cc35afaca416d658a96fa58924599eb7d0fb7","observation_id":"548e27e1-1903-42a6-8b79-686afb662f1d","resolution":{"observed_at":"2026-08-07T15:29:44.541245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v32i1.11295","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:47.531453Z","title":null,"venue":null,"work_id":"c4191b5e-aa6b-4870-affa-17a0693b4c43","year":2018},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:44.813018Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:6b3ed6606578064a52350de50f2d32d747c59d7166b1202521273feab6a23867","observation_id":"1b5c38e4-c5c3-4d5f-8325-3b2da96af338","resolution":{"observed_at":"2026-08-07T15:29:47.598569Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:49.716171Z","title":null,"venue":null,"work_id":"adebd2a8-daff-44d5-a6e9-85f8f29ff156","year":2021},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:44.931454Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:5894bcf0c5ffa8036477f9faa6cf6df5857bc4557d0ea204a5d6aaf4532cb3da","observation_id":"6bf8f9d4-7852-479b-aa0d-da8c51ca34b9","resolution":{"observed_at":"2026-08-07T15:29:49.746484Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:49.635348Z","title":"Hauptabt","venue":null,"work_id":"6b52c178-0ede-4d94-aa3d-7ded8e5d9a78","year":1998},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:45.058627Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:40399431a6bc0e435676b68b6dd3a2343535c1f04c2de42ba85bc71568924c32","observation_id":"eb319be1-0dd1-4b26-a26b-d5a732be27aa","resolution":{"observed_at":"2026-08-07T15:29:49.670291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:49.551051Z","title":null,"venue":null,"work_id":"6437515a-ed26-4101-a1a1-671899f3155d","year":2024},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:45.167157Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:17b1adf93b74edc2cdab2a6120ea97f76b5994d3c4e2182cc021a08b3a627cfc","observation_id":"7de1c634-0e51-4e0c-926b-1730fe63f9fd","resolution":{"observed_at":"2026-08-07T15:29:49.600286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:49.456607Z","title":null,"venue":null,"work_id":"398ae352-38b5-428d-937d-c04e346d6a04","year":2018},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:45.263771Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:57e16c64e91a7dc7f1a7b7cf6811e60ab36e7170ee4ed408487111a36dfcbbe7","observation_id":"f8d70b68-4efb-4b33-90cb-1371c0060446","resolution":{"observed_at":"2026-08-07T15:29:49.502077Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:45.357991Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:45.357991Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:d76be44c345b1b7686c8b4c2ff0f09bfb32b05876d536abdb8e127d229cc7b7a","observation_id":"550a2488-0789-4df3-87ee-9969e6210caa","resolution":{"observed_at":"2026-08-07T15:29:45.357991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09469","last_updated":"2021-04-19T17:33:07Z","snapshot_observed_at":"2026-07-06T11:01:45.274067Z","submitted_at":"2021-04-19T17:33:07Z","title":"Training Value-Aligned Reinforcement Learning Agents Using a Normative Prior","version":1},"cited_work":{"arxiv_id":"2104.09469","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.09469","snapshot_observed_at":"2026-08-07T15:29:48.319428Z","title":"Training Value-Aligned Reinforcement Learning Agents Using a Normative Prior","venue":"cs.LG","work_id":"6e47911e-d053-4ce9-95bb-dde203b1fa4a","year":2021},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:45.440912Z"},"links":{"cited_paper":"/paper/2104.09469","citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:a44ef283b43e51b4eada6c2b4f2a074172c92e3a2ef6680009699591f971460b","observation_id":"a3dbad0a-4ed1-45e7-97ba-f38945127bb1","resolution":{"observed_at":"2026-08-07T15:29:48.390968Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:45.536818Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:45.536818Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:d51947a71f21facb5af7c034b45ccbcb72453e820bb428ec44d89c482882d764","observation_id":"af378706-719e-4f27-b0e4-215f3a9c79b6","resolution":{"observed_at":"2026-08-07T15:29:45.536818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:49.297330Z","title":"Neufeld, Ezio Bartocci, and Agata Ciabattoni","venue":null,"work_id":"208b7a6d-a10f-48ba-bb00-c3460def89fa","year":2022},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:45.659152Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:446b4da74908b69cc6fc293c51d46ff1de63c717393a94abf73328dcba99c9e5","observation_id":"31e0eabc-f2b7-47cc-a689-0f23b5163ca9","resolution":{"observed_at":"2026-08-07T15:29:49.401537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:49.145024Z","title":"Neufeld, Ezio Bartocci, Agata Ciabattoni, and Guido Governatori","venue":null,"work_id":"3ff85a9a-062d-4de4-9d61-66d5713068e6","year":null},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:45.791671Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:725d3db8203362bd81eca590a76bec08a550a65c4e14c8f41eec9fc382f9bad7","observation_id":"28df5bc8-b13f-4eb6-a5f9-1b6c73d43956","resolution":{"observed_at":"2026-08-07T15:29:49.215661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2019/891","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:47.273315Z","title":"Varshney, Murray Campbell, Moninder Singh, and Francesca Rossi","venue":null,"work_id":"c9c70cb2-3c25-426a-9bfe-a303dea4fe68","year":2019},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.016637Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:78bf198d1b32584ad55ca5f1254abfc6f80ac2d25084d83e837703b5db24c2ae","observation_id":"3f6dd90d-8610-495a-bfe2-0a004950ee3f","resolution":{"observed_at":"2026-08-07T15:29:47.389279Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:46.133292Z","title":"Osoba, Benjamin Boudreaux, and Douglas Yeung","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.133292Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:794b503217240e6eb0b35de2489c0b827c951ff85429a9bbcda004e5650ad8cb","observation_id":"ea220ad8-f90a-4872-a2df-eff8584e2783","resolution":{"observed_at":"2026-08-07T15:29:46.133292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:46.189575Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.189575Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:38c42c2ad31e27993a9dd57bfb9f7373ad72676f9fc0ce140140d9ef725692e6","observation_id":"ef64e642-b235-4f0e-ba81-6653850dc5e2","resolution":{"observed_at":"2026-08-07T15:29:46.189575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:48.990852Z","title":"Oliehoek, and Luciano C","venue":null,"work_id":"e5fa9669-a8da-4e61-a0cc-587be068ef73","year":null},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.262577Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:e64ed9497c8f76924b0b9e6e51f66b2404862be0cb434d779078e42cc2d08d17","observation_id":"4854d889-93a8-40a6-bedc-e52c39514889","resolution":{"observed_at":"2026-08-07T15:29:49.069779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:48.777253Z","title":null,"venue":null,"work_id":"2a9f62f3-b38c-4fa0-b100-008152e1caf2","year":2019},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.373662Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:956cd0e6991cbd6297f8850ec3c32ca99f9268b0c1ad377177c9070be961e883","observation_id":"8e0d87da-b920-4c2c-be6b-fe776b1211e7","resolution":{"observed_at":"2026-08-07T15:29:48.798664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:46.489529Z","title":"Shaw, Andreas Stöckel, Ryan W","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.489529Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:952a8bfead8afe34dae47764c7edd9eee564899312d16350d8696ae4b1f214de","observation_id":"f2e25747-3b2a-4679-bd64-903669f2310d","resolution":{"observed_at":"2026-08-07T15:29:46.489529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:48.870193Z","title":"InProceedings of the 21st International Conf","venue":null,"work_id":"35af75ac-e538-48a6-95c3-2c5adc71ec3a","year":null},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.320335Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:2a8c9cd5d587388dc19eb7772b2471e25f7ea984615863a9b55f82526e14bc08","observation_id":"dee9b111-49f4-4194-8121-6ad689b612e3","resolution":{"observed_at":"2026-08-07T15:29:48.925273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-07T14:09:19.448496Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-07T15:29:46.611548Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.611548Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:3d5fdc2c17d470a26b99a077142eea868bd9f8739ce8f35a0e74f874f598972e","observation_id":"164746cd-c772-4674-847e-d9d152fddccd","resolution":{"observed_at":"2026-08-07T15:29:46.611548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:46.745452Z","title":"Czarnecki, Michaël Mathieu, An- drew Dudzik, Junyoung Chung, David H","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.745452Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:64ef096ed2945f437944d2859e3d3e7414c7099f0d1f22b006e7d4a74c74f182","observation_id":"c5cc2ca7-15bb-4bdf-ae16-5cb09a9a0ce0","resolution":{"observed_at":"2026-08-07T15:29:46.745452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:48.687404Z","title":null,"venue":null,"work_id":"29734ad3-2304-4e88-a908-52639bd5e6fd","year":2016},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.846243Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:a9f1baca9f7761424ec29a9eaab3824d22f6a9d0c09ec661ed5601b12eba7f40","observation_id":"b4cb5ffb-dfe9-4aa1-a9a3-1a7754de3f93","resolution":{"observed_at":"2026-08-07T15:29:48.726223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"biblio/1030136","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:48.029007Z","title":null,"venue":null,"work_id":"60e15c91-ee25-45e2-af8c-52959a2d0619","year":2017},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.535647Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:2b0e993fa225306e85bbefa18a9ed15b6cf3cff13f5301bdcd7676f7d66f1c15","observation_id":"1d695a29-cbb7-42db-84d1-e8ec1032ec9c","resolution":{"observed_at":"2026-08-07T15:29:48.085845Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:48.596503Z","title":null,"venue":null,"work_id":"79d88159-16bc-4608-a7c5-a41e9f6c684e","year":2018},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.948522Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:aad145ae947de0b2202c38e48fdfa0256637637045c9dda843e4a3afe0877458","observation_id":"948d17fb-3f1e-4d04-b5fe-c84cdc96c77d","resolution":{"observed_at":"2026-08-07T15:29:48.634613Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:44.163712Z","title":"on Artificial Intelligence33, 01 (Jul","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:44.163712Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:6765e2073f8df8319325e3406d65ebaa8fa2b0901024a7975837bfd3f9bd81f8","observation_id":"fc70aa8e-b68e-466b-8639-77ca9f51adef","resolution":{"observed_at":"2026-08-07T15:29:44.163712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:45.894600Z","title":"https://doi.org/10.1007/s10676- 022-09665-8","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:45.894600Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:834d8702d7fcab6d0f5140aeae478c925a863af8e12e00380b461dcb9f84e154","observation_id":"505f516f-aac2-40d8-99ee-83f6560d8370","resolution":{"observed_at":"2026-08-07T15:29:45.894600Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v33i01.33019785","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:47.086964Z","title":null,"venue":null,"work_id":"4659bd71-d6c3-4c0f-af18-7b6d8a9e8b79","year":null},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":9789,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.434752Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:8da49f83aeea16b34fb7f556ebd5ca2f3a44a964910489e3fce124df273a667c","observation_id":"4fb8835b-2bb1-4ef5-8d8d-ea135d9da299","resolution":{"observed_at":"2026-08-07T15:29:47.165029Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T15:23:15.558853Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":7,"verified_fuzzy":5},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2505.15011."}