{"as_of":"2026-08-09T12:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:620eeb2b1e1314d3eb008c08a1ec44b8437926e35123b886dc8d0af7215af340","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T01:55:22.266761Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2512.04246/citation-record","integrity":"/paper/2512.04246/integrity","json":"/paper/2512.04246/citation-record.json","paper":"/paper/2512.04246"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards artificial virtuous agents: games, dilemmas and machine learning.AI and Ethics, 3(3):663–672","venue":null,"work_id":"2ae26d1f-d90a-4434-91d4-b632067969ad","year":2023},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:f367505a0135e3fcf9169d307cf8706c536dd25123d4cd3796a57bb45677ebcd","observation_id":"65fc118f-8b8e-4d5b-be22-1152804a5203","resolution":{"observed_at":"2026-05-17T02:01:26.797474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning as a framework for ethical decision making","venue":null,"work_id":"a87981c5-1c06-47dc-ba6d-c421b8c24cf0","year":2016},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:def7a8d97e2b5bd55947aa36518731d6fbc83298904385962761c6b51b7c515a","observation_id":"b8184140-7a14-49c7-b189-e15938be5ce2","resolution":{"observed_at":"2026-05-17T02:01:26.774477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.02425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning and machine ethics: a systematic review","venue":null,"work_id":"a2ba7514-3ad0-4cbe-858e-159896b763fe","year":2024},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:130de41bb90aa0fd8c31689e438bcd51b6097756b2dc977d26db86cbce621f64","observation_id":"0b603340-0650-4831-9dda-69d18fe323bb","resolution":{"observed_at":"2026-05-17T01:58:51.927971Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Groundwork of the metaphysic of morals","venue":null,"work_id":"0ac7a7f6-2f6b-41c5-ae0a-5c1749202486","year":2020},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:f396e577a02db3cbd4a6d3a22bf0b51531dcce0b7807c340592aef474bd1d5a8","observation_id":"3d317330-0976-4308-acf6-f8405188ed22","resolution":{"observed_at":"2026-05-17T02:01:26.808489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Utilitarianism","venue":null,"work_id":"d137f359-2bc6-400a-ab74-4f294a58b566","year":2016},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:c724cdce363a1c248891937c0a7b948d93d4925c5c39f39d0f8ecb646740e72e","observation_id":"165de463-5327-4399-bc58-858b22e40eba","resolution":{"observed_at":"2026-05-17T02:01:26.751337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:25:56.527513Z","title":"Safe reinforcement learning via shielding","venue":null,"work_id":"d227d877-db3e-4eac-b747-0e243d7766e7","year":2018},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:e60e3cc7db3e7f2d3429ce2a038e9402a4dbe4f5b09ff5f55a8a6f90f4556090","observation_id":"6a602ff6-f407-412c-bcfc-0ddac7a374b3","resolution":{"observed_at":"2026-05-17T02:01:26.777540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can model-free reinforcement learning explain deontological moral judgments?Cognition, 150:232–242","venue":null,"work_id":"3715289f-4a59-46f8-b43f-bd93751bf908","year":2016},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:e6ab357b626549f6fe04a91060f8c9b7cc37a655d647123f12eba76847b35dfa","observation_id":"93f96e0d-dead-4312-9175-88f88be0362e","resolution":{"observed_at":"2026-05-17T02:01:26.754625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning under moral uncertainty","venue":null,"work_id":"5b9ad2a9-c380-49c1-b273-d25ee2e22afc","year":2021},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:f7437a55499bbd07a202e54ca60a19d01b89f7a6d14d71fbd52f522097c58398","observation_id":"ea0ae0e3-ee69-4e20-8545-6b5890ae6943","resolution":{"observed_at":"2026-05-17T02:01:26.768431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Q-learning as a model of utilitarianism in a human–machine team.Neural Computing and Applications, 35(23):16853–16864","venue":null,"work_id":"8cb67f9f-b55f-40c8-8e7c-b22e55530972","year":2023},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:d063b623bdf7c1066d5cc2ddfb56e2a601d285f4908763c70ec13bb4aa63e42d","observation_id":"cf320c6b-aa29-4dfe-bea4-e1f9f9dbb7c0","resolution":{"observed_at":"2026-05-17T02:01:26.804121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Artificial morality: Top-down, bottom-up, and hybrid approaches","venue":null,"work_id":"10cd77bd-2d6d-410c-84a4-f6d33cd4b97f","year":2005},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:a6079c10c47829137511acf1c3cbb54919a27e9ed4a42bff8d4310251871c9f0","observation_id":"0041ea57-7882-47b9-ac40-77df2b52780b","resolution":{"observed_at":"2026-05-17T02:01:26.748504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Building ethically bounded ai","venue":null,"work_id":"87290b36-cac8-42ec-a6ce-98065ccc77ba","year":2019},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:f66398b8b6a3cef2b2db232963c5b8347e6d56ec2ecf6b1279f188d1f528cbaf","observation_id":"6e1235e9-c99d-4d1c-97b8-b5e20f6e2355","resolution":{"observed_at":"2026-05-17T02:01:26.757415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02953","last_updated":"2018-12-07T09:18:01Z","snapshot_observed_at":"2026-08-06T13:30:46.304863Z","submitted_at":"2018-12-07T09:18:01Z","title":"Building Ethics into Artificial Intelligence","version":1},"cited_work":{"arxiv_id":"1812.02953","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.02953","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Building Ethics into Artificial Intelligence","venue":"cs.AI","work_id":"a07f9062-3f59-40c2-9402-15be2c91ba15","year":2018},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"cited_paper":"/paper/1812.02953","citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:378c6c15bdbf550257167695496ccaf053e29237cf792426a73412b84ffc6ac7","observation_id":"b0b3d56a-599b-4450-8476-ab972085d163","resolution":{"observed_at":"2026-05-17T01:58:51.922355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A low-cost ethics shaping approach for designing reinforcement learning agents","venue":null,"work_id":"968488cf-4942-4eac-97cc-7e3f61b3a6a4","year":2018},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:974663ef21e779d415efdf818f8face3b4f3ab77e28d7611e7a01c46e4a85b57","observation_id":"4797add2-a982-442d-ab9b-39d7dd1263f0","resolution":{"observed_at":"2026-05-17T02:01:26.762694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Virtuous vs","venue":null,"work_id":"c02dcbcd-7590-44fc-b006-ad8dbf4333fe","year":2020},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:a5a5889d28e320ed9557e1a00b89612e44834c27a4be22560030e04cf54adcfa","observation_id":"5094bf44-3db7-4cc3-88d1-19f68825dcf7","resolution":{"observed_at":"2026-05-17T02:01:26.765337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching ai agents ethical values using reinforcement learning and policy orchestration.IBM Journal of Research and Development, 63(4/5):2–1","venue":null,"work_id":"e6b3b3ca-58c4-4199-99f0-1de5dfa1302c","year":2019},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:ff207ba157a79bb47b0dbac78bb7553486b07f86b5edf3d4dbf385b3755dc621","observation_id":"d044e971-4ef7-4f6d-970f-68b7082cc029","resolution":{"observed_at":"2026-05-17T02:01:26.771409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cambridge University Press","venue":null,"work_id":"54da8539-3e53-48e1-8a8f-7fab8f75373c","year":2014},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:a79329a164f46c31ff4f617e41b5109b7496f6babab22131b386f6e349e724bc","observation_id":"29d42ca0-a2b1-4545-be7d-b809c8d04ff9","resolution":{"observed_at":"2026-05-17T02:01:26.759968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Right action and the non-virtuous agent.Journal of Applied Philosophy, 28(1):80–92","venue":null,"work_id":"ab79423d-3d01-4bb5-a883-2d2ebeb19958","year":2011},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:4207cce82021e1b9fecda959a92753c043289d4054a7ca6f6a0adc3509b9eaaa","observation_id":"f8e052f7-d963-4aea-a4e5-298b88ef6df0","resolution":{"observed_at":"2026-05-17T02:01:26.829283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07712","last_updated":"2024-12-03T16:17:32Z","snapshot_observed_at":"2026-08-08T22:58:57.398581Z","submitted_at":"2024-08-13T23:08:06Z","title":"Introduction to Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2408.07712","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.07712","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introduction to reinforcement learning","venue":null,"work_id":"b5c92beb-01e9-4616-b15f-90c7163ca919","year":2024},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"cited_paper":"/paper/2408.07712","citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:44d765a2c8ea24d09d012f836ad8678576c120c243bd975df03363741f8352a7","observation_id":"7f1e9bae-cfcb-4c21-8af9-83b56572ba6c","resolution":{"observed_at":"2026-05-17T01:58:51.906720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.07750","last_updated":"2021-08-08T00:12:49Z","snapshot_observed_at":"2026-07-06T11:00:04.987477Z","submitted_at":"2021-04-15T20:14:19Z","title":"Joint Attention for Multi-Agent Coordination and Social Learning","version":2},"cited_work":{"arxiv_id":"2104.07750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.07750","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Joint attention for multi-agent coordination and social learning","venue":null,"work_id":"f2b5d887-ad51-4995-99ad-2281a5b1d566","year":2021},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"cited_paper":"/paper/2104.07750","citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:de82522663487d4348cbdc3b61591c7a7895da17b4698d6f25e1184366ed573a","observation_id":"089947a4-0e68-4e35-9f5f-7441dcb8e630","resolution":{"observed_at":"2026-05-17T01:58:51.917184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning few-shot imitation as cultural transmission.Nature Communications, 14(1):7536","venue":null,"work_id":"7af89ea6-fe14-428d-a9b0-f339bd69c236","year":2023},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:7452048a08334618c46af7dc24c3b73693c0858ea208ce4764c1c8d9f4b42119","observation_id":"35039a66-c971-4ece-bbef-011ca266d317","resolution":{"observed_at":"2026-05-17T02:01:26.818867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15679","last_updated":"2025-08-21T15:59:20Z","snapshot_observed_at":"2026-08-05T17:44:48.310123Z","submitted_at":"2025-08-21T15:59:20Z","title":"An Efficient Open World Environment for Multi-Agent Social Learning","version":1},"cited_work":{"arxiv_id":"2508.15679","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15679","snapshot_observed_at":"2026-07-02T21:57:26.476025Z","title":"An efficient open world environment for multi-agent social learning","venue":null,"work_id":"f1bb5eea-acd7-49a1-934a-d9c2988d8b4e","year":2025},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"cited_paper":"/paper/2508.15679","citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:c0f47d61c7ee67bba356a79a9ba140f9836e0c5f29e2a9867f9efad88d8873d5","observation_id":"ddf573f2-442c-44d0-86d3-9496a13d9d89","resolution":{"observed_at":"2026-05-17T01:58:51.912009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emergent social learning via multi-agent reinforcement learning","venue":null,"work_id":"4ad86cb9-40af-4d37-aa47-009c9b6b383d","year":2021},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:b16e042b639434c13b5af9a692038515af7027ee7b93360b9fdbd04966912e66","observation_id":"8efbd136-d07c-4f8b-b2a6-0b38994e95bb","resolution":{"observed_at":"2026-05-17T02:01:26.873772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Social influence as intrinsic motivation for multi-agent deep reinforcement learning","venue":null,"work_id":"bdc65590-1781-4f3b-9a88-74e4f34a5800","year":2019},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:c860d4a22cf7f786a8e831b0f11bf6324e5803586e5a2a4b034afc5471d1d12e","observation_id":"1a641980-ca1d-4a19-91fb-6e137c7a6a18","resolution":{"observed_at":"2026-05-17T02:01:26.860647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-objective reinforcement learning: an ethical perspective","venue":null,"work_id":"0f48d669-b912-47db-b793-ca4788aa263f","year":2024},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:c827ed8c63c64eb07b2721eb14a713cd226500a56c540d30a779fb99dbbf2045","observation_id":"a88686ce-f456-4a6a-8516-9bd636c56849","resolution":{"observed_at":"2026-05-17T02:01:26.840830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring affinity-based reinforcement learning for designing artificial virtuous agents in stochastic environments","venue":null,"work_id":"5f162a77-dcd7-4418-a21f-4496a756faef","year":2023},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:5cc6e966c19f91b302cec963e6a3272a1d6c41d505d0fc6890c78035aaab5cbf","observation_id":"8a690175-566a-4676-a538-cfc137fbc855","resolution":{"observed_at":"2026-05-17T02:01:26.813110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The core of confucian learning","venue":null,"work_id":"112f669d-bf6f-4813-a7ab-7eead76193bc","year":2003},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:5eeb33cc0db3b5fdb79b98efd92cfc4ad97c785bdb1993498b99a456346b0f5e","observation_id":"55ec86bd-7830-47c0-a72d-9ab0bf735c33","resolution":{"observed_at":"2026-05-17T02:01:26.868522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The daoist thought of wu wei–action through non-action and its influence in vietnam.Synesis (ISSN 1984-6754), 17(2):55–71","venue":null,"work_id":"bd8270c8-83d7-472b-9ae7-e0da7d6867fa","year":1984},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:415831e1783c8fd056e5ea37b6337a9a65da7dc184b0be6180f7bb3df6390806","observation_id":"98acc1b5-0419-47db-ad4e-c3ef28a39a9b","resolution":{"observed_at":"2026-05-17T02:01:26.864786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An anthology of philosophy in persia","venue":null,"work_id":"ac95951b-375b-4489-83d6-512f0d8eca41","year":2012},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:52a37edd966cd2162c2504752a5082519389704e5c690a0e1c58dcf353329f41","observation_id":"789ad6f0-1e3d-4e3b-b5a9-c11f7170a1f3","resolution":{"observed_at":"2026-05-17T02:01:26.851347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Composable modular reinforcement learning","venue":null,"work_id":"bf9f3d73-5513-4edc-aa14-2b9cf41d0319","year":2019},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:8562eaf9a66756688e160a2d4a4aea113490cab6c5d4c16b85a8f1549f584149","observation_id":"c8b9c0a0-1b71-403d-bbd0-000513057181","resolution":{"observed_at":"2026-05-17T02:01:26.845494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Formal verification of ethical choices in autonomous systems.Robotics and Autonomous Systems, 77:1–14","venue":null,"work_id":"d4bc442b-fcc5-4786-bbff-a6573b0b5965","year":2016},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:b472c770c322b1c4a83922d47ab40893df21309eb1e3480699ff512e55028ca6","observation_id":"4baf5916-afb9-4490-8e2d-77a4c7d1e6fe","resolution":{"observed_at":"2026-05-17T02:01:26.837274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ltl and beyond: Formal languages for reward function specification in reinforcement learning","venue":null,"work_id":"1490db20-93ab-4294-8303-349ef803b659","year":2019},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:129a4f5cc372b09d216f316fb5d343edbfd974bc13e88dff61e91644780628eb","observation_id":"de968810-320b-43e0-b86b-1cbb1271b02d","resolution":{"observed_at":"2026-05-17T02:01:26.833813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Using reward machines for high- level task specification and decomposition in reinforcement learning","venue":null,"work_id":"99597ba5-b5de-4042-8d91-e1eab5499e24","year":2018},"citing_paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T01:55:22.266761Z"},"links":{"citing_paper":"/paper/2512.04246"},"observation_digest":"sha256:4bb8532745b3b83ecea426d7585dfc15ece00e28c646b111c2403f38450c2875","observation_id":"6dfc234c-3620-48bf-9429-82d71cbe5d65","resolution":{"observed_at":"2026-05-17T02:01:26.824513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2512.04246","last_updated":"2026-04-06T19:43:12Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T04:35:59.040006Z","submitted_at":"2025-12-03T20:30:37Z","title":"Toward Virtuous Reinforcement Learning: A Critique and Roadmap"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":5,"verified_fuzzy":27},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2512.04246."}