{"as_of":"2026-08-21T13:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e560ed6b9db81f1455518739b5641782bcd959bc65c1f96a51236f47955a2269","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-25T23:35:03.577967Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.24622/citation-record","integrity":"/paper/2606.24622/integrity","json":"/paper/2606.24622/citation-record.json","paper":"/paper/2606.24622"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"A systematic study on reinforcement learning based applications,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:c668dc2a497d7f720cc231189a96b798b3cf6a5ca9877ca09211cec7eeccd00b","observation_id":"e0f1e3e4-9853-43c5-9dd2-10607f5a05d1","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Deep reinforcement learning for autonomous driving: A survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:b8e66f446cec293a97456f119dfc360f4b42a8221019eb94fd75be4dce66feb1","observation_id":"734e6cfc-0ea3-40dd-8d04-f959d0b0cf03","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Deep reinforcement learning for robotics: A survey of real-world successes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:48ed6d7c1e971de18f3b05e22ff0880b8d04bd58b7d74ea27a751336028ce98e","observation_id":"9acd538f-4867-48f8-bea5-f643018b3c42","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"A review on reinforcement learning: Introduction and applications in industrial process control,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:2c6c36bfb2d003102e402ebb30954277f2c309699b884aa70cbd76c6e6ee75cd","observation_id":"2d628a25-175e-49c9-a257-e17f252f9ec2","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":"2203.02155","doi":"10.1007/s00354-022-00198-8","metadata_source":"pith","pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training language models to follow instructions with human feedback","venue":"cs.CL","work_id":"52aff42f-4fa9-4fcf-bdb3-1459b9bebf65","year":2022},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:8eb1e81a4c055f683eceda89603de32f498fc73587cdc6e1e4548cb2f01f6a66","observation_id":"6efe7846-c89a-47c8-8aca-83c854f0ce70","resolution":{"observed_at":"2026-07-04T17:40:00.101740Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Mastering the game of go with deep neural networks and tree search,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:e0347a329b90999aeaafe40552fbdf18f8de3ce441bd4dac14677ae85982a8ae","observation_id":"31770af0-6afb-4646-bfd5-c94705e7c396","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Defining and characterizing reward gaming,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:97778a668a7bf194facdc1c74b9eb358df9c0fd5d1ba09840bcbf860bd46d7c9","observation_id":"4952f2d4-39bd-44ed-8b84-6a581194ea21","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Reward learning from human preferences and demonstrations in atari,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:71a0dde7cc5f0c52a31851e2a7e45a56f461fe9a1a1126792aac442513d29b1a","observation_id":"280248a8-afff-4f6e-9910-820c6c6079fa","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Deep reinforcement learning from human preferences,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:b32577af276decdca423c3c663e76ac6b1f1c13f807e697eba8a3a3c5a76b1ea","observation_id":"92295d92-e493-4c23-ac81-aeccc9907af6","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.07246","last_updated":"2021-04-15T05:33:03Z","snapshot_observed_at":"2026-08-16T18:31:29.124999Z","submitted_at":"2021-04-15T05:33:03Z","title":"Human-in-the-Loop Deep Reinforcement Learning with Application to Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2104.07246","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.07246","snapshot_observed_at":"2026-07-04T17:40:00.118458Z","title":"Human-in-the-loop deep reinforcement learning with application to autonomous driving,","venue":null,"work_id":"a13b17d7-0d20-4c7d-b1ac-9d6a7e7f7e1b","year":2021},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"cited_paper":"/paper/2104.07246","citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:9b1526c2903209a5203ec8bb21abf5cd512007d6e8a90a1fb4fdb4e8339c54a8","observation_id":"0d9726e2-5ace-487e-b7cb-c481e0309617","resolution":{"observed_at":"2026-07-04T17:40:00.119855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"The utility of explainable ai in ad hoc human-machine teaming,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:dd11d2593a0abb87ea43c087fa557f07c188cdf25a52e5fd0247c303b4626960","observation_id":"6cacb8aa-fded-42e3-86bd-3385714149d0","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-17T11:20:55.974248Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":"2307.15217","doi":"10.48550/arxiv.2307.15217","metadata_source":"pith","pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","venue":"cs.AI","work_id":"73fe40c4-d27f-4883-a2f1-52ea228f44fd","year":2023},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:9a94a6fb3fbb8e2d9e485b892cdcfa35ab1f778ae3b467a2314028a8a6a4f208","observation_id":"c2818fa3-3989-4636-9789-3e64e4039060","resolution":{"observed_at":"2026-07-04T17:40:00.117386Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:49:19.412323+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:49:19.412323+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:724bc7018e3a46080953c9e508da4e8d93c203c171a05e960e719979f97d8409","observation_id":"03251450-8d6d-4743-aa7b-840cacc514ce","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"An overview of the action space for deep reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:1f049066469deb3d002b7665fe517be95ac4e4c08d5b3df3ddbeb697f01f2c3a","observation_id":"0adaf2d5-9fa4-408c-85c5-0a469256b7f1","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:33631d07a28692a78b49dca980df4f7fa1fe50d5fcc76ae2302558c262da46fc","observation_id":"f690b0a8-1cbb-4ea6-93f7-f207bb2ba447","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Apprenticeship learning via inverse rein- forcement learning,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:2bc17f79f980c21079397b66d184946538fe64acc8e5a0d67e18722115571464","observation_id":"e084eeb8-84d0-440e-a3f7-582b3bc72455","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.11748","last_updated":"2018-10-28T02:18:40Z","snapshot_observed_at":"2026-08-14T18:08:17.274832Z","submitted_at":"2018-10-28T02:18:40Z","title":"DQN-TAMER: Human-in-the-Loop Reinforcement Learning with Intractable Feedback","version":1},"cited_work":{"arxiv_id":"1810.11748","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.11748","snapshot_observed_at":"2026-07-04T17:40:00.113572Z","title":"DQN-TAMER: Human-in-the-Loop Reinforcement Learning with Intractable Feedback","venue":"cs.HC","work_id":"a32722b3-7c11-4d76-9d4c-7dd48a3f04a0","year":2018},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"cited_paper":"/paper/1810.11748","citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:4a5df6c15a184a142974d436733de0e69a11845f190b868bac97d33c4ba646e8","observation_id":"f2cc9e3d-f69f-4c05-827e-a9aaead82ca6","resolution":{"observed_at":"2026-07-04T17:40:00.114755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-18T07:40:57.268095Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":"2106.05091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-07-04T19:40:06.257016Z","title":"PEBBLE: Feedback-efficient interactive reinforcement learning via relabeling experience and unsupervised pre-training","venue":null,"work_id":"bb93267b-0a0c-49b6-8a2e-00a9e4565cd1","year":2021},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:4cee3e300a692aa5161ddea2c41b8461c594ec36b45418e644296a56104a5946","observation_id":"7127ee49-baaf-4be9-99f8-d999492dfd71","resolution":{"observed_at":"2026-07-04T17:40:00.090762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10050","last_updated":"2022-03-18T16:50:38Z","snapshot_observed_at":"2026-08-19T20:58:49.095458Z","submitted_at":"2022-03-18T16:50:38Z","title":"SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2203.10050","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.10050","snapshot_observed_at":"2026-07-04T19:40:06.249099Z","title":"Surf: Semi-supervised reward learning with data augmentation for feedback- efficient preference-based reinforcement learning","venue":null,"work_id":"71001644-2637-4bea-90e2-8dadcbcf47af","year":2022},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"cited_paper":"/paper/2203.10050","citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:ee51bf05934a1acd184124ea1f4edcf32a427f0c5c23e6fdadeb058d46e3e165","observation_id":"a642df2a-df81-4add-97a5-b3b176611927","resolution":{"observed_at":"2026-07-04T17:40:00.087977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.12904","last_updated":"2020-12-26T02:02:31Z","snapshot_observed_at":"2026-08-14T14:19:30.751926Z","submitted_at":"2020-07-25T10:37:15Z","title":"Weak Human Preference Supervision For Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2007.12904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.12904","snapshot_observed_at":"2026-07-04T17:40:00.112551Z","title":"Human preference scaling with demonstrations for deep reinforcement learning","venue":null,"work_id":"8ce436b6-8e8d-4cfe-a339-d28a9930b9c1","year":2007},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"cited_paper":"/paper/2007.12904","citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:2e1c58713b92312e2d2fd7d32fac7b465d82b245b9c4abbdc46df8d2c79d5026","observation_id":"efd56d09-8f33-48f8-8e89-583583adf205","resolution":{"observed_at":"2026-07-04T17:40:00.113955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3357236","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A survey on interactive reinforcement learning: Design principles and open challenges,","venue":null,"work_id":"42cf6bc1-9dbb-4b66-8f7f-6b3aa9d22e32","year":2020},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:c66b6a57366190dae8499bd77d18787038d00d043630848697ffb5807491cd56","observation_id":"93605ef0-3991-445f-936e-20a5ce3b29ad","resolution":{"observed_at":"2026-06-25T23:38:41.377751Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Leveraging human guidance for deep reinforcement learning tasks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:a439fc484165ff1821451dc33b353ef175fa0f24bb39cd50ce628c238c0980f1","observation_id":"ec1b64f0-6d15-443e-9788-450974ae89f8","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Knowledge-based causal attribution: The abnormal conditions focus model","venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:be0e78abe335b269576ff66a4b27dba2dfec0643d80042a2a57c075551d2e589","observation_id":"f8b4feff-9a10-4b08-80c2-3c5e5217bf8d","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Collective ex- plainable ai: Explaining cooperative strategies and agent contribution in multiagent reinforcement learning with shapley values,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:fbb6cc7ed950dd5623ff0c279281f5b217aadfb49dbdd5c8920d024ee167496c","observation_id":"4ccbeded-bafc-436c-9e0d-70cddb4a0302","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Visualizing and understanding atari agents,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:c056efd46c7754e3884c279a83032e2e73900b1c2919ca006fa5028005255fff","observation_id":"fe01a410-39aa-4112-826c-709aa91356df","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06665","last_updated":"2025-08-29T04:07:26Z","snapshot_observed_at":"2026-08-18T05:46:43.452145Z","submitted_at":"2022-11-12T13:52:06Z","title":"A Survey on Explainable Reinforcement Learning: Concepts, Algorithms, Challenges","version":6},"cited_work":{"arxiv_id":"2211.06665","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.06665","snapshot_observed_at":"2026-07-04T17:40:00.099254Z","title":"A survey on explainable rein- forcement learning: Concepts, algorithms, challenges,","venue":null,"work_id":"200d1512-75e1-43d6-8eea-6f19caf74ae7","year":2022},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"cited_paper":"/paper/2211.06665","citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:98c07453f553c279de2b7ac645e83bcd75e421bf57058d9312fe1f71ee20a8a3","observation_id":"cce16177-4309-4f79-b2b7-f9a3b6c38933","resolution":{"observed_at":"2026-07-04T17:40:00.100803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Explainable deep reinforcement learning: state of the art and challenges,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:aa95e59fa881a748ad81d9ffc5efa0bf443a6a33a26608483afee062f5da3b55","observation_id":"2811f7cd-e373-4b7e-a6c9-26ea84c42aa3","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"B-pref: Benchmarking preference-based reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:fb26bb830f1924aeb423057b9fa976572f9643b5291daaa9a5378cdea6956945","observation_id":"6fab2a8d-de65-438c-a29a-25aefb881173","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Hydra - a framework for elegantly configuring complex applications,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:913d3b722bb308094039f265e09b5b3d7d5ec417c8cc7501fac6c8ba31083f90","observation_id":"dbc08dbc-28a6-4977-8501-26b3482094de","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"record/8127025","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T21:36:34.381025Z","title":"Kazuma Tsuji, Ken’ichiro Tanaka, and Sebastian Pokutta","venue":null,"work_id":"7cf473a0-008e-4e96-b223-92408f26f776","year":2023},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:2780da382fe7be9696183f58963f4a03310543c4cef7293732c3891e633aecbf","observation_id":"d707d3f9-0055-4f6e-9058-f40c3ef0f269","resolution":{"observed_at":"2026-07-04T17:40:00.104551Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-19T15:54:12.095845Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:697c052cdcf44853de2b25e7a8c4fb214249670e05799ef415d59dc0a45641b8","observation_id":"8cc002af-4a8a-4e1d-96da-5b2b677bff84","resolution":{"observed_at":"2026-07-04T17:40:00.106038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08272","last_updated":"2019-12-19T15:44:33Z","snapshot_observed_at":"2026-08-18T15:47:16.281254Z","submitted_at":"2018-10-18T20:48:08Z","title":"BabyAI: A Platform to Study the Sample Efficiency of Grounded Language Learning","version":4},"cited_work":{"arxiv_id":"1810.08272","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1810.08272","snapshot_observed_at":"2026-07-04T17:40:00.108219Z","title":"H., and Ben- gio, Y","venue":null,"work_id":"7dd13a3f-6c40-4b43-acfe-a683900aaa78","year":2018},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"cited_paper":"/paper/1810.08272","citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:39030a24441e75d9d44f2e5faa410a0939e9b2ee95bf6dedd0633fdd1e853482","observation_id":"6f805bff-4e57-42bb-9448-567f431b30cd","resolution":{"observed_at":"2026-07-04T17:40:00.109677Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:083df3b2b80d4ba167c6cf637092bf2d8f4f7d4eec10f9bb6c27ff324a561dc4","observation_id":"2db9a9f8-8bc1-4eb4-bab4-75c3dacec16a","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Soft actor-critic for discrete action settings,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:da5c6b4306b632e754dcc0b637b16511bcce43c38e1dcc9691c9e6e3207e3893","observation_id":"4645bb36-af0f-4a25-adc7-772fe0386020","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Rank analysis of incomplete block designs: I. the method of paired comparisons,","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:8fdd4386a538dfea6b397f553c3d79d266568d6b60765b361782ca36f3316676","observation_id":"3b2466e7-060b-4d5b-bf60-7bc7bc4210bc","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.12796","last_updated":"2025-12-01T17:18:39Z","snapshot_observed_at":"2026-08-17T17:48:11.332765Z","submitted_at":"2025-11-16T21:55:59Z","title":"Maximizing the efficiency of human feedback in AI alignment: a comparative analysis","version":2},"cited_work":{"arxiv_id":"2511.12796","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.12796","snapshot_observed_at":"2026-07-04T17:40:00.110860Z","title":"Maximizing the efficiency of human feedback in AI alignment: a comparative analysis","venue":"cs.HC","work_id":"0d98a8c7-570c-4116-a432-605556655a9f","year":2025},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"cited_paper":"/paper/2511.12796","citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:a310d37c6f3b9409bab9ec391156801dbdbf4acdbb4ffc07581b413da6ba1f59","observation_id":"ad534517-0e90-4143-b268-8e1079188333","resolution":{"observed_at":"2026-07-04T17:40:00.112152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Local and global explanations of agent behavior: Integrating strategy summaries with saliency maps,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:9dff37c97ae304ef43a913097263b97b619723e5a644bfe8d10c91a1b8c541e0","observation_id":"dea1463d-b4fc-4386-b456-349acd775110","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Captum: A unified and generic model inter- pretability library for pytorch,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:db9731f49d8faa862b09e590710d45fe60a910c09a8bda76ef81d24277f1ca68","observation_id":"ba013a27-0995-4bf7-b32c-7346e362e45b","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Axiomatic attribution for deep networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:9f47597d5a94728e7e9df854af585b12c9ec510a47161398013254bc794f9b71","observation_id":"acb14a84-dde6-47f6-8ed8-0f38f1842cf2","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"A unified approach to interpreting model predictions,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:74e2c5b758339416714c3aa74227637f5f4fee99871e06c13baefe33c8208fbf","observation_id":"ad34cda8-f031-49ff-b032-95f9dd109e22","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Estimating training data influence by tracing gradient descent,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:5526f18422ea0dee500cc4804cbfef74e9e4447d93918fd2c4b47aab80453bd6","observation_id":"186fdd71-0186-4bef-a834-71b5b27b9368","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Mongodb: The developer data platform,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:9bbdbeeed2d5878de726881c87f52a7cc8ebb44620f3b8f763e4eb4e96fef776","observation_id":"9dae72b6-d693-4986-9033-68d4bf6187fa","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Next.js: The react framework,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:e2812f23189fa05aa917cf317ece3349591223a5432849d155db8b33108a9b0f","observation_id":"31a52f26-b387-4667-8225-b8d75c936d7f","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"The arcade learning environment: An evaluation platform for general agents,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:cbf96636881c2c88b015c77f3a1a51e132c1fcee6b7d09ef8a3eb7f667afccf5","observation_id":"63355d77-2d82-46f6-89cb-97087e1caa72","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Loadster: A load testing & website stress testing tool,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:989c1ac836a3dca385a362d7fed945f962cc874ebc1bd945d6c597bf1b9e4cb4","observation_id":"19fb7d8c-1937-4834-9ed0-1bd446b4c1bb","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Available: https://loadster.app/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:3f6582c5cd7acabaa7f23f210a92d5b7d9394b919df3886f5ce5f168da425881","observation_id":"0b336d9d-fd91-44f3-8ad7-21708d016557","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Mujoco: A physics engine for model-based control,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:fca29d2282b08e54b056d86fc0fbcfe6b33233526478ae79baac35d5ca5ec00a","observation_id":"df27150e-5b92-42eb-9c7a-1abab6b7f803","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-08-15T12:05:11.299477Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":"1502.05477","doi":"10.48550/arxiv.1502.05477","metadata_source":"pith","pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Trust Region Policy Optimization","venue":"cs.LG","work_id":"8660ac94-3f8e-474f-967f-98304c415ed7","year":2015},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:1479fd6b32cfa1ce9a92cf91d6196c0a02732793af8e73cd112829b6aa9dd6ec","observation_id":"7e2cb0ca-a83e-4731-846b-dbfca2b34261","resolution":{"observed_at":"2026-07-04T17:40:00.096607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:375d9aa8f93c30a6fa8e3283ecd13004fe41a12d3f1265be885eba98f732f4e6","observation_id":"bf0c0586-61db-445b-80db-e3ebf182fe08","resolution":{"observed_at":"2026-07-04T17:40:00.108311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T23:35:03.577967Z","title":"Widening the pipeline in human-guided reinforcement learning with explanation and context-aware data augmentation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:db21cc3e49bf1e1fa25c87e95a0cc6fefcd292330d2453f336d641ddb8acf19b","observation_id":"21ac579f-dc02-4006-a8ad-b142f77816aa","resolution":{"observed_at":"2026-06-25T23:35:03.577967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":35,"verified_exact":14,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2606.24622."}