{"as_of":"2026-08-08T19:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:133d10663342274188158a0a9cfcf816297809720211050c8bd7bd2028997134","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:46:28.386276Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03872/citation-record","integrity":"/paper/2608.03872/integrity","json":"/paper/2608.03872/citation-record.json","paper":"/paper/2608.03872"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.461189Z","title":"Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning,","venue":null,"work_id":"bd9dfdf1-d4e8-455e-8d7d-07290d4cb100","year":2025},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:24.994176Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:f02e6f6ee3f3a77748c8690d3b1a0fa1e81d0209ebf6fcfb897b284bcadb466b","observation_id":"c6a5e125-819a-4c7c-81a0-a85a03ff8c17","resolution":{"observed_at":"2026-08-05T10:46:32.464484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.452773Z","title":"SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning,","venue":null,"work_id":"9ae3a8c7-db2e-4d82-99a7-bafe18be7f0d","year":2024},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.057055Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:a4fa319e767450c2f2605a904e9d703be70649204af5758e38654e9e3b30538b","observation_id":"3dbb61d6-3dbf-49e8-a7ff-f65676dc94be","resolution":{"observed_at":"2026-08-05T10:46:32.455706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.444342Z","title":"Efficient Online Reinforcement Learning with Offline Data,","venue":null,"work_id":"283f1b93-e1ab-4619-9d7c-9a66e9acebf5","year":2023},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.109193Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:9bd6242f579bd94e1fd41721bbcc51162b4af633b19b550cfc30cb24c1e0f1b5","observation_id":"07bbcc99-6cde-46cd-8fe9-77c30a925837","resolution":{"observed_at":"2026-08-05T10:46:32.447346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.435995Z","title":"Reinforcement Learning in Robotics: A Survey,","venue":null,"work_id":"b0db1258-54f5-4a52-9232-1b030f33b3d2","year":2013},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.182950Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:3007449cecf68849bb3c4abbebb112891296051bdecfa0b44c9fd63abc6bf582","observation_id":"7970e09c-8226-4a0b-84c3-cc097a6ca283","resolution":{"observed_at":"2026-08-05T10:46:32.438802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.427554Z","title":"QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation,","venue":null,"work_id":"a15acaa1-316f-46df-a257-b2028d243758","year":2018},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.255645Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:9f8ee3c328f9e28f0710b76c3d264ca1bcbcb0c29b5bf06ee484b5130f665c1d","observation_id":"ee003f70-77fd-41ec-9553-583f223dc2f9","resolution":{"observed_at":"2026-08-05T10:46:32.430466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.419098Z","title":"How to Train Your Robot with Deep Reinforcement Learning: Lessons We Have Learned,","venue":null,"work_id":"5aa2c9ab-8a5e-4a1e-8da1-8e41e459615c","year":2021},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.360263Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:96eaad558b8746edf0991b96b019ff595556db3c20827028b6dd6e3a21158718","observation_id":"b3096895-cdc3-49b6-a3f4-ac879ef16933","resolution":{"observed_at":"2026-08-05T10:46:32.421970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.409847Z","title":"Addressing Function Approximation Error in Actor-Critic Methods,","venue":null,"work_id":"0d32fab5-c150-4987-8963-05e359b48259","year":2018},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.452881Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:1ab691b34084236b00571273012dee85258af0f681f4348ef2ac1157f1f1dccc","observation_id":"00b39d8e-ce23-45e3-bc7e-87952e9e97d3","resolution":{"observed_at":"2026-08-05T10:46:32.413050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.401320Z","title":"Offline Reinforcement Learning with Implicit Q-Learning,","venue":null,"work_id":"47583712-f46e-40cd-9a8b-d55b7c117c9e","year":2022},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.495996Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:c11f4d3e97f85d9f44677a98de20bdc9299aa4dadbbbebf059658811e491f109","observation_id":"40e94431-dc38-4d66-b60b-a0f90c99a8b7","resolution":{"observed_at":"2026-08-05T10:46:32.404067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.392593Z","title":"A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning,","venue":null,"work_id":"93f28451-e76a-4ca2-b279-91378aa468bc","year":2011},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.561058Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:bdd6ab3541818775fd84504eb5652e55253df0c565eee816e6115735a6f0d780","observation_id":"2a819dc0-b74a-4df3-8ca1-d924d20837c4","resolution":{"observed_at":"2026-08-05T10:46:32.395749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.383864Z","title":"HG-DAgger: Interactive Imitation Learning with Human Experts,","venue":null,"work_id":"b6f5eaa1-d6f1-4b76-8931-7a9adb8eca24","year":2019},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.622269Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:3bb4fcb2762ba66dce6cb77cc6c41df204616c7fe5c71629cdfe67ae680b73d0","observation_id":"34b44d0c-441e-4c62-8145-4a128c3a3356","resolution":{"observed_at":"2026-08-05T10:46:32.386727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.375311Z","title":"Deep Reinforcement Learning from Human Preferences,","venue":null,"work_id":"a92fcc7b-6fa8-4630-99bd-a8cfbf5cb04d","year":2017},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.690310Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:a20dfe9f3e564dfabd1863f6e864303994c950d7d3cc6c1c79b482893cef3859","observation_id":"f17c478f-2b73-4db6-9063-41c732a28843","resolution":{"observed_at":"2026-08-05T10:46:32.378305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.366294Z","title":"Variational Inverse Control with Events: A General Framework for Data-Driven Reward Definition,","venue":null,"work_id":"8d0e29fa-3cf8-498c-a1a9-781a0ec84691","year":2018},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.781019Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:2e386ecbf17e0083c9b61b3f35bebad4a604691b254e2782705b601efc005fed","observation_id":"4a128a76-9719-4ecd-acc5-a861f86a7e73","resolution":{"observed_at":"2026-08-05T10:46:32.369472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.357817Z","title":"Positive-Unlabeled Reward Learning,","venue":null,"work_id":"67581cd1-bd15-451c-9c86-e9cda65cd078","year":2021},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.865527Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:80bc462d5a5c8b7fa6abbc24e91e7bf8c73d2ed739f2e537a31629a2b19dfc6f","observation_id":"0483ecda-299b-411f-be2a-7c5315a3f4ac","resolution":{"observed_at":"2026-08-05T10:46:32.360738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.226238Z","title":"Human-Guided Online Reward Adaptation for Real-Robot Arm Manipulation,","venue":null,"work_id":"0a13811f-3284-42fe-8673-033eb442fc52","year":2026},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.947347Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:18d5b01e46d41b4a5d082f86b24ccc6767c2a22efcc6148dbc8add727bf535c9","observation_id":"0cb43490-8acb-4247-9fd0-dd6f41a666e9","resolution":{"observed_at":"2026-08-05T10:46:32.350941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.089455Z","title":"On Calibration of Modern Neural Networks,","venue":null,"work_id":"9d074536-94ef-4eba-8fe3-cec91cc6ddd8","year":2017},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.034319Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:1f78b2f3fce9a4c758cb07e70dda46c63ae5eeb06e6d63b3f4e53c19460490c6","observation_id":"69bc05e6-d327-4c3b-9aed-b739e9514e80","resolution":{"observed_at":"2026-08-05T10:46:32.194875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:31.894126Z","title":"Learning from Imbalanced Data,","venue":null,"work_id":"96abc869-2900-40be-a7b6-91cf9caf7405","year":2009},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.110725Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:f6fe84f97d6abf26f939bdbb166fbcb30d4e36dcd39bd43971ffe61b636646c9","observation_id":"723355f4-b2c4-4eb5-b93a-4753b1fbb54b","resolution":{"observed_at":"2026-08-05T10:46:31.989060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:31.610087Z","title":"A Survey on Concept Drift Adaptation,","venue":null,"work_id":"1555cfe0-8e67-4975-a414-625a227e6c6d","year":2014},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.162134Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:7767d9ff72c9a4609bc0fb812f9084e1d7ee82bb00d074d33038c78a3e13d5a5","observation_id":"2ac28726-310c-4896-acc0-01e4ed9f700b","resolution":{"observed_at":"2026-08-05T10:46:31.758765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:31.295362Z","title":"Can You Trust Your Model’s Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift,","venue":null,"work_id":"a845f43b-cb0a-4467-a4f0-2afc1ceb9304","year":2019},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.229088Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:f9e83a8b6f70c0dff7abde502684a7650adec8a77d7f20207bad4c3c9e3de1c4","observation_id":"59d41c21-fca4-407a-857b-bdf9634e7584","resolution":{"observed_at":"2026-08-05T10:46:31.454474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:31.106852Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion,","venue":null,"work_id":"3c81940c-67b6-49d0-96f0-bcbce937e54e","year":2023},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.255218Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:40428fbe17927f2a7c313c587b0f28cbb871e959ff8bde79ff2fdabcca154ed7","observation_id":"d5cb31de-eda3-46a4-bd7d-c5bb94bd9ddd","resolution":{"observed_at":"2026-08-05T10:46:31.134034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:30.937690Z","title":"Implicit Behavioral Cloning,","venue":null,"work_id":"578f740e-b0c4-4b35-9777-a9a3f8054625","year":2021},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.342791Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:1af5321b7a379e75b060b95c9d160f7c501205c59d2a5b0d9cd176e9817771cf","observation_id":"a22c2192-035a-45e7-90ae-1e414fee8020","resolution":{"observed_at":"2026-08-05T10:46:31.028914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:30.774941Z","title":"Flow Matching for Generative Modeling,","venue":null,"work_id":"87ce3681-f3eb-4b99-acca-fdeb9d1945bf","year":2023},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.396151Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:bc4dc4743d77a7756ba038af33ab17522c9f49728ece601214f6d93fdb592fda","observation_id":"32dbd220-c69c-442c-be16-d6c59c2bd1f1","resolution":{"observed_at":"2026-08-05T10:46:30.835593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:30.652344Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow,","venue":null,"work_id":"74a907de-db18-48c2-903e-2d928664a758","year":2023},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.458504Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:3a5cafb5825455d3bd20fc5e6bb0e4a988788ff51a6d4af461c38d8f14821f3e","observation_id":"9a1dcbfa-d030-4544-b0af-da1932723aba","resolution":{"observed_at":"2026-08-05T10:46:30.713808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:30.571717Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware,","venue":null,"work_id":"9666ab02-8556-4120-8fda-a1b38efac848","year":2023},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.561614Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:63f28ce080c024ec7b8b3084b104436e183dae23fcb573872496bcd7b0c65400","observation_id":"dbb56229-7bfe-4981-8084-ad4297a29541","resolution":{"observed_at":"2026-08-05T10:46:30.580894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07969","last_updated":"2026-05-11T17:12:21Z","snapshot_observed_at":"2026-07-06T21:55:17.277337Z","submitted_at":"2025-07-10T17:48:03Z","title":"Reinforcement Learning with Action Chunking","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07969","snapshot_observed_at":"2026-08-05T10:46:26.613179Z","title":"Reinforcement Learning with Action Chunking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.613179Z"},"links":{"cited_paper":"/paper/2507.07969","citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:8bbcb387513f5c1aee0fd4205d3f81df65d1cd7344cbe2de57812408dcb73e02","observation_id":"6d19b647-08af-4fa0-a909-304ec2ad1165","resolution":{"observed_at":"2026-08-05T10:46:26.613179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:30.458424Z","title":"Diffusion Policy Policy Optimization,","venue":null,"work_id":"4cb1ba60-6742-4045-a568-35f9f5702393","year":2025},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.667042Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:b5b4a4d5a43b216cf3d63280cf6928425e4995adfac907da7a80e1a364782202","observation_id":"83299f6f-d6a1-4a29-8389-38c1d2a70f88","resolution":{"observed_at":"2026-08-05T10:46:30.513155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:30.371080Z","title":"ReinFlow: Fine-Tuning Flow Matching Policy with Online Reinforcement Learning,","venue":null,"work_id":"05bc7ca9-f36c-441a-b46d-d2dd9046cd2b","year":2025},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.770861Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:7207f41f652a9b9b9ac21b9a2f518611dd9c27a8b14f438397f2e3850efa9db7","observation_id":"d2f9b537-f368-497f-969b-1ce7105477e0","resolution":{"observed_at":"2026-08-05T10:46:30.409585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:30.285642Z","title":"Flow Matching Policy Gradients,","venue":null,"work_id":"0473cd8b-d96b-4dd0-933f-e87098635be7","year":2026},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.927731Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:23744c923c999882f0b1fd8c658c4a087be5ce98097dad18f62a61c99edcd8b5","observation_id":"6923b95e-7b69-446d-afe5-258403ac8ab1","resolution":{"observed_at":"2026-08-05T10:46:30.323687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:30.107034Z","title":"SAC Flow: Sample-Efficient Reinforcement Learning of Flow-Based Policies via Velocity-Reparameterized Sequential Model- ing,","venue":null,"work_id":"b5b39397-5f0a-42c4-84a3-298036adee81","year":2026},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:27.068200Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:c07308cbd82da0763efda2535bc7b490200167749589aa8971f067677e1a2312","observation_id":"6cd7f075-b8fa-4009-92b8-47037a1cc47d","resolution":{"observed_at":"2026-08-05T10:46:30.197362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:29.912428Z","title":"Reinforcement Learning with Augmented Data,","venue":null,"work_id":"14e20f43-a708-48a4-9962-75861828f89e","year":2020},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:27.111855Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:f32b1e5b9cd1bfd2f4d64b5811ea9baa45d7034aeaec74818edcf66dd9fc6cc9","observation_id":"2517fc5d-0c76-4dc7-a093-946cd622f38c","resolution":{"observed_at":"2026-08-05T10:46:29.994478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:29.768501Z","title":"Image Augmentation Is All You Need: Regularizing Deep Reinforcement Learning from Pixels,","venue":null,"work_id":"2c874333-7ae0-4c2b-a71d-9bf58725ae8c","year":2021},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:27.230961Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:6fe4f2580b0349baab839c6a375445c2d93d0c1be70f382efc106be357d2cac9","observation_id":"e7cf9319-7bf0-4076-bc40-bdd9ec4bd6f4","resolution":{"observed_at":"2026-08-05T10:46:29.825849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:29.618226Z","title":"Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World,","venue":null,"work_id":"bd02f750-af79-4559-88f4-e7a45f4123c8","year":2017},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:27.392105Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:22c4a8b91758a6b84dfc3050cd712f91b3271a5ed316249ecebada2710f72538","observation_id":"ccc354a0-1743-4129-8397-473e10f00ace","resolution":{"observed_at":"2026-08-05T10:46:29.674788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:29.483734Z","title":"AugMix: A Simple Data Processing Method to Improve Robustness and Uncertainty,","venue":null,"work_id":"bbc2c139-1d9e-4234-a137-1ccb1a005b8a","year":2020},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:27.549821Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:dd88ee91b51d6166c70e87e87ab08a231f2db288e3b6079613d1588be5b0250c","observation_id":"bc970c47-367d-4ff0-a7e2-d1f5bbaa39a3","resolution":{"observed_at":"2026-08-05T10:46:29.554995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:29.364285Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control,","venue":null,"work_id":"841ab184-25ac-4c59-ba7c-06af02b67a73","year":2025},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:27.685656Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:b2b7e6ec313a3d8f0a2897da5d2cd7fc8a51e9cbddd317f2882d373e5e82faf4","observation_id":"f97f4f2d-835f-4c2c-a10a-38183256577b","resolution":{"observed_at":"2026-08-05T10:46:29.420052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:29.225210Z","title":"Experience Replay for Continual Learning,","venue":null,"work_id":"60356a45-b29c-46ed-abef-f6032e13cfeb","year":2019},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:27.797275Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:5f88403cc7407de43ce704cf50bc81fac9d34a8594c4e3e2e801372db6ac98aa","observation_id":"dc7d9fb0-6292-4c23-88a6-5756ed7bfc09","resolution":{"observed_at":"2026-08-05T10:46:29.280319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:29.106446Z","title":"Regularizing Action Policies for Smooth Control with Reinforcement Learning,","venue":null,"work_id":"143692d2-3806-4d0a-a4c3-b5539c7eb23e","year":2021},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:27.907550Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:cfcce95be017fd8a859edd8f6b890b6ff686409c4bffad31e5bf109656ff2e2a","observation_id":"474f25e8-3476-42bd-b255-702e7abdd32d","resolution":{"observed_at":"2026-08-05T10:46:29.166038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:28.928127Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor,","venue":null,"work_id":"f05dd7f8-9a62-4e8f-99aa-96831f52c5fc","year":2018},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:28.019240Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:85b703c3116206a33dce04d6a70ce66ad122569c29ed2a2fd79603fe7c56303c","observation_id":"e85a1045-5005-4159-8b4c-1f52b905c0ff","resolution":{"observed_at":"2026-08-05T10:46:29.009607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:28.776566Z","title":"Policy Invariance Under Reward Transformations: Theory and Application to Reward Shaping,","venue":null,"work_id":"88986333-e9d9-464e-9b10-2f3de05cf986","year":1999},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:28.152810Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:b4e4862a1c082a1757c0f6e3a42e074c6acfca49164dbcd8f43c7434c694649e","observation_id":"7c8b414a-ce74-4b4e-82e7-1ad220966588","resolution":{"observed_at":"2026-08-05T10:46:28.840976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:28.600787Z","title":"Imitation Bootstrapped Rein- forcement Learning,","venue":null,"work_id":"5cf09b9c-c121-433b-acd4-6417f3fbc977","year":2024},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:28.219528Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:931d9b7d4fb4a94e30f4731532a3aaa43fcca1609e8e49cdcf07b6be82275f46","observation_id":"a2cf5f71-6aba-4db1-acfc-d02d664a6107","resolution":{"observed_at":"2026-08-05T10:46:28.686166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:28.493921Z","title":"Deep Residual Learning for Image Recognition,","venue":null,"work_id":"eb831107-bf26-4590-ab03-2b4dd0b7bbe6","year":2016},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:28.301849Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:d630efae9d5ee16ecf101e3268fcb6610e0f00f7b413df66ff00fea5c1cd6b33","observation_id":"8d219ba2-7854-4e8b-bbaf-96a92aaa9b08","resolution":{"observed_at":"2026-08-05T10:46:28.536036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15673","last_updated":"2025-06-18T17:56:45Z","snapshot_observed_at":"2026-08-06T23:49:24.899590Z","submitted_at":"2025-06-18T17:56:45Z","title":"UniRelight: Learning Joint Decomposition and Synthesis for Video Relighting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15673","snapshot_observed_at":"2026-08-05T10:46:28.386276Z","title":"UniRelight: Learning joint decomposition and synthesis for video relighting,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:28.386276Z"},"links":{"cited_paper":"/paper/2506.15673","citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:568a54b4b22831cc6d5726cebd779c2c03f367fdc565cadc572ffa28eef2b87a","observation_id":"e6f0ca36-6b27-4b5b-9b06-5f9778184faf","resolution":{"observed_at":"2026-08-05T10:46:28.386276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":0,"verified_fuzzy":38},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2608.03872."}