{"as_of":"2026-08-13T10:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e9cf330cf836ad18db08f3c7ff99db22528647efec2626cbc045330ff96dceed","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:37:10.302475Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T21:57:15.285757Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T22:00:41.924058Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"cited_work":{"arxiv_id":"2411.17764","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17764","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Progressor: A perceptually guided reward estimator with self-supervised online refine- ment.arXiv preprint arXiv:2411.17764","venue":null,"work_id":"c9bf440f-e501-438c-978d-1ecee5797321","year":null},"citing_paper":{"arxiv_id":"2509.26627","last_updated":"2026-05-20T11:23:00Z","snapshot_observed_at":"2026-08-12T22:43:30.294223Z","submitted_at":"2025-09-30T17:58:20Z","title":"TimeRewarder: Learning Dense Reward from Passive Videos via Frame-wise Temporal Distance","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T21:57:15.285757Z"},"links":{"cited_paper":"/paper/2411.17764","citing_paper":"/paper/2509.26627"},"observation_digest":"sha256:a9377e6b37295e20c49792f0773e0613f6dd39c5fd4db243ff34fdbf3da3a026","observation_id":"7eaceeb8-4290-46cd-aa61-6ea87d041e5b","resolution":{"observed_at":"2026-05-21T22:00:41.926867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.17764/citation-record","integrity":"/paper/2411.17764/integrity","json":"/paper/2411.17764/citation-record.json","paper":"/paper/2411.17764"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.945309Z","title":null,"venue":null,"work_id":"a525564c-8ee7-4d6c-a01b-080fdb83498a","year":null},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.089977Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:bf6e4189c2cbe9229d75f808b0765808b06678b631fae0b4178b868b4b071dde","observation_id":"19ecd7f7-c150-4da4-9afa-467d9eef3a44","resolution":{"observed_at":"2026-08-12T12:37:10.949902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.922947Z","title":"Learning reward functions for robotic manipulation by observ- ing humans, 2023","venue":null,"work_id":"01710045-60fe-4ffe-8886-a56f358141f0","year":2023},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.099194Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:eddaa7f6b5cb6dd991cba31f095c529d737fccea62a40ef2d564a595f509164f","observation_id":"11dd6156-200d-4326-8beb-5c8979e7f81a","resolution":{"observed_at":"2026-08-12T12:37:10.927847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.09450","last_updated":"2022-07-19T17:59:59Z","snapshot_observed_at":"2026-08-11T13:55:57.377486Z","submitted_at":"2022-07-19T17:59:59Z","title":"Human-to-Robot Imitation in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.09450","snapshot_observed_at":"2026-08-12T12:37:10.103690Z","title":"Human-to-robot imitation in the wild","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.103690Z"},"links":{"cited_paper":"/paper/2207.09450","citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:dedf86b820e1128887fc2693d53f6586191776dcdd03fc1674facd0d6a74e4e3","observation_id":"b83cd651-b7cc-41d5-b329-d6d0bcc33a1c","resolution":{"observed_at":"2026-08-12T12:37:10.103690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.910745Z","title":"Video pre- training (VPT): Learning to act by watching unlabeled online videos","venue":null,"work_id":"9bfc2fdd-c3ea-4945-8e39-c1516ff9f115","year":2022},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.108383Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:687dd65b8ade1440c59b1584ecb96e62627e8a82fe4cb7a30b463d5db3690938","observation_id":"5c812fbd-383b-46b2-9b55-153ca65ac008","resolution":{"observed_at":"2026-08-12T12:37:10.914833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.898492Z","title":"The perils of trial-and-error reward design: Misdesign through overfitting and invalid task specifications","venue":null,"work_id":"178d738b-a070-4acd-8c5f-9ba5a679a143","year":2023},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.112634Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:12a10328e82f4f1b1f41b5e7d1af611b258f1644eb404abfc08cd49c72b682d8","observation_id":"e05c97db-108e-459b-97a6-8d1941bf3494","resolution":{"observed_at":"2026-08-12T12:37:10.902669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.886054Z","title":"Scaling ego- centric vision: The EPIC-KITCHENS dataset","venue":null,"work_id":"4fc3a0e9-9be9-4c62-af11-3d43148c2758","year":2018},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.116868Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:6e727e4cfe13d23c1dff96bcd0e4c528719b45f1e1bba9da3243702e9ab7db22","observation_id":"bb7f932b-2ae9-4327-83b2-b5baf845e580","resolution":{"observed_at":"2026-08-12T12:37:10.890141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.873464Z","title":"Rescaling egocentric vision: Collection, pipeline and challenges for EPIC-KITCHENS-100","venue":null,"work_id":"d6dcf1d8-750a-4794-be21-9347d8e6a582","year":2022},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.121410Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:e660b49cb8dff7f3d9d43de2d0462cec87826b64e72951e6d0e252f7917d111a","observation_id":"ee15b13c-1732-4860-8815-935e210c386a","resolution":{"observed_at":"2026-08-12T12:37:10.877817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.860207Z","title":"Video predic- tion models as rewards for reinforcement learning","venue":null,"work_id":"25216de3-b356-4500-b612-91a4e9aa2a29","year":2024},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.126007Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:5e59432c6ea7aae5e7c1ee3059ed1ba0d5bf6c68687dab4d339510926263a87c","observation_id":"82e1517c-2e2f-4a9e-8371-aa9d3e544c37","resolution":{"observed_at":"2026-08-12T12:37:10.864498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.847156Z","title":"Contrastive learning as goal-conditioned reinforcement learning,","venue":null,"work_id":"f44a4235-ec6a-4079-85bb-d61c20862114","year":null},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.130580Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:c4e600121589bb40763b91fa3a049b5b0a7c1a9cd3e9d9946edb08e6a221bc35","observation_id":"711d2e16-250e-481b-b1eb-14581d5bf553","resolution":{"observed_at":"2026-08-12T12:37:10.851708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1603.00448","last_updated":"2016-05-27T16:53:46Z","snapshot_observed_at":"2026-07-06T04:47:57.060551Z","submitted_at":"2016-03-01T20:35:56Z","title":"Guided Cost Learning: Deep Inverse Optimal Control via Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.00448","snapshot_observed_at":"2026-08-12T12:37:10.135535Z","title":"Guided cost learning: Deep inverse optimal con- trol via policy optimization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.135535Z"},"links":{"cited_paper":"/paper/1603.00448","citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:328dfab412870dfeb7161fdec503df944b0d8f906bb91bdd4a18f136678ca9e3","observation_id":"908bc309-970b-4a76-a7ae-68e01e0dd785","resolution":{"observed_at":"2026-08-12T12:37:10.135535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.11248","last_updated":"2018-08-13T18:33:24Z","snapshot_observed_at":"2026-08-10T07:11:22.809789Z","submitted_at":"2017-10-30T21:22:28Z","title":"Learning Robust Rewards with Adversarial Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.11248","snapshot_observed_at":"2026-08-12T12:37:10.141446Z","title":"Learning robust rewards with adversarial inverse reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.141446Z"},"links":{"cited_paper":"/paper/1710.11248","citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:ecfb51bb8bb48785c3d9b17d48b09116991e534effbae515b838e0daf50e93b5","observation_id":"944a3854-6209-45e7-8593-b15ea686d2a2","resolution":{"observed_at":"2026-08-12T12:37:10.141446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.834257Z","title":"Domain- adversarial training of neural networks","venue":null,"work_id":"674966fd-0cf1-4602-bc45-1765832d7948","year":2016},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.146160Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:5fbcf53047224aa838d7c5392416265a151526e31a06782c1edde3a6069d537a","observation_id":"da74d825-d443-43a8-bd2a-f30e958f31b7","resolution":{"observed_at":"2026-08-12T12:37:10.838662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.821865Z","title":"Generative adversarial nets","venue":null,"work_id":"34f91155-ecfd-4606-957e-10ac81097635","year":2014},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.150151Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:f43d4f31fd1aafcaed624e56b64320d61270177c12f7afd972880da3092d5026","observation_id":"963ddfdb-43cb-4490-ae74-5e8ac04635fb","resolution":{"observed_at":"2026-08-12T12:37:10.826040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.809618Z","title":"Ego4D: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"3d7239f5-91a0-416c-8879-6764dcc884e6","year":2022},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.154362Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:9e2946aec0d16c6ecfc6860a83507e9e1024091a5123d3f823e87c0b54e4cf1a","observation_id":"5f248316-4948-4d16-b633-39295f429797","resolution":{"observed_at":"2026-08-12T12:37:10.813695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.797574Z","title":"Inverse reward design","venue":null,"work_id":"82b81c95-860a-440d-94f3-d8f6420a633f","year":2017},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.159295Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:68f38723e6e6bf0076358172b701e2d94e6e5e23b37ad50240eda26ec8a39eb5","observation_id":"0c25a2c0-35f0-4577-acf5-a791b0b5542b","resolution":{"observed_at":"2026-08-12T12:37:10.801469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.785115Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"4e69e083-4f2b-48a2-97b3-957933f6214a","year":2016},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.163848Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:3d01fd0476e1e928400dbe934049d2f60ead30c44184407ba9e646fe594185e0","observation_id":"de714324-14be-4d2a-87e0-ef81573709ea","resolution":{"observed_at":"2026-08-12T12:37:10.789180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.772760Z","title":"Generative adver- sarial imitation learning","venue":null,"work_id":"e9f660d1-ead7-4b51-afb1-16accff25a8e","year":2016},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.168742Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:07358f9446e7d57beec87eac457f517b1c86f4672af999bf39aebcd4b8d90e5c","observation_id":"d94d9fea-05f5-42da-a25e-4c1a199c4a68","resolution":{"observed_at":"2026-08-12T12:37:10.776858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.03476","last_updated":"2016-06-10T20:51:29Z","snapshot_observed_at":"2026-07-06T04:59:35.089671Z","submitted_at":"2016-06-10T20:51:29Z","title":"Generative Adversarial Imitation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.03476","snapshot_observed_at":"2026-08-12T12:37:10.172794Z","title":"Generative adversarial imitation learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.172794Z"},"links":{"cited_paper":"/paper/1606.03476","citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:00d31e5d454ea9442fbb075ce60277f29f416b8e0f23c84a69d36883c4af2e91","observation_id":"5d735659-4254-420a-b394-07e71a116252","resolution":{"observed_at":"2026-08-12T12:37:10.172794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14134","last_updated":"2024-08-09T03:06:42Z","snapshot_observed_at":"2026-08-13T04:55:50.883651Z","submitted_at":"2023-12-21T18:55:05Z","title":"Diffusion Reward: Learning Rewards via Conditional Video Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14134","snapshot_observed_at":"2026-08-12T12:37:10.177205Z","title":"Diffusion reward: Learning rewards via conditional video diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.177205Z"},"links":{"cited_paper":"/paper/2312.14134","citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:1acdbe47d868c19f400ba550b15acc6dd946c6d99b2c35b73668b9ad90200fb0","observation_id":"4177153f-b177-4552-a35b-723fa3cd5a81","resolution":{"observed_at":"2026-08-12T12:37:10.177205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-12T12:37:10.181480Z","title":"Auto-encoding variational Bayes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.181480Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:535bb7b8654f5e26203868f17d92a06350fb611d351b7f7c6d41a5b9432b4070","observation_id":"ba02e57a-0222-4fd8-99ee-4cd0ed8209a7","resolution":{"observed_at":"2026-08-12T12:37:10.181480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.08840","last_updated":"2017-11-14T21:51:21Z","snapshot_observed_at":"2026-08-10T18:52:29.865348Z","submitted_at":"2017-03-26T16:20:36Z","title":"InfoGAIL: Interpretable Imitation Learning from Visual Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.08840","snapshot_observed_at":"2026-08-12T12:37:10.185660Z","title":"In- foGAIL: Interpretable imitation learning from visual demonstrations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.185660Z"},"links":{"cited_paper":"/paper/1703.08840","citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:8c0ff7d125e0c3f9657c41a862bc6e657743bcaa3145feabd2cd69252130163b","observation_id":"3b900e1a-230b-4a4d-ba7b-797012caff4b","resolution":{"observed_at":"2026-08-12T12:37:10.185660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00030","last_updated":"2023-03-07T02:29:59Z","snapshot_observed_at":"2026-08-11T15:42:16.204049Z","submitted_at":"2022-09-30T18:14:07Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.00030","snapshot_observed_at":"2026-08-12T12:37:10.190011Z","title":"VIP: Towards universal visual reward and represen- tation via value-implicit pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.190011Z"},"links":{"cited_paper":"/paper/2210.00030","citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:60db2cdc0c7124db97893c2e17cb191c009b8a161acee8243b68d0b6b0077db4","observation_id":"cc06a059-759c-403d-bd36-5874af830ede","resolution":{"observed_at":"2026-08-12T12:37:10.190011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.760518Z","title":"9 Vip: Towards universal visual reward and representa- tion via value-implicit pre-training, 2023","venue":null,"work_id":"9bbc3c53-e6a5-46e0-a692-0bfc41cbda7d","year":2023},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.194545Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:1182ace308cd28ec8a8b9f659c1e7ac8961c7318cd747f9b5868a0a31f6d7169","observation_id":"adba2c85-f6dd-4350-bf1c-3c1b7d81d907","resolution":{"observed_at":"2026-08-12T12:37:10.764630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12966","last_updated":"2023-04-25T16:21:10Z","snapshot_observed_at":"2026-07-06T15:19:53.739852Z","submitted_at":"2023-04-25T16:21:10Z","title":"Towards Theoretical Understanding of Inverse Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2304.12966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.12966","snapshot_observed_at":"2026-08-12T12:37:10.411764Z","title":"Towards Theoretical Understanding of Inverse Reinforcement Learning","venue":"cs.LG","work_id":"86552903-77f5-499a-a4cc-3a0b9a6d595a","year":2023},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.198337Z"},"links":{"cited_paper":"/paper/2304.12966","citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:952f6ec636778abbe8e2de1191ba879920770c96c868276f07e32238c0683347","observation_id":"04eab034-e282-4624-9b20-0fd582b6e75a","resolution":{"observed_at":"2026-08-12T12:37:10.418092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-11T08:36:53.636356Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-12T12:37:10.207476Z","title":"R3M: A univer- sal visual representation for robot manipulation.arXiv preprint arXiv:2203.12601, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.207476Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:c7ac3ec56a63c2d61f48e7695273bb841be4a6a54233936c6d2a29e863f47943","observation_id":"246b6b1a-a689-4a57-aa9b-a2a9b7a97eb5","resolution":{"observed_at":"2026-08-12T12:37:10.207476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-12T12:37:10.211650Z","title":"Advantage-weighted regression: Sim- ple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.211650Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:50a0478c87b2765c042b3486a25dcac9b67c099182788b3a9b56b4fa29214eb3","observation_id":"004c2f5f-ee50-415c-94cb-c222c43dc6b1","resolution":{"observed_at":"2026-08-12T12:37:10.211650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.748092Z","title":"Reinforcement learning by reward-weighted regression for operational space control","venue":null,"work_id":"78e3d371-7b41-4ef6-93b0-4b5b69535799","year":null},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.215957Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:7349d254486b81ef4a9c6340af7f1b78ee96c944ae9ec349fb4f8e60470a0209","observation_id":"ecd888a8-d3b6-4ca2-bbc9-1fbec814783c","resolution":{"observed_at":"2026-08-12T12:37:10.752336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.735828Z","title":"DexMV: Imitation learning for dexterous manipula- tion from human videos","venue":null,"work_id":"b319e19d-9d3c-4b04-bccb-afad572f0414","year":2022},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.219880Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:c12d5bb817f39f6d20897df502d1ae9edfbb88167df7eb5e1632138fbb6e0cfd","observation_id":"357bb53a-dc1d-43ca-8bbc-c6a30e6aa68e","resolution":{"observed_at":"2026-08-12T12:37:10.739943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.723203Z","title":"Artificial Intelli- gence: A Modern Approach","venue":null,"work_id":"7d4fcef3-9c93-4641-a714-2fe0541aa013","year":1995},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.223750Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:7f9320fb4637b2f6a865c2eacc645c0b3bf3bfbe542441dd5ddd773ad5fc91af","observation_id":"645b6f49-f943-47a1-9e58-929e12831184","resolution":{"observed_at":"2026-08-12T12:37:10.727545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.709777Z","title":"Time-contrastive networks: Self-supervised learning from video","venue":null,"work_id":"4678df74-08bb-4728-8144-a55a3ce46ad9","year":2018},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.227571Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:affaff72d968411d7cb32fc5441e58192941795504928abe97880001e181f587","observation_id":"e2b7d4e4-2577-413c-b68b-9dcdcaf96fed","resolution":{"observed_at":"2026-08-12T12:37:10.714888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.697316Z","title":"Time-contrastive networks: Self-supervised learning from video, 2018","venue":null,"work_id":"3ad0c050-90fd-415a-92bf-49c08cb571cf","year":2018},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.232100Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:481a41309ea66f3abdfcc9d76dfa3a7c0278732345553ce9b677697bc8554c26","observation_id":"6cadf0c8-47d7-4eba-a540-378e34d050c8","resolution":{"observed_at":"2026-08-12T12:37:10.701581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.684917Z","title":"Lewis, and Andrew G","venue":null,"work_id":"dfe19d32-c0ca-45ac-962d-a55ba9b965b5","year":2010},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.236502Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:bdb06bdc5d9ab4945008ba794d145d9671530550f7e3c5571be41779bbab80e2","observation_id":"15a2298d-e747-4f54-ba67-b433d350bbf6","resolution":{"observed_at":"2026-08-12T12:37:10.688946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.672582Z","title":"Reinforcement Learning: An Introduction","venue":null,"work_id":"70f4ccc4-c4e0-4891-b70a-f3a2eaf0f9e7","year":2018},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.240628Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:9e31142bc58571de58c29773df3e2a28c9c4cdfb4b0bc6a43a5e0a50fc558029","observation_id":"6d51ecbd-82a2-4075-97eb-1b64fc379c50","resolution":{"observed_at":"2026-08-12T12:37:10.676723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-12T12:37:10.244617Z","title":"DeepMind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.244617Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:222f81375e10cf4389ce7dbf78472c70c9bb9cb61cc5b1d8a2971206ee8a3495","observation_id":"936a2caa-1bd3-4ba7-a870-c0edf194c34f","resolution":{"observed_at":"2026-08-12T12:37:10.244617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.660289Z","title":"Wozniak, Andrea Gasparri, and Danica Kragic","venue":null,"work_id":"86c91ade-cca5-4dbf-b65b-2460b43c9b5e","year":2024},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.248726Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:10605efe90c1f72c605a195e7e168945b4073b0d9b3b4259c9e533a4a4398cc2","observation_id":"c5cd4583-7686-4fab-b620-431b38323e79","resolution":{"observed_at":"2026-08-12T12:37:10.664342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.646766Z","title":"Maximum entropy deep inverse reinforcement learning, 2016","venue":null,"work_id":"e1990bd9-01e1-406b-8b93-b40ddc85b523","year":2016},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.252493Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:1da729beca086eed0dd3a5d9dba1d99a354e7d372914e00cb795f705655d08aa","observation_id":"c8c79295-a259-4903-b880-ab88d7646851","resolution":{"observed_at":"2026-08-12T12:37:10.651501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14735","last_updated":"2024-04-23T04:31:30Z","snapshot_observed_at":"2026-08-13T00:24:08.665363Z","submitted_at":"2024-04-23T04:31:30Z","title":"Rank2Reward: Learning Shaped Reward Functions from Passive Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14735","snapshot_observed_at":"2026-08-12T12:37:10.257365Z","title":"Rank2Reward: Learning shaped reward functions from passive video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.257365Z"},"links":{"cited_paper":"/paper/2404.14735","citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:841b7de5c9d5db23839871c4c429c821b032319b878b74a591b4a45bd34c73b7","observation_id":"996fff09-c9d9-4953-846a-8b72577ef331","resolution":{"observed_at":"2026-08-12T12:37:10.257365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05815","last_updated":"2021-02-11T02:38:12Z","snapshot_observed_at":"2026-07-06T10:40:24.954633Z","submitted_at":"2021-02-11T02:38:12Z","title":"Representation Matters: Offline Pretraining for Sequential Decision Making","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05815","snapshot_observed_at":"2026-08-12T12:37:10.262203Z","title":"Representation matters: Offline pretraining for sequential decision making","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.262203Z"},"links":{"cited_paper":"/paper/2102.05815","citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:b73c8700bb944a6aaa245e91155fdc7f53aa5cdeedb683db3ff17eae0420ac08","observation_id":"1970e3be-72f5-45f6-9243-e36475cf76c4","resolution":{"observed_at":"2026-08-12T12:37:10.262203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.633854Z","title":"Im- age augmentation is all you need: Regularizing deep reinforcement learning from pixels","venue":null,"work_id":"48b9d755-46fb-46ea-95db-7814b1b9bd9b","year":2021},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.266988Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:b114828735469680696cc033578a12ef11a52284ffef169eeb8cf6b8a54a496e","observation_id":"a483121f-877f-4c80-abf5-f4462187d123","resolution":{"observed_at":"2026-08-12T12:37:10.638107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.620699Z","title":"Meta-World: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"1c795eff-a643-44ad-8bf8-206121bdde9c","year":2020},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.270930Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:779790ca6934a27e9b01d79d113c0d52be8a8930b8d91c9573be452b3683313a","observation_id":"48f19083-4e99-40ac-9f03-7518cbbe2b43","resolution":{"observed_at":"2026-08-12T12:37:10.625289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.607821Z","title":"Learning to drive by watching YouTube videos: Action-conditioned contrastive policy pretraining","venue":null,"work_id":"6bcbe5db-9448-48a3-9842-8cd3dc71b78f","year":2022},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.274803Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:a12a904725c13f83bf70ef5ba2d8028b6776ebc5a50e8e8979be40f27a2cd277","observation_id":"9e42a5d4-a8b3-4084-a30d-bea6d3ddc0b0","resolution":{"observed_at":"2026-08-12T12:37:10.612159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-12T12:37:10.278904Z","title":"Learning fine-grained bimanual ma- nipulation with low-cost hardware","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.278904Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:9f09b92d734a0710bfd7287087ea1727f66c89dc9c0fc2f0a67f1528df1efb7b","observation_id":"c9badd64-d63e-4c23-ac7c-b2f32411452a","resolution":{"observed_at":"2026-08-12T12:37:10.278904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.594733Z","title":"Ziebart, Andrew Maas, J","venue":null,"work_id":"6cc36136-7389-464e-a7bd-74b4c065e9b1","year":2008},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.282834Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:117ce40dc7e88286a33351893bc0d91e500ca1acf558a9c375cab4100880b8d2","observation_id":"c3dec94b-e16f-4063-979e-2dd7f4cabf69","resolution":{"observed_at":"2026-08-12T12:37:10.598736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.580838Z","title":null,"venue":null,"work_id":"89cc1cf7-fca3-4e5f-bb9f-1ec699ba9b3c","year":2000},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.286626Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:9e9a9a9e3ccae0b88b379c5a477567cf476360cfc3d3207e5254537b353e3f5d","observation_id":"4010f532-83d2-4b61-a1d5-8994dd33c5ff","resolution":{"observed_at":"2026-08-12T12:37:10.585018Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.568074Z","title":null,"venue":null,"work_id":"01ffb2a3-cc72-438e-97a7-7cead130d814","year":null},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.290638Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:5e56d5f11dea354a22e0dc337abb36fac464aa3d5fd1712655494f4de9ffddec","observation_id":"59b62d96-d08e-40bc-b3a6-5d739e0ac71a","resolution":{"observed_at":"2026-08-12T12:37:10.572140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.555201Z","title":"Robotic Experiment Setup The real-robot experiments are performed using a Universal Robots UR5 robot arm equipped with a Robotiq 3-Finger Gripper (Figure 8)","venue":null,"work_id":"c9780582-1590-422a-82f5-03f7f173e607","year":null},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.294524Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:488ad89127f8de6c6f20b6780c6013e3dcb63f04192b8a3563ed3da1781c8a26","observation_id":"dc209de8-e71d-49c8-b68d-be4ee4327b38","resolution":{"observed_at":"2026-08-12T12:37:10.559402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.542037Z","title":"The case of β = 0(PROGRESSOR with- out Push-back) is discussed in the main paper","venue":null,"work_id":"0e5eb861-f78e-4443-a9b8-4459f186d54c","year":null},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.298519Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:fd8793d89606adefd549b117ced762b5e43cae61fe889fd4fcbdefca8e4fdf82","observation_id":"d005df41-9d71-4167-b01f-87516338559a","resolution":{"observed_at":"2026-08-12T12:37:10.546314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.528910Z","title":"This figure serves as an extension to Figure 7 for complete- ness","venue":null,"work_id":"2866820f-691d-4a08-8cbc-2a6c617245c5","year":null},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.302475Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:f0452c73110ca8fed00563af5865f3a58210364196f61fd099e4a088c507ab8e","observation_id":"5422f123-94a9-4e8a-b7a6-299b5d1cba3a","resolution":{"observed_at":"2026-08-12T12:37:10.533313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:37:10.094791Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.094791Z"},"links":{"citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:9d8a0a978220108256bb784cd62d5cff17e66887e37d92d2f7a9ef8c007f63a0","observation_id":"d855ac28-3147-47c0-9bba-c525d45f80fb","resolution":{"observed_at":"2026-08-12T12:37:10.094791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-12T22:43:59.387758Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 1 inbound Pith citation observation for arXiv:2411.17764."}