{"as_of":"2026-08-18T20:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c944240f76e045e7e4c6aa0af992b383c930cb0fa96c65d4d33dca80fe38e93e","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:00:49.583586Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.08367/citation-record","integrity":"/paper/2505.08367/integrity","json":"/paper/2505.08367/citation-record.json","paper":"/paper/2505.08367"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.385469Z","title":"Learning to walk in minutes using massively parallel deep reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.385469Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:eefcdd0ee7ac98da2f299002241170077fafbd4e2af8c4f4d9c111f39623751f","observation_id":"f8be5de1-f33e-431c-ac7e-497fb28cd909","resolution":{"observed_at":"2026-08-15T22:00:49.385469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.391273Z","title":"Advanced skills through multiple adversarial motion priors in reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.391273Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:6101152a3dc22eb575dca0c86792565653541b4426d4490680dc297a3065f637","observation_id":"003a80c2-2005-4243-a7d7-bd74aaacc32b","resolution":{"observed_at":"2026-08-15T22:00:49.391273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.396041Z","title":"Walk these ways: Tuning robot control for generalization with multiplicity of behavior,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.396041Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:b1dddc26aa50e9d2d6e28aedb4aaf5584a96041d05cf4bd5208d1e0f689c7e50","observation_id":"5e4954a8-c1fe-493c-98a1-46e87dec2118","resolution":{"observed_at":"2026-08-15T22:00:49.396041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.400849Z","title":"Adversarial motion priors make good substitutes for complex reward functions,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.400849Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:6acbe0cfe08ebb863854eb266082f1e925534ae1d6f82a59443ff8676d184994","observation_id":"5076248c-1874-4214-ba74-ff551c7ac670","resolution":{"observed_at":"2026-08-15T22:00:49.400849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.405588Z","title":"Learning agile skills via adversarial imitation of rough partial demonstrations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.405588Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:d6d4f7cb2cf39ff42dd89c81bc7c8ad5c30c2d7fde678bfa93e5dbffb8865454","observation_id":"932d7c1d-dcb2-451c-a8f9-d17482c80fa3","resolution":{"observed_at":"2026-08-15T22:00:49.405588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.410414Z","title":"Roboclip: One demonstration is enough to learn robot policies,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.410414Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:9496e2b906322a3b69282d371e2e065afdf26899fc0b19f736b501d1e4c2fab3","observation_id":"ecf7c619-6db0-49e5-955b-2667f4665dca","resolution":{"observed_at":"2026-08-15T22:00:49.410414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11571","last_updated":"2025-08-20T10:38:10Z","snapshot_observed_at":"2026-08-16T13:09:12.185885Z","submitted_at":"2024-10-15T13:04:11Z","title":"SDS -- See it, Do it, Sorted: Quadruped Skill Synthesis from Single Video Demonstration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11571","snapshot_observed_at":"2026-08-15T22:00:49.415620Z","title":"Sds–see it, do it, sorted: Quadruped skill synthesis from single video demonstration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.415620Z"},"links":{"cited_paper":"/paper/2410.11571","citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:3beec9c68f35e8f3029458b29da893d8f0e04de630efd791352197781fe4cfe2","observation_id":"07c77394-d7b3-4da4-bb8e-24925943c9f6","resolution":{"observed_at":"2026-08-15T22:00:49.415620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:50.109278Z","title":"Mocapact: A multi-task dataset for simulated humanoid control,","venue":null,"work_id":"9257020f-1a07-4061-b0ab-1524531da8dd","year":2022},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.420628Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:6d9472d20bf40e75ec8e06399221bff386a329794d5652e58a425c845d82d99b","observation_id":"484b11ab-6ba6-4b8b-a544-307fdf227a3b","resolution":{"observed_at":"2026-08-15T22:00:50.114786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:50.092729Z","title":"Sfv: Re- inforcement learning of physical skills from videos,","venue":null,"work_id":"acde3b12-1700-441c-83a4-586f09ba93c4","year":2018},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.425222Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:1be57ce930b0bdc3c789cd6c6c9c2d4083b454494e5bb987950111dc1e584344","observation_id":"b3bd7250-9d93-42ec-9382-8c115272a73b","resolution":{"observed_at":"2026-08-15T22:00:50.098226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:50.073340Z","title":"Deep reinforcement learning-based safe interaction for industrial human-robot collaboration using intrinsic reward function,","venue":null,"work_id":"496c3d3a-981a-404b-8abf-f1d9082d3b65","year":2021},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.429884Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:04fc931739e8cf5b2bd53bde3b2fcef4a7a7bdabef10967fefc255608687032e","observation_id":"67addd62-dcf0-4bcc-9750-e6200c510896","resolution":{"observed_at":"2026-08-15T22:00:50.080062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16611","last_updated":"2024-09-25T04:24:46Z","snapshot_observed_at":"2026-08-16T13:15:38.640799Z","submitted_at":"2024-09-25T04:24:46Z","title":"Achieving Stable High-Speed Locomotion for Humanoid Robots with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16611","snapshot_observed_at":"2026-08-15T22:00:49.434912Z","title":"Achieving stable high-speed locomotion for humanoid robots with deep reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.434912Z"},"links":{"cited_paper":"/paper/2409.16611","citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:3c9505e729c02046654212e01a6e6567eac18d4a2bb648c912a8805403793b55","observation_id":"c941bb07-8860-41d9-ac7e-eba2f9e96484","resolution":{"observed_at":"2026-08-15T22:00:49.434912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.440252Z","title":"Mastering the game of go without human knowledge,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.440252Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:caaf591a23c0a222abd5fc7869111cddb47f8fa70a5a0837e695495d03d0a22e","observation_id":"95bb94f0-1151-43fa-ac5e-497b86b37efb","resolution":{"observed_at":"2026-08-15T22:00:49.440252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:50.041240Z","title":"Drl- dclp: A deep reinforcement learning-based dimension-configurable local planner for robot navigation,","venue":null,"work_id":"e78688ec-3bc1-48d7-a951-67711a7f325a","year":2025},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.444732Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:a35ce1085f485fcb0434c626ff5ee25162fa4495361d2ffc461c7109417157c4","observation_id":"31060761-a577-4c0d-9ba6-26e231f2386b","resolution":{"observed_at":"2026-08-15T22:00:50.046842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:50.022969Z","title":"Deep reinforcement learning for general game playing,","venue":null,"work_id":"9b3fd9b9-1a8d-4e17-ad7c-8530a297f59e","year":2020},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.450044Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:187933b87d000205a43e711cd41bac796e8d845d773e6bd11cb8d77e6604e271","observation_id":"4153d326-90bf-41f3-947b-3ade23c80fcb","resolution":{"observed_at":"2026-08-15T22:00:50.028772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:50.006186Z","title":"Novel automated interactive reinforcement learning framework with a constraint-based supervisor for procedural tasks,","venue":null,"work_id":"cfd31e6a-3258-4c26-8bfb-f186184440a8","year":2025},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.455909Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:77e3a16cf3c9f4f57227fba440d68f2b24fcff5f4cf27de80686d26b153c1190","observation_id":"25a76d6d-0f0e-4160-90a8-b934d47d40f4","resolution":{"observed_at":"2026-08-15T22:00:50.011469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.989687Z","title":"Deep reinforcement learning for unsu- pervised video summarization with diversity-representativeness reward,","venue":null,"work_id":"550dae49-ca9c-4af7-b87d-13d5e113a51f","year":2018},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.461630Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:82681d5e67a09e93d144bfc2db2839c9ebe0babd7440f09ff79f9b5d56594c23","observation_id":"352517f0-15ad-4000-b022-6b5c979e6642","resolution":{"observed_at":"2026-08-15T22:00:49.995498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.972877Z","title":"Imitation from observation: Learning to imitate behaviors from raw video via context translation,","venue":null,"work_id":"70227c4a-0261-4205-ac0e-6d95737b02a1","year":2018},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.467566Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:83aa437314c23e936020f56ed925e6a40f56131f0140a6adce7ed3ce96bfe059","observation_id":"43bd12f5-44d7-46a2-b595-eed7858e2752","resolution":{"observed_at":"2026-08-15T22:00:49.978334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.06507","last_updated":"2021-11-04T20:07:57Z","snapshot_observed_at":"2026-08-16T19:06:16.231226Z","submitted_at":"2020-11-12T17:15:48Z","title":"Reinforcement Learning with Videos: Combining Offline Observations with Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.06507","snapshot_observed_at":"2026-08-15T22:00:49.473148Z","title":"Reinforcement learning with videos: Combining offline observations with interaction,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.473148Z"},"links":{"cited_paper":"/paper/2011.06507","citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:58c17c0fa7622b3a703dc1a028e5e0244742bc2b1f0b13b7ce141afc636c75c1","observation_id":"4e3c512d-7408-471d-9524-e7278458e02c","resolution":{"observed_at":"2026-08-15T22:00:49.473148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.955798Z","title":"Learning agile robotic locomotion skills by imitating animals,","venue":null,"work_id":"c854d797-62ed-43ec-a058-cb0b7e5c7dcf","year":2020},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.478333Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:f1e4269da45f344696d27b6dbc17559b6da90a568ae9f6c750be426a4e4e0299","observation_id":"b6d92a21-8be0-405f-ab27-4605ccb67ed0","resolution":{"observed_at":"2026-08-15T22:00:49.961396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.487945Z","title":"Progprompt: Generating situated robot task plans using large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.487945Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:378b151229899ef0ab921f562092d4578e92d3e160776d5927a91e9aa2f7312c","observation_id":"3017d10b-0e12-4fe8-afe6-014639dd870c","resolution":{"observed_at":"2026-08-15T22:00:49.487945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08647","last_updated":"2023-06-16T23:02:21Z","snapshot_observed_at":"2026-08-17T22:16:17.971851Z","submitted_at":"2023-06-14T17:27:10Z","title":"Language to Rewards for Robotic Skill Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08647","snapshot_observed_at":"2026-08-15T22:00:49.493036Z","title":"Language to rewards for robotic skill synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.493036Z"},"links":{"cited_paper":"/paper/2306.08647","citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:f1ed61767a9c81efaede5d104bec31f60155b0716dfea58e31c3927e3e42f18c","observation_id":"6ed62dec-8c63-4f13-903d-56de5e93add8","resolution":{"observed_at":"2026-08-15T22:00:49.493036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.927485Z","title":"Eureka: Human-level reward design via coding large language models,","venue":null,"work_id":"3e2abd4e-4874-47eb-ad2e-f1f53da76241","year":2024},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.498626Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:0ef299a407f68387cd604a2fcbfb37c7d827052cd557b4dc9252af4d1c27d8ca","observation_id":"65b89694-9417-4811-b140-548212581532","resolution":{"observed_at":"2026-08-15T22:00:49.932703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.910388Z","title":"Dreureka: Language model guided sim-to-real transfer,","venue":null,"work_id":"2d745d83-a1dc-4a28-9356-c489abbde936","year":2024},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.503715Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:4421ed3f5bda0f4d04e7ade41459bb059a8ecb12121c0b97aa7f276429b05087","observation_id":"d15b3b39-863e-4178-b19f-18cb9ab12934","resolution":{"observed_at":"2026-08-15T22:00:49.915270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-16T14:50:37.995504Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-15T22:00:49.508669Z","title":"Vision-language models are zero-shot reward models for reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.508669Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:0f126284080a2811d9463499c6e78df8163dd643bc22b5f72edb280f449708c5","observation_id":"7bc36ccd-dfc0-4d5e-8fca-c861741619e7","resolution":{"observed_at":"2026-08-15T22:00:49.508669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.891820Z","title":"Slomo: A general system for legged robot motion imitation from casual videos,","venue":null,"work_id":"a0c4d4f9-6145-4d34-844a-28ea16bb1173","year":2023},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.514457Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:b9216f7803a4c26d9143524e32dca2733f5cb180d765c5f588c8ed210769945e","observation_id":"d7dd6408-6193-40aa-992b-1acf1df247d1","resolution":{"observed_at":"2026-08-15T22:00:49.897916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-15T22:00:49.520309Z","title":"Continuous control with deep reinforcement learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.520309Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:500b0a337054c8ebebdb87868463c52b6c67d98a1cdd1389daa55cf10a6ed2ab","observation_id":"c1bdfc47-eca9-4aed-8658-397f473c065a","resolution":{"observed_at":"2026-08-15T22:00:49.520309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.525521Z","title":"A survey on offline reinforcement learning: Taxonomy, review, and open problems,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.525521Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:531b2bab7d501ce3aacafb9a6a2afeefcb7e4cf3d9304d6b7751601f363fb4d5","observation_id":"73ce0b37-5164-4b53-8015-a7ea39dc84c2","resolution":{"observed_at":"2026-08-15T22:00:49.525521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.530208Z","title":"Deep reinforcement learning for autonomous driving: A survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.530208Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:b1bd0860887274db0d9e94bf41c3320b5ed24672a182f10a1a32eb400d95caee","observation_id":"3beca98d-57b5-48f5-a907-3a37b8e4195c","resolution":{"observed_at":"2026-08-15T22:00:49.530208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-15T22:00:49.536073Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.536073Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:22ef5d8c63bd942ae0f90880b2371f6230202d9454606ab11334710578be231b","observation_id":"3cafdd46-5731-469e-b948-468bf8ed1934","resolution":{"observed_at":"2026-08-15T22:00:49.536073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.855996Z","title":"Off-policy deep reinforcement learning without exploration,","venue":null,"work_id":"c25bdf9e-f513-4880-9ff2-d5a6b476ed70","year":2019},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.541876Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:7d9ba1113f87a62e3df6a39ba8ce9c29c5d426a2775bd32fb69e938c7cc81fa0","observation_id":"04157bdb-9c1f-4901-b673-dca6b0ad588c","resolution":{"observed_at":"2026-08-15T22:00:49.861601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.546597Z","title":"Conservative q-learning for offline reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.546597Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:d456859da7e8022a0c3da6c6baaa12baebd47c44efb9f3ec4a4b3386c5382f4d","observation_id":"e7753f54-1fc3-431a-9cd5-c61893628c5c","resolution":{"observed_at":"2026-08-15T22:00:49.546597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.828047Z","title":"Where do rewards come from,","venue":null,"work_id":"36d24fb8-7cb3-4963-9433-c884705f8a20","year":2009},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.551132Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:5f57f40e3c7ab1a2a66135055bf3a3316a4702032d629942fafc9ef1a3f8c77d","observation_id":"295d9e74-32b4-447a-80c4-d3c1f9b5ac67","resolution":{"observed_at":"2026-08-15T22:00:49.833836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12931","last_updated":"2024-04-30T21:35:53Z","snapshot_observed_at":"2026-08-02T10:40:03.816188Z","submitted_at":"2023-10-19T17:31:01Z","title":"Eureka: Human-Level Reward Design via Coding Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12931","snapshot_observed_at":"2026-08-15T22:00:49.555874Z","title":"Eureka: Human- level reward design via coding large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.555874Z"},"links":{"cited_paper":"/paper/2310.12931","citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:e90e53ce1dc3e2e62e2b2c4f34dc2e5edb65f6d3b446a56ec8217d131bc0717c","observation_id":"8a7be170-d85b-480a-8fd9-549766640f3a","resolution":{"observed_at":"2026-08-15T22:00:49.555874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.560695Z","title":"Two-frame motion estimation based on polynomial ex- pansion,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.560695Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:8b032859ce8a3a619475e2cc58e6b532964742632e1adcda1bf1568625c53c75","observation_id":"5c0c7afb-5947-4699-a4d4-81eebc13707b","resolution":{"observed_at":"2026-08-15T22:00:49.560695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.565552Z","title":"Off-policy deep reinforcement learning without exploration,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.565552Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:3b25ef1dd9439d88b8881d4aef1bcc5586477afe3f7d83bf56a25522fb722e03","observation_id":"a87dc0db-53cf-4429-8db2-264127c04271","resolution":{"observed_at":"2026-08-15T22:00:49.565552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.569935Z","title":"Offline-to-online reinforcement learning via balanced replay and pessimistic q-ensemble,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.569935Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:f5853297df2d3b56126bcd1f55767bc0729cb75bdaec16243a77577f812191e8","observation_id":"cc0bab48-ef4b-4e1b-b151-ef80d67bb7c9","resolution":{"observed_at":"2026-08-15T22:00:49.569935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T22:00:49.574470Z","title":"Prox- imal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.574470Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:9399e8543f74337ad7b0ce516dcec85bb938ba09d98287f86b4deb03685762af","observation_id":"a9c4b02f-1ae7-47e3-a9dd-368cef854201","resolution":{"observed_at":"2026-08-15T22:00:49.574470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.579142Z","title":"Offline reinforcement learning with implicit q-learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.579142Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:8ec34f25eed2c3a7f2fafc76531f195561e45d60b72a11fe4e7d1072bfde4698","observation_id":"1f284fcd-3f53-418c-94b7-56ab0636e3b0","resolution":{"observed_at":"2026-08-15T22:00:49.579142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.766287Z","title":"Gpt-4v(ision) system card,","venue":null,"work_id":"1068dea1-1d77-4026-8449-e519bba123b6","year":2023},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.583586Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:fdd52147ce679fa3a7bd543f7b4bc80cf7ec96d3e9ec6f298009938a2f28ea3a","observation_id":"bd2b8eea-ebbf-482e-b39a-0b46dbdd8291","resolution":{"observed_at":"2026-08-15T22:00:49.773116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.483083Z","title":"Available: https://doi.org/10.15607/RSS.2020.XVI.064","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:49.483083Z"},"links":{"citing_paper":"/paper/2505.08367"},"observation_digest":"sha256:266d653d55d67252f0b0a8c207c470bef587ee86e52ffa9e990187a90960d1e3","observation_id":"717a2144-7deb-455f-ade6-3ca707320a95","resolution":{"observed_at":"2026-08-15T22:00:49.483083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.08367","last_updated":"2025-05-13T09:12:32Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-18T11:36:00.976550Z","submitted_at":"2025-05-13T09:12:32Z","title":"MA-ROESL: Motion-aware Rapid Reward Optimization for Efficient Robot Skill Learning from Single Videos"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2505.08367."}