{"as_of":"2026-08-09T08:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:67a9ceef380531f0acbc2dd19e0dce3244cd872ee7bcbbbb59f275fb0d6d791a","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:12:39.980717Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T14:07:10.387869Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T14:10:13.290156Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.19769","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19769","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tevir: Text-to-video reward with diffusion models for efficient reinforcement learning","venue":null,"work_id":"9ba6d520-d9d6-4128-af72-cdef0acf0a50","year":2025},"citing_paper":{"arxiv_id":"2602.10503","last_updated":"2026-05-16T03:35:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-11T04:05:03Z","title":"Towards Long-Lived Robots: Continual Learning VLA Models via Reinforcement Fine-Tuning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T14:07:10.387869Z"},"links":{"cited_paper":"/paper/2505.19769","citing_paper":"/paper/2602.10503"},"observation_digest":"sha256:f267eb50ccdf371a54f4257f73b6ef3bd713382e886b454de0bd2c05119fbe8f","observation_id":"8c6c6ecb-c957-4102-8fde-ac21f52f0c8e","resolution":{"observed_at":"2026-05-21T14:10:13.292099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19769/citation-record","integrity":"/paper/2505.19769/integrity","json":"/paper/2505.19769/citation-record.json","paper":"/paper/2505.19769"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:48.888109Z","title":"Reinforcement learning control of a flexible two-link manipulator: An experimental investiga- tion,","venue":null,"work_id":"1fbe3f0d-7f9f-4229-8e05-6e355cc1f832","year":2021},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.075020Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:8b0c2b514c3ca82decd45f4cc24eb7627f56765df58a7c8672c08ee98fd9051c","observation_id":"27024c23-bf04-4f95-940f-23bed71c8ed5","resolution":{"observed_at":"2026-08-07T14:12:48.980192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:48.745334Z","title":"A hierarchical deep reinforcement learning framework for 6-dof ucav air-to-air combat,","venue":null,"work_id":"fc25b1f1-05b7-436c-bd32-d5f2baf96d27","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.140710Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:193f6ad0d213db0e933d1337b0844d8dafaac96c67cd9cb24fd0ca326558002f","observation_id":"1abc96b1-5307-4a78-b372-3c4875891862","resolution":{"observed_at":"2026-08-07T14:12:48.786602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:48.589802Z","title":"Conrft: A reinforced fine-tuning method for vla models via consistency policy,","venue":null,"work_id":"ee6c8c73-41d8-43b6-87f9-bf4d7e6bcc73","year":2025},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.212152Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:5eec7d8fbb2e72720fd51e17d38a149141bf070a2e34dcd2f1268024e8526cdd","observation_id":"225c0f0c-5c41-4fbc-9909-df8e35703d79","resolution":{"observed_at":"2026-08-07T14:12:48.668624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:48.391015Z","title":"End-to-end robotic rein- forcement learning without reward engineering,","venue":null,"work_id":"b44a5527-c9b2-4d0d-94f3-fd38562b70f0","year":2019},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.286207Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:6401b8d11690b28b6ad797c37254d252877db60055a3f9e970e729c7303eae9f","observation_id":"14bdcf12-d5af-4640-95fb-450e6caad0a4","resolution":{"observed_at":"2026-08-07T14:12:48.464203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:48.183603Z","title":"Deep learning in robotics: Survey on model structures and training strategies,","venue":null,"work_id":"286e2f84-f443-4941-89c5-6b807c3195b7","year":2021},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.381085Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:b6545cfb2991b9be0a5c364ce216b962f9044163af8d55ef74d6c9d8fb1ac173","observation_id":"8eee8e24-f7e1-4009-b36e-a37673c1e7d2","resolution":{"observed_at":"2026-08-07T14:12:48.293567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:48.039145Z","title":"Deep reinforcement learning-based automatic exploration for navigation in unknown environment,","venue":null,"work_id":"97669c8e-2c09-4dbe-959e-d5ccf6783ada","year":2020},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.453689Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:a6681af9a85f0e6eea25332b256fa229583658ca412eeb99b79e4a50327e5d32","observation_id":"c56853e9-357e-4fdb-9f96-d96174c16464","resolution":{"observed_at":"2026-08-07T14:12:48.109248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:47.837542Z","title":"Reward design with language models,","venue":null,"work_id":"3bafee3a-1536-4269-839b-038a108bc1c1","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.556922Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:393c879ebbaff8a51e0e433818d63b13d0c794bfee846d392cdba408b002368a","observation_id":"d46f445b-e656-431f-adc1-abe139950ee4","resolution":{"observed_at":"2026-08-07T14:12:47.912083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:47.685820Z","title":"A survey of inverse reinforcement learning: Challenges, methods and progress,","venue":null,"work_id":"c4bfd3ea-4456-4a3a-a535-f28148c9ddd0","year":2021},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.638152Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:d23f108f437471cffd7d16698b839b4a3f6bee3b42d25f956728638b9c913847","observation_id":"b501e6ce-83e3-458f-9aa3-add038e931a7","resolution":{"observed_at":"2026-08-07T14:12:47.760505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-07T14:12:36.725785Z","title":"Concrete problems in ai safety,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.725785Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:6f1242209692d889fc92a6e2bee0a26f9b7e821e14131a22027dba08ee62345a","observation_id":"7da671b2-4475-4e32-99d6-66747769b72d","resolution":{"observed_at":"2026-08-07T14:12:36.725785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:49.038904Z","title":"VIP: towards universal visual reward and representation via value-implicit pre-training,","venue":null,"work_id":"72bebd9f-f20b-4cf8-b789-5e24b88c5f8c","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.788123Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:26a9bf653ad2ce96d212bfb08b21df91713964d2660d3e548c5a9e87b37ca69e","observation_id":"c3cbd773-c63e-4274-929f-098bf17c90eb","resolution":{"observed_at":"2026-08-07T14:12:49.073408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:47.249471Z","title":"Robot fine-tuning made easy: Pre-training rewards and policies for autonomous real-world reinforcement learning,","venue":null,"work_id":"1fc0ea2b-7e44-467a-9383-8796f7118efb","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.977314Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:7f035e0e3db126423ba1719647108fbbc8c4ff385f0bb51649bcda8005dd658a","observation_id":"825f694e-f6b6-4ed6-9990-55202c3d94f6","resolution":{"observed_at":"2026-08-07T14:12:47.356268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:47.064743Z","title":"Roboclip: One demonstration is enough to learn robot policies,","venue":null,"work_id":"8bfda589-8ce4-4e53-ae38-28f906c524ee","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.075374Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:4098e349d04dd5d0a66d508cc96dd1db1dfc1732472034432878c66a58d7d74a","observation_id":"596ccf72-8360-4465-a1e6-5a2919135b43","resolution":{"observed_at":"2026-08-07T14:12:47.158266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:46.911430Z","title":"RL-VLM-F: reinforcement learning from vision language foundation model feedback,","venue":null,"work_id":"a00b58dc-3297-4afd-9b29-12cc67c7ebc2","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.154300Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:a4e384757b375f95041d54d5b0c6bc2cf72ccc9a76cba8f7a87c2cf0e4e34d70","observation_id":"76f78089-5877-4bfa-9fb6-a977c136a0d6","resolution":{"observed_at":"2026-08-07T14:12:46.963585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:37.242406Z","title":"Video diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.242406Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:8a87fc28c565a3e5b202d168b2d579c3822c84658c15057e165718a6934f873a","observation_id":"e7b7cd0a-ab1a-42a6-943f-d3d1263da7e7","resolution":{"observed_at":"2026-08-07T14:12:37.242406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-07T14:12:37.325571Z","title":"Imagen video: High definition video generation with diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.325571Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:f1aade371cc9358986f87cdeb2828fd39a205a573fbe55aa21ab39bf4cc9a755","observation_id":"cb591e85-a4c9-451c-bdfe-29f39d0749d3","resolution":{"observed_at":"2026-08-07T14:12:37.325571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:46.750292Z","title":"Learning universal policies via text-guided video generation,","venue":null,"work_id":"263662a2-de1a-4374-b19d-7f210b2cad44","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.372947Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:ca712de466a46e003e8175a404b6c27d65af73b780e505eae1049bf024c78733","observation_id":"f5b35545-33cc-4a89-a8ef-6156b2b944a0","resolution":{"observed_at":"2026-08-07T14:12:46.835479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:46.558244Z","title":"Learning to act from actionless videos through dense correspondences,","venue":null,"work_id":"d4ea0317-86a2-49ad-b949-348db7532b02","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.415391Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:da4441e639f4451784e537909b6a731dda645e137d6a628ce62c53c8408213c2","observation_id":"34755670-cc72-4d5b-96d0-f8eeb95c7bf3","resolution":{"observed_at":"2026-08-07T14:12:46.646711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:46.361960Z","title":"Learning interactive real-world simu- lators,","venue":null,"work_id":"8e8a95cc-ab7b-48e0-9ea6-98e61133dede","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.493384Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:19a595f14a0fb4f02a7225dea9708a4828d611b6e7d1e12f6f4db59440785476","observation_id":"30648508-4028-4a03-b905-5a8c9fae517c","resolution":{"observed_at":"2026-08-07T14:12:46.467102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:46.193299Z","title":"Any-point trajectory modeling for policy learning,","venue":null,"work_id":"1dde6a43-4757-4003-9aef-b173f8045994","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.557884Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:33c1e47cbb66393c3f01d8e961d15e454b0309634a172e32f09b9ba941ea9a4a","observation_id":"3a26a60b-4bf6-4682-a7ff-9bfef229619d","resolution":{"observed_at":"2026-08-07T14:12:46.275066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02635","last_updated":"2026-04-23T15:06:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-04T07:56:42Z","title":"Reinforcement Learning with Foundation Priors: Let the Embodied Agent Efficiently Learn on Its Own","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02635","snapshot_observed_at":"2026-08-07T14:12:37.630387Z","title":"Foundation reinforcement learning: towards embodied generalist agents with foundation prior assistance,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.630387Z"},"links":{"cited_paper":"/paper/2310.02635","citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:fa044fe5b70a4f4968d33a73c737c2e70bae7bc75ef6af5f03b1f74595b9d557","observation_id":"e1c6dba3-f10f-4dc2-897a-232876ce1fe9","resolution":{"observed_at":"2026-08-07T14:12:37.630387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:45.981053Z","title":"Video prediction models as rewards for reinforcement learning,","venue":null,"work_id":"7bcf87ae-38a8-46e7-9521-77fc41f701c0","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.705385Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:72e0451849ee9775e25cf82a5676bc60df5652b5960e699f8720ded17ed81217","observation_id":"3354cdda-7796-4340-a7eb-7ce23412e17a","resolution":{"observed_at":"2026-08-07T14:12:46.086688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:45.777782Z","title":"Diffusion reward: Learning rewards via conditional video diffusion,","venue":null,"work_id":"7bf273fc-dd9c-4da5-b2c3-9bf010f74c12","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.785627Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:328a06e8b1874be7e7548407a1a028eff589e0473148f406100847c0cdae7d52","observation_id":"bcb3a6e7-552d-493a-91a3-dab15c6ec1ae","resolution":{"observed_at":"2026-08-07T14:12:45.862965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:45.577870Z","title":"Stabilizing diffusion model for robotic control with dynamic programming and transition feasibility,","venue":null,"work_id":"582c1a76-9db5-46e9-b63d-92da4df4b4e8","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.870665Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:9a760a1bf43dcb9da8f1bc6f47ea175ef3b554846a8f7a5c7c9bb82485324c34","observation_id":"4e6c10ec-2b98-40fc-8f91-d205cd41a0c0","resolution":{"observed_at":"2026-08-07T14:12:45.680178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:45.329710Z","title":"Decision making with visualizations: a cognitive framework across disciplines,","venue":null,"work_id":"150dcf4c-4c3e-4954-9444-cfd59834536a","year":2018},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.934175Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:8dd6c55a617844ebec61dd0a3c3b38c5352d168ab15c44e41ee88ade440f6209","observation_id":"1a1cc20f-eb0e-48bd-8f7f-2541f323aaa2","resolution":{"observed_at":"2026-08-07T14:12:45.475153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:45.154420Z","title":"MAT: Morphological adaptive trans- former for universal morphology policy learning,","venue":null,"work_id":"f4138297-9e8d-4eae-83b2-2da5067d28d1","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.018053Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:d9f5662d7f635ae34ad5aa9bd870b73481c6f9c6a49f01236d3fe6eaf26e9798","observation_id":"b90ebe25-2d59-47f3-8a65-4c6ca05b7ec9","resolution":{"observed_at":"2026-08-07T14:12:45.227371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:44.955048Z","title":"Boosting continuous control with consistency policy,","venue":null,"work_id":"c40e0213-d3f7-490b-ba7a-79d08815ddec","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.057875Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:5cea6c0224fd851fafb608f28a5904a9c04b95648459f5e431427dad0d5ea421","observation_id":"ed71ba69-0257-41dc-98c5-54dc3feab07a","resolution":{"observed_at":"2026-08-07T14:12:45.039267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:44.705776Z","title":"Proximal policy optimization with policy feedback,","venue":null,"work_id":"b42e45a5-8120-49ea-ab5a-2a81c67a0f88","year":2022},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.145685Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:85a2873de7736164c36bd7778bcf270b4ba69cc17bc80b29ef7481419a6ba572","observation_id":"8626712b-1b7e-47e5-888b-bd508010bb37","resolution":{"observed_at":"2026-08-07T14:12:44.844818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:44.468775Z","title":"Interactive language: Talking to robots in real time,","venue":null,"work_id":"f77fb82c-179e-434c-8a5a-8c1167c48660","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.213119Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:7192773ff0e6548113a8212ff5bd72b696c11a803dd095654cf2f67ecf2cbcc5","observation_id":"16c2e37e-f51c-466b-aa1a-d8b76582137c","resolution":{"observed_at":"2026-08-07T14:12:44.578228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:44.288136Z","title":"The surprising effectiveness of representation learning for visual imitation,","venue":null,"work_id":"dfe4490c-3b5f-4a90-a532-ecaa8c6e698f","year":2022},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.310805Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:11d37e6387a287043167bd4f3faf49b56845c550bc0581e5f4dd41f95e11ff3c","observation_id":"43fb337f-fa29-4fc4-9474-ed9ebcc4b697","resolution":{"observed_at":"2026-08-07T14:12:44.369110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:44.138382Z","title":"Watch and act: Learning robotic manipulation from visual demonstration,","venue":null,"work_id":"2bb9fcdb-c32f-4a90-8d10-f7d2d781d2d9","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.394180Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:b416d039e4fdede1e6b15b1d3356d3f2632d05c7f061b5adeda92c8975c84963","observation_id":"523292ed-9b83-4171-a46b-47684c13c040","resolution":{"observed_at":"2026-08-07T14:12:44.200187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:43.899871Z","title":"Apprenticeship learning via inverse reinforce- ment learning,","venue":null,"work_id":"dbcd7fa2-6eaf-4404-a1dd-f40fa74dfab1","year":2004},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.453525Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:e33727f4387b6c4605b0e0d5055428c5512b5ecf54bf40336d2f188f3e3a37fc","observation_id":"b15d748d-8a0a-425d-8dbe-0eefc7f996d5","resolution":{"observed_at":"2026-08-07T14:12:44.022355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:43.712259Z","title":"Guided cost learning: Deep inverse optimal control via policy optimization,","venue":null,"work_id":"fcc900f7-7d03-4bef-8aa8-704afea6ffa1","year":2016},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.499364Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:7ac8848867e6f02373b456bb7949bd7f13946290b259e1367dc0900076cd9f19","observation_id":"e410135c-a395-471f-80fa-cc2e501c6dd1","resolution":{"observed_at":"2026-08-07T14:12:43.811499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:43.472116Z","title":"XIRL: cross-embodiment inverse reinforcement learning,","venue":null,"work_id":"ec30803d-3889-41b0-b198-b8f2d4f74506","year":2021},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.562239Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:9f57c34e247af91fde9e5eb7a082bff6e16bcc583c5ec998627dc5c500b6ddc6","observation_id":"8a3aab42-5c1e-403f-b2e3-1050e03c649f","resolution":{"observed_at":"2026-08-07T14:12:43.592043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:43.270999Z","title":"Unsupervised perceptual rewards for imitation learning,","venue":null,"work_id":"1aa9c2cd-3d8c-4cbd-9bff-3e9cbb9e106f","year":2017},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.602327Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:0a9c91ade1b4cfb4b79a29e3124a1b9f49c90e199c166ca6c15abae3de3dcafa","observation_id":"208e572a-6a09-43ea-a329-27ac0f909880","resolution":{"observed_at":"2026-08-07T14:12:43.363278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:43.077785Z","title":"Learning generalizable robotic reward functions from","venue":null,"work_id":"272da810-7ebf-4c35-9af0-4bd8d1deb3ce","year":2021},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.636347Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:2ddb41a592f206469d1cb8615560e380dc8922f4653b099d0c37c5f780b4a15a","observation_id":"f8b2f30f-c960-40f3-befa-a3bfe6ce27b6","resolution":{"observed_at":"2026-08-07T14:12:43.157022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:42.860868Z","title":"Can pre-trained text-to-image models generate visual goals for reinforcement learning?","venue":null,"work_id":"836b46b8-4113-4ffa-bb63-98a254cf5db4","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.677455Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:33258d8ecbfae5c10aefa7ac24db94f8bd7a0ad176cc06f3f932c89ac36ca83e","observation_id":"594138cd-4e9a-40e8-b77a-858a9245ce68","resolution":{"observed_at":"2026-08-07T14:12:42.973285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:42.766350Z","title":"Language instructed reinforcement learning for human-ai coordination,","venue":null,"work_id":"2f77d7e3-93c9-488c-b66e-bf645c983e7d","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.713140Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:5f94960694d8a814542f03199acbd9872a68a7768b713d53050a3317d18a6065","observation_id":"90b5adef-e3bb-4709-9b87-4e6f5eaaddad","resolution":{"observed_at":"2026-08-07T14:12:42.802993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:42.615106Z","title":"Language to rewards for robotic skill synthesis,","venue":null,"work_id":"42b2afc3-448b-40c4-82ff-c9b8ef223f5d","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.770906Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:4590929c5af401623d9028a1d5b5354c09a72af8729f46d8c57914c3ff1a3a1f","observation_id":"4bc8b726-a2ce-4e53-a4b9-3fad6a2b9833","resolution":{"observed_at":"2026-08-07T14:12:42.666517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:42.556170Z","title":"Robogen: Towards unleashing infinite data for automated robot learning via generative simulation,","venue":null,"work_id":"f10b189d-d388-475f-ab4a-74aeb7e5040c","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.841534Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:3db038bed8d98c276a03a1ac0bb6ed50a857f0ea0192ff913a4e5037a25e02c7","observation_id":"158d2f3b-1ed7-4a32-9688-514c3968db6f","resolution":{"observed_at":"2026-08-07T14:12:42.579438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:42.440628Z","title":"Eureka: Human-level reward design via coding large language models,","venue":null,"work_id":"ad85b70d-652e-41bd-baab-1336cee10369","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.898442Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:64cffc784523085a0bfa2749ca6b471e1f129c58348b1f3c51156159e48a9f5c","observation_id":"3b267ee1-508a-4082-a601-92184463a9b2","resolution":{"observed_at":"2026-08-07T14:12:42.509950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:42.331007Z","title":"Vision-language models as success detectors,","venue":null,"work_id":"d57b555a-36a8-4d75-b9b7-520e9201551e","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.938950Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:b2ee931d46c73678c495788ff647cca9d62257f273f87d44a30868fe84f6537e","observation_id":"31f54546-38a7-49ca-9b49-c7675c8da5d8","resolution":{"observed_at":"2026-08-07T14:12:42.404777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:42.199152Z","title":"Guiding pretraining in reinforcement learning with large language models,","venue":null,"work_id":"8ed75733-2562-420f-915b-901aff658e15","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.985497Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:389be37bd6ee068bf01aaf8e8f23baf2165e94ead5d3b51ca90355bd92d83421","observation_id":"7c2d1506-22b4-4b15-9929-f653089ed579","resolution":{"observed_at":"2026-08-07T14:12:42.230637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:42.084745Z","title":"Vision-language models are zero-shot reward models for reinforcement learning,","venue":null,"work_id":"b055a800-a666-43ab-8730-a23fd201e179","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.036230Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:bc6bba99f7237703a5419211bf68b15731514e0c4ee3f7b52606bfa57093f32b","observation_id":"aafd8bb6-9e97-4c32-a0d7-c954245f4438","resolution":{"observed_at":"2026-08-07T14:12:42.156413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:41.954608Z","title":"LIV: language-image representations and rewards for robotic control,","venue":null,"work_id":"47d08439-2499-47df-aa97-035293a997fa","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.105570Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:d15107aec811bccdf6dc969d6c6e48a7775428bd38d664c084a46909c7947368","observation_id":"9f6e7692-a622-497e-b82a-dc2409268921","resolution":{"observed_at":"2026-08-07T14:12:42.046295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:41.644149Z","title":"Llmscenario: Large language model driven scenario generation,","venue":null,"work_id":"253bb43f-aaf1-4756-b1ff-52d5435311fa","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.202104Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:1215d719d74d3389de0c2f9ecf7ef1eaa677c46b74c1e44d5eb266844f074a7f","observation_id":"9511828c-f62d-4486-9488-6da528c69c60","resolution":{"observed_at":"2026-08-07T14:12:41.759632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-07T14:12:39.269432Z","title":"Zero-shot robotic manipulation with pretrained image- editing diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.269432Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:06db2572c66a487bc8f9ea0ddc9d8c52607f4b41ae900fbc7701aace3fe8066d","observation_id":"1ae77ca1-1927-4e32-9360-ba9b95853b56","resolution":{"observed_at":"2026-08-07T14:12:39.269432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:41.436177Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":"2f2c6829-e896-4abe-bc4f-68c37e7b0a23","year":2021},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.364186Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:51fcdebd0e4ccd79211f60313447544ee00bf4ca738ecbd76bcc4e97203ad349","observation_id":"d21e32e1-5bce-4843-90c4-0721f22ba25d","resolution":{"observed_at":"2026-08-07T14:12:41.510138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:41.241662Z","title":"Taming transformers for high- resolution image synthesis,","venue":null,"work_id":"0191ba59-3dd7-4b8f-9608-cd2b5bbd6447","year":2021},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.441829Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:95c6c00dc69e36e6a232291edb98bff803c2f5a688dbaddc7f20760438a7126d","observation_id":"ccc18db5-19c4-420e-924e-28ccc8f14de0","resolution":{"observed_at":"2026-08-07T14:12:41.358889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:41.078635Z","title":"Exploration by random network distillation,","venue":null,"work_id":"4961b91d-2a8d-4a91-8f12-6c7f929a71d2","year":2019},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.528360Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:5b48346380e88f9246635fba2c59260bf617b0b0bfedfc5c2b4031b255ff8bb2","observation_id":"fb8dedd4-20e4-4fdc-8dba-e18dfc216d01","resolution":{"observed_at":"2026-08-07T14:12:41.189959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:40.891300Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning,","venue":null,"work_id":"01b9f4ac-6f67-4320-8a87-2b2c2c228d14","year":2019},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.628179Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:8b3c8426a33e849bf8d598cbbb29ed33a3bdaa034d73fecb8db282f218e74b82","observation_id":"e74a59dc-86ef-468c-b20e-0455c97b71e1","resolution":{"observed_at":"2026-08-07T14:12:40.969274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:47.472612Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":"fda8d720-da67-47aa-8ea2-91819662dfe3","year":2021},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.707397Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:312bc2ca3bc0c1f390bee6e49c2938293ba5e1f2e33c78eb8d79015e8e0fe75f","observation_id":"0d2eb78e-a383-4876-ad14-476908a4ada9","resolution":{"observed_at":"2026-08-07T14:12:47.571243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:40.651887Z","title":"Mastering visual continuous control: Improved data-augmented reinforcement learning,","venue":null,"work_id":"0f9a6828-03f4-4a68-9d78-0b85e42360f1","year":2022},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.778904Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:4561fb6ca03687c1d19312fc630400a4a68553822c342f2e8c08f89d869d860e","observation_id":"d859a0c4-18ee-4edd-a98c-5bd354ebe924","resolution":{"observed_at":"2026-08-07T14:12:40.768703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21845","last_updated":"2025-03-20T09:16:05Z","snapshot_observed_at":"2026-07-06T19:41:24.411424Z","submitted_at":"2024-10-29T08:12:20Z","title":"Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21845","snapshot_observed_at":"2026-08-07T14:12:39.869877Z","title":"Precise and dexterous robotic manipulation via human-in-the-loop reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.869877Z"},"links":{"cited_paper":"/paper/2410.21845","citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:de265a87726575c7a0aade6dabe6cdd5babc89b9a05dd134982b4273c85922ef","observation_id":"317c1489-65bc-4a26-9f5b-844fd14b6e39","resolution":{"observed_at":"2026-08-07T14:12:39.869877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:40.353085Z","title":"Con- trolvideo: Training-free controllable text-to-video generation,","venue":null,"work_id":"3ea3d002-7e91-443c-a551-373d6d82ea47","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.930879Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:7f26a92c114b63e502d0a8c26df34e732b1b9dbf6671ca3c411c291a0b96539f","observation_id":"83a06b74-1583-4d1f-9d23-e07fc8b507cc","resolution":{"observed_at":"2026-08-07T14:12:40.468780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:40.141822Z","title":"Ldr: Learning discrete representa- tion to improve noise robustness in multiagent tasks,","venue":null,"work_id":"ae04ea86-1092-4fe1-8a07-0c99a9a47aa4","year":2025},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.980717Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:39fed761ae62683ff24ad7d25b03afb6df5ac66c015e6360dab7a8b7a44677aa","observation_id":"242fe782-a447-48be-b781-d5e518ed0b1d","resolution":{"observed_at":"2026-08-07T14:12:40.214633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T14:04:25.278100Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":49},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2505.19769."}