{"as_of":"2026-08-17T05:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26646534946572542cceeb567f5172a3efdcaad98989dad1e8cacad337bae7b5","coverage":[{"denominator":99,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":99,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:12:55.177124Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T01:02:33.115136Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T21:33:59.294961Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"cited_work":{"arxiv_id":"2505.07817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07817","snapshot_observed_at":"2026-06-29T21:33:59.294961Z","title":"Pixel motion as universal representation for robot control","venue":null,"work_id":"f2fbbcd5-5e42-4635-b4fd-db6167380096","year":2025},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2505.07817","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:ef508148b16e611e841d7dfabf8bab394c6f44800dc328f7faee2077cd96344f","observation_id":"a403d4c8-0729-4cf5-8930-45045c11642f","resolution":{"observed_at":"2026-05-16T15:42:41.509367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"cited_work":{"arxiv_id":"2505.07817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07817","snapshot_observed_at":"2026-06-29T21:33:59.294961Z","title":"Pixel motion as universal representation for robot control","venue":null,"work_id":"f2fbbcd5-5e42-4635-b4fd-db6167380096","year":2025},"citing_paper":{"arxiv_id":"2605.23856","last_updated":"2026-05-22T17:08:37Z","snapshot_observed_at":"2026-07-06T23:33:59.210165Z","submitted_at":"2026-05-22T17:08:37Z","title":"Point Tracking Improves World Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-25T03:51:10.921839Z"},"links":{"cited_paper":"/paper/2505.07817","citing_paper":"/paper/2605.23856"},"observation_digest":"sha256:c237455b510496059372841b3dc2598b845cfe999f95c30c8d2cd9cf5d988950","observation_id":"efffbfc7-01ee-48bc-ab2b-e7b7dc56b9f7","resolution":{"observed_at":"2026-05-25T03:56:37.185041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"cited_work":{"arxiv_id":"2505.07817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07817","snapshot_observed_at":"2026-06-29T21:33:59.294961Z","title":"Pixel motion as universal representation for robot control","venue":null,"work_id":"f2fbbcd5-5e42-4635-b4fd-db6167380096","year":2025},"citing_paper":{"arxiv_id":"2605.25829","last_updated":"2026-05-25T13:28:33Z","snapshot_observed_at":"2026-08-02T07:58:35.491806Z","submitted_at":"2026-05-25T13:28:33Z","title":"OASIS: Observation-Action Space Alignment via SE(3) Trajectory Prediction for Robotic Manipulation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T21:27:26.682689Z"},"links":{"cited_paper":"/paper/2505.07817","citing_paper":"/paper/2605.25829"},"observation_digest":"sha256:d8b28292a40256ce506de480e4c1733dd150fac1a5319b061339d175d3e56bfd","observation_id":"1683184d-5b0a-42f4-bcfc-4fb682196d5f","resolution":{"observed_at":"2026-06-29T21:33:59.296739Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07817","snapshot_observed_at":"2026-08-05T00:16:06.186485Z","title":"arXiv preprint arXiv:2505.07817 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00793","last_updated":"2026-08-06T05:24:35Z","snapshot_observed_at":"2026-08-15T20:05:33.691717Z","submitted_at":"2026-08-01T17:49:39Z","title":"DynamicWAM: Dual-Path Motion Conditioning for World-Action Models in Dynamic Manipulation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T00:16:06.186485Z"},"links":{"cited_paper":"/paper/2505.07817","citing_paper":"/paper/2608.00793"},"observation_digest":"sha256:a77d17bfb6c5f84d4e4624a2105ef6e3bae16577f6ae4eaf64df2747a7c771e5","observation_id":"0eb571eb-9903-4074-a40b-614adabc6a67","resolution":{"observed_at":"2026-08-05T00:16:06.186485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07817","snapshot_observed_at":"2026-08-07T01:02:33.115136Z","title":"arXiv preprint arXiv:2505.07817 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00793","last_updated":"2026-08-06T05:24:35Z","snapshot_observed_at":"2026-08-15T20:05:33.691717Z","submitted_at":"2026-08-01T17:49:39Z","title":"DynamicWAM: Dual-Path Motion Conditioning for World-Action Models in Dynamic Manipulation","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T01:02:33.115136Z"},"links":{"cited_paper":"/paper/2505.07817","citing_paper":"/paper/2608.00793"},"observation_digest":"sha256:662014d7d5ac7131be86ecd5d0bb2701834dc5a31d90e7cc18e97fdd56963473","observation_id":"6255cc89-021c-400e-98d5-026a51ec4025","resolution":{"observed_at":"2026-08-07T01:02:33.115136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.07817/citation-record","integrity":"/paper/2505.07817/integrity","json":"/paper/2505.07817/citation-record.json","paper":"/paper/2505.07817"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.749696Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.749696Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:a281513068aa4bc313ce9d9bc6121e67915d58b9c81506c7b7f86c7d59632d28","observation_id":"7e919ead-7912-4d66-9ea6-16ba96cf48c9","resolution":{"observed_at":"2026-08-15T22:12:54.749696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.755719Z","title":"Learning optical flow from still images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.755719Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:34fbc511807cffb374eae50e101c5408f27691f5e19d7588bebacdd6f5d44f8b","observation_id":"78b358f5-8ecf-45d0-8675-7b900ea73a08","resolution":{"observed_at":"2026-08-15T22:12:54.755719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.761398Z","title":"Flowcontrol: Optical flow based visual servoing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.761398Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:ca03eb2f8a37b267564e6fd1bd1380319bbe45a7db75fa66fd769bc10fddb4ac","observation_id":"3b37c26b-22f4-41b8-a065-c50b5605b3ca","resolution":{"observed_at":"2026-08-15T22:12:54.761398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.765987Z","title":"Rheotropism in fishes","venue":null,"work_id":null,"year":1974},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.765987Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:0c766ac22739b1aadac7abda1dab890c5ea91882c46489962fb6113bd86114c0","observation_id":"e66aa6d1-74d2-4e8e-855b-b086be674a0b","resolution":{"observed_at":"2026-08-15T22:12:54.765987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.770497Z","title":"Human-to-robot imitation in the wild","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.770497Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:8751af155e84a841a850223f4919dc9c78562e73337d7f6ada691033a9772039","observation_id":"1a85b3fa-007b-40d5-8fe2-a10756e85103","resolution":{"observed_at":"2026-08-15T22:12:54.770497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.776113Z","title":"Srinivasan","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.776113Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:2c63f6afca502fb3663a514ffeb9b1d504ac75f6b384e13a96801844c84f812b","observation_id":"221d87fc-0b54-4d60-a895-99a232280bdb","resolution":{"observed_at":"2026-08-15T22:12:54.776113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-08-15T10:07:25.118684Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-15T22:12:54.780124Z","title":"Rt-h: Action hierarchies using language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.780124Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:f2ca1bc3f2a5271c823db0fee2668050cad2fed64c8e075af589f385fd0aa411","observation_id":"19fac862-d225-4114-bf06-c94ca64ed74e","resolution":{"observed_at":"2026-08-15T22:12:54.780124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.784756Z","title":"Gen2act: Human video generation in novel scenarios enables generalizable robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.784756Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:e5a683e4acc09d5963adb8d5f4048f489af00c1ffb2b64b9df33cc95fddde573","observation_id":"b521d8b9-1fdb-4d38-ba36-162cf5d9e6c8","resolution":{"observed_at":"2026-08-15T22:12:54.784756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.788797Z","title":"Track2act: Predicting point tracks from internet videos enables diverse zero-shot robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.788797Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:e1e4c9eb3f586e75409eb0829b7b614cb40440e4663cae39d8599b4fca6544f4","observation_id":"7da14d19-e5f3-4d01-aa02-213329ffd141","resolution":{"observed_at":"2026-08-15T22:12:54.788797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-15T22:12:54.793715Z","title":"Zero-shot robotic manipulation with pretrained image-editing diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.793715Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:5a87e4b3861dbb38c463b989145bf79634c3272b8faab919155377b0395e58e7","observation_id":"b698935f-eef1-45e0-a970-1542bc53d536","resolution":{"observed_at":"2026-08-15T22:12:54.793715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-15T22:12:54.798794Z","title":"0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.798794Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:1d0e80879d66523cbe5324bd1945760b3a5ab266b50e225faea0f264ae50623b","observation_id":"eee0df70-abec-404b-94e1-542ff9137572","resolution":{"observed_at":"2026-08-15T22:12:54.798794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-15T22:12:54.803313Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.803313Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:f3f03deeb31cbcfce70b752e7398f27c1ee071f6ce6e49d7fe1a431c6b5d3902","observation_id":"a8b0457c-0e62-486a-89a6-4bf6b5d246ec","resolution":{"observed_at":"2026-08-15T22:12:54.803313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.807560Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.807560Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:a97f5d9ae9567f3ed0439de677cab36f80dbe8a043d2e5821a4b8c11e2c06d2c","observation_id":"81027738-6dac-4172-b089-d1f727d64862","resolution":{"observed_at":"2026-08-15T22:12:54.807560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.811547Z","title":"John, Noah Constant, Mario Guajardo-Cespedes, Steve Yuan, Chris Tar, Yun-Hsuan Sung, Brian Strope, and Ray Kurzweil","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.811547Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:46646f3902c483cdfcb50bd56fc7dfa7041e0f1e89a144db2734700251a88c3a","observation_id":"d8be0fd0-4710-4962-a1d7-ae91bc7b34c8","resolution":{"observed_at":"2026-08-15T22:12:54.811547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-08-06T13:23:03.968769Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15493","snapshot_observed_at":"2026-08-15T22:12:54.815642Z","title":"Gr-3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.815642Z"},"links":{"cited_paper":"/paper/2507.15493","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:b72aed2d02e977690052bd0d5adc4dc134cff172b6d52a82fae20043a8d079a1","observation_id":"6f00f81a-8edb-40a5-9cf6-addda83d17c6","resolution":{"observed_at":"2026-08-15T22:12:54.815642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.820173Z","title":"In-The-Wild","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.820173Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:719d7bf42559b84f4cc05685ec5d5b35b96c1f45bde9d02daffe9d9a1f95ffe2","observation_id":"3fc90b2d-c690-423e-8d35-afcc659b6941","resolution":{"observed_at":"2026-08-15T22:12:54.820173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06240","last_updated":"2024-04-08T14:42:36Z","snapshot_observed_at":"2026-08-16T15:09:03.997040Z","submitted_at":"2023-08-11T17:19:09Z","title":"Superconducting nitridized-aluminum thin films","version":2},"cited_work":{"arxiv_id":"2308.06240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06240","snapshot_observed_at":"2026-08-15T22:12:55.703789Z","title":"Superconducting nitridized-aluminum thin films","venue":"cond-mat.supr-con","work_id":"97bfa27b-e230-46f4-ae41-51debf4cd93a","year":2023},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.823764Z"},"links":{"cited_paper":"/paper/2308.06240","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:1db286afb24ffe549abba083c034c9729514e1c0eb75796bb63e5a9c4e1383d7","observation_id":"126cd332-2245-4614-97d7-ad8a8d0a2fdd","resolution":{"observed_at":"2026-08-15T22:12:55.708836Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-15T22:12:54.828698Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.828698Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:4a514f0b27089d07d7c52ac3157a4423e817668be667575183c71834b3f24cc5","observation_id":"ce491a49-00ad-4d6d-95a2-99da32435beb","resolution":{"observed_at":"2026-08-15T22:12:54.828698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.832746Z","title":"de Croon, Christophe de Wagter, and Tobias Seidl","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.832746Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:85fbee295b65232829553419ef7df54672536136e74fc83876aa6cdae3bb53fd","observation_id":"805da579-8d25-4bb7-a1d9-719c51fdbe13","resolution":{"observed_at":"2026-08-15T22:12:54.832746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.836604Z","title":"Diffusion Models Beat GANs on Image Synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.836604Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:c4bedf899947c364c6463602932dcdd177fd52d58ce7ddf6cb09120758382e5c","observation_id":"ef17e9d6-af6d-4dab-9887-e0b9cf42a05b","resolution":{"observed_at":"2026-08-15T22:12:54.836604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-15T22:12:54.840362Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.840362Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:c5f6db9b2c77fe205ba2aceed69a472a80c827649e3508345ee5ed0d4feac5fc","observation_id":"62b60153-e664-466e-a2dd-f9c7622a049f","resolution":{"observed_at":"2026-08-15T22:12:54.840362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.844979Z","title":"Reduce, Reuse, Recycle: Compositional Generation with Energy-Based Diffusion Models and MCMC","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.844979Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:d54a6cd2bebc1ce3147f5c1c5cb8573b8932662462f596c12a11a9907aae89ed","observation_id":"99dadb1c-e963-4132-8608-f52889bac7a3","resolution":{"observed_at":"2026-08-15T22:12:54.844979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00111","last_updated":"2023-11-20T05:38:13Z","snapshot_observed_at":"2026-08-16T15:58:41.194108Z","submitted_at":"2023-01-31T21:28:13Z","title":"Learning Universal Policies via Text-Guided Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00111","snapshot_observed_at":"2026-08-15T22:12:54.849125Z","title":"Learning Universal Policies via Text-Guided Video Generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.849125Z"},"links":{"cited_paper":"/paper/2302.00111","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:86fd996638da2759a60d48f4fcebe42f9a2f8dfe3e515d7bbc5048ac2b68c10f","observation_id":"4bcdc975-60c8-4fb4-9dab-11aea8e063d3","resolution":{"observed_at":"2026-08-15T22:12:54.849125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.853182Z","title":"Deep Visual Foresight for Planning Robot Motion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.853182Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:f7dc7e927dab8e171ca1abc1202228fc2ee0684692e4d733aa6ff4fd12489b5a","observation_id":"62437a17-6854-4655-bae6-e97d646b247a","resolution":{"observed_at":"2026-08-15T22:12:54.853182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.857349Z","title":"Flip: Flow-centric generative planning as general-purpose manipulation world model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.857349Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:1ae6ae48b08b80eded409dbab604db060c7d1bf65c2890ad77c640b0fa914cd8","observation_id":"491efba8-76bf-4d0a-a619-63f51745c792","resolution":{"observed_at":"2026-08-15T22:12:54.857349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.861453Z","title":"Im2flow: Motion hallucination from static images for action recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.861453Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:be90ca60ac2e2014ff3c7d5d7a457ed0d8c022adb89f49462f71b855144a4b10","observation_id":"ec0b95e1-6b07-4a0f-973e-b72f4ac5b8fb","resolution":{"observed_at":"2026-08-15T22:12:54.861453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.865332Z","title":"Long video generation with time-agnostic vqgan and time-sensitive transformer, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.865332Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:e5ee75e37239630b16b9a6e3bbbe7d490736a0214279c7cb0aa5eaa3d2d8eaa0","observation_id":"494dd0d0-26ca-41dc-9908-ab8bf3f145e6","resolution":{"observed_at":"2026-08-15T22:12:54.865332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.869405Z","title":"Flight control in drosophila by visual perception of motion","venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.869405Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:6413ab9e3c73b95f34d21f96ad2ac70ad66f5349105b594ff53fc557d8690a12","observation_id":"d4546c1a-f3ec-468b-a0e2-626194d6bcb5","resolution":{"observed_at":"2026-08-15T22:12:54.869405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14897","last_updated":"2026-04-25T05:18:57Z","snapshot_observed_at":"2026-07-06T15:08:15.836938Z","submitted_at":"2023-03-27T03:12:24Z","title":"Seer: Language Instructed Video Prediction with Latent Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14897","snapshot_observed_at":"2026-08-15T22:12:54.873277Z","title":"Seer: Language instructed video prediction with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.873277Z"},"links":{"cited_paper":"/paper/2303.14897","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:8273a7e7e4acdce4bedde8b33197cf59ddff0c13d12551e79ea59d7657a066bc","observation_id":"ed342b03-648b-43d9-8582-5a4156666847","resolution":{"observed_at":"2026-08-15T22:12:54.873277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.09709","last_updated":"2021-01-11T20:53:18Z","snapshot_observed_at":"2026-08-16T19:12:21.425341Z","submitted_at":"2020-10-19T17:59:01Z","title":"Self-supervised Co-training for Video Representation Learning","version":2},"cited_work":{"arxiv_id":"2010.09709","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.09709","snapshot_observed_at":"2026-08-15T22:12:55.641694Z","title":"Self-supervised Co-training for Video Representation Learning","venue":"cs.CV","work_id":"b52d0447-ebaf-4c97-bdb7-075d4a0ab788","year":2020},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.877505Z"},"links":{"cited_paper":"/paper/2010.09709","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:d48f6fa218edc5d6e26fd4ccaba79d7a950f14840ec19289e085aeb230ee27d2","observation_id":"d9a2bba6-8360-47ab-9cb0-f5ef94b7539f","resolution":{"observed_at":"2026-08-15T22:12:55.646645Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:54.882215Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.882215Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:ae579fffc8d00f57c4cd6e7d284896d1a8cdb3080e772fbb5d7487996b939edb","observation_id":"6b7a815b-960e-4731-a574-4f5ae4b42d74","resolution":{"observed_at":"2026-08-15T22:12:54.882215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.313094Z","title":"Video Diffusion Models","venue":null,"work_id":"be87a732-5f6b-4829-9abd-fc3e75430e47","year":2022},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.886040Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:a901d722ddcc0d0aa7e37b367533c6ef64f3c5210240069ab80eefec8693f869","observation_id":"bf216347-338b-4908-bb6b-de9700949b65","resolution":{"observed_at":"2026-08-15T22:12:56.317509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04413","last_updated":"2025-04-19T08:02:11Z","snapshot_observed_at":"2026-08-16T13:02:13.865908Z","submitted_at":"2024-11-07T04:06:57Z","title":"Seeing Through Pixel Motion: Learning Obstacle Avoidance from Optical Flow with One Camera","version":2},"cited_work":{"arxiv_id":"2411.04413","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04413","snapshot_observed_at":"2026-08-15T22:12:55.625887Z","title":"Seeing Through Pixel Motion: Learning Obstacle Avoidance from Optical Flow with One Camera","venue":"cs.RO","work_id":"74825bea-95f5-4975-8374-710e6f84ac0b","year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.889800Z"},"links":{"cited_paper":"/paper/2411.04413","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:edcbb396c249079b6e7884e93c31072a67cb62f853d5e97f93747277350e8c1e","observation_id":"4067b911-21dc-4dae-b5ce-93bcecfa51c6","resolution":{"observed_at":"2026-08-15T22:12:55.630131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.297315Z","title":"Video prediction policy: A generalist robot policy with predictive visual representations","venue":null,"work_id":"c95f4eee-3a19-4988-8703-8805db16600e","year":2025},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.893986Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:ea612435b2a26a53e589a1d0565d5ada34f368a0827d4048975e42043bc589be","observation_id":"a258e473-a430-45dc-91de-88a32b4a4216","resolution":{"observed_at":"2026-08-15T22:12:56.302859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.282208Z","title":"Rekep: Spatio-temporal reasoning of relational keypoint constraints for robotic manipulation","venue":null,"work_id":"c880109b-b10a-4fc4-a957-c348302698ac","year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.898178Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:9a5493aba6cf8848e618479d9af6c7dfb6b96a2fc41ad93ae71ca87eb7618465","observation_id":"67a17fce-1335-410d-8b93-60385ad776a8","resolution":{"observed_at":"2026-08-15T22:12:56.287141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.265817Z","title":null,"venue":null,"work_id":"93659fd7-cad6-447d-bc54-70af2d02a414","year":2025},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.903082Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:a02910bb6086448c8d501cc6e30c7836f8d6e23090c84118f48af532c872a41f","observation_id":"d813ec95-42c0-45e0-96cf-d1a5a210d87a","resolution":{"observed_at":"2026-08-15T22:12:56.270530Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.251507Z","title":"Tenenbaum, and Sergey Levine","venue":null,"work_id":"23e94acd-b9b8-4113-bafe-91648a6a570d","year":2022},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.907989Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:0de775948fa54b74f496efa8a63c356d952f0e3a536f663802e33d75d7a5d60d","observation_id":"587a2024-1c38-4466-babe-6698b731e2c1","resolution":{"observed_at":"2026-08-15T22:12:56.256688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06170","last_updated":"2025-03-12T13:52:50Z","snapshot_observed_at":"2026-08-16T12:51:57.554911Z","submitted_at":"2025-03-08T11:17:37Z","title":"Object-Centric World Model for Language-Guided Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06170","snapshot_observed_at":"2026-08-15T22:12:54.911523Z","title":"Object-centric world model for language-guided manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.911523Z"},"links":{"cited_paper":"/paper/2503.06170","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:97daaf1a663d92b0fca2fcfcd6a4e6c84596c2cfcd91c6b625df9f170e4425c3","observation_id":"ef8cea9a-7ff8-4cf7-8526-fa96d3849c44","resolution":{"observed_at":"2026-08-15T22:12:54.911523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.234623Z","title":"Thinking, fast and slow, 2011","venue":null,"work_id":"fa726024-7177-4d20-b0c3-6d1d7ead80c3","year":2011},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.915605Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:b3e3f53b4877229b74368da037b414f26ea2efa0f0d17665e8df97a0e5eb51b1","observation_id":"01b127ef-18ef-4014-8a20-3af2649e2d77","resolution":{"observed_at":"2026-08-15T22:12:56.240709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-15T22:12:54.919593Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.919593Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:220c0c46e9555968f4517e74fb6b4a0a1b1a05e6350c0d02fb04d4b15470771c","observation_id":"7af56078-8abf-491c-801f-88ad92109a2a","resolution":{"observed_at":"2026-08-15T22:12:54.919593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08576","last_updated":"2023-10-12T17:59:23Z","snapshot_observed_at":"2026-08-16T14:52:35.031233Z","submitted_at":"2023-10-12T17:59:23Z","title":"Learning to Act from Actionless Videos through Dense Correspondences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08576","snapshot_observed_at":"2026-08-15T22:12:54.923559Z","title":"Learning to act from actionless videos through dense correspondences","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.923559Z"},"links":{"cited_paper":"/paper/2310.08576","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:4d39d9b6991c87f2e6ca58043126c0dda7ca85f6ee4fe16efe07f6c5ad095811","observation_id":"e3507de8-6a0f-455f-9bed-dda6797d19aa","resolution":{"observed_at":"2026-08-15T22:12:54.923559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.219790Z","title":"Onlyflow: Optical flow based motion conditioning for video diffusion models, 2024","venue":null,"work_id":"17668455-7558-439b-a4cf-58a25cdc9a70","year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.928516Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:77649f2c47d46abab7d24ec7e951d668eb34df71d0be75bb843110d8d0c5eeba","observation_id":"6ab74074-2a51-4d1f-a020-ecf0051f2afc","resolution":{"observed_at":"2026-08-15T22:12:56.224435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.204885Z","title":"Multi-concept customization of text-to-image diffusion, 2023","venue":null,"work_id":"33ebe6ac-7bdb-4e83-a63a-d9258e14a46d","year":2023},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.932672Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:e8f84eb7b3797452f0eeec9613bb4e69b995459d71f958e1dd51e61b3d05d277","observation_id":"d710e925-f0b7-47eb-a4aa-656e16ead04e","resolution":{"observed_at":"2026-08-15T22:12:56.209410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.191301Z","title":"Learning Plannable Representations with Causal InfoGAN","venue":null,"work_id":"ab20643b-a766-48c8-a39c-6ed0e99611fc","year":2018},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.937742Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:fb613366adcbfb7687cae7f11b846a81f1b8a88da834badf7db928d1f99046bf","observation_id":"09a9898e-f15a-4e83-bc70-f7a1f52a1f9b","resolution":{"observed_at":"2026-08-15T22:12:56.196000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.176770Z","title":"Learning Robot Activities from First-Person Human Videos Using Convolutional Future Regression","venue":null,"work_id":"f2512800-042a-43e7-b51c-901caa3a951a","year":2017},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.941503Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:9e47f867b2451930ab8f3cfa45a400e0ca8ce9d40c971aa16e4e2c6054688ac6","observation_id":"f8b9b64b-92da-4f94-b6d4-617d7f942bc9","resolution":{"observed_at":"2026-08-15T22:12:56.182538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.161828Z","title":"Molmoact: Action reasoning models that can reason in space","venue":null,"work_id":"a1786104-edaf-4b89-8a09-31dd0ae74eec","year":2025},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.945402Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:d9dbbf4612c04956f942620723e08f83bab86ceb6a3d6b2105ac20f798d21788","observation_id":"ffb2b12d-8e3e-4578-b18a-2bd42d9593c2","resolution":{"observed_at":"2026-08-15T22:12:56.166574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.147849Z","title":"Theodorou","venue":null,"work_id":"0a7a344a-53a6-47a0-af62-559694adbae4","year":2020},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.949535Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:1c48745774164230e2f0d9f35d7d7b690bf86e8edfcf100926c6ce9568154987","observation_id":"aa44993b-a3f4-4f4d-9958-575d4a682c31","resolution":{"observed_at":"2026-08-15T22:12:56.152611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20095","last_updated":"2025-01-30T17:34:37Z","snapshot_observed_at":"2026-08-16T13:38:39.507024Z","submitted_at":"2024-06-28T17:59:12Z","title":"LLaRA: Supercharging Robot Learning Data for Vision-Language Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20095","snapshot_observed_at":"2026-08-15T22:12:54.954161Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.954161Z"},"links":{"cited_paper":"/paper/2406.20095","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:9e1566d405c992b184d7bd219242633b4c4bdfcd46363743983d8dd730b9c551","observation_id":"be8c60bd-3dff-48aa-8ff2-c0ec98644c23","resolution":{"observed_at":"2026-08-15T22:12:54.954161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.133551Z","title":"Movideo: Motion-aware video generation with diffusion model","venue":null,"work_id":"5a8a4d97-bae0-46b5-a723-d8e3b3d377a3","year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.958342Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:7799e49397ccea9d1f2d26a4b965a9646add7eae8c0bb5f7483d047a9975c6fc","observation_id":"e8d673e4-ef9c-497c-be04-c04c7b49a9a1","resolution":{"observed_at":"2026-08-15T22:12:56.138072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.120031Z","title":"Selflow: Self-supervised learning of optical flow","venue":null,"work_id":"ed0c253d-55da-4009-b527-c509dd782ec2","year":2019},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.963531Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:f9efea408de9209525f45ec913384d05fcf8601fc60efa2ef9de711d7b20d0aa","observation_id":"21ecfb7f-aea4-4f11-a59c-a9b36a07383a","resolution":{"observed_at":"2026-08-15T22:12:56.124629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.104575Z","title":"StructDiffusion: Language-Guided Creation of Physically-Valid Structures using Unseen Objects","venue":null,"work_id":"cad73972-511d-4b94-8a10-8e3dbdc653d7","year":2023},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.967692Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:b46e14bbddb7f250f621525e937a48ba8d742cdbb37dac027e00c1cd30216358","observation_id":"7c17e01a-48ce-4170-9e57-95f258ad881d","resolution":{"observed_at":"2026-08-15T22:12:56.109919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.089221Z","title":"Flowdiffuser: Advancing optical flow estimation with diffusion models","venue":null,"work_id":"1f340e85-6895-4527-8e25-6751dd671cb3","year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.972590Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:6988c472cc4cef67ed62fb8017a0dc366b556dd7396020461ba59f6e2636d9be","observation_id":"aeb51c70-f790-4c1b-b815-9a976c311c0c","resolution":{"observed_at":"2026-08-15T22:12:56.094140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.074770Z","title":"Calvin: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks","venue":null,"work_id":"1df55abb-9ae4-48ee-8948-2671b4f5de7e","year":2021},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.977059Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:0a53eb757ae8385378854b49cf47a928979174dbe98513020d0927980699a3ef","observation_id":"0e0fd7cf-2bbe-437a-a4f8-ccf16c497b96","resolution":{"observed_at":"2026-08-15T22:12:56.080278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.059826Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","venue":null,"work_id":"01451f06-e643-4487-b3e4-39c88b6ebd5b","year":2022},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.980932Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:6bfa14b072a744170a394cdaab27db5c1799f7c57eaf9bbb54614fd5fd210327","observation_id":"1037ef11-968e-4a24-97eb-9251b78d61fd","resolution":{"observed_at":"2026-08-15T22:12:56.065045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11815","last_updated":"2024-06-17T17:55:29Z","snapshot_observed_at":"2026-08-16T13:42:08.042355Z","submitted_at":"2024-06-17T17:55:29Z","title":"LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11815","snapshot_observed_at":"2026-08-15T22:12:54.984719Z","title":"Llarva: Vision-action instruction tuning enhances robot learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.984719Z"},"links":{"cited_paper":"/paper/2406.11815","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:7b5d5a801a02f492ba8b5fdf9bc53365ab09c16da7385815ba25b9dec4c5a9c4","observation_id":"013774cc-b1e7-436a-9cc5-ed7e4d8a81a3","resolution":{"observed_at":"2026-08-15T22:12:54.984719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-15T22:12:54.988865Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.988865Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:02343dc49b5e5d6fcd3332bc4f9c98c50205714f47b5008fae3c001445d21fa0","observation_id":"d71d82dc-9417-413d-8e25-9e51c23fc5d0","resolution":{"observed_at":"2026-08-15T22:12:54.988865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.043879Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":"c52b2fad-020c-4f38-81a1-877a5c67ddea","year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.993496Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:2cd7abf5f695137ffa0df17acca45a1ec0ea7a4b923acbca9f73465ac6ecd65b","observation_id":"0b6f8b73-6f2d-489e-bc30-af23a21de111","resolution":{"observed_at":"2026-08-15T22:12:56.050051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-15T22:12:54.997751Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:54.997751Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:f3d7c62078c4b7db36cee83e8e53c85d85314d79c21e7066e41c0a310e903fd4","observation_id":"fd7228ba-4014-4861-881b-dd8ad4d58d06","resolution":{"observed_at":"2026-08-15T22:12:54.997751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.030132Z","title":"The Surprising Effectiveness of Representation Learning for Visual Imitation","venue":null,"work_id":"5f1544b9-4639-4b6d-8341-a7729323d6f4","year":2022},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.001981Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:3d733f7c2bb52492554961bee1779f345e2aef4d506c257955a3233685719f7e","observation_id":"c0e30bbd-ed00-4270-8e1e-afcb790afffc","resolution":{"observed_at":"2026-08-15T22:12:56.034284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.005689Z","title":"Language models are unsupervised multitask learners, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.005689Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:f5b35e466a858e2cc02ed0cabb521b56f01f5e170a08c56aef9b28639afbb6fb","observation_id":"cdf3dfca-98ec-4242-8c23-270a5775d487","resolution":{"observed_at":"2026-08-15T22:12:55.005689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-15T22:12:55.009774Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.009774Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:5f50c19094e4813060602ce20503d5ebcef10b4d2ef804e049f8e03c9f296a21","observation_id":"eecfdd42-9374-4214-8239-94d332220901","resolution":{"observed_at":"2026-08-15T22:12:55.009774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:56.010185Z","title":"A generalist agent","venue":null,"work_id":"302ab40d-0361-493e-bab4-116f8765a1c3","year":2022},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.014568Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:b7fa99d162f6f9c35abcbbf686fba6306862d908581d568819c0cd0dc6199c67","observation_id":"82a4919c-73aa-4460-a803-ded849f1e504","resolution":{"observed_at":"2026-08-15T22:12:56.014480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.018736Z","title":"Motion tracks: A unified representation for human-robot transfer in few-shot imitation learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.018736Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:610b170b39a2c82e99f5304c2065441757de7c27ce0a493c083147fd3e2fbe47","observation_id":"3958c491-b294-4844-8753-340411024397","resolution":{"observed_at":"2026-08-15T22:12:55.018736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.12315","last_updated":"2023-04-14T14:39:54Z","snapshot_observed_at":"2026-08-16T16:22:04.347149Z","submitted_at":"2022-10-22T00:41:17Z","title":"Diffusion Motion: Generate Text-Guided 3D Human Motion by Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.12315","snapshot_observed_at":"2026-08-15T22:12:55.023180Z","title":"Diffusion motion: Generate text-guided 3d human motion by diffusion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.023180Z"},"links":{"cited_paper":"/paper/2210.12315","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:4710135835758e082b74729e38c9b71e76ddddae0c212e001c36258ecdef0e85","observation_id":"67dc76cb-9b5c-41f8-8b18-eeaea24ba5d2","resolution":{"observed_at":"2026-08-15T22:12:55.023180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.027741Z","title":"U-net: Convolutional networks for biomedical image segmentation, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.027741Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:aabfbf4145c9466f0316e133d34c6879c721a8d9cfd3160e8b8d8e4c1742deec","observation_id":"cd5c73b8-0761-4084-9fbd-f75753803ae1","resolution":{"observed_at":"2026-08-15T22:12:55.027741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.989612Z","title":"Ros and Andrew A","venue":null,"work_id":"bdee357b-2172-4ac4-a951-829ab8079952","year":2016},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.033084Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:c3f0658fd2fae5a5e7c86e2d9398d4f9475b547a189368774dcd26343030e0d8","observation_id":"d16af67d-18a0-4d88-bdbc-5e4c9bdc7980","resolution":{"observed_at":"2026-08-15T22:12:55.994209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01923","last_updated":"2023-12-06T04:19:29Z","snapshot_observed_at":"2026-08-16T15:26:59.595247Z","submitted_at":"2023-06-02T21:26:20Z","title":"The Surprising Effectiveness of Diffusion Models for Optical Flow and Monocular Depth Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01923","snapshot_observed_at":"2026-08-15T22:12:55.037499Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.037499Z"},"links":{"cited_paper":"/paper/2306.01923","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:18c62618fac498951e4b16e1240bbf717b0c708dc3e66d27713ca28fb9e47f0f","observation_id":"45d71a07-9d45-41c1-bd8c-25cb02d063da","resolution":{"observed_at":"2026-08-15T22:12:55.037499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.976979Z","title":"Concept2Robot: Learning Manipulation Concepts from Instructions and Human Demonstrations","venue":null,"work_id":"e00d94c7-b7e3-40f3-a3e6-52f4fe394104","year":2021},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.041920Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:24364ac1977dcdd8a978f214ff29a12f038fa7888371bf1179d087d774ea442f","observation_id":"571a7b32-a0d3-42ea-a653-3482fb3cd317","resolution":{"observed_at":"2026-08-15T22:12:55.980961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.963068Z","title":"Third-person visual imitation learning via decoupled hierarchical controller","venue":null,"work_id":"8268b2e3-4028-465b-91ef-0718ebf87867","year":2019},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.046167Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:b38ce2d7a8a3635caf72470452420e9a7c3b4c732505e969fe0e21ef49d067e6","observation_id":"8bd1ce42-959e-465c-b5fc-22eb7bf5dd8e","resolution":{"observed_at":"2026-08-15T22:12:55.967857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.03866","last_updated":"2022-07-08T12:50:13Z","snapshot_observed_at":"2026-08-16T16:47:23.597847Z","submitted_at":"2022-07-08T12:50:13Z","title":"Pixel-level Correspondence for Self-Supervised Learning from Video","version":1},"cited_work":{"arxiv_id":"2207.03866","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.03866","snapshot_observed_at":"2026-08-15T22:12:55.437118Z","title":"Pixel-level Correspondence for Self-Supervised Learning from Video","venue":"cs.CV","work_id":"50957d90-cb17-4912-8460-5c41ae934953","year":2022},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.050003Z"},"links":{"cited_paper":"/paper/2207.03866","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:ca351ff785b800299461c732c70e55d8bb12f543c80579139b9de11bb17a85b4","observation_id":"a8f067d7-f9e4-4379-be87-4c5ff5a79e76","resolution":{"observed_at":"2026-08-15T22:12:55.443452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.946097Z","title":"Zeromimic: Distilling robotic manipulation skills from web videos, 2025 a","venue":null,"work_id":"d176ec2a-d961-4a4f-9708-895f36d8fe18","year":2025},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.053914Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:30fd6acbc9717605367c8c17f9b3a425a714030cc748bd5c82285dbbf201437d","observation_id":"ee46f79a-00e2-4042-91a0-6a5e0b975fa8","resolution":{"observed_at":"2026-08-15T22:12:55.952184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-15T22:12:55.058096Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.058096Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:c49c92779b3c9556540eb28c0e96480ebb0f623631293bf7a5243c724e4d896a","observation_id":"1c4be4ca-def9-4848-a7c2-abf479880a69","resolution":{"observed_at":"2026-08-15T22:12:55.058096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07875","last_updated":"2024-10-08T17:43:06Z","snapshot_observed_at":"2026-08-16T13:35:20.311079Z","submitted_at":"2024-07-10T17:41:10Z","title":"Generative Image as Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07875","snapshot_observed_at":"2026-08-15T22:12:55.063154Z","title":"Generative image as action models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.063154Z"},"links":{"cited_paper":"/paper/2407.07875","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:c31669bd0f8dbf5164e34fc1dc77003a81a1aa1863f49ea3a825e59100f99e97","observation_id":"663234a5-dc0a-4091-b6bc-81df4502c42b","resolution":{"observed_at":"2026-08-15T22:12:55.063154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.068835Z","title":"Make-a-video: Text-to-video generation without text-video data, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.068835Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:6c0acd60e37cb6e5741f663f0e352743e70b7920fbac03b9b39ff755f4695787","observation_id":"ec44e0cf-e17d-40d7-9a60-f3139b3f9fa4","resolution":{"observed_at":"2026-08-15T22:12:55.068835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.922707Z","title":"Robotic Telekinesis: Learning a Robotic Hand Imitator by Watching Humans on Youtube","venue":null,"work_id":"7d9ae6b4-a999-40f4-ae9f-75804905cbf6","year":2022},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.072734Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:6a1fe8ff50965a775361d5054f30cc07785205c3dfbcf419247e423060b66c3f","observation_id":"78b32db4-8973-485c-a2f3-a20c4f54a6cd","resolution":{"observed_at":"2026-08-15T22:12:55.928388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.076392Z","title":"History-guided video diffusion, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.076392Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:7714b59ef167284498ff97751162b78e845f212892943491510a312e394b49b6","observation_id":"f911ac13-f4d4-47ef-94a0-f78de5fea16c","resolution":{"observed_at":"2026-08-15T22:12:55.076392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07147","last_updated":"2024-08-13T18:33:45Z","snapshot_observed_at":"2026-08-16T13:26:39.173661Z","submitted_at":"2024-08-13T18:33:45Z","title":"Controlling the World by Sleight of Hand","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07147","snapshot_observed_at":"2026-08-15T22:12:55.080325Z","title":"Controlling the world by sleight of hand","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.080325Z"},"links":{"cited_paper":"/paper/2408.07147","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:e9710e8cdb0af7e9780bb11e9bb5e88342da381e41784577d785ffadde44b667","observation_id":"006000ef-2824-4b90-af7c-3ed0bbece8d9","resolution":{"observed_at":"2026-08-15T22:12:55.080325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.901836Z","title":"Neural program synthesis from diverse demonstration videos","venue":null,"work_id":"f97dd61c-c06b-4ca7-ad74-693c6741a1dc","year":2018},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.084865Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:eae21733cfc4ca1953ec4d47ea0ab019aa15738f1ae489c1b275d929588efe21","observation_id":"68550694-9578-42ec-b241-f630cc50052d","resolution":{"observed_at":"2026-08-15T22:12:55.905973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.890292Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":"23f1d7d4-9b3a-452f-bbd9-96c605a1660e","year":2020},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.088983Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:2e042e68b7e5ad283efcc81ac1c661367111487075b8ddb29dec8f6190dae498","observation_id":"8e50f206-5e81-4516-b085-f271b01af635","resolution":{"observed_at":"2026-08-15T22:12:55.894065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15109","last_updated":"2024-12-19T17:52:50Z","snapshot_observed_at":"2026-07-06T20:10:19.704368Z","submitted_at":"2024-12-19T17:52:50Z","title":"Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15109","snapshot_observed_at":"2026-08-15T22:12:55.093023Z","title":"Predictive inverse dynamics models are scalable learners for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.093023Z"},"links":{"cited_paper":"/paper/2412.15109","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:ef88239889013f4a608b05a1d93379a63c17aa355abe4ede8a2501b207c29234","observation_id":"2fcd7fe9-615e-45b8-a18c-754966571a55","resolution":{"observed_at":"2026-08-15T22:12:55.093023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.878096Z","title":"Phenaki: Variable length video generation from open domain textual description, 2022","venue":null,"work_id":"7e93b911-3f28-4dde-9259-baacd3efb394","year":2022},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.097909Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:6181796e49c8c5dc54f73d2871d616f2579fc8adcc5d50357b19ccee6c077621","observation_id":"5d092bb0-930b-42c1-acf9-e77def4894eb","resolution":{"observed_at":"2026-08-15T22:12:55.882052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.865693Z","title":"Dense optical flow prediction from a static image","venue":null,"work_id":"4225b7a9-b0e8-415e-abc3-3d66b5ccc873","year":2015},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.102445Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:196bddf9c14f1717c9338c5904acd5623b1cb015f4ad05a362485ef9352bd6e5","observation_id":"cfac3b31-e61f-4d22-b12d-c26f36cda912","resolution":{"observed_at":"2026-08-15T22:12:55.870135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13335","last_updated":"2024-06-03T16:17:28Z","snapshot_observed_at":"2026-08-16T15:52:39.279682Z","submitted_at":"2023-02-26T15:40:09Z","title":"Diffusion Model-Augmented Behavioral Cloning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13335","snapshot_observed_at":"2026-08-15T22:12:55.106896Z","title":"Diffusion Model-Augmented Behavioral Cloning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.106896Z"},"links":{"cited_paper":"/paper/2302.13335","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:1b7091938c1e03d002fc26734d38dcd40031227fe0d3a3633c74a5862f04b994","observation_id":"b047333d-5cf7-4361-8071-52d85836e7bd","resolution":{"observed_at":"2026-08-15T22:12:55.106896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.851391Z","title":"Any-point trajectory modeling for policy learning","venue":null,"work_id":"0e5f7be2-a541-4245-9109-cbcfcddc9dea","year":2023},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.111731Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:e3d804da2748e1bfd1a953ec0334d0b9314de61d8c133f70b9262b005f336ee5","observation_id":"4e3b2132-b0d9-4708-bf8e-d24d3f4d1e38","resolution":{"observed_at":"2026-08-15T22:12:55.856510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-08-15T22:12:55.115980Z","title":"Unleashing large-scale video generative pre-training for visual robot manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.115980Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:e14a9630c25bcf3270eb7a1b7b27c1097faf3ba6cd8eefd81511d72a77cf61fe","observation_id":"2084c354-9cde-4778-a3bb-1f09efdb24ff","resolution":{"observed_at":"2026-08-15T22:12:55.115980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.837805Z","title":"GMFlow: Learning Optical Flow via Global Matching","venue":null,"work_id":"e49eacfd-3098-4758-86ce-b6de04e3f77e","year":2022},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.120514Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:eb920f0be28c38012698577e7e0b6dd1257cc2ffd71a99aa562f24d1ce6dc5e7","observation_id":"2cda5f74-005c-4d6c-88cc-7a77ca1b2222","resolution":{"observed_at":"2026-08-15T22:12:55.842730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.824824Z","title":"Flow as the cross-domain manipulation interface","venue":null,"work_id":"b7261cee-840a-4b6d-a7bf-3f8e62491ea4","year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.124462Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:715ea796b3d2e6c2f1f676d1f3476f39c1a6460fcc3a7c4c2523893e2ab81268","observation_id":"8b0183bf-a487-4e6e-95ae-1334a514aac8","resolution":{"observed_at":"2026-08-15T22:12:55.829469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.810457Z","title":"Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning","venue":null,"work_id":"dbcabd26-23ec-4a1f-902f-f9e33775a7c6","year":2019},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.129054Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:28e3a3adb04f39d3b3e26de00704d0a78511dbd7552ad4f21c88ddd6eaca1728","observation_id":"5c229d40-53bb-4229-9101-7488c35468bc","resolution":{"observed_at":"2026-08-15T22:12:55.815483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11439","last_updated":"2024-09-23T08:22:04Z","snapshot_observed_at":"2026-08-16T14:25:49.886675Z","submitted_at":"2024-01-21T09:39:11Z","title":"General Flow as Foundation Affordance for Scalable Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11439","snapshot_observed_at":"2026-08-15T22:12:55.133106Z","title":"General flow as foundation affordance for scalable robot learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.133106Z"},"links":{"cited_paper":"/paper/2401.11439","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:cdecdb9a997048b8adcd8377ebe30c974f4052b8268706273825cf45b87a2952","observation_id":"42589bd7-0882-4556-a611-1b1d7ecda6a1","resolution":{"observed_at":"2026-08-15T22:12:55.133106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-08-16T13:42:40.054113Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-15T22:12:55.137394Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.137394Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:fce62068e275e8a44b6894f8fb4447f08fab9746b0fbe9237552bd7918aff513","observation_id":"76c23de5-1cb1-4420-aa71-f3125f94393a","resolution":{"observed_at":"2026-08-15T22:12:55.137394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.796774Z","title":"Robotic control via embodied chain-of-thought reasoning","venue":null,"work_id":"9cb3adf5-9ce0-49c4-9fc2-ecd733ad5aae","year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.141524Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:6f5211292a79ac6799e327b3dcea267b50cb522f910b972c1dd933ac6599e8f4","observation_id":"ea8ca035-3190-443c-bf4f-f98f940a62bb","resolution":{"observed_at":"2026-08-15T22:12:55.801468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.145239Z","title":"Adding conditional control to text-to-image diffusion models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.145239Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:6454946769e92238ea19a7b451d11a4ddd689dc925b477bc8bee1ce776a98e6d","observation_id":"ebe29658-6ad5-4462-a630-ed50b7da664c","resolution":{"observed_at":"2026-08-15T22:12:55.145239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.15001","last_updated":"2022-08-31T17:58:54Z","snapshot_observed_at":"2026-08-16T16:35:36.335456Z","submitted_at":"2022-08-31T17:58:54Z","title":"MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.15001","snapshot_observed_at":"2026-08-15T22:12:55.149229Z","title":"Motiondiffuse: Text-driven human motion generation with diffusion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.149229Z"},"links":{"cited_paper":"/paper/2208.15001","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:0b78dc86c1c76573e934a8ed4a0352072ad145f7ca6f6f4f1ce75d934cadcaac","observation_id":"a3cab248-49f6-453c-9eda-72a3033fe4c6","resolution":{"observed_at":"2026-08-15T22:12:55.149229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04447","snapshot_observed_at":"2026-08-15T22:12:55.153938Z","title":"Dreamvla: A vision-language-action model dreamed with comprehensive world knowledge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.153938Z"},"links":{"cited_paper":"/paper/2507.04447","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:ac84582921b96ea859c50a54a587b2e147b01c35123e5780ce54b9d79311b4a0","observation_id":"34650779-ad36-4fb9-9f84-6c7b3cbfe9c2","resolution":{"observed_at":"2026-08-15T22:12:55.153938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10105","last_updated":"2025-03-08T13:55:48Z","snapshot_observed_at":"2026-08-14T09:40:41.520844Z","submitted_at":"2025-01-17T10:45:22Z","title":"Universal Actions for Enhanced Embodied Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10105","snapshot_observed_at":"2026-08-15T22:12:55.159016Z","title":"Universal actions for enhanced embodied foundation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.159016Z"},"links":{"cited_paper":"/paper/2501.10105","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:a0eb39491650c835c565c2341a7451b98c8eed3b0e829a5f12d558f0938ff64b","observation_id":"757e11c2-aa7a-49ce-acc7-7909657b640a","resolution":{"observed_at":"2026-08-15T22:12:55.159016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-12T18:17:40.083518Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10345","snapshot_observed_at":"2026-08-15T22:12:55.163015Z","title":"Tracevla: Visual trace prompting enhances spatial-temporal awareness for generalist robotic policies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.163015Z"},"links":{"cited_paper":"/paper/2412.10345","citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:22da02f05ea6d36cba167fc2495f608723e0394f43088fbfc5d3e00921258dd9","observation_id":"9a8d16ba-31bb-4f3d-8dbc-018804c48403","resolution":{"observed_at":"2026-08-15T22:12:55.163015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.167484Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.167484Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:f7b792dad711a8380d2bae9475d0fb55c9a8b4bf0ed1a965f223d3ee8dd53bee","observation_id":"a68576da-d0b6-461d-8ad0-c727ead6a25a","resolution":{"observed_at":"2026-08-15T22:12:55.167484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.172510Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.172510Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:80190c1cb75f315ce9b632ca660b632b3880f60a518692947e7df238f23466b7","observation_id":"87f230cd-c735-4a82-a891-28c0f6fe34e5","resolution":{"observed_at":"2026-08-15T22:12:55.172510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:12:55.177124Z","title":") leads to a modest performance drop (from 53.6\\ Removing the previous optical flow input (``Prev Flow","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:55.177124Z"},"links":{"citing_paper":"/paper/2505.07817"},"observation_digest":"sha256:c7c85ddb7780a31bf8008b16c55bd574d87629321a7d7a59e3700e75820a8092","observation_id":"55e62ab3-3929-408c-b847-d59637e3fac2","resolution":{"observed_at":"2026-08-15T22:12:55.177124Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.07817","last_updated":"2025-08-28T13:58:02Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T22:05:21.910009Z","submitted_at":"2025-05-12T17:59:32Z","title":"Pixel Motion as Universal Representation for Robot Control"},"reference_resolution":{"displayed":99,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":60,"verified_exact":3,"verified_fuzzy":34},"total_outbound_references":99},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 99 of 99 outbound references and 5 inbound Pith citation observations for arXiv:2505.07817."}