{"as_of":"2026-08-08T03:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3490c56be68e1c73d8480e256a6ade8273b970056563e86973d10baa49015b8e","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:08:11.723353Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16192/citation-record","integrity":"/paper/2607.16192/integrity","json":"/paper/2607.16192/citation-record.json","paper":"/paper/2607.16192"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:02.926217Z","title":"Gibson.The Ecological Approach to Visual Perception","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:02.926217Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:3a9ac82003afcbdd60e219336fa5aa86ce9c44060465d81be06a2f32f1655865","observation_id":"5d39d198-f022-4dfb-a2e2-1d4a6c753b96","resolution":{"observed_at":"2026-08-01T21:08:02.926217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:02.996305Z","title":"MIT Press, Cambridge, MA, 1979","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:02.996305Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:9ed46b2f6483791aafe68c8abdb4604f0ffb64a6dee971fbc4009ab38e83fb56","observation_id":"d03305c0-239c-434e-a55a-57363f14e8a7","resolution":{"observed_at":"2026-08-01T21:08:02.996305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:03.065262Z","title":"Battaglia, Jessica B","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.065262Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:391fd7a9a808d71f791ac7949d469941d54f33cebdef423c843c0dd264691bf0","observation_id":"bbd53c76-1089-4357-a1b9-ab23afc9f07b","resolution":{"observed_at":"2026-08-01T21:08:03.065262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/415755a","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rational imitation in preverbal infants","venue":"Nature","work_id":"d182a40c-cb61-428d-95d7-5c70936edba7","year":2002},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.205525Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:0b4d7d18ae9dd93fd25b9682ba5aba6f47638874ceb7f1f3bd13b1802b252d94","observation_id":"d0e28455-666f-445c-abff-0edd9914eabd","resolution":{"observed_at":"2026-08-01T21:08:35.157213Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.18558","last_updated":"2026-06-17T00:19:00Z","snapshot_observed_at":"2026-07-06T23:53:59.519305Z","submitted_at":"2026-06-17T00:19:00Z","title":"MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction","version":1},"cited_work":{"arxiv_id":"2606.18558","doi":"10.48550/arxiv.2606.18558","metadata_source":"pith","pith_arxiv_id":"2606.18558","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction","venue":"cs.CV","work_id":"0f33a82e-e8d3-42dd-8b49-b35bbfbb9e02","year":2026},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.318004Z"},"links":{"cited_paper":"/paper/2606.18558","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:7dd1bbbbae2ab3559e51b14de4162da8028e7e4dc11c235264af5c1805ef0b20","observation_id":"2d2c935f-c823-4426-a51b-c3b1b8deba94","resolution":{"observed_at":"2026-08-01T21:08:34.903088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-07T10:56:45.950464Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"cited_work":{"arxiv_id":"2506.03605","doi":"10.48550/arxiv.2506.03605","metadata_source":"pith","pith_arxiv_id":"2506.03605","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","venue":"cs.CV","work_id":"e97989cf-b4de-49f9-842c-6dda264f5663","year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.385771Z"},"links":{"cited_paper":"/paper/2506.03605","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:32c98431286e5ac1ca58c91feef543fe413f97e8d639581d303b9451869e8f9b","observation_id":"8bda7ddf-e769-428a-b03a-0e6824903cce","resolution":{"observed_at":"2026-08-01T21:08:34.652209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:03.492409Z","title":"ObjectForesight: Predicting future 3d object trajectories from human videos.arXiv preprint arXiv:2601.05237,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.492409Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:4e5f71101d639d5c353a11c3691c21bef969577e170d541e10eaa5f19748de56","observation_id":"1cf48797-d72c-4276-9406-c87c7738e523","resolution":{"observed_at":"2026-08-01T21:08:03.492409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:03.635971Z","title":"Track2Act: Predicting point tracks from internet videos enables generalizable robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.635971Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:55840588780e5f500833d6b8b9949530a51db7b71e81f2dcfb3606e9272903fa","observation_id":"c80709e4-a0dd-4dd1-99f0-f06e8c906c05","resolution":{"observed_at":"2026-08-01T21:08:03.635971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:03.706598Z","title":"Any-point trajectory modeling for policy learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.706598Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:a2409d72c6c2377a2c39a62adb5db820bcc91bea73e1055637dd1d22d36e708c","observation_id":"bce010d1-35c8-4f0b-86fa-a15beb351f7e","resolution":{"observed_at":"2026-08-01T21:08:03.706598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:03.861656Z","title":"Motion tracks: A unified representation for human-robot transfer in few-shot imitation learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.861656Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:01a107e01e8bf72eadbe049647b9427b09fa910242a8dd2d5e0925a6e5235dae","observation_id":"9690d49b-e4c6-466d-b566-0dadabbccf18","resolution":{"observed_at":"2026-08-01T21:08:03.861656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12587","last_updated":"2026-05-12T17:59:27Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:27Z","title":"TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking","version":1},"cited_work":{"arxiv_id":"2605.12587","doi":"10.48550/arxiv.2605.12587","metadata_source":"pith","pith_arxiv_id":"2605.12587","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking","venue":"cs.CV","work_id":"81730fcd-2b29-4303-84a2-3875fe51a96d","year":2026},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.956642Z"},"links":{"cited_paper":"/paper/2605.12587","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:bc01a1af26a0f22a2712a0896f9115de9b6b1bf249e9d9054467fcb76958d76e","observation_id":"e64d958b-996c-4fcc-9cfe-ccb10ac21c48","resolution":{"observed_at":"2026-08-01T21:08:34.345489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-01T21:08:04.041568Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.041568Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:383a28d9fca905b83832409c90360b9a79fe00bd14ef9c4621b4585a377e0ab6","observation_id":"087b81c3-1dc9-4d99-ba17-7b733fff36da","resolution":{"observed_at":"2026-08-01T21:08:04.041568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-01T21:08:04.239228Z","title":"World models.arXiv preprint arXiv:1803.10122, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.239228Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:1fe40cc13a01255d62265615e490787c45416e271e18d625a871875fbeaf5456","observation_id":"3f0398c3-181a-41c3-b9a5-97ec90990127","resolution":{"observed_at":"2026-08-01T21:08:04.239228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:04.319399Z","title":"Deep visual foresight for planning robot motion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.319399Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:c2f745382578e42a27a09155158e51de895e8d1cceec86ec2e38e01a2d95e4c4","observation_id":"d9b9b770-c82c-46d0-8c57-c891333c70aa","resolution":{"observed_at":"2026-08-01T21:08:04.319399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:04.476158Z","title":"Decomposing motion and content for natural video sequence prediction","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.476158Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:ebd46b8efd2b6999ad32a5dc585fb1584f56dbe70bc139291033d3b55da1cdcc","observation_id":"c87fa03f-70e7-46f4-8821-70dae328a2a8","resolution":{"observed_at":"2026-08-01T21:08:04.476158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:04.580212Z","title":"An uncertain future: Forecasting from static images using variational autoencoders","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.580212Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:d93dc212996c83e109cfd3f2c00cc6b23fd9f9d75d80e2dc96729c7824a64c19","observation_id":"753e912b-c894-4b5d-9962-357c5d639f3b","resolution":{"observed_at":"2026-08-01T21:08:04.580212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:04.670644Z","title":"Gen2Act: Human video generation in novel scenarios enables generalizable robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.670644Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:907fb1d9b2fe3971a22efd00ae3c595a2d0dd74afedf7cddd5163b9fac9d3b69","observation_id":"a50c7708-3445-4e27-839f-f57d9922ba80","resolution":{"observed_at":"2026-08-01T21:08:04.670644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:04.888292Z","title":"Video prediction policy: A generalist robot policy with predictive visual representations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.888292Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:3d10aea355032c6f4c6076dd084a7a083d4bf6e65ff07cb823c9609e0cbfa37d","observation_id":"1100d987-5939-4465-b9b4-f12699bcbece","resolution":{"observed_at":"2026-08-01T21:08:04.888292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00795","last_updated":"2025-08-01T17:23:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-01T17:23:49Z","title":"Video Generators are Robot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.00795","snapshot_observed_at":"2026-08-01T21:08:04.972434Z","title":"Video generators are robot policies.arXiv preprint arXiv:2508.00795, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.972434Z"},"links":{"cited_paper":"/paper/2508.00795","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:8cde571b70a22b5ee63cff44865b2fa26cf5ffa5f57a08cf11d2d7f4064e573a","observation_id":"7f9ff0f1-8422-46a8-be47-7dbe75bb07f2","resolution":{"observed_at":"2026-08-01T21:08:04.972434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.054514Z","title":"Learning latent action world models in the wild.arXiv preprint arXiv:2601.05230,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.054514Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:2e90a373d1923f9a6f864dde05d11c4278e6c44f7ea3217fdb3117f921958c75","observation_id":"8e4f0d75-d026-45bd-97a7-bd898ba0f5c4","resolution":{"observed_at":"2026-08-01T21:08:05.054514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-01T21:08:05.241430Z","title":"V-JEPA 2: Self-supervised video models enable understanding, prediction and planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.241430Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:3fac1942a99cd5437b18ba0bb1416e5f2f8046f809edf058655cdc47aa51d979","observation_id":"9ed41a93-fa35-4286-901f-ac6f8d820a08","resolution":{"observed_at":"2026-08-01T21:08:05.241430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:04.752345Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.752345Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:d8ebaff6481e8315206aa39a628530983e350c5457c954836bbdb409da1502ff","observation_id":"4b9539c2-08a6-45ce-b59c-5ae20fb9871b","resolution":{"observed_at":"2026-08-01T21:08:04.752345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.465352Z","title":"Contrastive learning of structured world models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.465352Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:9cb0e6eb6b3ebc48f5d25ee1a85a88182d59d0738c7e43527cb8539cf7ed78a7","observation_id":"32141199-f808-498b-9cc5-f0bb2f6023c9","resolution":{"observed_at":"2026-08-01T21:08:05.465352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.533345Z","title":"SomethingSomething","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.533345Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:63c29e7112b4203b9548cf99d278cdaa99a31598a68abe51b0fe519e05176c29","observation_id":"02b630b1-2d65-4c8a-b075-e9e626c7878b","resolution":{"observed_at":"2026-08-01T21:08:05.533345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.662287Z","title":"Doell, and Jason J","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.662287Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:509e9d09c9fb2eba0c7c664ccd71e03cf3aa69749afd9a33cdd94a52ec9d6071","observation_id":"1bbda2fb-e58b-4128-8d26-d3346919153a","resolution":{"observed_at":"2026-08-01T21:08:05.662287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.136592Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.136592Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:f4a0d26d54edd2f96143e0126bd70f9885f5c8a8da90de659835e35292fa79e6","observation_id":"8cdc7013-fb8c-43fa-ad6a-df4845f3e0b4","resolution":{"observed_at":"2026-08-01T21:08:05.136592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.835753Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.835753Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:812183f32c8164c442e04ee1affe939e74947297125a57b99ede72d6ce84f9ca","observation_id":"473d728d-24be-4b5f-87cf-02ee5cfcb27b","resolution":{"observed_at":"2026-08-01T21:08:05.835753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.350557Z","title":"Dream to con- trol: Learning behaviors by latent imagination","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.350557Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:b5eec9901997644acdbaac29a2674931a684e8221db6c851eb0aa665ea3fb389","observation_id":"953f0aa9-b9fd-459b-ba01-e36412422fb6","resolution":{"observed_at":"2026-08-01T21:08:05.350557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.980579Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.980579Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:ddfbac85a6ed5020c13728181777136f584c0ad1810d22c75b7d5a87351e4bab","observation_id":"bd1e8057-cea0-43dd-baf6-d87a3ac50b93","resolution":{"observed_at":"2026-08-01T21:08:05.980579Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.043040Z","title":"Human–object interaction prediction in videos through gaze following.Computer Vision and Image Understanding, 233: 103741, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.043040Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:c3aaca18cd2e3aca9c8e03348fe97a6ab7db71a95cfee56e902bb15af2cc653c","observation_id":"4a1824d8-df7d-4e9a-b31c-c7bb4249840b","resolution":{"observed_at":"2026-08-01T21:08:06.043040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.111870Z","title":"ContactGrasp: Functional multi-finger grasp synthesis from contact","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.111870Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:03f429b4427a9bfe26abc789b8897a2eb55a71005672c297e7155f10bfdef782","observation_id":"28f98bed-959a-4dfa-a104-25a34c397f0c","resolution":{"observed_at":"2026-08-01T21:08:06.111870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.753292Z","title":"Scaling egocentric vision: The EPIC-KITCHENS dataset","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.753292Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:7baafcc4c58a546e798b03536e64ca43f7db99ef5561d39641bf3a430c59fc17","observation_id":"f4b6d1d4-f3e4-4285-95bb-caece6d5123b","resolution":{"observed_at":"2026-08-01T21:08:05.753292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.267788Z","title":"Joint hand motion and interaction hotspots prediction from egocentric videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.267788Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:1e6f2c74820dca1ccd571c0f087b8fce7b14d0ef3f77c5289d90496773ddb626","observation_id":"6600dc5b-fb2b-45f6-be4f-83e9b0bfee58","resolution":{"observed_at":"2026-08-01T21:08:06.267788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.917618Z","title":"Ego4D: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.917618Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:5ecaef3a4be5fd3cf648b6b5dcbb6922dbbbde53ccf6bc61c01a3fe7f21073e8","observation_id":"a96a30c3-7ded-4cbc-9596-7776ff9e10c2","resolution":{"observed_at":"2026-08-01T21:08:05.917618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.410635Z","title":"Newtonian image understanding: Unfolding the dynamics of objects in static images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.410635Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:7191bd75edc4288cdf759f46387589d6ed55d84378235dc928eb7948b29bb1e9","observation_id":"9861203a-874f-4111-bbe6-da276283adea","resolution":{"observed_at":"2026-08-01T21:08:06.410635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.482696Z","title":"Grounded human-object interaction hotspots from video","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.482696Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:c435c4b19fb531dda86db68cd69e0df38a57003c28c9017b0ad53e5c05c52427","observation_id":"25f96095-8223-46c0-8564-fe4458022f59","resolution":{"observed_at":"2026-08-01T21:08:06.482696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.542986Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.542986Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:afd666f0d60d08c8f10b510b93f3398674b0e255d5c9174c341b7eece526230c","observation_id":"d35973f7-524c-441d-b48e-44a2322d0f3d","resolution":{"observed_at":"2026-08-01T21:08:06.542986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.187309Z","title":"Human hands as probes for interactive object understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.187309Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:7cc5d56da805dd5810e131e509e87b9f65c7691a3019ac8b3d546a7865dcc659","observation_id":"77876ee3-c8f6-420f-bd4d-343a2f6197ff","resolution":{"observed_at":"2026-08-01T21:08:06.187309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-01T11:11:47.133079Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13187","snapshot_observed_at":"2026-08-01T21:08:06.701306Z","title":"Hand- sOnVLM: Vision-language models for hand-object interaction prediction.arXiv preprint arXiv:2412.13187, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.701306Z"},"links":{"cited_paper":"/paper/2412.13187","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:ebb78836a684740cd3b4931d26e8f153f46945ec3a7c12623b415c2aadecd995","observation_id":"89482c55-4d31-4fb9-8ee6-08a30eaafcdd","resolution":{"observed_at":"2026-08-01T21:08:06.701306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.350657Z","title":"Guibas, Mustafa Mukadam, Abhinav Gupta, and Shubham Tulsiani","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.350657Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:24e9f4181f6a6f0841f4f4f5422068924eac70a4d84ef47d5867cee1d33fd216","observation_id":"1b0d3e2b-9ea3-4c8f-a196-90e97a5d8159","resolution":{"observed_at":"2026-08-01T21:08:06.350657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.862084Z","title":"Mask2Act: Predictive multi-object tracking as video pre- training for robot manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.862084Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:5e52c02bb37df1f527374530457274f7793c149ae3a41be1bc247174d28a4705","observation_id":"40f5bd1d-9f4e-44de-8485-c8dfc00899db","resolution":{"observed_at":"2026-08-01T21:08:06.862084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.937012Z","title":"3d hand shape and pose estimation from a single RGB image","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.937012Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:1c78ed0780898ef4f68db18e72ea282873bc87914752d48969195bfaff6b48cd","observation_id":"15ac6c39-325d-4f71-8259-117316dd7cce","resolution":{"observed_at":"2026-08-01T21:08:06.937012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.997853Z","title":"Black, Ivan Laptev, and Cordelia Schmid","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.997853Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:c56b45695b69b39c8267d14190553d6fbc1f84bfea8f6b2181366f3da9260f68","observation_id":"67cc1d18-74fd-4728-86f7-c66bb7808793","resolution":{"observed_at":"2026-08-01T21:08:06.997853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.621031Z","title":"Guide to the carnegie mellon university multimodal activity (CMU- MMAC) database","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.621031Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:b03e8b021e8786e5c0064dd4323d1b28fb1822b8f08633b1703286e7c24dd438","observation_id":"a11e4dc1-4bf6-415b-8744-3c91d1691522","resolution":{"observed_at":"2026-08-01T21:08:06.621031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.08324","last_updated":"2020-08-19T08:22:30Z","snapshot_observed_at":"2026-07-06T09:48:19.033988Z","submitted_at":"2020-08-19T08:22:30Z","title":"FrankMocap: Fast Monocular 3D Hand and Body Motion Capture by Regression and Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.08324","snapshot_observed_at":"2026-08-01T21:08:07.169924Z","title":"FrankMocap: Fast monocular 3d hand and body motion capture by regression and integration.arXiv preprint arXiv:2008.08324, 2020","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:07.169924Z"},"links":{"cited_paper":"/paper/2008.08324","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:9ea6fe67542588048320e7ef5fb62491377793eeba0617502c90a1d1cd9f8d56","observation_id":"3220aa4f-8613-4118-85e8-fc111bbb4453","resolution":{"observed_at":"2026-08-01T21:08:07.169924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.765398Z","title":"Flowing from reasoning to motion: Learning 3d hand trajectory prediction from egocentric human interaction videos.arXiv preprint arXiv:2512.16907, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.765398Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:4a1e4aa1badcd6a81eecf4bec68372259bddf050fe02f6ac75e2e3cc709993e3","observation_id":"d9bdb4bc-e81e-437a-8366-c16a7e260967","resolution":{"observed_at":"2026-08-01T21:08:06.765398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:07.512912Z","title":"PVN3D: A deep point-wise 3d keypoints voting network for 6dof pose estimation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:07.512912Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:1dc04a6e50f7a22f1fb67e88aae414066d53b0fdb795f3735d944925793143e8","observation_id":"1fe054e9-fb57-44f8-829e-1c20f51eed55","resolution":{"observed_at":"2026-08-01T21:08:07.512912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:07.668258Z","title":"Segmentation-driven 6d object pose estimation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:07.668258Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:9d1e91b970815cc3811df7f7c84342f4ab7833e38bbcf0b75399eb7031e62f1d","observation_id":"faf6970f-f887-4b33-88b6-96d3a0ea3221","resolution":{"observed_at":"2026-08-01T21:08:07.668258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:07.824655Z","title":"SSD-6D: Making RGB-based 3d detection and 6d pose estimation great again","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:07.824655Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:6a1c7439bc16f205323ba5c97c5650587f461e3e2c1d94e4a10ef42e612cbfef","observation_id":"d98d81c3-be80-42ac-9b5e-29ad52b51ad2","resolution":{"observed_at":"2026-08-01T21:08:07.824655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:07.013467Z","title":"Hand pose estimation via latent 2.5d heatmap regression","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:07.013467Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:7ab95d37fd6b0a7c80e4d115bbaa422e2f10771a8baab177380215e7b594aee5","observation_id":"ed9f48a8-f0cb-4d1e-a57b-8940e5e0bfde","resolution":{"observed_at":"2026-08-01T21:08:07.013467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:08.108094Z","title":"SAM 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:08.108094Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:aaf40f439056e3c22332fad868d6394cc7850e5dfa43d93872d5a47ef7d8bd10","observation_id":"194c8f67-903d-4bc5-843f-52ea3333300a","resolution":{"observed_at":"2026-08-01T21:08:08.108094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:07.316576Z","title":"Learning to estimate 3d hand pose from single RGB images","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:07.316576Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:47b8b2863497b3d69c7f42f6688c100cd8be9783d237eef73801fee7975b2c37","observation_id":"dcc1f61a-bf86-45de-acd4-d0d05a6e7958","resolution":{"observed_at":"2026-08-01T21:08:07.316576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16624","last_updated":"2025-11-20T18:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-20T18:31:46Z","title":"SAM 3D: 3Dfy Anything in Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16624","snapshot_observed_at":"2026-08-01T21:08:08.479185Z","title":"Liang, Alexander Sax, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:08.479185Z"},"links":{"cited_paper":"/paper/2511.16624","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:d1ac6980589ba825935c1bf0f93ce4668491d191048f19d8c3cdb974056b3125","observation_id":"cb77d25c-bb1b-41b1-af3d-7341aa9f23b9","resolution":{"observed_at":"2026-08-01T21:08:08.479185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:08.666083Z","title":"Self-supervised point cloud prediction using 3d spatio-temporal convolutional networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:08.666083Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:524d0ac6e2b929e8637aeb4dc72b8707988a9af281848de32350903f915adb11","observation_id":"b8676e74-e36d-49b0-b586-145764dc2d84","resolution":{"observed_at":"2026-08-01T21:08:08.666083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:09.071412Z","title":"Visual point cloud forecasting enables scalable autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:09.071412Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:c811edc48160f0c5f6fcc3e1c62babc00e2bbf2cb6d3399ca52f0234a33de084","observation_id":"dcb1968e-f585-4a5f-b4fc-df833d9e205d","resolution":{"observed_at":"2026-08-01T21:08:09.071412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:07.942149Z","title":"PoseCNN: A convo- lutional neural network for 6d object pose estimation in cluttered scenes","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:07.942149Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:610ba031a831579c0023e9706d3a0cf36140b1be9ad915923577829c50ce2bc1","observation_id":"2afc36e2-8916-407f-a0dd-8b9557e5cfc2","resolution":{"observed_at":"2026-08-01T21:08:07.942149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:09.493365Z","title":"ManipTrans: Efficient dexterousbimanualmanipulationtransferviaresiduallearning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:09.493365Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:c24174ef3779c9b184de82fb9616d66e77e111a7930402ae57bcb08a285d0dcd","observation_id":"4fc5edd6-1945-4d90-96e5-ff75231c0e07","resolution":{"observed_at":"2026-08-01T21:08:09.493365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:08.328003Z","title":"Structured 3d latents for scalable and versatile 3d generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:08.328003Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:02f6ba2dcb110bb35888fef2d6df760b3c64bc486b953053b48eddaa79210405","observation_id":"502a4ad2-0f4d-458c-8697-ea0593e37f38","resolution":{"observed_at":"2026-08-01T21:08:08.328003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:09.950434Z","title":"World models for learn- ing dexterous hand-object interactions from human videos.arXiv preprint arXiv:2512.13644,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:09.950434Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:baaa4a9a501c35ace3c3cfe1312ebcc6674316d0ecde988b28f80661d9371008","observation_id":"3dbe438d-aa1a-46c2-81a9-1f624dfa8f43","resolution":{"observed_at":"2026-08-01T21:08:09.950434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:10.208378Z","title":"Qi, and Leonidas J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.208378Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:a8b55b77924d1be2b607254d73e06a18f34e852541fc108bd12ff9e929dd8f43","observation_id":"46e02707-70f1-4da8-b826-125d87fe3ebe","resolution":{"observed_at":"2026-08-01T21:08:10.208378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:10.378846Z","title":"Harley, Yang You, Xinglong Sun, Yang Zheng, Nikhil Raghuraman, Yunqi Gu, Sheldon Liang, Wen-Hsuan Chu, Achal Dave, Suya You, Rares Ambrus, Katerina Fragkiadaki, and Leonidas J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.378846Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:62299dc1c9c0c8fd9de164eb0f88270d7db3b7eb76ee64dfea1961d49db35f47","observation_id":"5dc331fd-2879-43ad-b8c8-0ca2850087af","resolution":{"observed_at":"2026-08-01T21:08:10.378846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:09.331914Z","title":"ViP3D: End-to-end visual trajectory prediction via 3d agent queries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:09.331914Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:6eb2fefe9028dac7a412efcc28b5b27ee5d8d742a9dfd101f08995ccc7a79dbc","observation_id":"dc4884ea-653d-4f14-8da4-9e7b9ec9ede5","resolution":{"observed_at":"2026-08-01T21:08:09.331914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:10.583837Z","title":"DELTA: Dense efficient long-range 3d tracking for any video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.583837Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:ca9f447a597721596b4049b4acb8d85a76a2f6e53afbe99ec0fe12e4812f7d12","observation_id":"3a497286-20c1-4af7-8ded-d241fcc3674c","resolution":{"observed_at":"2026-08-01T21:08:10.583837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:09.689219Z","title":"PointWorld: Scaling 3d world models for in-the-wild robotic manipulation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:09.689219Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:bdfe915b75292f5f9bd2b5405f70c00839ee546c5b34c1c7b0c54791a22787a0","observation_id":"ee2324a4-746d-4784-92aa-399747a27aee","resolution":{"observed_at":"2026-08-01T21:08:09.689219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:10.736636Z","title":"Berg, Wan-Yen Lo, Piotr Dollár, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.736636Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:d945b5928f28ee7c3a2e92948f59c81675ff6a08019d38140f8041314d266f3b","observation_id":"b8eef71c-872c-4323-ad24-6e9a93874599","resolution":{"observed_at":"2026-08-01T21:08:10.736636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:10.084810Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.084810Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:b109091399b1f9cd1e92e38c5e1d41e21fde068fe0575bada2c5d530445dae8f","observation_id":"22762334-5b6f-4e3a-814d-57776dd59222","resolution":{"observed_at":"2026-08-01T21:08:10.084810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:10.885000Z","title":"Rotary position embedding for vision transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.885000Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:4ae2ff36e6428c75844bf4490e5877f8f4fe54d639e6c143ecbefff8f39bd20f","observation_id":"9945e0b2-8aa4-4742-8f1b-2ab3d85d5b77","resolution":{"observed_at":"2026-08-01T21:08:10.885000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:10.959228Z","title":"RoFormer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.959228Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:59fc18754a89af3026a19d6c7cbd8a49065eeebae310f98d2d1e47e4990b7682","observation_id":"45d21f6d-d9e4-4841-98a2-8f6bac3fdb2f","resolution":{"observed_at":"2026-08-01T21:08:10.959228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.020780Z","title":"Forecasting motion in the wild.arXiv preprint arXiv:2604.01015, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.020780Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:8fd433477c4b22578d3555bfc1f2df9183747ba0c17f385f9b148fa9ed3961a4","observation_id":"b384054c-23ba-4e3f-8b4a-7b90cd4f43d1","resolution":{"observed_at":"2026-08-01T21:08:11.020780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-73033-7_2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoTracker: It is better to track together","venue":"Lecture notes in computer science","work_id":"6c536829-a041-4f5c-a38f-258306fb1ce1","year":2024},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.509167Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:acfb005be15df0d6dae92cead032abe864f6f8329a17cb05792ca4ea1d150ef1","observation_id":"218eedf8-6a4e-47af-b1ce-64c29abedf4b","resolution":{"observed_at":"2026-08-01T21:08:32.681179Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.168088Z","title":"Dex4d: Task-agnostic point track policy for sim-to-real dexterous manipulation.arXiv preprint arXiv:2602.15828, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.168088Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:81d56ffa7fe6ea313e55def4944f6ebaf09487f7250d660e6bef5972b4fd7666","observation_id":"29f1935a-8d90-4b9a-8ac9-c3402ed5817d","resolution":{"observed_at":"2026-08-01T21:08:11.168088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:10.659830Z","title":"SpatialTrackerV2: Advancing 3d point tracking with explicit camera motion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.659830Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:e4e30abc9a9159711863071cc9bb31be011921190d57beebd20e000ce8bd7095","observation_id":"dab819f2-27b4-431b-a2f5-2b9340d0b476","resolution":{"observed_at":"2026-08-01T21:08:10.659830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-07-06T22:35:46.018050Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-01T21:08:10.829759Z","title":"Chen, Zhenyu Li, Guang Shi, Jiashi Feng, and Bingyi Kang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.829759Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:de89bcdb06666f8dc7aced26df73d0867392be34cd001c801df6e43eaf98c8cf","observation_id":"0df9acc1-845c-4247-8e25-1e2ab0283843","resolution":{"observed_at":"2026-08-01T21:08:10.829759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.091720Z","title":"Novaflow: Zero-shot manipulation via actionable flow from generated videos.arXiv preprint arXiv:2510.08568, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.091720Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:0e7b42044af1d07dad7d1d4e079b3d729123c6b73308bde6231b67de053f4129","observation_id":"2aabca53-94dc-459b-b35b-8a32fefaae46","resolution":{"observed_at":"2026-08-01T21:08:11.091720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.236120Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.236120Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:eb75fa17ca57c878d723a63cdb1721355435edf182f7b3b71353ede9648b01dd","observation_id":"225639f7-6d36-48ae-9fb9-93d6691cd78b","resolution":{"observed_at":"2026-08-01T21:08:11.236120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.340760Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.340760Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:9d7c12a59266345b433df2bfc8b43021377d80120319d76427c432ff7180e45d","observation_id":"e0ff0579-802d-4d89-8adf-0d50cae0a32c","resolution":{"observed_at":"2026-08-01T21:08:11.340760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.404206Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.404206Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:d28d196d13cd0183766a5ee2d1c06a6ea168fcbf68291531564c0e6c83281981","observation_id":"1b81fa00-33dc-4cb1-8b1b-1c4f1e3e5ec9","resolution":{"observed_at":"2026-08-01T21:08:11.404206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.475358Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.475358Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:a79308cd659e9c13b52e88af374afb671be570703024e9d5fa402c4e4183d6a7","observation_id":"85254c77-8344-4712-8298-2d49a303b335","resolution":{"observed_at":"2026-08-01T21:08:11.475358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.548643Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.548643Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:18718b1184586b40d473516846844fbfdcf5453905a4857417511203ef67e0b6","observation_id":"64ddfc8a-ec61-479e-b968-9441e5b204aa","resolution":{"observed_at":"2026-08-01T21:08:11.548643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.616413Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.616413Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:cd71861f06981a10666bb431cb47d140979fd676215be0e0740b519634931f82","observation_id":"6edb8e74-a3d3-43b1-bbd8-6c67248d4b81","resolution":{"observed_at":"2026-08-01T21:08:11.616413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.674282Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.674282Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:dd8b6cdc45331a24f6625af053e7303c19bd9e2b95af921dbf6b18df8e20a4c7","observation_id":"97f24870-0ae4-4162-b1ed-48869ff97e3e","resolution":{"observed_at":"2026-08-01T21:08:11.674282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.723353Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.723353Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:11bc7c2d6962210c4a9ff5619687498ed894a52accfd70ad8f1d535fa94a34d0","observation_id":"9737f7df-901c-4a8f-8d77-c0d90c9acfbb","resolution":{"observed_at":"2026-08-01T21:08:11.723353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:04.392981Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.392981Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:9c2d4810dfb6b28070992727fb825b4d3251deee05961829e6d6d7ef23f7b6a0","observation_id":"53b09f4e-3d7b-41bc-b8f2-9c61fe2a1288","resolution":{"observed_at":"2026-08-01T21:08:04.392981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:08.839813Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:08.839813Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:3c86763fd85b2489d0d77f901281a560d10994d3f32ea8f20cdc8d4f446d38d1","observation_id":"e4605b7f-e1b6-4231-afec-c042f6cc3452","resolution":{"observed_at":"2026-08-01T21:08:08.839813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:03.774833Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.774833Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:6a23f486d7b1d7b5c0a287739a59ae7b55f393eba92c9366cc7e4f370b5d32df","observation_id":"7de84400-49ce-4983-b129-bec74691297c","resolution":{"observed_at":"2026-08-01T21:08:03.774833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-01T21:08:04.131033Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.131033Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:611c05d3a44729382965215a99d7089921f3d4bd5afd12a5a89000d461974bbd","observation_id":"9ca762a5-3b80-460d-8ae4-1e7ab71e8bfd","resolution":{"observed_at":"2026-08-01T21:08:04.131033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:03.567786Z","title":"12 MotionForesight Brains, Bots, and Behavior Lab","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.567786Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:54933e5d8b11e078f4fcf518a14514f5ab895ec1816aee04d1244ef6be9c7a26","observation_id":"cea0f0cd-1890-4e9b-9bfa-af71316ad47c","resolution":{"observed_at":"2026-08-01T21:08:03.567786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T21:08:01.911139Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":81,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 0 inbound Pith citation observations for arXiv:2607.16192."}