{"as_of":"2026-08-09T03:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3a31922b10b12f9440e45ade686ce5c83acf3ecd49047e681f0c2bfd58d655b9","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T19:15:34.751856Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T17:36:01.254174Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T12:49:53.218336Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"cited_work":{"arxiv_id":"2508.13104","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13104","snapshot_observed_at":"2026-07-04T12:49:53.218336Z","title":"arXiv preprint arXiv:2508.13104 (2025) 5","venue":null,"work_id":"f052f90d-1a37-469d-bdb7-97269b7e0e44","year":2025},"citing_paper":{"arxiv_id":"2603.11755","last_updated":"2026-06-29T14:21:14Z","snapshot_observed_at":"2026-07-14T22:39:44.966501Z","submitted_at":"2026-03-12T10:02:23Z","title":"Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T12:18:45.538658Z"},"links":{"cited_paper":"/paper/2508.13104","citing_paper":"/paper/2603.11755"},"observation_digest":"sha256:c83223ca66e25ffa231080ec79b8a5f428af978cefe0d8f8d7e5cb0a0312180c","observation_id":"5146c375-6962-4624-8511-7a7893229b71","resolution":{"observed_at":"2026-05-15T12:20:00.625747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"cited_work":{"arxiv_id":"2508.13104","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13104","snapshot_observed_at":"2026-07-04T12:49:53.218336Z","title":"arXiv preprint arXiv:2508.13104 (2025) 5","venue":null,"work_id":"f052f90d-1a37-469d-bdb7-97269b7e0e44","year":2025},"citing_paper":{"arxiv_id":"2606.26694","last_updated":"2026-06-28T04:16:09Z","snapshot_observed_at":"2026-07-07T00:01:01.437499Z","submitted_at":"2026-06-25T07:27:09Z","title":"PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T05:46:21.198781Z"},"links":{"cited_paper":"/paper/2508.13104","citing_paper":"/paper/2606.26694"},"observation_digest":"sha256:b3b736d09d52c3bc719de34fe8024a0bb6d2b3004defd8a15e76fbd83690f15b","observation_id":"92200f97-2258-4608-8c8a-e82fe275d20b","resolution":{"observed_at":"2026-07-04T12:49:53.220072Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"cited_work":{"arxiv_id":"2508.13104","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13104","snapshot_observed_at":"2026-07-04T12:49:53.218336Z","title":"arXiv preprint arXiv:2508.13104 (2025) 5","venue":null,"work_id":"f052f90d-1a37-469d-bdb7-97269b7e0e44","year":2025},"citing_paper":{"arxiv_id":"2606.26694","last_updated":"2026-06-28T04:16:09Z","snapshot_observed_at":"2026-07-07T00:01:01.437499Z","submitted_at":"2026-06-25T07:27:09Z","title":"PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T10:19:06.268547Z"},"links":{"cited_paper":"/paper/2508.13104","citing_paper":"/paper/2606.26694"},"observation_digest":"sha256:29ed32d97a44e365bc8ae85b81aa17cfcc663b48aac9e392aba2be8661b1211e","observation_id":"63f2e8db-c8e4-4c18-b917-fd3e1bf5c50d","resolution":{"observed_at":"2026-06-30T12:04:39.281373Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13104","snapshot_observed_at":"2026-07-11T17:36:01.254174Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04546","last_updated":"2026-07-05T23:29:23Z","snapshot_observed_at":"2026-08-03T14:09:27.379397Z","submitted_at":"2026-07-05T23:29:23Z","title":"Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T17:36:01.254174Z"},"links":{"cited_paper":"/paper/2508.13104","citing_paper":"/paper/2607.04546"},"observation_digest":"sha256:db387d96860f6bfe5029e2acab0feae18dc4a14b1df382a09b410203223c33f8","observation_id":"58c0452d-2ab4-4841-a0c3-ca847f61293a","resolution":{"observed_at":"2026-07-11T17:36:01.254174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.13104/citation-record","integrity":"/paper/2508.13104/integrity","json":"/paper/2508.13104/citation-record.json","paper":"/paper/2508.13104"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:13:33.172988Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T19:13:33.172988Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:8b7655fb49f7204e65303c1b3d11c7a9bf8f6a857f1c244f0bc754c2e8e5e4b8","observation_id":"60256d56-1918-4bb7-b7ce-f244880d90be","resolution":{"observed_at":"2026-08-05T19:13:33.172988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-05T19:14:34.361533Z","title":"Cosmos world foundation model platform for physical ai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T19:14:34.361533Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:9487afdfa37cfaeec33c92963803cff67a12878927cf8a92ee822e04c80683d4","observation_id":"1daa2b1b-c9ed-47ff-9302-d7b07c4255a8","resolution":{"observed_at":"2026-08-05T19:14:34.361533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11785","last_updated":"2025-04-04T14:22:32Z","snapshot_observed_at":"2026-08-05T23:39:48.490749Z","submitted_at":"2024-12-16T13:57:02Z","title":"InterDyn: Controllable Interactive Dynamics with Video Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11785","snapshot_observed_at":"2026-08-05T19:14:51.841623Z","title":"Interdyn: Con- trollable interactive dynamics with video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T19:14:51.841623Z"},"links":{"cited_paper":"/paper/2412.11785","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:48849ed1d4086cdd2e4c5e4a5688636b4e3b67a782f8fb506ca387726015ad61","observation_id":"9a4cb098-bed9-4131-b721-3a24e55fcf06","resolution":{"observed_at":"2026-08-05T19:14:51.841623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:04.622150Z","title":"Diffusion for world modeling: Visual details matter in atari","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:04.622150Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:e2858b3845e4b4898b9be6425a9bf8ed3be0611657def51507a9d4e8d0b997e2","observation_id":"2cfdc77f-8959-4e24-b4a0-2b4519aab69d","resolution":{"observed_at":"2026-08-05T19:15:04.622150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T19:15:30.984449Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:30.984449Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:600c3f24d70cbe25de7f39778103c7b7eb2c4606aebec1df8d69ca2a03a80576","observation_id":"5075b4ea-386a-4733-be38-7dd996117d1d","resolution":{"observed_at":"2026-08-05T19:15:30.984449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.262239Z","title":"Introducing hot3d: An egocentric dataset for 3d hand and object tracking, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.262239Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:9feda626ea588dea72a6f2ccf0745069a8f2ab044db987240d5da392c569da08","observation_id":"70878d32-88ff-450a-9db4-193333146606","resolution":{"observed_at":"2026-08-05T19:15:31.262239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.315633Z","title":"Lumiere: A space-time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.315633Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:d2e212f7fb9ef09d2a0a6ad99f6af728acd22be709e176611ed210eb2d0410a8","observation_id":"a755468e-3c01-4254-b336-fec4b6e284bb","resolution":{"observed_at":"2026-08-05T19:15:31.315633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.348171Z","title":"Automatic rigging and anima- tion of 3d characters","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.348171Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:34670cdf60a35b58c2daf45e29a3452535b839dfe4a0a32a0be95e30ecd3935f","observation_id":"8d3787ea-af80-409d-af2e-01179bc12842","resolution":{"observed_at":"2026-08-05T19:15:31.348171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-05T19:15:31.357011Z","title":"Gen2act: Human video generation in novel scenarios enables generalizable robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.357011Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:a45747350f83de1e2db6bf6802c5b2ac07476cbf3739878be18ccc3a6fb8bb66","observation_id":"78af8e13-775a-43df-af28-0c2d8a3144e8","resolution":{"observed_at":"2026-08-05T19:15:31.357011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-05T19:15:31.367241Z","title":"Zero- shot robotic manipulation with pretrained image-editing dif- fusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.367241Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:bc8c11d3103948e4efe10f88d42364532fac47effe5cd69f69ca7792437dc21e","observation_id":"a4738a33-af55-4a7b-b4a4-8dc1d9898485","resolution":{"observed_at":"2026-08-05T19:15:31.367241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T19:15:31.378635Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.378635Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:ef535ff2657e6f680a37441e6c7b9b5333a49231977416c711676238bfaf46f7","observation_id":"2c495f89-e5a7-439f-8d27-ec80194f2e00","resolution":{"observed_at":"2026-08-05T19:15:31.378635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.407516Z","title":"Genie: Generative interactive environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.407516Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:41b19c5fecb99ca2dbb69573b8f224d0095c466fd3cffc7f10c8ba9b6787a895","observation_id":"c203145b-f52a-4401-9386-5b8a5b1a257a","resolution":{"observed_at":"2026-08-05T19:15:31.407516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.425634Z","title":"1C filter: a simple speed-based low-pass filter for noisy input in interac- tive systems","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.425634Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:15e4616e0e0a9fbb14c105ca1cfa2ae7bf2c216c1cbf3a04a5c5f272a1a25bff","observation_id":"8d5a3834-d60e-4088-bd2b-457991f717b8","resolution":{"observed_at":"2026-08-05T19:15:31.425634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00769","last_updated":"2024-12-06T13:09:43Z","snapshot_observed_at":"2026-07-06T19:43:42.287026Z","submitted_at":"2024-11-01T17:59:17Z","title":"GameGen-X: Interactive Open-world Game Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00769","snapshot_observed_at":"2026-08-05T19:15:31.439193Z","title":"Gamegen-x: Interactive open-world game video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.439193Z"},"links":{"cited_paper":"/paper/2411.00769","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:358a37f054e39bff117f3746b34367456342c8a7c4f0867d5c4711bb538c49c1","observation_id":"b456ac54-02b6-492e-a7f8-ee9f91467e62","resolution":{"observed_at":"2026-08-05T19:15:31.439193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.474949Z","title":"Scaling egocentric vision: The epic-kitchens dataset","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.474949Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:fe287e863d3fb876f6a019232973072000ba011a4f105d39a8479dbbe7a16ffe","observation_id":"dfc4a088-9b51-4689-8f1e-d636e08ec80b","resolution":{"observed_at":"2026-08-05T19:15:31.474949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.503297Z","title":"Oasis: A universe in a transformer,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.503297Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:49106f37620969ff6019de8a4e21e90eda61e4ef3171553385fa72b1eaefc098","observation_id":"2da638c3-b55e-4aac-ade5-58b95b99c301","resolution":{"observed_at":"2026-08-05T19:15:31.503297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.527442Z","title":"Genie 2: A large-scale foundation world model,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.527442Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:2a9c9f48407e43ac78dd1f8b75a01ea06d82517c41ce701ecc84eacfe2b125ee","observation_id":"f3df8d26-b67a-4672-97e2-625ed288367b","resolution":{"observed_at":"2026-08-05T19:15:31.527442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.553318Z","title":"Motion capture from internet videos","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.553318Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:bfd3a90ab12d3671026dc3f8e9e01024a964359c14e68502552e509e35d55f13","observation_id":"0596b06a-5d90-485a-89fc-5d833fc7f272","resolution":{"observed_at":"2026-08-05T19:15:31.553318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.584748Z","title":"Tenenbaum, Dale Schuurmans, and Pieter Abbeel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.584748Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:db555900c40f6b861c482d209ac15c86229d8e2865de3998fcd12a09fc3209e7","observation_id":"745f3d2c-3b99-4f3f-b138-c0e89ca35bb0","resolution":{"observed_at":"2026-08-05T19:15:31.584748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.613428Z","title":"Arctic: A dataset for dexterous bimanual hand- object manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.613428Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:1e1edc47bcff2d3c60a4f9fd215c149062e9cb7149f838f5890bb6f70a238b3c","observation_id":"b7c33008-0a3d-4f81-9981-1bf6483dec1d","resolution":{"observed_at":"2026-08-05T19:15:31.613428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03568","last_updated":"2024-12-04T18:59:05Z","snapshot_observed_at":"2026-08-07T13:35:51.338673Z","submitted_at":"2024-12-04T18:59:05Z","title":"The Matrix: Infinite-Horizon World Generation with Real-Time Moving Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03568","snapshot_observed_at":"2026-08-05T19:15:31.619881Z","title":"The matrix: Infinite-horizon world generation with real-time moving control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.619881Z"},"links":{"cited_paper":"/paper/2412.03568","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:a4849f21bf849514a4627a70aa2b636e995f3ca713e87c7440f496b187ed5865","observation_id":"9187ef7e-f0f3-4c0b-bb64-a00df3bfad4d","resolution":{"observed_at":"2026-08-05T19:15:31.619881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.634652Z","title":"Gigahands: A massive annotated dataset of bimanual hand activities, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.634652Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:d4d19c69a8b7da585dba73139209078b69746147f6f1fadc92a4957d5021a982","observation_id":"3bc7d8dc-607f-4fc9-a95c-df317c42ff33","resolution":{"observed_at":"2026-08-05T19:15:31.634652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.650167Z","title":"Vista: A generalizable driving world model with high fidelity and versatile controllability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.650167Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:92a5e1f19459bb996498e5ae274819b5ac8e5c8173e39481ce7eb8e1d0c60bc9","observation_id":"2d6592d7-74cf-42d5-9acb-ce5335339722","resolution":{"observed_at":"2026-08-05T19:15:31.650167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02700","last_updated":"2025-03-27T21:38:09Z","snapshot_observed_at":"2026-08-08T23:53:57.839217Z","submitted_at":"2024-12-03T18:59:56Z","title":"Motion Prompting: Controlling Video Generation with Motion Trajectories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02700","snapshot_observed_at":"2026-08-05T19:15:31.659153Z","title":"Motion prompting: Controlling video generation with motion trajec- tories","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.659153Z"},"links":{"cited_paper":"/paper/2412.02700","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:b52ea0f9faab00eccabc104e615dfa934b3ff45a080b3d2ea1bec3cec895b92d","observation_id":"e67a4cd9-5fa8-426e-9919-e6c2f4ce8062","resolution":{"observed_at":"2026-08-05T19:15:31.659153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.670489Z","title":"The ”something something” video database for learning and evaluating visual common sense, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.670489Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:b945569470f78d0b2b3127582cfb0b6286985d6d6953b186b9b38f939db8e434","observation_id":"0ea2ced9-fdde-4c0d-88cc-59a759ccb189","resolution":{"observed_at":"2026-08-05T19:15:31.670489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.686672Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.686672Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:4f1ebb4695eb82046d7bb3f5df36068f99f93d1601ef750a9494de3060574c8c","observation_id":"2243be9b-abab-4a12-abb2-846fb1109606","resolution":{"observed_at":"2026-08-05T19:15:31.686672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.701792Z","title":"Ego-exo4d: Understanding skilled human activity from first- and third-person perspectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.701792Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:74f40a4795b7234d4276b9496961bda5d0dc45633d5c8ae627a1e56d1f8b5935","observation_id":"b01cae2c-f5d8-4898-a66b-b83f3949bae1","resolution":{"observed_at":"2026-08-05T19:15:31.701792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07556","last_updated":"2025-01-13T18:37:36Z","snapshot_observed_at":"2026-07-06T20:20:28.171470Z","submitted_at":"2025-01-13T18:37:36Z","title":"MatchAnything: Universal Cross-Modality Image Matching with Large-Scale Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07556","snapshot_observed_at":"2026-08-05T19:15:31.712338Z","title":"Matchanything: Universal cross-modality image matching with large-scale pre-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.712338Z"},"links":{"cited_paper":"/paper/2501.07556","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:be40dd4d9be970496097adb3fbb1ae28325795420e0bc80282776b4a2f8ff322","observation_id":"8d956fe0-0779-45b0-a5fc-97ce2918c6dd","resolution":{"observed_at":"2026-08-05T19:15:31.712338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.729237Z","title":"Hand-eye calibration","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.729237Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:bab693ccd2e739ab874582deb40dff30f43975eee8926e042b71b9d3cc4ef043","observation_id":"7c1a7c24-223f-41cc-aef4-50d0f1328e73","resolution":{"observed_at":"2026-08-05T19:15:31.729237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.734702Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.734702Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:f07e0a2eee988d25830ac0c491102eba965489b153164d9ae338793883ed6fda","observation_id":"b25704f9-b7e5-4ec6-9c08-b1ef38a1f23c","resolution":{"observed_at":"2026-08-05T19:15:31.734702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.739938Z","title":"Animate anyone: Consistent and controllable image- to-video synthesis for character animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.739938Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:417c7df4f8ecfc627df50a08c21374b5b5e501c5c83cbfbc9b16b2298c1a3e1a","observation_id":"3ff48e37-f7db-43c7-8cc9-9007c51c5501","resolution":{"observed_at":"2026-08-05T19:15:31.739938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06145","last_updated":"2025-02-10T04:20:11Z","snapshot_observed_at":"2026-08-08T16:33:13.977887Z","submitted_at":"2025-02-10T04:20:11Z","title":"Animate Anyone 2: High-Fidelity Character Image Animation with Environment Affordance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06145","snapshot_observed_at":"2026-08-05T19:15:31.750331Z","title":"Ani- mate anyone 2: High-fidelity character image animation with environment affordance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.750331Z"},"links":{"cited_paper":"/paper/2502.06145","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:86d6866c0040bb1b66066dd04472456c9d04b855eb6eecb2882409b0e75e9fbc","observation_id":"1aa7adb4-b970-4a1b-b514-7fbeeba0fa7d","resolution":{"observed_at":"2026-08-05T19:15:31.750331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11831","last_updated":"2024-10-15T17:56:32Z","snapshot_observed_at":"2026-08-03T21:35:04.144048Z","submitted_at":"2024-10-15T17:56:32Z","title":"CoTracker3: Simpler and Better Point Tracking by Pseudo-Labelling Real Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11831","snapshot_observed_at":"2026-08-05T19:15:31.768262Z","title":"Co- tracker3: Simpler and better point tracking by pseudo- labelling real videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.768262Z"},"links":{"cited_paper":"/paper/2410.11831","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:2d0fe6bf6066ce0129f8f25260908796ce4279a23ed370fe460854cda7ef4f63","observation_id":"813318ee-f29c-464b-922a-6c6e56ba610f","resolution":{"observed_at":"2026-08-05T19:15:31.768262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.778318Z","title":"The kinetics human action video dataset, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.778318Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:78b141d530532adf42ec195b4bc32ca9e016de4befd785f5ef1c86c271adf306","observation_id":"9132b549-d6a0-4de2-88d8-b5841df3d597","resolution":{"observed_at":"2026-08-05T19:15:31.778318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-05T19:15:31.792222Z","title":"Droid: A large-scale in-the-wild robot ma- nipulation dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.792222Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:5f539d003d12af0728fb1075f17a8f07ee5276aa20c723536c7776dd6b25ab3a","observation_id":"d50df9b7-850b-4f6a-bcc9-30dccab68493","resolution":{"observed_at":"2026-08-05T19:15:31.792222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.854660Z","title":"Sapiens: Foundation for human vision mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.854660Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:fdde291a9b804d67f544b35b71f501419e638e6a8f55c7e44a7d5adf1ed5cc1e","observation_id":"a2725ab3-fc2f-4225-aedf-0470386e666b","resolution":{"observed_at":"2026-08-05T19:15:31.854660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08576","last_updated":"2023-10-12T17:59:23Z","snapshot_observed_at":"2026-08-05T14:38:36.869054Z","submitted_at":"2023-10-12T17:59:23Z","title":"Learning to Act from Actionless Videos through Dense Correspondences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08576","snapshot_observed_at":"2026-08-05T19:15:31.867862Z","title":"Learning to act from actionless videos through dense correspondences","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.867862Z"},"links":{"cited_paper":"/paper/2310.08576","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:fa681e871cec3d6eb3713da6737e56fe07f99beb9a685af4c1161a039026d617","observation_id":"f1065572-00dc-42ae-aabf-adf95f136f96","resolution":{"observed_at":"2026-08-05T19:15:31.867862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:31.881776Z","title":"Pose space deformation: a unified approach to shape interpolation and skeleton-driven deformation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.881776Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:ecc3103b04fa052088fc4a0dc3330156069c265023ddcf2abd3165004a1cdeaa","observation_id":"0685dd8e-9c77-4bfd-9ec1-7256dccc8706","resolution":{"observed_at":"2026-08-05T19:15:31.881776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12091","last_updated":"2025-04-26T13:48:44Z","snapshot_observed_at":"2026-07-06T20:07:58.873037Z","submitted_at":"2024-12-16T18:58:17Z","title":"Wonderland: Navigating 3D Scenes from a Single Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12091","snapshot_observed_at":"2026-08-05T19:15:31.963426Z","title":"Wonderland: Navigating 3d scenes from a single image","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.963426Z"},"links":{"cited_paper":"/paper/2412.12091","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:af3eaa7ed5c41e858e04917cc4f2407af337d1c639c33b6227223905934970db","observation_id":"b3e93b1b-f504-47ef-9f7e-fb46ff0a4d09","resolution":{"observed_at":"2026-08-05T19:15:31.963426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:32.124734Z","title":"Taco: Benchmarking general- izable bimanual tool-action-object understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:32.124734Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:80688f956a29c56c5b4931962e735ff9fcd1b5a6b421e7d236b3c00afdeb3d22","observation_id":"0742e22e-6796-4822-8fdd-5499e550eeab","resolution":{"observed_at":"2026-08-05T19:15:32.124734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10447","last_updated":"2025-07-22T22:34:57Z","snapshot_observed_at":"2026-08-08T00:40:22.017303Z","submitted_at":"2024-06-14T23:52:27Z","title":"The BabyView dataset: High-resolution egocentric videos of infants' and young children's everyday experiences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10447","snapshot_observed_at":"2026-08-05T19:15:32.211938Z","title":"The babyview dataset: High-resolution egocentric videos of infants’ and young children’s everyday experiences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:32.211938Z"},"links":{"cited_paper":"/paper/2406.10447","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:a68d0d8f7412612c582dc605208a81d1579b8f993b72cfa610c08896d9560585","observation_id":"cce376c2-119d-4b1b-bb34-8dbc05b709fb","resolution":{"observed_at":"2026-08-05T19:15:32.211938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-05T19:15:35.517082Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-05T19:15:32.347462Z","title":"Mediapipe: A framework for building perception pipelines.arXiv preprint arXiv:1906.08172, 2019","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:32.347462Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:585785dbceab89591e04e8ba22a9e0c3dc846bd865901a469189471df9cefd78","observation_id":"d10c0c7f-277f-4683-866b-e7f5739a9199","resolution":{"observed_at":"2026-08-05T19:15:32.347462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16160","last_updated":"2025-06-11T08:28:01Z","snapshot_observed_at":"2026-08-07T23:57:27.127966Z","submitted_at":"2024-09-24T15:00:07Z","title":"MIMO: Controllable Character Video Synthesis with Spatial Decomposed Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16160","snapshot_observed_at":"2026-08-05T19:15:32.454826Z","title":"Mimo: Controllable character video synthesis with spatial decomposed modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:32.454826Z"},"links":{"cited_paper":"/paper/2409.16160","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:c561cee6de0cefbe3072eeb3a875ac73fe8d8a82874bfeb6f35b95a405666b79","observation_id":"1c9e602f-c4d6-4f7f-befa-3be7ee9e27df","resolution":{"observed_at":"2026-08-05T19:15:32.454826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09038","last_updated":"2025-02-27T15:10:51Z","snapshot_observed_at":"2026-08-02T17:18:33.867969Z","submitted_at":"2025-01-14T20:59:37Z","title":"Do generative video models understand physical principles?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09038","snapshot_observed_at":"2026-08-05T19:15:32.503772Z","title":"Do generative video models understand physical principles? arXiv preprint arXiv:2501.09038, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:32.503772Z"},"links":{"cited_paper":"/paper/2501.09038","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:b26ae27be2640abd4b7b557b7b1f5e2cbd56021760e6a76fb38609b51ffa05b2","observation_id":"60ca9129-a756-4b67-9b64-e36f1bd4e604","resolution":{"observed_at":"2026-08-05T19:15:32.503772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:32.584211Z","title":"A survey on deep learning for skeleton-based human animation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:32.584211Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:fc1a47ca23c356afa7c7fee4607f799e2c7a1f178c8916eb0931ecbd73b8dc1e","observation_id":"81e2e1f7-a9e4-4e20-a133-5215c25c9563","resolution":{"observed_at":"2026-08-05T19:15:32.584211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:32.671158Z","title":"Openai sora, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:32.671158Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:9220e733ffa33a74209edc47bb0cc5395086ae4d04e3ce5811813071cceafe22","observation_id":"b6d7e9f7-ad75-4f5d-9473-5e51d7c31b0c","resolution":{"observed_at":"2026-08-05T19:15:32.671158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:32.734752Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:32.734752Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:085a88fc2e5c25340c52530a89be6512425801582a7578f94a59229e4e4dc557","observation_id":"17bc754a-3a3e-4632-99da-c975150821bb","resolution":{"observed_at":"2026-08-05T19:15:32.734752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:32.828586Z","title":"Computer animation: algorithms and techniques","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:32.828586Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:eb15fc69fd84abe47e40916108b1d78ca415bc09cb0c39d5a07d7a4c4feeeb37","observation_id":"5880a6a6-32bb-4b1c-9441-42314804c31a","resolution":{"observed_at":"2026-08-05T19:15:32.828586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:32.903369Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:32.903369Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:c6e06de8c4ce73cf2df5169b57dd3eaf7f580885af82b197550e5b5be77b0ea4","observation_id":"66b4011d-db36-4198-9a9a-cb93a57612ff","resolution":{"observed_at":"2026-08-05T19:15:32.903369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:32.964980Z","title":"Sampson, Shikai Li, Simone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petrovic, and Yuming Du","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:32.964980Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:f4fc3c19f44652394f743b864d7c8c9854bb4fe1b808009577936e00fc847f26","observation_id":"8ad72c32-8f59-4344-b9e1-ce4d8a19e61a","resolution":{"observed_at":"2026-08-05T19:15:32.964980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12259","last_updated":"2025-03-26T18:05:52Z","snapshot_observed_at":"2026-07-06T19:17:46.809272Z","submitted_at":"2024-09-18T18:46:51Z","title":"WiLoR: End-to-end 3D Hand Localization and Reconstruction in-the-wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12259","snapshot_observed_at":"2026-08-05T19:15:32.986642Z","title":"Wilor: End-to-end 3d hand localization and reconstruction in-the-wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:32.986642Z"},"links":{"cited_paper":"/paper/2409.12259","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:6e712208c80c7f23608de3e956b9844bde025f357ea23c740a67518a0e108248","observation_id":"333eddb6-26d6-48b0-97e6-d63793da210e","resolution":{"observed_at":"2026-08-05T19:15:32.986642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T19:15:32.991524Z","title":"Sam 2: Segment any- thing in images and videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:32.991524Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:4e33c6a77cb85f916f0613cc46d683e86dcfb03dd522b8935ad02c659d6e4294","observation_id":"c7867f6f-f8ec-4e64-a853-463835f4df2c","resolution":{"observed_at":"2026-08-05T19:15:32.991524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:33.055594Z","title":"World-grounded human motion recovery via gravity-view co- ordinates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:33.055594Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:f4bae054ce774c702201a2da730fb3208a3f5d886dbf5e6bed4e2402504482b8","observation_id":"e1b1493d-301d-40c6-b942-fbfa0484ab2b","resolution":{"observed_at":"2026-08-05T19:15:33.055594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:33.169774Z","title":"Motion-i2v: Consistent and controllable image-to-video gen- eration with explicit motion modeling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:33.169774Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:9cf6259bcaf09539918a30370bbf9081648ab17a0c3e868dc4fb394533c66111","observation_id":"56c0324b-d41f-4071-9e1f-4162b3135e57","resolution":{"observed_at":"2026-08-05T19:15:33.169774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:33.330539Z","title":"Genhowto: Learning to generate actions and state transformations from instructional videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:33.330539Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:b71316e37e0470d223da1cb25527916ffabddb53603ad80239b7ef473ede0404","observation_id":"0a760d21-6dbc-4a72-b1c9-c4d977d0d174","resolution":{"observed_at":"2026-08-05T19:15:33.330539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:33.437010Z","title":"Optimal hand-eye cali- bration","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:33.437010Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:6e4cdc0d351be65723a93f30f410ad3a061ffc0d2187b75c610cc715a5276055","observation_id":"a7ddd85e-195c-4d2d-9b7a-6795245cb9b7","resolution":{"observed_at":"2026-08-05T19:15:33.437010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:33.534183Z","title":"Controlling the world by sleight of hand","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:33.534183Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:a11a7906ec7ac86b3640c13e54e87cdef0735857100562d994f48ac92ff915df","observation_id":"17874761-d284-4e65-ba06-b254102ef742","resolution":{"observed_at":"2026-08-05T19:15:33.534183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:33.604874Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:33.604874Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:97a3959605865245aa1a6df280550ecdcece876667a0f6458f848cf4c5e261d6","observation_id":"55ca3260-b9bd-4bf6-8d98-38558533cbfd","resolution":{"observed_at":"2026-08-05T19:15:33.604874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:33.719708Z","title":"A new technique for fully autonomous and efficient 3 d robotics hand/eye calibration","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:33.719708Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:43c81b8b0a5763061f89b1e86dde1d3629ade30b92f650aab7392a50980ecde9","observation_id":"a59459fc-d4f8-468d-a52a-4ba3aedb1085","resolution":{"observed_at":"2026-08-05T19:15:33.719708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:33.765796Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:33.765796Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:d840a4566e0dfb9729c3f6098e3aab34bcb1309e1cc5bee99fd879bac0f7d0c9","observation_id":"caf6a23d-d957-4466-a80c-918dc681d3d6","resolution":{"observed_at":"2026-08-05T19:15:33.765796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-07-06T19:06:23.640089Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-05T19:15:33.850238Z","title":"Diffusion models are real-time game engines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:33.850238Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:839e19b731be1727bac5597df5af2e2a87ea894d9e47e8b8062d9cc781545b89","observation_id":"69492a8f-750b-4b60-bbb9-21a373efdea6","resolution":{"observed_at":"2026-08-05T19:15:33.850238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01566","last_updated":"2024-02-02T16:59:48Z","snapshot_observed_at":"2026-08-05T10:16:25.180895Z","submitted_at":"2024-02-02T16:59:48Z","title":"Boximator: Generating Rich and Controllable Motions for Video Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01566","snapshot_observed_at":"2026-08-05T19:15:34.008515Z","title":"Boximator: Generating rich and controllable motions for video synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:34.008515Z"},"links":{"cited_paper":"/paper/2402.01566","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:4e2f92b283c790d0fdce5980563aa6b96d592fdf1f9bb5152c7b502dd17eec31","observation_id":"7e07eb07-a377-4dd4-b077-448780dd9982","resolution":{"observed_at":"2026-08-05T19:15:34.008515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20193","last_updated":"2024-10-16T18:35:31Z","snapshot_observed_at":"2026-08-06T01:11:00.872917Z","submitted_at":"2024-03-29T14:14:22Z","title":"Motion Inversion for Video Customization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20193","snapshot_observed_at":"2026-08-05T19:15:34.140230Z","title":"Motion inversion for video customization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:34.140230Z"},"links":{"cited_paper":"/paper/2403.20193","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:72ba802eea3bcc9d0eb158d24943a91add1bbb7669651c2d7fafd6629c3782cb","observation_id":"21d70202-8869-4e07-a7eb-a46f1a171958","resolution":{"observed_at":"2026-08-05T19:15:34.140230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-07-06T19:49:34.518432Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-08-05T19:15:34.292314Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:34.292314Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:247c284503f2e472b2e5b2ed232c3382194423ea70f5bfac6c2c6642921f73de","observation_id":"8d4ee067-2a01-470c-a0e8-d8cbe31222ec","resolution":{"observed_at":"2026-08-05T19:15:34.292314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:34.451746Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:34.451746Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:a829a0528a4e0736d8f07803664e6e930cb413b76d6f63f1e9a058b93269d902","observation_id":"a9e55f6f-982f-4e2a-91d3-5804930451cb","resolution":{"observed_at":"2026-08-05T19:15:34.451746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:34.548947Z","title":"Mo- tionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:34.548947Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:3c71784902d3f9401e4870c59c6bb7d07233515d791ebba52b12ae3be2ac7410","observation_id":"60b236e7-d8f2-49a4-9292-c167d04d171d","resolution":{"observed_at":"2026-08-05T19:15:34.548947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:34.655334Z","title":"ivideogpt: Interactive videogpts are scalable world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:34.655334Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:9f63ff6e8f7bddd6c3f2905aa09f083cf6bc2f1a5cc2a0c77c9178021c970b69","observation_id":"8435d1d5-5001-42f7-a240-8e5b2d7f2baa","resolution":{"observed_at":"2026-08-05T19:15:34.655334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:15:34.751856Z","title":"Samurai: Adapt- ing segment anything model for zero-shot visual tracking with motion-aware memory, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:34.751856Z"},"links":{"citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:ed6db5ada14fa162c1582e9f97fbcfeef636d823f88a128247521307e1cc3723","observation_id":"3efa7fda-a3a9-4916-9a96-170102a4f36a","resolution":{"observed_at":"2026-08-05T19:15:34.751856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":68,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 4 inbound Pith citation observations for arXiv:2508.13104."}