{"as_of":"2026-08-14T16:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:06665f72f4b1c82a42f03e4c13d6d823813393a1e195e790aab0dc1ee76cdc48","coverage":[{"denominator":119,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:55:59.914437Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.00932/citation-record","integrity":"/paper/2412.00932/integrity","json":"/paper/2412.00932/citation-record.json","paper":"/paper/2412.00932"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.397059Z","title":"When will you do what?-anticipating temporal occurrences of activities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.397059Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:ceb66198f683f32d1297d8340a26c7728d857aac1b0e447109d4494e96ccb1f0","observation_id":"c95a774e-e9a0-4766-a269-52b754da3f11","resolution":{"observed_at":"2026-08-12T04:55:59.397059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.401821Z","title":"A spatio-temporal transformer for 3d human mo- tion prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.401821Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:26ded947aa6579be7d42d75d7614f7f95583f508ed743410098d1973740a6710","observation_id":"022228d3-b30f-4870-826d-c08cd4edc939","resolution":{"observed_at":"2026-08-12T04:55:59.401821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.406523Z","title":"Zero experience required: Plug & play modu- lar transfer learning for semantic visual navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.406523Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:a0b10b11a5c87a6a97f6fe9fae00a7ddef815bf8aa8bd95ae6a783b89253da0b","observation_id":"b58bab80-8db7-48bc-9ab1-8c9ea6846ff9","resolution":{"observed_at":"2026-08-12T04:55:59.406523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.06757","last_updated":"2018-07-18T03:28:02Z","snapshot_observed_at":"2026-08-14T11:12:04.949259Z","submitted_at":"2018-07-18T03:28:02Z","title":"On Evaluation of Embodied Navigation Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.06757","snapshot_observed_at":"2026-08-12T04:55:59.412778Z","title":"On evaluation of embodied navigation agents","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.412778Z"},"links":{"cited_paper":"/paper/1807.06757","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:680511925fdcc5c97700c10da634c30038446568972d9bd3149e181d3e5cb350","observation_id":"7e2b7f73-dc70-429b-83f1-2e990df1e54e","resolution":{"observed_at":"2026-08-12T04:55:59.412778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.418626Z","title":"Hiervl: Learning hierarchical video- language embeddings","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.418626Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:a61ebe1e606570f8f71f61be79a1b99a71217f7ce3a81ae5085fe9cb3f9e19e5","observation_id":"dc20e4b7-d67d-4887-9c40-3dd2704841e0","resolution":{"observed_at":"2026-08-12T04:55:59.418626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00672","last_updated":"2025-04-11T20:37:50Z","snapshot_observed_at":"2026-08-12T23:10:07.704417Z","submitted_at":"2024-08-01T16:13:07Z","title":"ExpertAF: Expert Actionable Feedback from Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00672","snapshot_observed_at":"2026-08-12T04:55:59.425152Z","title":"ExpertAF: Ex- pert actionable feedback from video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.425152Z"},"links":{"cited_paper":"/paper/2408.00672","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:2b82cc88d90f1b41ef627f906b4c4b73a2522ddfbb45ccb266bf4b86346cced8","observation_id":"2542b0b9-ef66-40d1-ae14-91d0690dcb4c","resolution":{"observed_at":"2026-08-12T04:55:59.425152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.429721Z","title":"Video-mined task graphs for keystep recognition in instructional videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.429721Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:7b5288da42b17c7113cf9a6be96b43f76f050ee55d3f3c2a5aea48bc8fbfaf83","observation_id":"1a821230-2642-46a5-84fa-8a3633942ca3","resolution":{"observed_at":"2026-08-12T04:55:59.429721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.434263Z","title":"Affordances from human videos as a versatile representation for robotics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.434263Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:f3c1da9e7469ce3ef013050955de0402c2862d4696d6770e0fd6db3f6f9c0218","observation_id":"f90a7c01-627c-42ef-a83f-4f677f48f99b","resolution":{"observed_at":"2026-08-12T04:55:59.434263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13171","last_updated":"2020-08-30T04:28:13Z","snapshot_observed_at":"2026-08-14T14:40:15.936772Z","submitted_at":"2020-06-23T17:18:54Z","title":"ObjectNav Revisited: On Evaluation of Embodied Agents Navigating to Objects","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13171","snapshot_observed_at":"2026-08-12T04:55:59.438939Z","title":"Objectnav revisited: On evaluation of embodied agents navigating to objects","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.438939Z"},"links":{"cited_paper":"/paper/2006.13171","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:c87b17bded4cb4fa2e0d05217f2a247f9a1b9b5463594b7b0403572f00df1fca","observation_id":"95c4d2c7-7c85-46bb-8864-5b7294c1375c","resolution":{"observed_at":"2026-08-12T04:55:59.438939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.443996Z","title":"Is space-time attention all you need for video understanding? In ICML, page 4, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.443996Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:4648b0ddbcc809d853b8ee9c8444707c56fd9bb92588be6d042bd1efbec26007","observation_id":"2297cef5-8674-44dc-b5a2-c97368b3ec24","resolution":{"observed_at":"2026-08-12T04:55:59.443996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.450889Z","title":"Procedure planning in instructional videos via contextual modeling and model- based policy learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.450889Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:aabc60f0a5ca5f0efa2e11e79ec17c84cf9d02f7e27cdae90a9391899cb8b59a","observation_id":"f8935a8d-f960-4b47-913e-5e629a3e7a4c","resolution":{"observed_at":"2026-08-12T04:55:59.450889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.454637Z","title":"Long-term human mo- tion prediction with scene context","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.454637Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:01746b8ae469164f1601d7e83457015bcd2f0a0d196732a381af386a758365f5","observation_id":"f740a5e7-ad07-4b37-9228-1038b8bc3012","resolution":{"observed_at":"2026-08-12T04:55:59.454637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.457842Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.457842Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:69324cf598d095dc557fc440212946afd4c87e564a7d076710a42f4dde1e70a0","observation_id":"b9a306b7-83f1-4529-a98d-6b87fb4af34f","resolution":{"observed_at":"2026-08-12T04:55:59.457842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.461437Z","title":"Procedure planning in instructional videos","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.461437Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:01f7a7b36afb244d609ee380083b26a1b785deee68ad3246a703b8d336eb4a61","observation_id":"4c1da243-0ef4-44e7-8edd-fb9aab1adbc5","resolution":{"observed_at":"2026-08-12T04:55:59.461437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16796","last_updated":"2024-03-06T02:19:38Z","snapshot_observed_at":"2026-08-14T10:57:44.231246Z","submitted_at":"2024-02-26T18:09:24Z","title":"Expressive Whole-Body Control for Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16796","snapshot_observed_at":"2026-08-12T04:55:59.464865Z","title":"Expressive whole-body con- trol for humanoid robots","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.464865Z"},"links":{"cited_paper":"/paper/2402.16796","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:4164b48c5a1ca87d058d8ee413011f95a75b6c50a64d3ea2926bfd8ccc0f98f5","observation_id":"5eb360d5-b888-47e2-9637-920da724e3ac","resolution":{"observed_at":"2026-08-12T04:55:59.464865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.468904Z","title":"Context-aware human motion prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.468904Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:5f7da151fb7a26e191be0296cfed3dde5a94374724d6fdcaebcdb7eff665319e","observation_id":"58b08415-f29b-4bf7-9c4e-ef45c24e6c0f","resolution":{"observed_at":"2026-08-12T04:55:59.468904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.473018Z","title":"Enrichme: Per- ception and interaction of an assistive robot for the elderly at home","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.473018Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:3f3b23e360173d1a88b42fa7262e6045abe515b87be1cc21969b0268d3d87ba4","observation_id":"065ad2b4-b807-45b1-8c15-3fdb8eddb8c1","resolution":{"observed_at":"2026-08-12T04:55:59.473018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.477471Z","title":"Rescaling egocentric vision: collection, pipeline and chal- lenges for epic-kitchens-100","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.477471Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:391e01d9bf7da318b1e08b9dc95837bc584d604579db056bb559542bebe9ea73","observation_id":"4ac30229-5b29-4828-b673-33e479576cbd","resolution":{"observed_at":"2026-08-12T04:55:59.477471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.481221Z","title":"3d affordancenet: A benchmark for visual object affordance understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.481221Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:59017603dd3d3625a9711d7dd46b640e91d63a9325f76a5bcd14373f8efd3792","observation_id":"ceac0663-40ab-4778-b4be-0bc8c98e4ea9","resolution":{"observed_at":"2026-08-12T04:55:59.481221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.485891Z","title":"Cg-hoi: Contact-guided 3d human-object interaction generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.485891Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:ea5df0a4c24d352d9c12be6f4c3560763a68bd102a0ce83bbaccfe7be09d1d67","observation_id":"6dcfee24-9873-4266-ae4a-81bc264f9f9d","resolution":{"observed_at":"2026-08-12T04:55:59.485891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T04:55:59.489732Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.489732Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:db9e89c772d1428eebe7705b158d326457f27c30db66594da6ef79f79e1c05b0","observation_id":"265f3001-992f-4a17-ba35-d57b79014bc1","resolution":{"observed_at":"2026-08-12T04:55:59.489732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.494237Z","title":"Simultaneous local- ization and mapping: part i","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.494237Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:0b9e5aca45be1ac804534ea6088792b09c36682e43b4e1b4b2ed6ac869d19f17","observation_id":"96efb0e0-9d9a-46de-89a9-b2aff306908b","resolution":{"observed_at":"2026-08-12T04:55:59.494237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.497741Z","title":"Flow graph to video grounding for weakly-supervised multi-step localization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.497741Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:7c0a98a8edad2ff199377f9cb42df87a84f532e6e0bb37f4f8d6716c1dcef19d","observation_id":"32520ba7-dcf5-46d1-b2d5-95079b5c9a9c","resolution":{"observed_at":"2026-08-12T04:55:59.497741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.501481Z","title":"Tokenhmr: Advancing human mesh re- 9 covery with a tokenized pose representation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.501481Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:f9b353492b4511df155d993690ca041dd39e52bf1c3061c71a4365ad2e98df7e","observation_id":"2dc1a19b-e9a0-4a68-8f4c-96490736776f","resolution":{"observed_at":"2026-08-12T04:55:59.501481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13561","last_updated":"2023-10-01T20:16:22Z","snapshot_observed_at":"2026-08-13T14:52:21.014234Z","submitted_at":"2023-08-24T20:42:21Z","title":"Project Aria: A New Tool for Egocentric Multi-Modal AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13561","snapshot_observed_at":"2026-08-12T04:55:59.505259Z","title":"Project aria: A new tool for egocentric multi-modal ai research","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.505259Z"},"links":{"cited_paper":"/paper/2308.13561","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:cb5931b2c17d5f3cc5796562cc250c7c5d7e01559f3c5aef16c6a3050d6d532b","observation_id":"85643271-4cea-4c54-9799-21e1a05540db","resolution":{"observed_at":"2026-08-12T04:55:59.505259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.509543Z","title":"A density-based algorithm for discovering clusters in large spatial databases with noise","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.509543Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:80c92d635d15bae5a8d516965837e7d07d8433b5d6da7d0c2a37b94896676d82","observation_id":"2299be9d-93e7-4fdd-90b7-400eaaf71e2c","resolution":{"observed_at":"2026-08-12T04:55:59.509543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.513886Z","title":"Slowfast networks for video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.513886Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:9904fa2c2e780a4c848a5a0e9373c5c84f0a76bb411e44e0bbca9fdea7aceb6e","observation_id":"9650bfbe-83f2-4201-9ec7-c30b3fd4ba0c","resolution":{"observed_at":"2026-08-12T04:55:59.513886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.517545Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.517545Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:d697b734bd28a97a738aa788268cdbdb1b533d0fae876038513c420b692628e0","observation_id":"2ca6f636-f66d-4bf6-ae28-7b0be065eb78","resolution":{"observed_at":"2026-08-12T04:55:59.517545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.521528Z","title":"Rolling- unrolling lstms for action anticipation from first-person video","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.521528Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:2086ba6f5eb1929d10f3aed5ba28517e544c3d96ff3be95265bd99c049da8204","observation_id":"3f76046c-4380-4c1c-9f2c-70af36c75545","resolution":{"observed_at":"2026-08-12T04:55:59.521528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.526581Z","title":"Next-active-object predic- tion from egocentric videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.526581Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:ecd5dae32762de84c33674d2ef1e7536ddd28104b6995f5dec459de32b30a310","observation_id":"a70b580e-32ca-4e3e-beba-618376031e57","resolution":{"observed_at":"2026-08-12T04:55:59.526581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.04818","last_updated":"2017-07-16T04:23:57Z","snapshot_observed_at":"2026-08-06T21:39:58.286842Z","submitted_at":"2017-07-16T04:23:57Z","title":"RED: Reinforced Encoder-Decoder Networks for Action Anticipation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.04818","snapshot_observed_at":"2026-08-12T04:55:59.535082Z","title":"Red: Re- inforced encoder-decoder networks for action anticipation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.535082Z"},"links":{"cited_paper":"/paper/1707.04818","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:c32bf6b90965366c5a2dc1d057286ba5c9966fe67f6948283efb9ed2d0ec47b4","observation_id":"01abb968-9e33-48bd-b23d-55d9f11abb22","resolution":{"observed_at":"2026-08-12T04:55:59.535082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.538490Z","title":"Anticipative video transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.538490Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:bab02ddd507e28ce2ff14402d94f8261582cecd1ee9be536ee902219e833c87a","observation_id":"a6063b88-8054-4b1a-8174-13b6c88ae93a","resolution":{"observed_at":"2026-08-12T04:55:59.538490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.542273Z","title":"Omni- vore: A single model for many visual modalities","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.542273Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:af3316c1d1d7c5ace23b3c067a8f00d91d1e1240daaceda4e28cad9db493f00c","observation_id":"004f3e4f-8e7e-4127-88d3-bf299f685a08","resolution":{"observed_at":"2026-08-12T04:55:59.542273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.545672Z","title":"Humans in 4d: Re- constructing and tracking humans with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.545672Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:149e61b86d9c5e7c626599b97c18bcf804462f3b534db6465ce27ecb99131fa8","observation_id":"bf196040-dcb1-4cfb-af48-5c104814bb4f","resolution":{"observed_at":"2026-08-12T04:55:59.545672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.549484Z","title":"Con- tactopt: Optimizing contact to improve grasps","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.549484Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:c62e365e9b2ab5d74a2bb60db02a916245393e5afa9eda7fb1495c7eca2f2dbb","observation_id":"47955e9a-7cf5-4cc3-8590-d870b02ffe80","resolution":{"observed_at":"2026-08-12T04:55:59.549484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.553880Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.553880Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:a7b56df200405093c1f42476ea3b76b57675e983b9cf476fc522c97ba7a471eb","observation_id":"cbe0b724-33af-4318-b876-7ed2bbe59832","resolution":{"observed_at":"2026-08-12T04:55:59.553880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.558067Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.558067Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:a1df63c5ebf998bef84b5dbef10b72ddfbfc1ad794a5f5063ee6ec3d0fab2f56","observation_id":"818be1cb-7ff7-494a-9c1b-967c34453325","resolution":{"observed_at":"2026-08-12T04:55:59.558067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.562199Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.562199Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:9a3b3630f31cfaf9a078ed8ab65ff536dee1881b4ebc6501a106669289413148","observation_id":"649f042e-568f-453c-9609-b41fc3830ebc","resolution":{"observed_at":"2026-08-12T04:55:59.562199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.566700Z","title":"Resolving 3d human pose ambiguities with 3d scene constraints","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.566700Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:c59c6356a91fac947dd0b5fb785d9db9a556208794c6efa371c4d97ead1aa57d","observation_id":"896641e9-732a-4cae-a3d5-7b1c5182b8a1","resolution":{"observed_at":"2026-08-12T04:55:59.566700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.571042Z","title":"Stochas- tic scene-aware motion prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.571042Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:f74aad683466a44c01fa06348802b1479e6e0b97ed62042e9544ad31f6ab32a4","observation_id":"ed044fe1-a82f-448f-b79b-0247bdcd712b","resolution":{"observed_at":"2026-08-12T04:55:59.571042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.575363Z","title":"Synthesizing phys- ical character-scene interactions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.575363Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:a930604e31bb29b6139ec56ac007dc0559962c3ad63bc36eb33cb528de1c45e3","observation_id":"14dd2e39-6a5c-4c28-a458-dc4e16fee3a4","resolution":{"observed_at":"2026-08-12T04:55:59.575363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04436","last_updated":"2024-03-07T12:10:41Z","snapshot_observed_at":"2026-08-13T04:00:51.099269Z","submitted_at":"2024-03-07T12:10:41Z","title":"Learning Human-to-Humanoid Real-Time Whole-Body Teleoperation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04436","snapshot_observed_at":"2026-08-12T04:55:59.579824Z","title":"Learning human- to-humanoid real-time whole-body teleoperation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.579824Z"},"links":{"cited_paper":"/paper/2403.04436","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:3525eed370cd68c6d29645d12e7127d59d6408d2a953cf59afef1a9ed64cd2b3","observation_id":"ccdee9e4-0959-4787-b098-6152f839eea3","resolution":{"observed_at":"2026-08-12T04:55:59.579824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.584042Z","title":"Diffusion- based generation, optimization, and planning in 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.584042Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:e9c2066dc3facab575197779a326332f1c0a4a85855ef6c52e2077aaa74d3a81","observation_id":"90595afb-d08a-4055-9a06-4a6c2fe5c670","resolution":{"observed_at":"2026-08-12T04:55:59.584042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.587680Z","title":"Human3.6m: Large scale datasets and pre- dictive methods for 3d human sensing in natural environ- ments","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.587680Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:7a06c2f28ee7e020f54e6faabe8e66ee9f1ebb66ef2ac92619848cdd1ce051e1","observation_id":"7ce5930b-6c19-4f41-ad7e-6a8ee7bda2da","resolution":{"observed_at":"2026-08-12T04:55:59.587680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.591402Z","title":"Hand-object contact consistency reasoning for hu- man grasps generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.591402Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:1d4da0d18b21a119b0b5b59a0271b6d6bc29d69f1d8699341481ddc9785250da","observation_id":"9f203ce7-0efa-4553-b54a-9303e78e8174","resolution":{"observed_at":"2026-08-12T04:55:59.591402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.595135Z","title":"Sym- phonize 3d semantic scene completion with contextual in- stance queries, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.595135Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:2e11cc9b5d6ac9b1ca72e8e934e756c184bec6658b0caee208ce773d43ed5694","observation_id":"f0a1d69a-e07a-47c5-8728-ec5dedaf5cb7","resolution":{"observed_at":"2026-08-12T04:55:59.595135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.09579","last_updated":"2017-06-30T13:01:52Z","snapshot_observed_at":"2026-07-06T05:48:59.355615Z","submitted_at":"2017-06-29T05:00:38Z","title":"R2CNN: Rotational Region CNN for Orientation Robust Scene Text Detection","version":2},"cited_work":{"arxiv_id":"1706.09579","doi":null,"metadata_source":"pith","pith_arxiv_id":"1706.09579","snapshot_observed_at":"2026-08-12T04:56:00.177012Z","title":"R2CNN: Rotational Region CNN for Orientation Robust Scene Text Detection","venue":"cs.CV","work_id":"44acee94-e7e8-422f-a906-36d736117b7c","year":2017},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.598689Z"},"links":{"cited_paper":"/paper/1706.09579","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:a54b9ce9365d23502fd202c2bbd9b834447692ecf8a904881607aa28e31a3caa","observation_id":"07767f29-b574-4145-aaba-ea6861a5e29d","resolution":{"observed_at":"2026-08-12T04:56:00.181188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.602804Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.602804Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:27e0644547f7655ab1150c449e78520095eb6a9b0e673c01130a304a51f75daa","observation_id":"e35a7de4-ea32-4cb1-9a81-21fade0c5aa1","resolution":{"observed_at":"2026-08-12T04:55:59.602804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.964335Z","title":"Interactive object segmentation in 3d point clouds","venue":null,"work_id":"2b995604-1150-4f35-9f1d-0ecbbf616e25","year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.606482Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:9d4aaa2229904cb595c33a10fabda21d2af24865b8c949e92bfbeb2187c772db","observation_id":"b05ffc6d-7d7f-4961-9cd1-1a35dc569ff4","resolution":{"observed_at":"2026-08-12T04:56:00.969264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.952193Z","title":"A hi- erarchical representation for future action prediction","venue":null,"work_id":"3f1779bc-aa1c-44d0-903d-591b501884a2","year":2014},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.609535Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:76a94d0d5ba9f88ace3eb7f85e6b655a27d04c0a3be4b40a8400e9f79799921f","observation_id":"63eef815-7046-4c14-94d7-2ce13dd3dd57","resolution":{"observed_at":"2026-08-12T04:56:00.956226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00890","last_updated":"2023-06-01T16:50:07Z","snapshot_observed_at":"2026-08-09T05:23:28.778360Z","submitted_at":"2023-06-01T16:50:07Z","title":"LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00890","snapshot_observed_at":"2026-08-12T04:55:59.612463Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.612463Z"},"links":{"cited_paper":"/paper/2306.00890","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:c6451ad7e8d7b54df249184df2fe3c19efb61eac72079f6deb6c36c8cf5ae9e8","observation_id":"2d32b3ba-df97-467e-927c-13a462eb3b29","resolution":{"observed_at":"2026-08-12T04:55:59.612463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.09450","last_updated":"2023-05-31T09:19:23Z","snapshot_observed_at":"2026-08-13T16:54:26.879994Z","submitted_at":"2022-01-24T04:39:39Z","title":"UniFormer: Unifying Convolution and Self-attention for Visual Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.09450","snapshot_observed_at":"2026-08-12T04:55:59.615541Z","title":"Uniformer: Unifying convolution and self-attention for visual recogni- tion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.615541Z"},"links":{"cited_paper":"/paper/2201.09450","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:7d418a176e8bab3f2a7800c4e68b935474767baf7020a5c9d3f48348f6bbd0b3","observation_id":"1e9820cb-45c1-4420-a34d-f00c8bad3a4b","resolution":{"observed_at":"2026-08-12T04:55:59.615541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.938631Z","title":"Mvitv2: Improved multiscale vision transform- ers for classification and detection","venue":null,"work_id":"2def1459-46ef-49ac-b29e-f02e3cbfa4b6","year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.618770Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:27f0b092c5b0c2a0ab097cbc77db80777b568af15cc849ab3bcb3f8bd4938f94","observation_id":"c0cb4845-502b-4372-a53e-19f406dbed80","resolution":{"observed_at":"2026-08-12T04:56:00.943815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.925336Z","title":"Alvarez, Sanja Fidler, Chen Feng, and Anima Anandkumar","venue":null,"work_id":"e5a5f812-344c-449f-821f-d57b0415688b","year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.622214Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:92932daccde741b1cf987befaeb46e87cb2158a7ceb1eafc2e20fcc14c7322db","observation_id":"a0c3ed5b-aad4-414a-99b3-572528567b07","resolution":{"observed_at":"2026-08-12T04:56:00.930511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.911563Z","title":"Egocen- tric video-language pretraining","venue":null,"work_id":"7a3fc06c-75ca-489f-b458-e5bddd478f18","year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.625968Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:84734b3f86ac017cf64f45755d16c90cab6b7ceb7c51f8e7d1d37fc0f6a0a74e","observation_id":"0fb9c6e7-6b18-4534-be8f-4499916cc2e4","resolution":{"observed_at":"2026-08-12T04:56:00.915968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.629458Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.629458Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:f30f01e30f246ddad87fbb9c4060d447fb5cb3c698dc19e1023cd3c1921e47e3","observation_id":"3c376914-a25f-4b3a-835a-282c30660cd0","resolution":{"observed_at":"2026-08-12T04:55:59.629458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.889270Z","title":"Learn- ing to recognize procedural activities with distant supervi- sion","venue":null,"work_id":"d8481794-9bfc-43be-9fd3-2b2e2762e9ce","year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.633145Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:ca6b137e18229bb63b852c97e0828f4f0bae53627848ec0737f5a2f422dd22d3","observation_id":"d1798fd1-2fc4-40ee-bb42-e11d60d02a8e","resolution":{"observed_at":"2026-08-12T04:56:00.893705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.877707Z","title":"Deep patch visual slam","venue":null,"work_id":"46aaed5e-e333-41a3-805e-b0b633a07fef","year":2025},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.637095Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:20fdf4dbbfa2b79b96a82aec8e406804f65d9496549bc2907bddc7c87799f48b","observation_id":"04161796-2915-456a-aabf-ab8359d75e6d","resolution":{"observed_at":"2026-08-12T04:56:00.881706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-12T04:55:59.641299Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.641299Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:d1122cb4a5006e616360a33b59bd3b8e5d5c476fbbe3a3cc74d0a6de7b1ced9b","observation_id":"87fed159-0559-4ad8-8d4b-9908c2664220","resolution":{"observed_at":"2026-08-12T04:55:59.641299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.866691Z","title":"Fore- casting human-object interaction: joint prediction of motor attention and actions in first person video","venue":null,"work_id":"bf76a08d-478d-4055-bbe2-8e1d6196b7c1","year":2020},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.645564Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:a2d64f801cc42a2f135ab4592fead852c885c692917ebdffd69bea6497331e1f","observation_id":"cf3b1fc8-af49-4d67-9408-ca464e6ada64","resolution":{"observed_at":"2026-08-12T04:56:00.870748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.855431Z","title":"Joint hand motion and interaction hotspots prediction from egocentric videos","venue":null,"work_id":"50bae926-624a-42e6-be69-0395c75a6e67","year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.649079Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:f86f097872b99e63ab822bbe800b0f095081a3834a2c67b59a35bcf29ae25995","observation_id":"8c1cdd44-0956-481e-82dd-e18914533a92","resolution":{"observed_at":"2026-08-12T04:56:00.859489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.844247Z","title":"Joint hand motion and interaction hotspots prediction from egocentric videos","venue":null,"work_id":"924f56cf-5b78-4cea-9f08-706fb6624d07","year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.652471Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:d0d34be7de2d25108023a3ac5994fe6a114cdba4e2431e4728164f99c5042076","observation_id":"bf640659-1a84-4232-b088-3e464f2819e8","resolution":{"observed_at":"2026-08-12T04:56:00.847867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.833450Z","title":null,"venue":null,"work_id":"cd248f4b-af8d-46e2-8704-e75719f0dbbc","year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.655916Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:29c417f51cccbb4db53ed2e07229647eb19d9cc8c6ead7dcd36c2c67308c2107","observation_id":"2860e921-7892-4b06-9a23-8b62fe354f34","resolution":{"observed_at":"2026-08-12T04:56:00.837304Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.822491Z","title":"Multimodal sense-informed forecasting of 3d human motions","venue":null,"work_id":"70d9b7ee-c690-4eb4-9949-ce6e31bb8e75","year":2024},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.659781Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:5e2a809936dd0e0d855e2e67be9498a5a4da3307ab27c59f80a8d011dab950a5","observation_id":"9cbe04d5-4a68-4396-b4fd-0ad035ca3fb5","resolution":{"observed_at":"2026-08-12T04:56:00.826379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.810913Z","title":"Amass: Archive of motion capture as surface shapes","venue":null,"work_id":"17ce6295-bbbf-4bdb-93f0-be3f81e965b2","year":2019},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.663603Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:8f47a2866564459ce1df0611e75797fcd032b739a34cc4d08c0dcb84b637957e","observation_id":"5b87f850-56d8-4358-958d-e7f36ea74cf0","resolution":{"observed_at":"2026-08-12T04:56:00.814816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.799266Z","title":"Contact-aware human motion forecasting","venue":null,"work_id":"d5206ede-2243-44b7-8ab6-9785d254c9ed","year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.667609Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:8a427a3b3df3a4e45e429e12f7a1866143696e5c7cf46b530c58b5ea45629481","observation_id":"fee3d281-a9ba-4e46-96fd-245e975f7d4c","resolution":{"observed_at":"2026-08-12T04:56:00.803216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.787035Z","title":"On human motion prediction using recurrent neural networks","venue":null,"work_id":"9b3592a1-2114-422b-9171-ab5436f683ca","year":2017},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.671250Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:f39676cb0eb15128a299279d67fbf40357cfe48f6e28a3318395c1df74e48be2","observation_id":"f8dfe2d4-90ed-4baf-b6a4-7b73c28a4120","resolution":{"observed_at":"2026-08-12T04:56:00.791592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12080","last_updated":"2024-04-08T15:50:13Z","snapshot_observed_at":"2026-08-13T14:57:46.027491Z","submitted_at":"2022-07-25T11:57:01Z","title":"Intention-Conditioned Long-Term Human Egocentric Action Forecasting","version":4},"cited_work":{"arxiv_id":"2207.12080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.12080","snapshot_observed_at":"2026-08-12T04:56:00.129396Z","title":"Intention-Conditioned Long-Term Human Egocentric Action Forecasting","venue":"cs.CV","work_id":"08e0f316-f8a4-45f9-a7ca-d09e8f443986","year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.675387Z"},"links":{"cited_paper":"/paper/2207.12080","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:9214c6f73d1d950ab1278c61910bbf20d9519053884b771e62f64d757d8a2671","observation_id":"00f2291d-45aa-49fe-9888-a8acafb95bfb","resolution":{"observed_at":"2026-08-12T04:56:00.133452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.774839Z","title":"Howto100m: Learning a text-video embedding by watch- ing hundred million narrated video clips","venue":null,"work_id":"d6257583-f86d-4ac6-a8a7-3f27757dbce2","year":2019},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.679252Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:e5235f312c29a424c92d57bc39067ce7013aa334e1658f0b269af620501abb8f","observation_id":"4986b394-7980-4259-8baa-bb8b72142364","resolution":{"observed_at":"2026-08-12T04:56:00.778937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.762669Z","title":"End-to-end learning of visual representations from uncurated instruc- tional videos","venue":null,"work_id":"63a83053-ae21-409d-b0c2-4dd64e1aa703","year":2020},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.682922Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:29ca225c891aa53083ff41566bfb5111986bae35331a757374352809364408be","observation_id":"75393f18-c82b-49eb-aa56-cd909c9a897f","resolution":{"observed_at":"2026-08-12T04:56:00.767520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.749524Z","title":"Nerf: Representing scenes as neural radiance fields for view syn- 11 thesis","venue":null,"work_id":"53f3337d-0001-49e4-8ce4-7f4f74594f9f","year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.686550Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:d8ba3a9cc5850b1353696ea30e8d6c707400dc0646ce31320723bba78d7b976b","observation_id":"877213ac-c196-423a-8cb6-5e895cf645af","resolution":{"observed_at":"2026-08-12T04:56:00.753669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.736928Z","title":"Graspit! a versatile simulator for robotic grasping","venue":null,"work_id":"a94c16cf-8adf-4c8a-9167-281af521433a","year":2004},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.690285Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:adf8332565b3ffd9a3bcdcd5282ad59e87c043c80a57860f79f2a3bff8f5b8d9","observation_id":"9ec69155-3b27-4297-94da-1192e797f937","resolution":{"observed_at":"2026-08-12T04:56:00.741183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.724911Z","title":"Where2act: From pixels to actions for articulated 3d objects","venue":null,"work_id":"e5f7723b-147c-4ca7-9830-f9b1fd228a44","year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.694406Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:13a1063de9c0cec241844a76c7ff85e66e675f7fb5d333ae749369379dd4e3a4","observation_id":"44846b5c-4c04-4323-b8fe-dcdc281ff0bb","resolution":{"observed_at":"2026-08-12T04:56:00.729177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.697773Z","title":"Orb-slam: a versatile and accurate monocular slam system","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.697773Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:66e798d5eb6cc264aa2ac1808a4cc590aefd9703ebc414c337eefd4ad9259f61","observation_id":"0b75ac41-22cb-45bc-9a2f-9a0068bcdd1a","resolution":{"observed_at":"2026-08-12T04:55:59.697773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.706283Z","title":"Multi-label affordance mapping from egocentric vision","venue":null,"work_id":"bbec3780-80bf-4f51-b59f-e2d8fc2aa253","year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.704470Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:c1130748e37b22539fe8ac6e5d1d26f73f7f7256ab5b0b511cb328ec7299e324","observation_id":"c7b528b3-e084-4f00-a9ea-934d83e910ef","resolution":{"observed_at":"2026-08-12T04:56:00.710600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01194","last_updated":"2024-06-05T15:34:47Z","snapshot_observed_at":"2026-08-12T23:51:43.765245Z","submitted_at":"2024-06-03T10:57:18Z","title":"AFF-ttention! Affordances and Attention models for Short-Term Object Interaction Anticipation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01194","snapshot_observed_at":"2026-08-12T04:55:59.707512Z","title":"Aff-ttention! affordances and attention models for short- term object interaction anticipation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.707512Z"},"links":{"cited_paper":"/paper/2406.01194","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:957c3a25c388f44f334940e5883418430054833c0e09d007b50e626a68214576","observation_id":"e41b3955-af65-441b-aa9e-703b140f0ec7","resolution":{"observed_at":"2026-08-12T04:55:59.707512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.693125Z","title":"Nagarajan and K","venue":null,"work_id":"d2f3b8bc-7db3-4a70-aec6-c76506bf8e98","year":2020},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.710676Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:30293a7ad6e4ac888877f5e6e6b7da1dd81a3a0186f577a0ce7cf005a8971368","observation_id":"0d4db6a3-d95d-45a6-bebc-b9feb5891460","resolution":{"observed_at":"2026-08-12T04:56:00.697433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.681588Z","title":"Grounded human-object interaction hotspots from video","venue":null,"work_id":"4d4f1e66-f89a-47d0-835f-b04df3569686","year":2019},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.713776Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:885482712bcc38332bbba628874d16384575deea3a08cc38585dfa96c037fe5f","observation_id":"7be45799-0727-413b-8734-fb27ef1dad26","resolution":{"observed_at":"2026-08-12T04:56:00.685731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.669831Z","title":"Future event prediction: If and when","venue":null,"work_id":"db646957-7189-4fb3-b7b6-27996788a0e5","year":2019},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.717287Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:170af84fc4506514290a3d4d2923aca39996f637a294b0362864e84e157ad7d1","observation_id":"26792741-cff7-4591-b15b-46d282ad7b76","resolution":{"observed_at":"2026-08-12T04:56:00.674007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1501.03100","last_updated":"2015-04-29T02:22:38Z","snapshot_observed_at":"2026-08-12T22:14:14.949662Z","submitted_at":"2015-01-13T18:40:11Z","title":"Using Geometry to Detect Grasps in 3D Point Clouds","version":3},"cited_work":{"arxiv_id":"1501.03100","doi":null,"metadata_source":"pith","pith_arxiv_id":"1501.03100","snapshot_observed_at":"2026-08-12T04:56:00.103323Z","title":"Using Geometry to Detect Grasps in 3D Point Clouds","venue":"cs.RO","work_id":"72692ace-fc32-4516-a75f-a71dcc262864","year":2015},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.837998Z"},"links":{"cited_paper":"/paper/1501.03100","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:037efc77fd6c82c62d6c458ea048499d74b4bf02555128cd9279e145a4235211","observation_id":"2472ca63-6afd-48f3-bcc4-77ef094f42c3","resolution":{"observed_at":"2026-08-12T04:56:00.107862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.842388Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.842388Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:8dcce2a23e50893b678149d8baa37b8dd783115e87276941f2fcb209c02d26a3","observation_id":"1306d568-892c-4691-b533-161300a63894","resolution":{"observed_at":"2026-08-12T04:55:59.842388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.651613Z","title":"Egovlpv2: Egocentric video-language pre-training with fusion in the backbone","venue":null,"work_id":"0e0dac2f-c0ca-47fa-bd37-21950aa69152","year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.846244Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:738580a177e92ebdaaccda373e79bd6afcd442d2f388d6fa5922cc08c3b36851","observation_id":"7414532d-4fee-4cef-96e3-b58cb3017e6d","resolution":{"observed_at":"2026-08-12T04:56:00.655407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13724","last_updated":"2023-10-19T17:29:17Z","snapshot_observed_at":"2026-08-13T05:45:12.083288Z","submitted_at":"2023-10-19T17:29:17Z","title":"Habitat 3.0: A Co-Habitat for Humans, Avatars and Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13724","snapshot_observed_at":"2026-08-12T04:55:59.850055Z","title":"Habitat 3.0: A co-habitat for humans, avatars and robots","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.850055Z"},"links":{"cited_paper":"/paper/2310.13724","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:538da5bd015c3bb0d5742debb18595ed7a950d22d97e9bbab9e811fc58bb8f79","observation_id":"4e6dd8f6-41fa-4a1d-add9-743bed487856","resolution":{"observed_at":"2026-08-12T04:55:59.850055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.640593Z","title":"Vins-mono: A ro- bust and versatile monocular visual-inertial state estimator","venue":null,"work_id":"90da757d-733e-4c63-846c-6676f4f54c77","year":2018},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.853864Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:b74c8bce72db8d8b98f7bdca6d41168e118c25390e0f723fff7127b08975b64b","observation_id":"ad74e877-1478-4938-bc7f-c3f14648910b","resolution":{"observed_at":"2026-08-12T04:56:00.644501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.628070Z","title":"State-only imitation learning for dexterous manipulation","venue":null,"work_id":"ba2e4114-3050-493b-a895-d20e44dc013d","year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.856756Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:f0d8227eb9f9b853623ce1a8020214a63a45434646e9770c9399575a81a7be23","observation_id":"a9b6bcdf-c44d-42a6-ba3e-1230e330fa99","resolution":{"observed_at":"2026-08-12T04:56:00.632033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.616878Z","title":"Poni: Potential functions for objectgoal navigation with interaction-free learning","venue":null,"work_id":"33df3d61-2dc2-4581-a111-20e6b8ec35e5","year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.860281Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:55bbbf9040e4407e4dbb7d4d4e2fada71335171f922e44f5639b5e308a161907","observation_id":"4e0c5a99-7e26-42ad-8eb6-e26325e83235","resolution":{"observed_at":"2026-08-12T04:56:00.620790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.605285Z","title":"Humor: 3d human motion model for robust pose estimation","venue":null,"work_id":"2746d1a5-d523-4ac9-9be1-c2c125250d76","year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.863253Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:7363da90fb105348eebdee30f4d47c8ae33dd6b600b6a3b1cfd8a18ae7124b03","observation_id":"9c418893-8def-4287-aae8-0409267c61d5","resolution":{"observed_at":"2026-08-12T04:56:00.609620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.594081Z","title":"First-person activity forecasting with online inverse reinforcement learning","venue":null,"work_id":"063a9ccb-2ebf-48cb-bade-8ad380d38034","year":2017},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.866660Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:2fa8ea254205565eb0250f217d6f2b33ad2566fcd5745b9bfa609d0045c0fed7","observation_id":"ffafcde5-3f30-4535-9a77-390b2dcf1093","resolution":{"observed_at":"2026-08-12T04:56:00.598098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.582636Z","title":"Structure-from-motion revisited","venue":null,"work_id":"01a68356-bc49-4cf1-b3de-477829291841","year":2016},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.869991Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:49605f3629e180a22f4b2e5fd9805c1658e76d4848a54142331486d8c1c21b76","observation_id":"34224ca4-994f-4a09-88e9-2cc83b93bf22","resolution":{"observed_at":"2026-08-12T04:56:00.586404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.571186Z","title":"Wham: Reconstructing world-grounded humans with accurate 3d motion","venue":null,"work_id":"f48b93fe-23eb-40b3-ac94-ed5e6edd6f64","year":2024},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.874484Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:bc184bc8ba1fde5f65000b676e1ee8afd595c73bd1365f86c0525fa70cadc7e0","observation_id":"32b5e6bd-0ae5-450e-8e3d-e2d922e48ff1","resolution":{"observed_at":"2026-08-12T04:56:00.575160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.559570Z","title":"Learn- ing structured output representation using deep conditional generative models","venue":null,"work_id":"60e03570-3771-44ec-903c-957544d0f688","year":2015},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.878602Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:8c73936dc3955e2e703c15061c84041dff1bdf7e82996741f0201033e57f71bc","observation_id":"9f894892-d0c4-42d8-b1fd-2c988dcaadc4","resolution":{"observed_at":"2026-08-12T04:56:00.563868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.547400Z","title":"Generating notifications for missing actions: Don’t forget to turn the lights off! In Proceedings of the IEEE International Con- ference on Computer Vision, pages 4669–4677, 2015","venue":null,"work_id":"b1152fff-5127-4dec-9d55-b3af8d3e2450","year":2015},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.882948Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:53696f97e509766ca8db0a7c07c11e596ca7aa3427911a07fbeac8db8c0dc66a","observation_id":"38969f8c-5b29-4748-a4f8-5b10810fdf06","resolution":{"observed_at":"2026-08-12T04:56:00.552001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.533580Z","title":"Segcloud: Semantic segmen- tation of 3d point clouds","venue":null,"work_id":"ea0792ac-0f1e-4591-ad4c-7f97bb204a78","year":2017},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.886883Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:3079e879827eb299bc87a94c61e8c2f3427c62a3830e593d2361eee0f574d785","observation_id":"38789a9a-c1e2-41a3-ad9e-ddbac541ddd3","resolution":{"observed_at":"2026-08-12T04:56:00.537792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.891500Z","title":"Droid-slam: Deep visual slam for monocular, stereo, and rgb-d cameras","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.891500Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:901c21f97caf431d437ede2bca4d56393b098a055af3a4830b69ef8be60871b3","observation_id":"22414549-19af-4e40-96c5-263c29df85cb","resolution":{"observed_at":"2026-08-12T04:55:59.891500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.514177Z","title":"EPIC Fields: Marrying 3D Geometry and Video Understanding","venue":null,"work_id":"cac70f27-e17e-4519-bc1f-84c463a2994c","year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.895419Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:d6efcae9d9731a3030189785a2a448a81f426c061a4b18682762b99912ba6dd7","observation_id":"5e2e33b1-5232-4ec4-8eb3-dbeb01c899f7","resolution":{"observed_at":"2026-08-12T04:56:00.518624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.08435","last_updated":"2023-02-06T14:49:05Z","snapshot_observed_at":"2026-07-06T05:27:58.459475Z","submitted_at":"2017-01-29T21:39:05Z","title":"Transformation-Based Models of Video Sequences","version":3},"cited_work":{"arxiv_id":"1701.08435","doi":null,"metadata_source":"pith","pith_arxiv_id":"1701.08435","snapshot_observed_at":"2026-08-12T04:56:00.073950Z","title":"Transformation-Based Models of Video Sequences","venue":"cs.LG","work_id":"402eb7ac-f990-4bf5-b322-d74c38a11951","year":2017},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.899330Z"},"links":{"cited_paper":"/paper/1701.08435","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:d9b81587b35451d3320b1fb6c837da8937eff6e4b5e73c3621797eefe64d8db5","observation_id":"5667d731-4af4-4431-9556-0195e76ddcf1","resolution":{"observed_at":"2026-08-12T04:56:00.080431Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.501793Z","title":null,"venue":null,"work_id":"e0c40177-06ae-4567-b201-29da50b3793a","year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.903006Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:e4a1df899ca867786ba148c56fdcce77d0cc1326d9f011a8a4e4e86dc8399a04","observation_id":"2ee9e01c-18a7-4644-8c0d-a8e20bfbfad9","resolution":{"observed_at":"2026-08-12T04:56:00.506311Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.489328Z","title":"Synthesizing long-term 3d human mo- tion and interaction in 3d scenes","venue":null,"work_id":"416ac475-d2b4-45ee-b703-c49a2806e577","year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.907142Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:21b65e57ea4dd467d09e0db9631db62a29416bd87afd2a132bd9efa9c2bdeb95","observation_id":"cedbaa9f-ae03-4c41-802e-89cd7425b035","resolution":{"observed_at":"2026-08-12T04:56:00.493415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.476001Z","title":"Adaafford: Learn- ing to adapt manipulation affordance for 3d articulated ob- jects via few-shot interactions","venue":null,"work_id":"20a83356-4555-4863-8f71-771d758eb207","year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.910653Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:a3099601c30b59354995f9e9366bbff984a15845f58491ba28eecb9029fe0d3b","observation_id":"3d6d5e86-d9da-4c0d-8d7a-3552690f5732","resolution":{"observed_at":"2026-08-12T04:56:00.480249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.462578Z","title":"Memvit: Memory-augmented multiscale vision transformer for efficient long-term video recognition","venue":null,"work_id":"e5f93654-6ed8-4b4e-a328-7578888d1874","year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.914437Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:6dc117bc2e1b831f3d42a45d583e610ae0fc3be4bd4d50f363195691452f0a04","observation_id":"9747d2c8-d121-46a7-865e-8ccc3c9072c6","resolution":{"observed_at":"2026-08-12T04:56:00.467780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T10:31:10.405946Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":4,"verified_fuzzy":38},"total_outbound_references":119},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 100 of 119 outbound references and 0 inbound Pith citation observations for arXiv:2412.00932."}