{"as_of":"2026-08-09T20:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:028f66420cdb0298ad666146b3cf8b33724396663f8a5d63e7466a399b40dedd","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:29:06.878705Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:10:14.672688Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-14T00:18:30.107372Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"cited_work":{"arxiv_id":"2506.02444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02444","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Svimo: Synchronized diffu- sion for video and motion generation in hand-object interac- tion scenarios","venue":null,"work_id":"eb0a46e8-addb-4237-be1d-a22060df399b","year":2025},"citing_paper":{"arxiv_id":"2604.03305","last_updated":"2026-03-31T01:28:42Z","snapshot_observed_at":"2026-07-30T07:10:43.620755Z","submitted_at":"2026-03-31T01:28:42Z","title":"HVG-3D: Bridging Real and Simulation Domains for 3D-Conditional Hand-Object Interaction Video Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T00:14:36.537688Z"},"links":{"cited_paper":"/paper/2506.02444","citing_paper":"/paper/2604.03305"},"observation_digest":"sha256:ee4d1d65ed92a3f4aa1090179c9e87fa1727cff29dc71081ad1f60b78b96997e","observation_id":"3e3cca65-46dd-480f-ade2-e5256b5c6423","resolution":{"observed_at":"2026-05-14T00:18:30.110150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02444","snapshot_observed_at":"2026-08-01T10:37:55.063859Z","title":"Svimo: Synchronized diffusion for video and motion generation in hand- object interaction scenarios,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20174","last_updated":"2026-07-22T14:06:39Z","snapshot_observed_at":"2026-08-06T22:13:37.273683Z","submitted_at":"2026-07-22T14:06:39Z","title":"StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T10:37:55.063859Z"},"links":{"cited_paper":"/paper/2506.02444","citing_paper":"/paper/2607.20174"},"observation_digest":"sha256:ca52ad63525fad37ed98c8863c7265083b1fdac9aa1f9615c4c584b3611e3c19","observation_id":"f8beea9c-8d04-4da1-b448-79dfe4f7dd5b","resolution":{"observed_at":"2026-08-01T10:37:55.063859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02444","snapshot_observed_at":"2026-08-01T05:27:16.175479Z","title":"Svimo: Synchronized diffu- sion for video and motion generation in hand-object interac- tion scenarios.arXiv preprint arXiv:2506.02444, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22241","last_updated":"2026-07-30T03:34:42Z","snapshot_observed_at":"2026-08-06T04:16:05.161328Z","submitted_at":"2026-07-24T12:17:57Z","title":"AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T05:27:16.175479Z"},"links":{"cited_paper":"/paper/2506.02444","citing_paper":"/paper/2607.22241"},"observation_digest":"sha256:2d1d005a98019f61a0e49852d4015f9f9657d71371d97d426613b8368840a467","observation_id":"a81105ac-ac46-4737-99dc-576b15490232","resolution":{"observed_at":"2026-08-01T05:27:16.175479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02444","snapshot_observed_at":"2026-08-04T18:35:26.468228Z","title":"arXiv preprint arXiv:2506.02444 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01905","last_updated":"2026-08-06T13:24:49Z","snapshot_observed_at":"2026-08-09T19:14:00.290776Z","submitted_at":"2026-08-03T08:39:31Z","title":"PhotoHOI: Synthesizing 3D Hand-Object Interactions from a Single RGB Photograph","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T18:35:26.468228Z"},"links":{"cited_paper":"/paper/2506.02444","citing_paper":"/paper/2608.01905"},"observation_digest":"sha256:07c82a2c71c0e0270003ede6b18ab110c340c0bd0e7439d03e582482443c5dcb","observation_id":"c76c5d80-b73d-4dfc-8da3-743d5c59f131","resolution":{"observed_at":"2026-08-04T18:35:26.468228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02444","snapshot_observed_at":"2026-08-07T04:10:14.672688Z","title":"arXiv preprint arXiv:2506.02444 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01905","last_updated":"2026-08-06T13:24:49Z","snapshot_observed_at":"2026-08-09T19:14:00.290776Z","submitted_at":"2026-08-03T08:39:31Z","title":"PhotoHOI: Synthesizing 3D Hand-Object Interactions from a Single RGB Photograph","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:14.672688Z"},"links":{"cited_paper":"/paper/2506.02444","citing_paper":"/paper/2608.01905"},"observation_digest":"sha256:2f78de2e2d3278101eb9769687f33015e77e1aa00070bb876112a3b9ab1003a6","observation_id":"0cd1448c-0687-4bd5-9198-157da069b78e","resolution":{"observed_at":"2026-08-07T04:10:14.672688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02444/citation-record","integrity":"/paper/2506.02444/integrity","json":"/paper/2506.02444/citation-record.json","paper":"/paper/2506.02444"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.02879","last_updated":"2024-08-06T01:13:09Z","snapshot_observed_at":"2026-08-05T17:22:02.707336Z","submitted_at":"2024-08-06T01:13:09Z","title":"Body of Her: A Preliminary Study on End-to-End Humanoid Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02879","snapshot_observed_at":"2026-08-07T11:28:59.252913Z","title":"Body of her: A preliminary study on end-to-end humanoid agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:59.252913Z"},"links":{"cited_paper":"/paper/2408.02879","citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:198718ed6450210f3cb49193cfd599aa4b355906097a480642c9d1d30717d2b7","observation_id":"fc5e5238-9f2a-4b5e-ad10-7e160adb5df5","resolution":{"observed_at":"2026-08-07T11:28:59.252913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T11:28:59.438395Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:59.438395Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:db88fd91b8556c71241b40f3358d70efffaf1f77a73bf7b0f8a17258b0f04b9f","observation_id":"f7f07dd0-afa8-4423-9915-89916cf3086f","resolution":{"observed_at":"2026-08-07T11:28:59.438395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T11:28:59.510279Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:59.510279Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:eacd4f193838058ea19bd6a8b441e5452396678754959bcf60f5d388c3ec1757","observation_id":"f7cb1d75-dffb-4694-8c49-a23ef5ff2ab0","resolution":{"observed_at":"2026-08-07T11:28:59.510279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:15.109782Z","title":"Physically plausible full-body hand-object interaction synthesis","venue":null,"work_id":"aceef8e8-ab83-4947-896c-cf899179b47f","year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:59.562898Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:eeaf780e43585d4af0b39d8086a5a65421fd731cb8ada1cfefeaff72a2b6d8d0","observation_id":"7ddaac18-9d8d-4a40-85d2-b7c3891e1941","resolution":{"observed_at":"2026-08-07T11:29:15.278550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:59.634748Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:59.634748Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:51d44eac15c1d761d5f2ff89cfdb6a63ada24947df2325df7a3c3336a206f805","observation_id":"88f12b54-76ff-4f82-99a5-afcfbbf7ba93","resolution":{"observed_at":"2026-08-07T11:28:59.634748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:59.770914Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:59.770914Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:8eb72f7afd752cb208ebdb2da59f9b4490933808480d9555c7bdae440b27d73b","observation_id":"376c7fd6-a8d1-4fe7-8652-8b4a68d62048","resolution":{"observed_at":"2026-08-07T11:28:59.770914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:59.890753Z","title":"Text2hoi: Text-guided 3d motion generation for hand-object interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:59.890753Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:9132ae376c4193ed7ec5bf37f598e5db5f1c0e0cfb1983d83a20eb2ce8c37867","observation_id":"6068e9ad-7fe3-423c-b148-398a55b5d045","resolution":{"observed_at":"2026-08-07T11:28:59.890753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:59.947785Z","title":"Dexycb: A benchmark for capturing hand grasping of objects","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:59.947785Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:ebcd8f19a0eba9c9605090bf5f86aa9dd766bc480f0804163a398c5807a1ad81","observation_id":"1499def3-c35a-4461-80af-35ccc4d7ead7","resolution":{"observed_at":"2026-08-07T11:28:59.947785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:00.054337Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:00.054337Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:abbbaa763b863c9b41cd2062c998d75bafa91e95652731d3b992e94eb1defd88","observation_id":"3c290931-61bb-4ed0-853e-ddf3935892c2","resolution":{"observed_at":"2026-08-07T11:29:00.054337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:14.785899Z","title":"Diverse human motion prediction via gumbel-softmax sampling from an auxiliary space","venue":null,"work_id":"ff8b2ce0-7138-4933-b7a4-236374f380a7","year":2022},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:00.205296Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:2c745f92eb608c48751f0ef68f85cff7ec5cd7722a21a67d5d40bedca2aefa37","observation_id":"0e3d241b-db13-453f-a9ba-7ba44c20972f","resolution":{"observed_at":"2026-08-07T11:29:14.906162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:14.580632Z","title":"Cg-hoi: Contact-guided 3d human-object interaction generation","venue":null,"work_id":"a9076ace-444d-4969-9521-9986dc74991a","year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:00.320954Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:164685ca713a3c16a18a1f6a794a37e51f662b4bcce5e97e6b110352242ff644","observation_id":"e6b4d1d3-6fa3-4107-ad08-2a7ae6231d7e","resolution":{"observed_at":"2026-08-07T11:29:14.670755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:00.418663Z","title":"Arctic: A dataset for dexterous bimanual hand-object manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:00.418663Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:6aee9647bc3d29c5c4859fcfe734fd42acbca364293c815564a8138086cae6f3","observation_id":"6bbf3627-d530-4fca-b477-e617644b11f4","resolution":{"observed_at":"2026-08-07T11:29:00.418663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:14.336672Z","title":"Coohoi: Learning cooperative human-object interaction with manipulated object dynamics","venue":null,"work_id":"9079e62a-4966-4ba1-bea0-454f79841c2f","year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:00.565115Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:50d9006af914f2f5c794cb29ea6f0f3810a04751dff4695637c1c3818e20fef1","observation_id":"b7e3a644-57d3-451e-9ec5-c6e17944cbb1","resolution":{"observed_at":"2026-08-07T11:29:14.456528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:14.121749Z","title":"Prediction with action: Visual policy learning via joint denoising process","venue":null,"work_id":"8cbafac1-1558-4d15-9890-c15ba4f25a8b","year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:00.671840Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:cd0c772b1cb7d3650524e543c1e22e0993d433825adefabcb2e3896e3a8110a4","observation_id":"15868f4e-08f4-4729-b0e6-44e50208efcf","resolution":{"observed_at":"2026-08-07T11:29:14.221492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:00.783005Z","title":"Stochastic scene-aware motion prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:00.783005Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:a9533c5640d49ed638c71267cfedd0899bb892f9c742c605cf67070d06b265bc","observation_id":"a43d552e-a8ea-46b4-8de5-27ee47bc0eaf","resolution":{"observed_at":"2026-08-07T11:29:00.783005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:00.916542Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:00.916542Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:8c77d1f7b31de652416d19accd0cbe55b6e91d3526833f047f9ac2d247b8e572","observation_id":"90dfb212-eea2-47ec-8c03-fd8cfe0030ff","resolution":{"observed_at":"2026-08-07T11:29:00.916542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:13.815097Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":"1cf06257-c9d3-4199-abff-0faffc352665","year":2023},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:01.016743Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:53a27335e6bfc5fe6e87c42ddf3ddadcfd572feef820812e5b92717191f2f8cb","observation_id":"d37851e6-0b83-45df-92d5-90ef879c4e3b","resolution":{"observed_at":"2026-08-07T11:29:13.932132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:01.156559Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:01.156559Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:cda62c3b2959a3b71f7ecc92eb1f4a640101e65e0be30fba235a9337999b51ee","observation_id":"af3ea639-e121-414f-a1c8-8489ba011bc3","resolution":{"observed_at":"2026-08-07T11:29:01.156559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:01.232642Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:01.232642Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:f0468bc8ca272b1e8e7860a268b6bda5531a040d77fad3cee50e02c64127223d","observation_id":"a3d023e0-872a-472c-af94-869ef263f45a","resolution":{"observed_at":"2026-08-07T11:29:01.232642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:13.580464Z","title":"The power of sound (tpos): Audio reactive video generation with stable diffusion","venue":null,"work_id":"ac024bc8-057b-4fb5-b0dc-df1f4ec4fca3","year":2023},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:01.343728Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:9f8314b489f4372fe9646dd1a647bc2d3e23816a51eebc48a6aa57108981bcdb","observation_id":"1f83025c-a539-4be8-b4d9-e1537f72974d","resolution":{"observed_at":"2026-08-07T11:29:13.679724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-08-07T11:29:01.468907Z","title":"Vace: All-in-one video creation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:01.468907Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:da23c4be4fa276a1de4945f3e64a31c97b962525e35716996aba2fde28b66fe7","observation_id":"862781df-f76c-4a6c-8594-e3c06f35902c","resolution":{"observed_at":"2026-08-07T11:29:01.468907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T11:29:01.608522Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:01.608522Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:eb0650365830db179cd043dd1ea378fbe8cb5ceec68879c57d27570d40854764","observation_id":"f1fa39dd-4b4b-4d98-aba5-f0d28ec6b820","resolution":{"observed_at":"2026-08-07T11:29:01.608522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:13.327474Z","title":"Nifty: Neural object interaction fields for guided human motion synthesis","venue":null,"work_id":"e7bf557a-b3dc-4c46-bdb9-fd1b48a3f51a","year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:01.712935Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:ea1ac84fec19907e6051ced51c51c384f7ad9e492b07742685bb67e597fc95d3","observation_id":"6509e18e-422a-40d1-978e-9d2b3bddf12f","resolution":{"observed_at":"2026-08-07T11:29:13.461294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:13.175004Z","title":"Interhandgen: Two-hand interaction generation via cascaded reverse diffusion","venue":null,"work_id":"e1c6fbda-3377-468a-92a1-1623999e9471","year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:01.841671Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:06cda4a6334a5a6daaf3a7aaa7099db4735e9928c72c2962f494561b250bee20","observation_id":"704b2776-f350-4a1e-8336-33cfe9d43e40","resolution":{"observed_at":"2026-08-07T11:29:13.229870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:01.973487Z","title":"Controllable human-object interaction synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:01.973487Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:6a8f1c9bc8c22cd0d67e1a2f8bf73875cb0f841989b95314d4d725863214db85","observation_id":"6061c08c-5794-4aa5-b5ad-23aa0503fb3b","resolution":{"observed_at":"2026-08-07T11:29:01.973487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:02.099180Z","title":"Object motion guided human motion synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:02.099180Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:b8dc7f980a7d6973938fcb06daab1e42f9f903328c04860e949571efe106ab9b","observation_id":"4ad78e16-7d2f-42f1-8162-63c01103766e","resolution":{"observed_at":"2026-08-07T11:29:02.099180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:12.995141Z","title":"Task-oriented human-object interactions generation with implicit neural representations","venue":null,"work_id":"b1ba8ca8-41b7-4272-b3b0-aaf1f859fdab","year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:02.159259Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:ccafff15b7c2bd84e905b88d7b53beb5e8a22493d94b4ad2b3619fb7d922199b","observation_id":"1a37028e-a14d-45fc-a6c3-28b8ecf7f0fd","resolution":{"observed_at":"2026-08-07T11:29:13.077736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:12.796996Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":"44e3a2b1-fcfc-4642-809a-3a4901f8e02f","year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:02.272037Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:de031297007fdb95fda8589d2ec0718c471a27c4767f43d7e52623d0a9b2b0e0","observation_id":"778cd270-11c7-4e00-9a06-cdefb38374af","resolution":{"observed_at":"2026-08-07T11:29:12.879061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:12.559811Z","title":"Amt: All-pairs multi-field transforms for efficient frame interpolation","venue":null,"work_id":"4bd484cc-d8be-464c-81c4-f02d4b6cf9de","year":2023},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:02.412088Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:914d83613c8946afb9e8b078b6e8b59450def2a4b1ec4c25512e6c6b419bdc38","observation_id":"7841240a-2b58-4190-a8ce-a0cebf37014c","resolution":{"observed_at":"2026-08-07T11:29:12.671992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:02.518157Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:02.518157Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:e7138d03eae1ae0ad7342fd174a3263805b9e222a0038f92f23038c32b662664","observation_id":"c44dbbad-f78c-496b-8e5c-8b778324d395","resolution":{"observed_at":"2026-08-07T11:29:02.518157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:02.653794Z","title":"Javisdit: Joint audio-video diffusion transformer with hierarchical spatio-temporal prior synchronization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:02.653794Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:90a0f19715105b7c87f6f24dd937085fd15e818203770eec2c1bfbc4e2caf77c","observation_id":"28d60e2c-6b2c-4f67-b468-3f19292ebae9","resolution":{"observed_at":"2026-08-07T11:29:02.653794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:12.303007Z","title":"Primitive-based 3d human-object interaction modelling and programming","venue":null,"work_id":"745a401e-9d98-4e57-ab5e-b320c0a7dc89","year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:02.756572Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:11fec36b06ec90f95255f4989b87ad7bf20c69b2cce26b510f02804128150870","observation_id":"ba4503df-60bb-47f6-a857-5313a4c1294a","resolution":{"observed_at":"2026-08-07T11:29:12.407256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:12.065270Z","title":"Geneoh diffusion: Towards generalizable hand-object interaction denoising via denoising diffusion","venue":null,"work_id":"8bbf98a4-5250-4967-b1f3-aed0aadba4e8","year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:02.865643Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:5778b89a4d015d26831ed0fef0af8ba35e825adc7bf25ea0cb9b2ab60dbbc6a1","observation_id":"f0c0aa2d-1aeb-4973-8e75-5fa41bda1d29","resolution":{"observed_at":"2026-08-07T11:29:12.179360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:02.945310Z","title":"Taco: Benchmarking generalizable bimanual tool-action-object understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:02.945310Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:572bc4fcea926930a9d2d80ec4546e67677cd37605c3ca8e78bbd3899dc0d634","observation_id":"7bc42f5b-ea4c-4053-8ee7-2cdedb949707","resolution":{"observed_at":"2026-08-07T11:29:02.945310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:11.830658Z","title":"Hoi4d: A 4d egocentric dataset for category-level human-object interaction","venue":null,"work_id":"748bacfc-4fa2-4a09-952c-a3654766d961","year":2022},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:03.014251Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:b412c20432de9e24fcac391348a29cea9c939397699fc291898f388375048476","observation_id":"15c7421d-9dfc-4fcf-ac89-347c671da035","resolution":{"observed_at":"2026-08-07T11:29:11.934837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T11:29:03.126140Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:03.126140Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:9f3a37d38afe430741d85716a72b4606c42c4b4aea9ef9299dc9fdd86d7f5ccf","observation_id":"0d7158d8-3810-49d5-b17b-621d14f5f181","resolution":{"observed_at":"2026-08-07T11:29:03.126140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:11.564471Z","title":"Omnigrasp: Grasping diverse objects with simulated humanoids","venue":null,"work_id":"5861ceae-3c19-4a24-93f5-ff28c2572ebf","year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:03.223803Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:b594a36baf95a625baf0c674249d2146e9283fe8e730621e0e98a0c31d98a0fa","observation_id":"025c8fac-bb0a-4fe7-a7b7-65b6a93e7be7","resolution":{"observed_at":"2026-08-07T11:29:11.673914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:03.376595Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:03.376595Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:bca512590b2b7191e318f6bf22a6cb9589a53e06499aca7112042cef41ee4c7a","observation_id":"f42461c3-a015-461e-af72-4fcd54a1e1c8","resolution":{"observed_at":"2026-08-07T11:29:03.376595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16212","last_updated":"2024-12-18T00:37:55Z","snapshot_observed_at":"2026-08-04T04:33:28.080502Z","submitted_at":"2024-12-18T00:37:55Z","title":"ManiVideo: Generating Hand-Object Manipulation Video with Dexterous and Generalizable Grasping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16212","snapshot_observed_at":"2026-08-07T11:29:03.505575Z","title":"Manivideo: Generating hand-object manipulation video with dexterous and generalizable grasping","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:03.505575Z"},"links":{"cited_paper":"/paper/2412.16212","citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:a3677c314614ea4d67ba649f5b56e04df43c48fe50dbcb7d4b3d81c6daff09c3","observation_id":"b662a0da-3f5e-4073-81af-8693d78100ae","resolution":{"observed_at":"2026-08-07T11:29:03.505575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:03.652566Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:03.652566Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:ab4d3db4dbcb51b978c80fcebccca5e6fa7d03fdf9970adaa6022d8ae5cc26d9","observation_id":"a2198627-a368-4d79-9c2b-c0ef489fbc62","resolution":{"observed_at":"2026-08-07T11:29:03.652566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06553","last_updated":"2025-07-07T05:09:32Z","snapshot_observed_at":"2026-08-06T14:47:15.286683Z","submitted_at":"2023-12-11T17:41:17Z","title":"HOI-Diff: Text-Driven Synthesis of 3D Human-Object Interactions using Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06553","snapshot_observed_at":"2026-08-07T11:29:03.743604Z","title":"Hoi-diff: Text- driven synthesis of 3d human-object interactions using diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:03.743604Z"},"links":{"cited_paper":"/paper/2312.06553","citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:9cd61b0a6a4117da802b82845cd83625978bb37356426201dce4af65d3dac1fe","observation_id":"93224f88-b4bc-4486-91b4-98431024c3ed","resolution":{"observed_at":"2026-08-07T11:29:03.743604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:11.342895Z","title":"Hierarchical generation of human- object interactions with diffusion probabilistic models","venue":null,"work_id":"1963ca16-8e39-4a1a-b2d4-49b6342cbb24","year":2023},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:03.835908Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:cb2d5a0fb7f1f2884be50f24010096b7ed2b40b61a7d061a2f71a5f375fa3c19","observation_id":"1ff6d839-d05f-4233-b385-999e7d9e8697","resolution":{"observed_at":"2026-08-07T11:29:11.441585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:03.951478Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:03.951478Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:9d207c2ab134560440ec56382a606c0d53b360c28fd6b6d1d8b58e84ae471677","observation_id":"6b567976-c336-4f54-aa2c-799edab2aa0c","resolution":{"observed_at":"2026-08-07T11:29:03.951478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:04.037964Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:04.037964Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:c2ccf93e82cd2441772d9175d2cc3bd7535a009b0b4cc58c2effe229a170c5d4","observation_id":"2bb6fe21-95fe-478b-a244-617248d39e83","resolution":{"observed_at":"2026-08-07T11:29:04.037964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:04.208113Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:04.208113Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:aceb42f7b8badabcc60ec06435a15e9f36ed3ee6bcb83075813a7dba81998f21","observation_id":"38c69bab-f3bb-4ad7-872f-d312d59ab737","resolution":{"observed_at":"2026-08-07T11:29:04.208113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:04.351168Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:04.351168Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:d1fbc175f07cd9c0bd62dae17381b95e3e5d53146dd575f0fe5b43f47a90a3dc","observation_id":"270da79e-0c15-4a3c-96af-7fa997ca26ee","resolution":{"observed_at":"2026-08-07T11:29:04.351168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:04.461811Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:04.461811Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:80bde203d3a463521ae2d7d19290e122bef4b77ddd68e3f95bfcf0cb215f2a02","observation_id":"5499978a-9eff-4e8f-9a75-3232ac3ca477","resolution":{"observed_at":"2026-08-07T11:29:04.461811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:04.570786Z","title":"Photorealistic text-to- image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:04.570786Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:f655510c0e384a7b557781163261cdbb95d70c89c306c5bfbdad772d1b2afc04","observation_id":"600a4446-509d-4136-b0ea-d0fc9cdc6c4d","resolution":{"observed_at":"2026-08-07T11:29:04.570786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08273","last_updated":"2024-09-12T17:59:07Z","snapshot_observed_at":"2026-08-06T08:16:50.619202Z","submitted_at":"2024-09-12T17:59:07Z","title":"Hand-Object Interaction Pretraining from Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08273","snapshot_observed_at":"2026-08-07T11:29:04.683935Z","title":"Hand-object interaction pretraining from videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:04.683935Z"},"links":{"cited_paper":"/paper/2409.08273","citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:753d16003017fdc0ebe935a3727e8699c3ae0eb9f0b8af4ac5eeff73ae4d4bea","observation_id":"5ed1133c-a3bf-4f78-b182-ae50846e14a6","resolution":{"observed_at":"2026-08-07T11:29:04.683935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:10.958883Z","title":"Grab: A dataset of whole-body human grasping of objects","venue":null,"work_id":"2dcb4580-e79f-4b55-8dc4-65ebab2af2ad","year":2020},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:04.800452Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:03f894f9431b2488c1d9f54975558780be86f9af56b58507f99abec889b94f23","observation_id":"50def3c1-627d-4f21-9cba-998e4202f6ef","resolution":{"observed_at":"2026-08-07T11:29:11.084079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:10.754031Z","title":"Any-to-any generation via composable diffusion","venue":null,"work_id":"582f5d14-1dc5-4598-9e5c-9a2c6a621b37","year":2023},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:04.885671Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:89dd8e294352558f3d850297355239b1775483d0e990466f4b6d41fc956f0e44","observation_id":"c3803749-a5dd-449b-bc5f-ada3713a056b","resolution":{"observed_at":"2026-08-07T11:29:10.833308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:04.953168Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:04.953168Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:7f17dccb35dba5717452cbeef73d1a2f7c6f724d3cdfb7b0fdd830206b809eeb","observation_id":"b29a7c5c-0251-4a74-b1b3-e00ba1d0f11e","resolution":{"observed_at":"2026-08-07T11:29:04.953168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:05.028705Z","title":"Human motion diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:05.028705Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:a53412f0143fe9b6860ab913acb6844862fc467df69cd059a202c44b4142927e","observation_id":"c2afb283-976e-4948-bcd5-32f5e6efde19","resolution":{"observed_at":"2026-08-07T11:29:05.028705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:10.455132Z","title":"Deepsimho: Stable pose estimation for hand-object interaction via physics simulation","venue":null,"work_id":"76fe527e-e0b8-4d39-9dce-88d44cfbbfb4","year":2023},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:05.104217Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:2c0d4a4fcbe9f89c696612dbe9a2865a890f85f0eca3c0260aa950ec52cee3b8","observation_id":"08143ec8-ca17-4dfb-8927-5e4083f58fb1","resolution":{"observed_at":"2026-08-07T11:29:10.543054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:05.143860Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:05.143860Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:8adf403a4a2c7e287ce717dfdddf856c8e6e5374527dbd8bd689d5070591b5a6","observation_id":"d19071c2-fc6a-4069-b907-8c35f059d613","resolution":{"observed_at":"2026-08-07T11:29:05.143860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04393","last_updated":"2023-12-07T16:06:31Z","snapshot_observed_at":"2026-08-06T12:06:41.391790Z","submitted_at":"2023-12-07T16:06:31Z","title":"PhysHOI: Physics-Based Imitation of Dynamic Human-Object Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04393","snapshot_observed_at":"2026-08-07T11:29:05.220366Z","title":"Physhoi: Physics-based imitation of dynamic human-object interaction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:05.220366Z"},"links":{"cited_paper":"/paper/2312.04393","citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:fc84d97c4c4b68c1e079f00e2b7fc3cc60a8ca532aaafc4b7b0a1fc30d61b46b","observation_id":"7d32ac8f-6ed1-4526-9d2e-d7aa85ee4bad","resolution":{"observed_at":"2026-08-07T11:29:05.220366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:05.314134Z","title":"Easyanimate: A high-performance long video generation method based on transformer architecture","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:05.314134Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:a8324cbe1dbc90c5a3b178fb15b522ea946b6e9a25060471785d005db1446876","observation_id":"50bdc760-77cb-44a8-8dbf-ef1cc691b94a","resolution":{"observed_at":"2026-08-07T11:29:05.314134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:05.380924Z","title":"Interdiff: Generating 3d human-object interactions with physics-informed diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:05.380924Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:607381b9ae1fee28a3221315a2ad85d0db57ea33d5803a8497590fc50e22528f","observation_id":"5a401baa-84e2-423e-9cf6-f8262337e588","resolution":{"observed_at":"2026-08-07T11:29:05.380924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:10.240998Z","title":"Intermimic: Towards universal whole-body control for physics-based human-object interactions","venue":null,"work_id":"0b19ee89-e9f6-48f9-9885-7b367e070fdd","year":2025},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:05.471978Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:10b53597c26dad879d430038668517fedf82bb43cbcb85d1a732f736ee58b495","observation_id":"e62e22f1-2c2e-47be-99ec-8931538b9667","resolution":{"observed_at":"2026-08-07T11:29:10.325426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:09.999789Z","title":"Interdreamer: Zero-shot text to 3d dynamic human-object interaction","venue":null,"work_id":"31235b5e-e74f-491b-9776-efae76963944","year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:05.546487Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:4f852a553aa4a12b69bfe084ff84d1041f0f96a71fcacab27231349a9972a168","observation_id":"def8529f-e32e-4ab7-8cb7-e31f92890363","resolution":{"observed_at":"2026-08-07T11:29:10.117411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:05.632537Z","title":"Magicanimate: Temporally consistent human image animation using diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:05.632537Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:a8ffd076c1d77db87eba5d8bdc8473eab2ba3b66693f2f2139bfae3838aae046","observation_id":"772d192a-2603-4302-838c-3c549f6d46c5","resolution":{"observed_at":"2026-08-07T11:29:05.632537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17383","last_updated":"2025-06-23T06:27:21Z","snapshot_observed_at":"2026-07-06T19:57:14.289258Z","submitted_at":"2024-11-26T12:42:13Z","title":"AnchorCrafter: Animate Cyber-Anchors Selling Your Products via Human-Object Interacting Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17383","snapshot_observed_at":"2026-08-07T11:29:05.702331Z","title":"Anchorcrafter: Animate cyberanchors saling your products via human-object interacting video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:05.702331Z"},"links":{"cited_paper":"/paper/2411.17383","citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:676975ec99f966535674bd6967b829bb2d4fa9a33b745aa0aa9b8e48cd452777","observation_id":"96c659a6-e3e8-4831-98cc-1275780fb212","resolution":{"observed_at":"2026-08-07T11:29:05.702331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:09.695478Z","title":"Oakink: A large- scale knowledge repository for understanding hand-object interaction","venue":null,"work_id":"ec781270-9bb3-4f59-ab63-74523e4a4ab5","year":2022},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:05.797285Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:e29afe6abf3598d99ac74458705eed03fe63aa94b40d51dfcab3c066d067c291","observation_id":"84744637-242e-4531-bfcb-479fa12ea8cf","resolution":{"observed_at":"2026-08-07T11:29:09.810360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-07T11:29:05.840015Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:05.840015Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:a1d20d707304eb49fd66f2d1ca7369e7778ed753cb816c8f9b0de3c724a89d5a","observation_id":"fc7a88ea-b638-4a6f-ab1d-2ad03c9da93a","resolution":{"observed_at":"2026-08-07T11:29:05.840015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:09.423902Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":"7fd15a43-b699-499b-9e14-1c1e64229570","year":2025},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:05.870422Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:42e32b03b2640a1f2b40f49f51eabd3aed9569ffcfa5479a3abae124f95034d1","observation_id":"3a7b274a-0c18-4a97-b69e-09c546b768a9","resolution":{"observed_at":"2026-08-07T11:29:09.542934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:09.117529Z","title":"Diverse and aligned audio-to- video generation via text-to-video model adaptation","venue":null,"work_id":"83ea1a8d-992d-45d6-9c86-1dc046a9f0df","year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:06.010511Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:a37819e08bb40d9f9921f2f667b9236f068eb65f6af6e3a630f916da77de3c3a","observation_id":"864b99ea-f983-4e63-bbd3-0784000f2e8a","resolution":{"observed_at":"2026-08-07T11:29:09.302029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:08.841204Z","title":"Oakink2: A dataset of bimanual hands-object manipulation in complex task completion","venue":null,"work_id":"6fb9f282-dca9-4f01-822d-19d5f171dc05","year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:06.121308Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:81fc4df1a2203df08ce7f6b247a8053930472c68dc0163363d63652215d9bff0","observation_id":"f2d41a80-24d2-4dac-a3ff-2acb967e47d9","resolution":{"observed_at":"2026-08-07T11:29:08.986003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09300","last_updated":"2024-09-14T04:28:44Z","snapshot_observed_at":"2026-07-06T19:15:17.200627Z","submitted_at":"2024-09-14T04:28:44Z","title":"ManiDext: Hand-Object Manipulation Synthesis via Continuous Correspondence Embeddings and Residual-Guided Diffusion","version":1},"cited_work":{"arxiv_id":"2409.09300","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.09300","snapshot_observed_at":"2026-08-07T11:29:06.994750Z","title":"ManiDext: Hand-Object Manipulation Synthesis via Continuous Correspondence Embeddings and Residual-Guided Diffusion","venue":"cs.CV","work_id":"de6b5f1a-e008-4868-9ff2-0e50c1cb1b54","year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:06.314273Z"},"links":{"cited_paper":"/paper/2409.09300","citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:6cbb91bf6c41eae815055c4ba7ac83aba2885a52cc41e9b2382ec0b3f00d44de","observation_id":"34b26231-8c05-45e5-9c00-b99e66179bbb","resolution":{"observed_at":"2026-08-07T11:29:07.077298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:08.537590Z","title":"Couch: Towards controllable human-chair interactions","venue":null,"work_id":"a070dd88-8c65-4bab-9591-9ce4cfc5e496","year":2022},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:06.492979Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:484aada90107236d1567bfa0c9557c7f89af7d5d8aebc025a9e271caece0a746","observation_id":"f2db1453-ab85-47f9-97a0-0bb598b0199e","resolution":{"observed_at":"2026-08-07T11:29:08.711736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:08.246820Z","title":"Emdm: Efficient motion diffusion model for fast and high-quality motion generation","venue":null,"work_id":"fff8e88d-c42c-4315-acdf-4217325fd676","year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:06.643675Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:c68274314cb60c5d2f93d59fd0aec3f20c488793f9288bb04d192107fa95599c","observation_id":"8ff90525-bead-41b8-b02f-8533fb05c192","resolution":{"observed_at":"2026-08-07T11:29:08.378340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:07.920291Z","title":"Champ: Controllable and consistent human image animation with 3d parametric guidance","venue":null,"work_id":"f70ad4af-69fc-4e5d-b6b3-f3aa12fa39e6","year":2024},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:06.800490Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:56d108eee5b05e32c21464c65adfe6729cd7bcce8632a2e9a462a24fda869b61","observation_id":"3b4a5d85-8cb1-42a5-98ed-9a6c23b3703f","resolution":{"observed_at":"2026-08-07T11:29:08.084227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:07.588326Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"8ed8ea7c-b442-47e5-b65f-2338d985dfeb","year":2023},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:06.878705Z"},"links":{"citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:835227f78e84c9495c9bb69ce8bfe4afe329fb5a34d6ee6772e37df847a96b56","observation_id":"06640dcd-bcb3-4c4b-92ab-e3a65c68a1ad","resolution":{"observed_at":"2026-08-07T11:29:07.738463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 5 inbound Pith citation observations for arXiv:2506.02444."}