{"as_of":"2026-08-05T15:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a20cb0554b7eed90d1cb6d8e14e641a854104e666091e9a33e079ecdc19c9a85","coverage":[{"denominator":109,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T07:25:41.219753Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T23:30:14.969895Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-16T23:31:22.000482Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"cited_work":{"arxiv_id":"2506.19840","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19840","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","venue":"cs.CV","work_id":"4a4d269c-091f-49e2-80b9-a67c168ec15b","year":2025},"citing_paper":{"arxiv_id":"2512.09646","last_updated":"2026-04-08T15:03:02Z","snapshot_observed_at":"2026-08-03T08:11:41.374378Z","submitted_at":"2025-12-10T13:40:24Z","title":"VHOI: Controllable Video Generation of Human-Object Interactions from Sparse Trajectories via Motion Densification","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T23:30:14.969895Z"},"links":{"cited_paper":"/paper/2506.19840","citing_paper":"/paper/2512.09646"},"observation_digest":"sha256:d99a579f2679c1b8c4c907ffa99396647e9155f7457d1f9f9c1536369aa836ee","observation_id":"4a07035f-929a-442a-9a64-d6dbb5889d01","resolution":{"observed_at":"2026-05-16T23:31:22.002931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"cited_work":{"arxiv_id":"2506.19840","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19840","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","venue":"cs.CV","work_id":"4a4d269c-091f-49e2-80b9-a67c168ec15b","year":2025},"citing_paper":{"arxiv_id":"2601.10632","last_updated":"2026-04-10T16:10:59Z","snapshot_observed_at":"2026-07-06T22:41:48.115083Z","submitted_at":"2026-01-15T17:52:29Z","title":"CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T13:43:26.460480Z"},"links":{"cited_paper":"/paper/2506.19840","citing_paper":"/paper/2601.10632"},"observation_digest":"sha256:9e785c7d39e707749a3f480f6da247605b7bb45814dc29fc68d2e0aa11086191","observation_id":"fce67bb8-d112-45d1-9e60-fdf9e3d2b5ba","resolution":{"observed_at":"2026-05-16T13:47:57.383574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.19840/citation-record","integrity":"/paper/2506.19840/integrity","json":"/paper/2506.19840/citation-record.json","paper":"/paper/2506.19840"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://huggingface","venue":null,"work_id":"b488d487-bb29-4eb7-b981-700b7fde69f3","year":null},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:615ef6097d1ee94511be755296d5d1e46e46bc8bc7d1a34dc0fbc4de981e96d9","observation_id":"2d686a18-97ad-4803-ad5c-e21ec9abcca0","resolution":{"observed_at":"2026-05-19T07:27:09.391897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https : / / klingai","venue":null,"work_id":"c7d103d6-5f0f-443a-9521-4b3c07c5c052","year":null},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:5948fb38ce38c47ef42554d5c0533cc52c87fa21e8d7ceefd1a8193571465386","observation_id":"6aef5841-5d96-4d7f-bf92-0beee8b0ee9b","resolution":{"observed_at":"2026-05-19T07:27:09.383113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https : / / klingai","venue":null,"work_id":"5cfd37e3-ce06-4c02-9e34-d6b80d3bf6d9","year":null},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:64414a9de6e4668c0eb006107c7b8de3c3a0489d7be3de820f575588685e4711","observation_id":"ae8cea70-f067-4eee-a58e-543e57456759","resolution":{"observed_at":"2026-05-19T07:27:09.370562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Circle: Capture in rich contextual environments","venue":null,"work_id":"8101bad2-f569-4fca-8367-7b5c85e32eb8","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:2632125ea080542073857dac8af8199c3e045379a3374f8d148a5b3d7f004dab","observation_id":"e94bc09f-f9df-4fa8-9b1d-fe8372b631f3","resolution":{"observed_at":"2026-05-19T07:27:09.387795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:0dbfe3e10f45346472da23541e9af9b017222c8e3e33a303844b89faf50956e7","observation_id":"79e7acd1-7de7-44d2-a56f-9471e8513031","resolution":{"observed_at":"2026-05-19T07:27:09.017753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Align your latents: High-resolution video syn- thesis with latent diffusion models","venue":null,"work_id":"f53dec66-2659-4388-919b-933e2112f629","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:eb3b8ea1a7bdf92efe03197f58a9e52d6462c6c851f2d3c853ba644488f94366","observation_id":"0b34be10-717e-434d-b030-c5ffc30ce52b","resolution":{"observed_at":"2026-05-19T07:27:09.380862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08331","last_updated":"2025-08-06T08:27:53Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:59:10Z","title":"Go-with-the-Flow: Motion-Controllable Video Diffusion Models Using Real-Time Warped Noise","version":5},"cited_work":{"arxiv_id":"2501.08331","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08331","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Go-with-the-flow: Motion- controllable video diffusion models using real-time warped noise","venue":null,"work_id":"0f39a941-ade2-4b23-91d0-49540e59835d","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2501.08331","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:074cd88bf82909d66c8d945203bcf1ecc596907c821e0f12cbaad91cedec6c55","observation_id":"8e7dfc2e-fee8-46e4-b10a-53b6c422f84d","resolution":{"observed_at":"2026-05-19T07:27:08.987121Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18597","last_updated":"2025-03-26T09:05:41Z","snapshot_observed_at":"2026-07-06T20:12:54.710203Z","submitted_at":"2024-12-24T18:51:19Z","title":"DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation","version":2},"cited_work":{"arxiv_id":"2412.18597","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18597","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2412.18597 (2024)","venue":null,"work_id":"09730fa6-d46e-4939-9bdf-6e28a187a693","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.18597","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:d97b591e2a76cd7a6b21c46eaea73abcb9ead78c6468f2eddeec32bd6b717073","observation_id":"64831998-ba09-4e44-9bf8-46a485de7063","resolution":{"observed_at":"2026-05-19T07:27:08.888669Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wang, and Gordon Wet- zstein","venue":null,"work_id":"4dbb6e77-39c1-4450-95c5-cbdce1eda652","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:abfd0dbdde23a463161e5a3d95cb719b1a541be45dcf6066dc4eea72dab0d081","observation_id":"18ccce00-371a-4fde-b02b-54c13375c4f3","resolution":{"observed_at":"2026-05-19T07:27:09.372865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gen- erating human motion in 3d scenes from text descriptions","venue":null,"work_id":"4d570086-dc16-42ba-9d81-72533c24599a","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:4d326495f204cc604c0c0a21166ea37a84a385beb51b566dab353832cfa0dbd5","observation_id":"01b88b08-d983-4942-ab93-41a85ebec5fc","resolution":{"observed_at":"2026-05-19T07:27:09.432964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videocrafter2: Overcoming data limitations for high- quality video diffusion models","venue":null,"work_id":"7914f943-d80d-4ad6-9d09-f3f0510849a8","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:158f5c84224ceb97c0367c1b02c3bafa3438cae79d583c02f201bf90d98b752d","observation_id":"d1813d2b-2b25-413a-98d9-b96938e3bb6f","resolution":{"observed_at":"2026-05-19T07:27:09.434985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:058290861444f47da58e18b3e00a2ce44501e2414349356dd697a78fee1d6e86","observation_id":"d34ff940-edb5-4b82-ba0b-7606b5f9523b","resolution":{"observed_at":"2026-05-19T07:27:09.031158Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02690","last_updated":"2024-12-04T20:51:17Z","snapshot_observed_at":"2026-07-06T20:01:05.921085Z","submitted_at":"2024-12-03T18:58:19Z","title":"FoundHand: Large-Scale Domain-Specific Learning for Controllable Hand Image Generation","version":2},"cited_work":{"arxiv_id":"2412.02690","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02690","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Foundhand: Large- scale domain-specific learning for controllable hand image generation","venue":null,"work_id":"f804423a-1051-4db4-ba39-3d5ea94a79a9","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.02690","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:1aabb0daaa47dc132b3de6393c174af2a9315d0833a7d6f97844caaf45e2a1f1","observation_id":"8980f562-7d33-4e49-909f-b8303dd47069","resolution":{"observed_at":"2026-05-19T07:27:08.950681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06187","last_updated":"2025-03-20T17:59:56Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:54Z","title":"Multi-subject Open-set Personalization in Video Generation","version":2},"cited_work":{"arxiv_id":"2501.06187","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06187","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-subject open-set personalization in video generation","venue":null,"work_id":"d75990b3-0ef1-4b4d-988b-455afa033c08","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2501.06187","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:abe7022d21a526862b2e8d58d795eb8f81c25afddae766cd2fafa9799faa15a0","observation_id":"a41d63e8-a50f-4d6d-b081-8964572aa162","resolution":{"observed_at":"2026-05-19T07:27:08.962058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12601","last_updated":"2025-07-02T06:39:01Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T17:59:44Z","title":"DreamCinema: Cinematic Transfer with Free Camera and 3D Character","version":2},"cited_work":{"arxiv_id":"2408.12601","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.12601","snapshot_observed_at":"2026-07-03T20:28:55.541052Z","title":"Dreamcinema: Cinematic transfer with free camera and 3d character","venue":null,"work_id":"53443bf8-4cf9-4ccd-b02d-df30f96e44c4","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2408.12601","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:b30a74da2fe5b4ad1ed16b84da1012191a181182ab1defa2bc4f73c5da51a74c","observation_id":"95f81163-0c62-48c3-b556-f280a720f4a5","resolution":{"observed_at":"2026-05-19T07:27:08.924583Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Style in- jection in diffusion: A training-free approach for adapting large-scale diffusion models for style transfer","venue":null,"work_id":"f80a5c83-a03d-4fc6-b4bf-c36fc36c23b0","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:4b0ec7043caeb4ed19814b5e6ab243ffd3b7440934f325b15de2d011d29d43b7","observation_id":"6d017889-c582-4163-9e44-3fa9aad3cf04","resolution":{"observed_at":"2026-05-19T07:27:09.407942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13307","last_updated":"2024-03-21T13:06:49Z","snapshot_observed_at":"2026-07-06T17:47:30.518562Z","submitted_at":"2024-03-20T05:11:10Z","title":"LaserHuman: Language-guided Scene-aware Human Motion Generation in Free Environment","version":2},"cited_work":{"arxiv_id":"2403.13307","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.13307","snapshot_observed_at":"2026-06-29T08:13:15.845179Z","title":"Laserhuman: language-guided scene- aware human motion generation in free environment","venue":null,"work_id":"32dfe758-454f-48eb-82d3-e148b1cf084f","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2403.13307","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:8d0e6c64580c240b25c9562c9805241ddd840fb3e41676e646830510c1d92c36","observation_id":"ea15e6f4-ff2a-49bb-a810-e591ee266e7d","resolution":{"observed_at":"2026-05-19T07:27:08.928143Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dragvideo: Interactive drag-style video editing","venue":null,"work_id":"8b1d26ae-329d-47df-a9de-67604dde9707","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:8da21cf27c37794a2e635b38487b8edd4a0be183894d29a888dd27d1c962662f","observation_id":"c5853e52-9dc2-49d6-9516-9bf42fe391bc","resolution":{"observed_at":"2026-05-19T07:27:09.415913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"d2799393-6ff9-4a57-a4db-41fafe84a7d7","year":null},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:40d31a5a569bada18f1b246f8a84c4fbec685946fa24b46ff7c79f0aad0637e7","observation_id":"4735d37b-4b3c-40b7-ac2b-de5f38da1b2b","resolution":{"observed_at":"2026-05-19T07:27:09.460875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"08d0ef70-a0e9-40d4-91a3-8353264e406c","year":2017},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:fb0a3e3e0dc7cae38ed21988863091e1e7ac552ddb04a6f98237f755abe4ebe1","observation_id":"38402460-8972-4a89-b6c1-797260cc1575","resolution":{"observed_at":"2026-05-19T07:27:09.402967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.18281","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Motioncharacter: Identity-preserving and motion controllable human video generation","venue":null,"work_id":"50840446-3606-4fe1-aae9-640bd41999d1","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:848187383833232b0dac1f076437e1f33a783292afb15f79414eb4592003117d","observation_id":"44297a95-be3f-42aa-a795-984e0ec19c5f","resolution":{"observed_at":"2026-05-19T07:27:08.943609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05107","last_updated":"2023-12-11T11:00:13Z","snapshot_observed_at":"2026-07-06T16:58:51.683654Z","submitted_at":"2023-12-08T15:37:17Z","title":"DreaMoving: A Human Video Generation Framework based on Diffusion Models","version":2},"cited_work":{"arxiv_id":"2312.05107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.05107","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreamoving: A human 9 video generation framework based on diffusion models","venue":null,"work_id":"01dc1447-30c7-41a8-a01c-adf0db7c71d0","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2312.05107","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:f850f9ffe089af03b68495a024152a5ff5dc8a7beca752d1b576f63b276705ce","observation_id":"5833cf9c-ea0e-4167-b952-ddf3442a58a5","resolution":{"observed_at":"2026-05-19T07:27:08.903461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hu- mandit: Pose-guided diffusion transformer for long-form human motion video generation","venue":null,"work_id":"55d17465-1ab4-46ac-931e-68b17d8d8a2f","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:3f19aa7dd66c33a85bb9a6644289c34f0cd396f6349505bc0deb7c78275772ac","observation_id":"d4a87c14-ff9c-4fb5-992a-95da6d00b502","resolution":{"observed_at":"2026-05-19T07:27:09.424764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Preserve your own cor- relation: A noise prior for video diffusion models","venue":null,"work_id":"e2b02bec-63b3-4497-821e-21be2578f740","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:a59d4e762bf238439a0b55b05883b0dde482e63b63af94f5e4fb0b71a61b6ef7","observation_id":"bde0305e-a6aa-4411-b26e-5ab1ff159543","resolution":{"observed_at":"2026-05-19T07:27:09.395903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03847","last_updated":"2025-01-09T04:25:42Z","snapshot_observed_at":"2026-07-06T20:17:43.203959Z","submitted_at":"2025-01-07T15:01:58Z","title":"Diffusion as Shader: 3D-aware Video Diffusion for Versatile Video Generation Control","version":2},"cited_work":{"arxiv_id":"2501.03847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03847","snapshot_observed_at":"2026-07-04T00:09:14.791130Z","title":"arXiv preprint arXiv:2501.03847 (2025)","venue":null,"work_id":"2b6484b7-b532-4eb7-a7d9-45bc262bc16a","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2501.03847","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:9c23cc57d596ee10979e0b47070a56ecabc8da8a05268244a3824d9012b8a8d2","observation_id":"1fe104f2-9d30-490c-a21c-dbc76fe11627","resolution":{"observed_at":"2026-05-19T07:27:08.870018Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"I2v-adapter: A general image-to-video adapter for diffusion models","venue":null,"work_id":"0c147b93-2585-4523-a2d6-65070ac39a20","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:75ea2a13afc8f401d200cc579dc43c77ee08b88544f82771ecf64fe39930275d","observation_id":"6de8377e-6e7e-471a-99e9-7365c9a8aed0","resolution":{"observed_at":"2026-05-19T07:27:09.470482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":"2307.04725","doi":"10.48550/arxiv.2307.04725","metadata_source":"pith","pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","venue":"cs.CV","work_id":"1f9d1d3b-a6d6-45a9-9f13-51393c03be8a","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:7a55c2531569fa850314a6ba76a8648d16b66248a22b2b2e4d1a83b5b697d884","observation_id":"57fbd5a5-c7e7-4861-98c4-c4c292d21c2f","resolution":{"observed_at":"2026-05-19T07:27:08.982745Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human poseitioning system (hps): 3d human pose estimation and self-localization in large scenes from body-mounted sensors","venue":null,"work_id":"a8a1682b-6501-488f-a479-9426d06d86a6","year":2021},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:a51e4a8406727de14a8994be0343fde0e4a5eaa43ec42795c00b76222c8f5cdf","observation_id":"ec21d92d-03ff-446c-978f-9944d80f78c4","resolution":{"observed_at":"2026-05-19T07:27:09.448646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":"2501.00103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-07-09T07:56:04.699528Z","title":"LTX-Video: Realtime Video Latent Diffusion","venue":"cs.CV","work_id":"cee5c521-3ce9-466e-a035-1e42f89254f4","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:6ce8f49935914a6617dc4a7598dee81b77e4a56218a123a21bdd1c0af44e5c6b","observation_id":"6eb35fcf-5690-483d-b0ad-2b267534a11b","resolution":{"observed_at":"2026-05-19T07:27:08.881798Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Resolving 3d human pose ambiguities with 3d scene constraints","venue":null,"work_id":"6f99507a-7e8a-4080-b5bc-e497ddfa8985","year":2019},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:a39b8b0c3295a82830d80ea0e01ec8d840b49f7d49ad87124f04b6e7c24b341d","observation_id":"f880363c-9778-4dc1-a132-03e48c0fac0c","resolution":{"observed_at":"2026-05-19T07:27:09.442835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cameractrl: En- abling camera control for text-to-video generation","venue":null,"work_id":"e410b73b-4c0c-48bf-ad73-b917baa37ae2","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:bd82974250b5e888b177512ecbf793968258a6c239fadea77552d78c05b3f30c","observation_id":"29faf151-4e34-443f-a81c-c327a84bd195","resolution":{"observed_at":"2026-05-19T07:27:09.438862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"662ccbc5-2e43-43d7-b509-3121dab16551","year":2020},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:2df633bd447caee7afbd6074b24e3ca0cdc47a3d17504171d573689be8612dd7","observation_id":"0ee1e086-8eb5-41b6-bc25-094c13d7ab0e","resolution":{"observed_at":"2026-05-19T07:27:09.352457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video dif- fusion models","venue":null,"work_id":"6154d0da-7b03-44f1-9794-14f6c9919c64","year":2022},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:831067f1bf64094d567d8a3e307c42b8647b61b67c54df2710f19d0f64c273ab","observation_id":"72adb8c4-cf57-42a5-950b-9c94279a883e","resolution":{"observed_at":"2026-05-19T07:27:09.378506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04925","last_updated":"2024-11-11T13:24:18Z","snapshot_observed_at":"2026-07-06T19:46:50.403301Z","submitted_at":"2024-11-07T18:00:33Z","title":"StoryAgent: Customized Storytelling Video Generation via Multi-Agent Collaboration","version":2},"cited_work":{"arxiv_id":"2411.04925","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04925","snapshot_observed_at":"2026-07-09T07:56:04.704136Z","title":"Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, and Eli Shechtman","venue":"cs.CV","work_id":"d989b19d-4134-4b76-a09f-cc1e4b0e579e","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2411.04925","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:e8922e4c38bb0181da6f32eccb54f279622546d1a9fe0c383e150c6067802a7b","observation_id":"d8dfb9d3-1e8f-49aa-b4a1-0c68a32fd565","resolution":{"observed_at":"2026-05-19T07:27:09.047774Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13185","last_updated":"2024-12-17T18:58:07Z","snapshot_observed_at":"2026-07-06T20:08:48.064792Z","submitted_at":"2024-12-17T18:58:07Z","title":"Move-in-2D: 2D-Conditioned Human Motion Generation","version":1},"cited_work":{"arxiv_id":"2412.13185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13185","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Move-in-2d: 2d-conditioned human motion generation","venue":null,"work_id":"721ef584-29b7-49f1-b16c-4123ad4c1eae","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.13185","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:641fe24808961c57984f00b1b511bd4b3a5e06254c7f9a862c17ead7e068406f","observation_id":"d8d95c5e-a9f6-46e1-8879-6bd7835672af","resolution":{"observed_at":"2026-05-19T07:27:09.026206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion- based generation, optimization, and planning in 3d scenes","venue":null,"work_id":"34e14cdc-9a79-4367-8fdf-9f09dde559cb","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:2eb0c53ee61a01a6b5241be9475f0692ce5cd8cec6eae810dc146a47a78b45cf","observation_id":"0a703d01-3746-4922-a8fa-52d7f51a99b3","resolution":{"observed_at":"2026-05-19T07:27:09.400573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09600","last_updated":"2024-12-12T18:59:01Z","snapshot_observed_at":"2026-08-05T00:53:15.041432Z","submitted_at":"2024-12-12T18:59:01Z","title":"Owl-1: Omni World Model for Consistent Long Video Generation","version":1},"cited_work":{"arxiv_id":"2412.09600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09600","snapshot_observed_at":"2026-07-03T20:28:55.530707Z","title":"Owl-1: Omni world model for consistent long video generation","venue":null,"work_id":"7229dc8c-33c8-4190-b5c8-2f7bc6e6ba76","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.09600","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:3e79b99c56dbce4956db239ffc4ef96c92fe95d91abf08a7ba7240f71863dfdf","observation_id":"ab80ed95-0cf1-4260-bb39-cf4bdd53d804","resolution":{"observed_at":"2026-05-19T07:27:08.914073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VBench: Comprehensive benchmark suite for video generative mod- els","venue":null,"work_id":"587bf44b-d860-4797-8ae3-e5060465dff7","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:609aa7bf94eb2282e6b1d4b2365b543bcf1fe0befc35e5b3d8688eb46d82d581","observation_id":"5aef4116-47de-4fd1-8ffb-eab323b57762","resolution":{"observed_at":"2026-05-19T07:27:09.338032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Peekaboo: Interactive video generation via masked- diffusion","venue":null,"work_id":"a094fec5-c99c-4822-ae22-bc01155977fb","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:25b8c753e9ef6ccb0d2fd021223d4ab33aca5cc0e5b4abe017fa48d9ac108374","observation_id":"8c7ea417-d225-4159-9b03-a54064538929","resolution":{"observed_at":"2026-05-19T07:27:09.355593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling up dynamic human-scene interaction mod- eling","venue":null,"work_id":"a1a97dea-cebb-404a-976a-34f59218f3d6","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:192328f14daf204a7861727226fb6557e7cc37ef3c3007ba51ffa3eb09487a00","observation_id":"1abb434e-c6e7-4f68-9e21-90ea0fc7fec9","resolution":{"observed_at":"2026-05-19T07:27:09.349819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.06244","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Story-adapter: A training-free iterative framework for long story visualization","venue":null,"work_id":"5b137cec-538a-4374-a20e-c46d55dbee8d","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:247d508558828c9cc9b27c18c97469c3dc6d692bf45068c07ff12485724a6c71","observation_id":"d75ab0ff-7002-442f-8baa-d0364867cf24","resolution":{"observed_at":"2026-05-19T07:27:08.969859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b1d33aed-b5eb-4e39-ab3a-a19d5daf5e82","year":2022},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:cc023377019ff54bab7a3b8e2675b7adb0a775587f3b41c11ae101add7c0ddd1","observation_id":"7fb8259d-5cb8-4452-a262-6136b00325dd","resolution":{"observed_at":"2026-05-19T07:27:09.347205Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":"d7f94bea-a769-4893-b50f-dc321bfa2127","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:fb526e1c91d3cada5e4916cfe390bbde0ca82463649d28987c42499e778149e4","observation_id":"070fbb13-03a5-4e37-aef3-d79af46ed906","resolution":{"observed_at":"2026-05-19T07:27:09.430996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08333","last_updated":"2025-08-11T11:45:30Z","snapshot_observed_at":"2026-08-03T17:27:23.702259Z","submitted_at":"2025-01-14T18:59:59Z","title":"DAViD: Modeling Dynamic Affordance of 3D Objects Using Pre-trained Video Diffusion Models","version":3},"cited_work":{"arxiv_id":"2501.08333","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08333","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"David: Modeling dynamic affordance of 3d objects using pre- trained video diffusion models","venue":null,"work_id":"7c190ede-491f-4d30-8a4f-55f926d504ae","year":null},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2501.08333","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:d11bb3ca13be8d87b3ef30911ce4e9d5e65810524943cb55dc3b6b98c256ec09","observation_id":"0536bf5d-27ba-4e47-b7e2-bf5ad2f02654","resolution":{"observed_at":"2026-05-19T07:27:08.899329Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segment anything","venue":null,"work_id":"1dec762c-a558-48a6-96b6-54616121d7d0","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:1577ee368844c5675184f8bfb80c54600616563a5433e479905b24ea5a59bfdb","observation_id":"03e928e1-e6fa-47f9-b330-463f389b43dc","resolution":{"observed_at":"2026-05-19T07:27:09.444712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Putting people in their place: Affordance-aware hu- man insertion into scenes","venue":null,"work_id":"bd971ac0-4182-4c02-8602-20de42f9706a","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:f48dabc0f5ad4c2e7fecf32edd0cdbdac3d288ee6a981a85c06c4e0a4a3dbaa4","observation_id":"e4bc4dcd-92d7-45d4-b02a-4937a5878675","resolution":{"observed_at":"2026-05-19T07:27:09.440806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5332fee4-9488-435e-a71e-fe867fce114a","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:c030cbef3402a19be715555e18c5103071c6c6958fc48a54e7b526f3f0ab65b8","observation_id":"296e44be-638a-4080-b07d-a60c071a34bc","resolution":{"observed_at":"2026-05-19T07:27:09.335703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18600","last_updated":"2025-03-21T16:17:28Z","snapshot_observed_at":"2026-07-06T20:12:54.710203Z","submitted_at":"2024-12-24T18:55:38Z","title":"ZeroHSI: Zero-Shot 4D Human-Scene Interaction by Video Generation","version":2},"cited_work":{"arxiv_id":"2412.18600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18600","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ze- rohsi: Zero-shot 4d human-scene interaction by video gen- eration","venue":null,"work_id":"5198abbf-14ea-4520-af19-adef1e7f39f6","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.18600","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:3dcd3338292af6007226f1b102341683604ecaf1e12ce13c84eb03e2bad547a3","observation_id":"d12c0e47-faf6-40eb-b8fd-ec341830cc80","resolution":{"observed_at":"2026-05-19T07:27:09.005765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hybrik: A hybrid analytical-neural inverse kinematics solution for 3d human pose and shape estimation","venue":null,"work_id":"85b19daa-5a9a-4ebf-86e4-18c919784ac3","year":2021},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:dd9330907d140812e0ecddc8ed1dc02ef779120b88f75c8eab3eef7f667f927d","observation_id":"8535c6c0-ccc4-4ca8-92e7-d29bd5452c65","resolution":{"observed_at":"2026-05-19T07:27:09.342596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05690","last_updated":"2023-04-12T08:29:31Z","snapshot_observed_at":"2026-07-06T15:14:44.015806Z","submitted_at":"2023-04-12T08:29:31Z","title":"HybrIK-X: Hybrid Analytical-Neural Inverse Kinematics for Whole-body Mesh Recovery","version":1},"cited_work":{"arxiv_id":"2304.05690","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.05690","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hybrik-x: Hybrid analytical-neural inverse kinematics for whole-body mesh recovery","venue":null,"work_id":"5781ce84-d0ae-41f7-b0b2-1c04a21f570e","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2304.05690","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:b93b4c9586f56c1a9887e1105c711e40e172a3e04f0f43007e095f41c7ea2f22","observation_id":"1849a30c-4223-4bbd-8554-76fc0c4a368f","resolution":{"observed_at":"2026-05-19T07:27:08.966145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Genzi: Zero-shot 3d human-scene interaction generation","venue":null,"work_id":"ba427dad-a53c-4fc9-a5d4-2d14237572e2","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:c92eff5b40d516bacab8933d71fbda372b7cdf09294b9dac7d8a04aacab35ff8","observation_id":"4a4af4a0-1bae-4dbf-8d40-ea9a1363cc3b","resolution":{"observed_at":"2026-05-19T07:27:09.364710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Animatable gaussians: Learning pose-dependent gaussian maps for high-fidelity human avatar modeling","venue":null,"work_id":"4eb390df-0532-4239-8889-6a7eabde5891","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:c4025e5326dd4cc6e46f586f997bb3ddb10b188a3a0b903407cd0000bf080d57","observation_id":"f588f632-89b7-4004-80a6-2383245b6ef4","resolution":{"observed_at":"2026-05-19T07:27:09.458737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intergen: Diffusion-based multi-human motion generation under complex interactions","venue":null,"work_id":"78e69804-d506-4a55-927c-b9ce34990a32","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:a2852b777e2188c0d810ec71d93e4f15d03cb5180dbbe11625a6756858dfc4d9","observation_id":"115bb29e-130f-4e5b-bd3f-2b358d905c90","resolution":{"observed_at":"2026-05-19T07:27:09.456774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":"2412.00131","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-07-08T14:44:59.776032Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","venue":"cs.CV","work_id":"51c0ab25-66f7-4d1a-a028-86b9b1b9e313","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:4c06c015818ec21708c56348d7052d027828f4191028d1e6607364b6f44c1a0b","observation_id":"34ca8adf-9162-44e3-8901-b29d53285c1a","resolution":{"observed_at":"2026-05-19T07:27:09.022234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnihuman-1: Rethinking the scaling-up of one-stage conditioned human animation models","venue":null,"work_id":"79bb9dca-058b-45e8-b81a-b901bc5afbd7","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:7e175436feb2c99b5d2f82cf67eee4df5fb5bbeca574d2b391822bc77b246ae5","observation_id":"189a6fe0-a962-4f45-b246-e815895e0b69","resolution":{"observed_at":"2026-05-19T07:27:09.462806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16714","last_updated":"2025-09-07T04:06:42Z","snapshot_observed_at":"2026-07-06T20:27:14.226247Z","submitted_at":"2025-01-28T05:40:20Z","title":"Separate Motion from Appearance: Customizing Motion via Customizing Text-to-Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2501.16714","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16714","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Separate motion from appear- ance: Customizing motion via customizing text-to-video diffusion models","venue":null,"work_id":"9202a2ec-5626-4696-a0de-5332bbff8bce","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2501.16714","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:0ea2bd47df7586b4a8224de79c88f18c76a7026303296a0af85eebf80deac6cc","observation_id":"5f29e41d-f228-456c-88b1-cfec2d8fa30f","resolution":{"observed_at":"2026-05-19T07:27:09.001999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Phantom: Subject- consistent video generation via cross-modal alignment","venue":null,"work_id":"e01a1b8e-9583-4a2b-942d-01458bba1618","year":null},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:a4fd78e9e0d555ce125325709b60691ddace0cdb99242a643a094e972e6bb65a","observation_id":"1be80dee-8757-4f06-a69e-df212fd69564","resolution":{"observed_at":"2026-05-19T07:27:09.452798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"fd7eb815-fa59-4124-8df9-ba6bc86709e8","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:3089790254c97c4c0e20bceba5154805da81ce2724255755ad63703de024da89","observation_id":"2d7f362f-8694-427e-b6e4-b59211684046","resolution":{"observed_at":"2026-05-19T07:27:09.454779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a9c2a502-bc31-48d3-b229-d20a70cd445b","year":2015},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:3b320d9deb0932f31a58a29b51e38da814cffcca69e7558c5c76d06b0d7f0dc6","observation_id":"39061465-73aa-4e5a-b3a5-af5efd170eed","resolution":{"observed_at":"2026-05-19T07:27:09.358337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smpl: A skinned multi-person linear model","venue":null,"work_id":"be6e0cb6-1998-4efe-8e62-5e9365040f69","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:7518492b0d49d8e58ed7c360305f773d079d8ceb7e568e7cf8de5355bdba9409","observation_id":"96cf5621-27a3-4696-bea5-df3c0801f1de","resolution":{"observed_at":"2026-05-19T07:27:09.446574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:7a6e83bb6aeef2307af920bb78a1bdf56c5c9737fa625d1ffbf81b24700d38ab","observation_id":"0d4a097e-ebf6-431b-9307-90e7333825a0","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trailblazer: Trajectory control for diffusion-based video generation","venue":null,"work_id":"05eabbcc-6106-4087-9d45-911187016677","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:f83433a843eebffb3b14310ffcef008fb5c52e64dfacf74aa975880232312240","observation_id":"1d152e8b-37c2-4b57-bcc9-ad345fa439e4","resolution":{"observed_at":"2026-05-19T07:27:09.464690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15642","last_updated":"2024-07-23T01:35:07Z","snapshot_observed_at":"2026-07-06T18:50:04.824067Z","submitted_at":"2024-07-22T14:00:03Z","title":"Cinemo: Consistent and Controllable Image Animation with Motion Diffusion Models","version":2},"cited_work":{"arxiv_id":"2407.15642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15642","snapshot_observed_at":"2026-07-01T13:25:44.776981Z","title":"Cinemo: Consis- tent and controllable image animation with motion diffu- sion models","venue":null,"work_id":"00d9186f-bc87-4cbf-800c-6822025cc5c5","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2407.15642","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:b292a01e7735831b7d5e9c78d716152398daaaeee638b99c356c9512d2b367f8","observation_id":"16e914aa-bf57-4099-b717-a41c5f3bbeab","resolution":{"observed_at":"2026-05-19T07:27:08.974069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05059","last_updated":"2024-06-15T03:10:59Z","snapshot_observed_at":"2026-07-06T18:27:15.980730Z","submitted_at":"2024-06-07T16:31:41Z","title":"GenHeld: Generating and Editing Handheld Objects","version":3},"cited_work":{"arxiv_id":"2406.05059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05059","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Genheld: Generating and editing handheld objects","venue":null,"work_id":"0cc0be1f-a852-4061-9c12-04182241dfe6","year":null},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2406.05059","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:aefad644714ef9540a7d32baf78005bb476ca3d637f6e118cd496bf7a15c2782","observation_id":"4bfec488-8c34-49e8-b044-e6fbfcdd13ee","resolution":{"observed_at":"2026-05-19T07:27:08.990992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatgpt-4o","venue":null,"work_id":"31741dd3-75fa-45f9-8a33-7d20a53bb68d","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:57b773a40f8f2d22925ca023de5b60625455714ee3df89ce5afc3bea57d6c390","observation_id":"300ce8fe-0613-4839-9536-e790d8bb5566","resolution":{"observed_at":"2026-05-19T07:27:09.466611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:288cee1a9c841362d1cc008412e8e0d012501216cdeb6cbc9c0255be0051b149","observation_id":"c4e4a262-85db-4ee2-8300-f1c4f750e3ca","resolution":{"observed_at":"2026-05-19T07:27:08.873264Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text2place: Affordance-aware text guided human placement","venue":null,"work_id":"5ef52c11-2064-4b15-933f-e8c04f13daf1","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:1805d7f9405bf43f296ba69d76ce54b409d28f0f37fe8d6035898257600cfd6a","observation_id":"0aa829ac-d6d5-4bb9-a7ca-3fedc685819d","resolution":{"observed_at":"2026-05-19T07:27:09.389822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Expressive body capture: 3d hands, face, and body from a single image","venue":null,"work_id":"b974ad20-c305-4b1d-a69f-e2beedc5b445","year":2019},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:c364c3aa5344cfa377d7c23a55639022f0ca37a2afd3f4ce9f0e0a20a8426b20","observation_id":"71e92500-4790-482e-923f-fd7e378ded66","resolution":{"observed_at":"2026-05-19T07:27:09.450669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b7b9357d-cbb7-4994-b357-94c268cfceea","year":2019},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:4e08868e025b42fa036888fbdd590a6c90ab4ccc2c68f296868f5d51a9206587","observation_id":"b0877edb-f0a7-4c78-947a-deec8120059e","resolution":{"observed_at":"2026-05-19T07:27:09.393722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06553","last_updated":"2025-07-07T05:09:32Z","snapshot_observed_at":"2026-07-06T16:59:56.350207Z","submitted_at":"2023-12-11T17:41:17Z","title":"HOI-Diff: Text-Driven Synthesis of 3D Human-Object Interactions using Diffusion Models","version":3},"cited_work":{"arxiv_id":"2312.06553","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.06553","snapshot_observed_at":"2026-07-10T16:17:21.682636Z","title":"Hoi-diff: Text-driven syn- thesis of 3d human-object interactions using diffusion mod- els","venue":"cs.CV","work_id":"7a68c4d2-5d8e-4e97-a3ef-47ab042ae72e","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2312.06553","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:903af527a2dbd0eac572c9882d26a4e311a871cdf74af574c127a01243b520e1","observation_id":"5591942f-fc0b-4541-b148-251f5b228a7d","resolution":{"observed_at":"2026-05-19T07:27:09.035768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"c74eb1ea-7362-413a-b763-8b413ab8efd2","year":2022},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:e78c958e8248e10fc9225f33f566b813a7bb45c519d2e8608518c2f5a2c518e3","observation_id":"bf2fba20-6a2a-449f-b352-c2ea3df051f5","resolution":{"observed_at":"2026-05-19T07:27:09.385354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreambooth: Fine 11 tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"f41598f0-cb60-426c-ad70-156931bd9e35","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:fae9d5b4b807fe7fc2bacfdaac8020f12d67e02ce12aa072484b7d6b7eb53018","observation_id":"e902d4ca-924e-4236-aabc-db5fc03a42e6","resolution":{"observed_at":"2026-05-19T07:27:09.375906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02489","last_updated":"2024-07-02T17:59:50Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:50Z","title":"Magic Insert: Style-Aware Drag-and-Drop","version":1},"cited_work":{"arxiv_id":"2407.02489","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.02489","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magic insert: Style-aware drag-and-drop","venue":null,"work_id":"bdf17c82-7c11-4f74-b69e-4ef052c7b4e4","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2407.02489","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:d47bd605d731ddca77059d0bff64e447ac6f0ae359fbad220fcfe03f17cc49b6","observation_id":"22bc4474-9940-4e22-83ba-eb914b642d16","resolution":{"observed_at":"2026-05-19T07:27:09.009377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14403","last_updated":"2025-01-02T18:59:09Z","snapshot_observed_at":"2026-08-04T23:42:15.822209Z","submitted_at":"2024-04-22T17:58:36Z","title":"GeoDiffuser: Geometry-Based Image Editing with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2404.14403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.14403","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geodiffuser: Geometry-based im- age editing with diffusion models","venue":null,"work_id":"ead8c563-ff70-4a52-bd38-448c54f4776b","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2404.14403","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:1e084e527a3eeae70ab318ac031068e4bc98d39b2c37a39101710b7f971b4153","observation_id":"81b99bce-39b2-49de-8bae-4f071099b6c4","resolution":{"observed_at":"2026-05-19T07:27:09.043662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15977","last_updated":"2024-01-31T07:41:04Z","snapshot_observed_at":"2026-07-06T17:21:42.659240Z","submitted_at":"2024-01-29T09:06:43Z","title":"Motion-I2V: Consistent and Controllable Image-to-Video Generation with Explicit Motion Modeling","version":2},"cited_work":{"arxiv_id":"2401.15977","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.15977","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhang, Manyuan Zhang, Ka Chun Cheung, Simon See, Hongwei Qin, Jifeng Da, and Hong- sheng Li","venue":null,"work_id":"26d80b1f-8520-4075-8ace-cdc04afa9e5f","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2401.15977","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:2af4ab22457790d83efbb0f454294b905caea670fae66c266c636ca45f631766","observation_id":"7bacf2e7-fe99-4746-8a9e-19a8c7e2727c","resolution":{"observed_at":"2026-05-19T07:27:08.917643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dragdiffusion: Harnessing diffusion models for interac- tive point-based image editing","venue":null,"work_id":"4fb8e3f2-96c5-4302-aadd-b25af807dac8","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:9194c12c82d4439903742310fb24a950b85f1a0402b38fa95c679850721401cd","observation_id":"7efac2ba-12ec-46e9-b146-7442b8da72ea","resolution":{"observed_at":"2026-05-19T07:27:09.367844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:fb17bfa99d55d71648a046a35d75b0af98482a8a5f48d578d5d22afc57bbc2a4","observation_id":"f7b39e52-d76b-492b-9d47-b0adf1258b4a","resolution":{"observed_at":"2026-05-19T07:27:08.920941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sound to visual scene gener- ation by audio-to-visual latent alignment","venue":null,"work_id":"c1c80cd7-0598-4ee9-9b9b-ab703f2e37c9","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:af50f96a3589e4a9c7a1137b7af90d469ab9ee48ab8fd7c6d81b1eebeab50b25","observation_id":"4620c837-2869-44c6-af38-f5cd775c838c","resolution":{"observed_at":"2026-05-19T07:27:09.340214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07232","last_updated":"2024-11-12T07:49:39Z","snapshot_observed_at":"2026-07-06T19:48:36.508447Z","submitted_at":"2024-11-11T18:50:09Z","title":"Add-it: Training-Free Object Insertion in Images With Pretrained Diffusion Models","version":2},"cited_work":{"arxiv_id":"2411.07232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.07232","snapshot_observed_at":"2026-07-01T14:25:46.030765Z","title":"arXiv preprint arXiv:2411.07232 , year=","venue":null,"work_id":"7ad26308-3c67-4558-b93e-486a1fecd946","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2411.07232","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:f7bcb946ab97995ec5e37a928fcb8757f71c8e70e10cbc8a0a541a9dafaa12c2","observation_id":"e1b32098-9779-423d-82a5-4c6ce7bf9df8","resolution":{"observed_at":"2026-05-19T07:27:09.013480Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-07-06T20:06:21.957662Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"cited_work":{"arxiv_id":"2412.09856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09856","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lingen: Towards high-resolution minute- length text-to-video generation with linear computational complexity","venue":null,"work_id":"05a946c3-128b-4972-b09e-65191eb37b5d","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.09856","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:9f83026b694dedb99f6117d48aea53660309fe804c934a0a7c36348d5272c8c4","observation_id":"d2d1e529-6b84-4fb0-92c2-28dede2602f8","resolution":{"observed_at":"2026-05-19T07:27:08.877210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20193","last_updated":"2024-10-16T18:35:31Z","snapshot_observed_at":"2026-08-01T15:15:08.959349Z","submitted_at":"2024-03-29T14:14:22Z","title":"Motion Inversion for Video Customization","version":2},"cited_work":{"arxiv_id":"2403.20193","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.20193","snapshot_observed_at":"2026-06-30T13:44:40.581238Z","title":"Motion inversion for video customization","venue":null,"work_id":"eb92c9d2-6778-40ba-8d96-ccd3e12c3422","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2403.20193","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:ea5d5f11dfa2630a4c0813c44ccfb28e6849f404b73a765f2bf9b004965c50d2","observation_id":"c3f32616-caa4-40b8-a3aa-2f27f420d4f9","resolution":{"observed_at":"2026-05-19T07:27:08.946885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19115","last_updated":"2025-04-15T06:33:45Z","snapshot_observed_at":"2026-07-06T19:39:23.839070Z","submitted_at":"2024-10-24T19:29:02Z","title":"MoGe: Unlocking Accurate Monocular Geometry Estimation for Open-Domain Images with Optimal Training Supervision","version":3},"cited_work":{"arxiv_id":"2410.19115","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.19115","snapshot_observed_at":"2026-07-10T01:46:41.316792Z","title":"Moge: Unlocking accurate monocular geometry estimation for open-domain images with optimal training supervision","venue":"cs.CV","work_id":"f448b8f3-4ea5-46af-a336-f7953b2dfb17","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2410.19115","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:f7f20162cc9b9d8a0ababc9ab8f1b995c74c24a28128c53fe274f0a426b6f9e3","observation_id":"925e6259-f10e-4e01-9422-6020090b9be7","resolution":{"observed_at":"2026-05-19T07:27:08.895161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2309.15103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-06-29T18:43:51.114876Z","title":"Lavie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":"e26464f0-6aed-49c2-b00f-e3639b1da5b1","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:17341919540f7ff0a496f473bcffe0855613a5306d366a7723b3b5ab8901c096","observation_id":"50ce6ba8-6eed-4fe4-a2ae-a9a976fec222","resolution":{"observed_at":"2026-05-19T07:27:08.958137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Humanise: Language-conditioned hu- man motion generation in 3d scenes","venue":null,"work_id":"7c448260-e0a4-4cc6-a5ba-7ec7a91d164a","year":2022},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:7889559b6e99c8bb0257c392f622f3bbdf208cf6eaa32e7f4bf1981ca26b1f31","observation_id":"27d965a2-5d41-472a-8f55-7d87a2629c64","resolution":{"observed_at":"2026-05-19T07:27:09.420514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":"59db025b-d18d-470d-9435-aae6871c3cc2","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:0f375291511c5601645a259c1fc87d3c0ea0821673ade959d78c629482e8862d","observation_id":"c249ca28-d251-4837-b1b9-5beb53033a29","resolution":{"observed_at":"2026-05-19T07:27:09.468603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Move as you say interact as you can: Language-guided human motion generation with scene af- fordance","venue":null,"work_id":"d5d2c2f2-5fe5-4b74-a8c4-426a01f03008","year":null},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:c72a703506657f0fe5536cb2d60b9d4e98f0150fdab0fd08ee850ae4135c7db1","observation_id":"f9bb6f49-3570-46f7-8380-9ba05f467d6f","resolution":{"observed_at":"2026-05-19T07:27:09.426869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18605","last_updated":"2024-12-24T18:58:43Z","snapshot_observed_at":"2026-07-06T20:12:54.710203Z","submitted_at":"2024-12-24T18:58:43Z","title":"Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models","version":1},"cited_work":{"arxiv_id":"2412.18605","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18605","snapshot_observed_at":"2026-07-04T08:59:43.205863Z","title":"Orient anything: Learn- ing robust object orientation estimation from rendering 3d models","venue":null,"work_id":"c5b7666c-e46a-4729-b933-1457ddcf103a","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.18605","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:26a48f67df461a1de8caa975dc1634f8baa9478b8cd4f4c77d8cf46a4e87d866","observation_id":"e9760be3-30a2-4784-9777-75f367f9a1bb","resolution":{"observed_at":"2026-05-19T07:27:08.891900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreamvideo: Composing your dream videos with customized subject and motion","venue":null,"work_id":"880b520d-cb1a-43b3-acc4-e076e68536b4","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:53d39a5cd43cdaa456af0a0026ec4ecf7deae6e54e33ce8125c63aaab74f0588","observation_id":"88e19441-c22e-44dc-858e-1a9cb996cf0d","resolution":{"observed_at":"2026-05-19T07:27:09.429085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detectron2","venue":null,"work_id":"bac6f22f-af03-4be8-b5b0-718f44b62a6b","year":2019},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:a30644cf9f39d9435eeb392872e1af4b2185ff36b311f7221617cb0cb137b163","observation_id":"64cbe6db-137f-44c0-9de4-4844d727dc9f","resolution":{"observed_at":"2026-05-19T07:27:09.436871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05263","last_updated":"2025-03-08T01:36:55Z","snapshot_observed_at":"2026-08-04T01:59:46.469472Z","submitted_at":"2024-12-06T18:52:20Z","title":"Mind the Time: Temporally-Controlled Multi-Event Video Generation","version":2},"cited_work":{"arxiv_id":"2412.05263","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05263","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mind the time: Temporally-controlled multi-event video generation","venue":null,"work_id":"a7f3df9e-8015-4ec6-9432-29c74ebd9306","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.05263","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:7c0f2e91fe2b86309ebe1ddb0eb3b33dcca7589d6953b818cb5b5d7ee1da8ae7","observation_id":"43fc0743-f735-4ecd-87f2-75b0dc7b0efb","resolution":{"observed_at":"2026-05-19T07:27:08.907092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01506","last_updated":"2025-05-30T11:13:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-02T13:58:38Z","title":"Structured 3D Latents for Scalable and Versatile 3D Generation","version":3},"cited_work":{"arxiv_id":"2412.01506","doi":"10.48550/arxiv.2412.01506","metadata_source":"pith","pith_arxiv_id":"2412.01506","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Structured 3D Latents for Scalable and Versatile 3D Generation","venue":"cs.CV","work_id":"6ce98e46-048f-47fa-917a-0c001eaae143","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.01506","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:8a70a0977a4bc90b9cf7fc6c865f28ad75a32c67c084e08e1328cceffb2ea20a","observation_id":"8290e019-f9b5-49cc-afa5-b322e83843f7","resolution":{"observed_at":"2026-05-19T07:27:08.978037Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.568006+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.568006+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06173","last_updated":"2025-06-07T09:44:59Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:52:11Z","title":"VideoAuteur: Towards Long Narrative Video Generation","version":2},"cited_work":{"arxiv_id":"2501.06173","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06173","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoauteur: Towards long narrative video generation","venue":null,"work_id":"e65d381c-1002-458d-a1ff-2e129bd9b784","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2501.06173","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:8994eb0323d24a8834668218b09fded9ba77666af5afbbda5eae82c375be6b7f","observation_id":"49fb1186-151a-4121-86a4-0fe4be1d0868","resolution":{"observed_at":"2026-05-19T07:27:08.885606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12190","last_updated":"2023-11-27T13:36:04Z","snapshot_observed_at":"2026-07-06T16:35:15.777674Z","submitted_at":"2023-10-18T14:42:16Z","title":"DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors","version":2},"cited_work":{"arxiv_id":"2310.12190","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.12190","snapshot_observed_at":"2026-07-04T14:59:55.949933Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"cd60d897-1a74-482c-84b4-93dfa38c1c33","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2310.12190","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:d210346dee1479c2a5dd94fa9a0a72f63ad1c16e99bf44a7b26c11da54993856","observation_id":"43bde310-09d2-4678-88eb-0cfe5a0906bf","resolution":{"observed_at":"2026-05-19T07:27:09.040021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"ef9acbea-1140-40cc-a608-5da28a201ffb","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:af22ae8052adfa6e38353c173877bf6224579eae04b0be87c7a14c9043044b78","observation_id":"ebf16d2e-4af2-4012-8a34-6ea564663f14","resolution":{"observed_at":"2026-05-19T07:27:09.422556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17383","last_updated":"2025-06-23T06:27:21Z","snapshot_observed_at":"2026-07-06T19:57:14.289258Z","submitted_at":"2024-11-26T12:42:13Z","title":"AnchorCrafter: Animate Cyber-Anchors Selling Your Products via Human-Object Interacting Video Generation","version":2},"cited_work":{"arxiv_id":"2411.17383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anchorcrafter: Animate cyberanchors sal- ing your products via human-object interacting video gen- eration","venue":null,"work_id":"d0853815-241f-45a2-9ca3-b04b9432e7a8","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2411.17383","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:3921f3fb67c4d712781b368758b351e1370f63c61038524e2d5c4e2852af2561","observation_id":"37457f85-25e3-4d6e-956d-77a39d7f0d06","resolution":{"observed_at":"2026-05-19T07:27:08.931807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Person in place: Generating associa- tive skeleton-guidance maps for human-object interaction image editing","venue":null,"work_id":"db17f2d1-6c91-4f6f-9d63-f5624048bae3","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:aa779994e34ec54bbd9903ab53febd40d421ea204c2521d0fded2231b216b773","observation_id":"88d53b2d-cad6-438f-a4b7-61efa9a77901","resolution":{"observed_at":"2026-05-19T07:27:09.410778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating human interaction motions in scenes with text control","venue":null,"work_id":"34cf544e-69d7-491e-a769-b47a5c1529e7","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:1c9458bcc0c7f3bbb17eb9be7ce6f3815fd1fd8ac768c6f187273bf7aaf82c8a","observation_id":"fb632a70-f0a9-4d66-b20e-c4f0989dbe53","resolution":{"observed_at":"2026-05-19T07:27:09.418152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"599bfa67-f24d-4f2f-898e-e990d1185484","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:13f945336495c27d8a38cdabc7901241c3848a5f7ea71d3d7545d876bb478115","observation_id":"b675014c-3183-4d0e-9b43-feb2333148a4","resolution":{"observed_at":"2026-05-19T07:27:09.413583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07563","last_updated":"2025-01-13T18:53:08Z","snapshot_observed_at":"2026-07-06T20:20:28.171470Z","submitted_at":"2025-01-13T18:53:08Z","title":"Training-Free Motion-Guided Video Generation with Enhanced Temporal Consistency Using Motion Consistency Loss","version":1},"cited_work":{"arxiv_id":"2501.07563","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07563","snapshot_observed_at":"2026-07-03T16:28:38.472435Z","title":"Training-free motion-guided video genera- tion with enhanced temporal consistency using motion consistency loss","venue":null,"work_id":"8ba0a72d-4c16-4095-b49d-3ab8b43612ab","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2501.07563","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:20880b39ef1563a5200bb51328b98490cc9c265ab0915e21dbd5a9d415d7a1a9","observation_id":"04faad48-d1f5-4bff-8960-98b4b22362f1","resolution":{"observed_at":"2026-05-19T07:27:09.055448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating 3d people in scenes with- out people","venue":null,"work_id":"7a4e13dc-cc74-4bb5-adca-555a57a515aa","year":null},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:e2261cfd58c7235060df786dad48cf3a30f45358a68faafa15bb830e6bd1c399","observation_id":"171c67e9-8747-4036-b9ea-b0410b11eb38","resolution":{"observed_at":"2026-05-19T07:27:09.405656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":5,"verified_exact":37,"verified_fuzzy":52},"total_outbound_references":109},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 109 outbound references and 2 inbound Pith citation observations for arXiv:2506.19840."}