{"as_of":"2026-08-13T04:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:746168fe35d5baa44e929ef4c337eb6cb3236bdfdeb14b49d96e2a9c3b3ebc0c","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:45:10.247547Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.04189/citation-record","integrity":"/paper/2412.04189/integrity","json":"/paper/2412.04189/citation-record.json","paper":"/paper/2412.04189"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:09.848461Z","title":"The mug facial expression database","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.848461Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:6a03578fa69239be21827191ea050b87f6151aebbeef19dd94c28376e91b0b09","observation_id":"f642428d-8390-4af5-9e2e-5c12478cec54","resolution":{"observed_at":"2026-08-11T21:45:09.848461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:09.853490Z","title":"Detours for navigating instructional videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.853490Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:178d049e62eedc661e6e486b68c9a0a54ff26c6247a5f81527da24091e93d1ea","observation_id":"3729c403-f6e6-4ebd-be85-0bfa87f6a5b4","resolution":{"observed_at":"2026-08-11T21:45:09.853490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:09.857437Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.857437Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:d32a3b5e8677f8c9bc7b80e92536887e4d6cbf6e27d390ba13be0b14a3519d1a","observation_id":"0d056796-4471-4d98-8e3a-c9b3035531ba","resolution":{"observed_at":"2026-08-11T21:45:09.857437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.507417Z","title":"Hrs-bench: Holistic, reliable and scalable benchmark for text-to-image models","venue":null,"work_id":"0a93121b-6af9-45f9-b71e-8e9998b31cd3","year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.860935Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:45bca960f6c522e2bc034dd45e382786cd6bb570fed0958a6afb262810fad237","observation_id":"ef9e9c3f-5e94-4e05-ae3d-8469909202c7","resolution":{"observed_at":"2026-08-11T21:45:11.512917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02426","last_updated":"2023-10-03T20:46:10Z","snapshot_observed_at":"2026-08-08T14:14:02.804572Z","submitted_at":"2023-10-03T20:46:10Z","title":"EditVal: Benchmarking Diffusion Based Text-Guided Image Editing Methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02426","snapshot_observed_at":"2026-08-11T21:45:09.864718Z","title":"Editval: Benchmarking diffusion based text-guided image editing methods","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.864718Z"},"links":{"cited_paper":"/paper/2310.02426","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:3b2ef5cc9ed3b618513dbc30489bd47a55799806d78ae1f13b2aed4a67d62c60","observation_id":"081a8a1c-63a7-44b8-916d-1cb2173a61ee","resolution":{"observed_at":"2026-08-11T21:45:09.864718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.492499Z","title":"Brooks, A","venue":null,"work_id":"c9753734-9e03-4846-a7ab-200d83d5f12f","year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.868784Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:70458c50204ae7f87757b7bccf6c7b14ac4fda8169725d683ac47df79f4a958e","observation_id":"ea11565d-4198-43ef-8e98-275e2cda8b11","resolution":{"observed_at":"2026-08-11T21:45:11.496580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.478816Z","title":"Gener- ating human motion in 3d scenes from text descriptions","venue":null,"work_id":"f3096c07-1b87-4703-b111-5d5769c9e79a","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.873338Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:83a6e8b10af869f0eef0d48792b74d60a88d3f3a9cd5a3685784eef0c30b8659","observation_id":"31a2ed05-e1eb-4f98-a350-6f0915c6de41","resolution":{"observed_at":"2026-08-11T21:45:11.483499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.466035Z","title":"Ceylan, C.-H","venue":null,"work_id":"3a1ecb81-2371-46cc-8686-ea21a6df902d","year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.876682Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:85e56d836aaf411584e9082b24a5e925061e3601a2a4402f681dae7f1041c8e6","observation_id":"164c07f7-1778-4547-9ded-584d90d528d5","resolution":{"observed_at":"2026-08-11T21:45:11.469388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.453297Z","title":"Cognitive load theory and the format of instruction","venue":null,"work_id":"348526e1-cf75-41cc-850e-92d54e02e3e5","year":1991},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.883210Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:ff5b48ee73f7f97f1617a5fb7dd0a27b3b925e9ca80b659208da27ca2083e2e8","observation_id":"653a53e4-930a-455c-9b5c-2321bfceb89d","resolution":{"observed_at":"2026-08-11T21:45:11.457298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.435233Z","title":"Learning video-conditioned policies for unseen manipula- tion tasks","venue":null,"work_id":"6687c555-be77-4e93-b7a8-2e340cd4ce0a","year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.887050Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:952e18517ef312f868569b9d2c5a1554487db9fcd31110df809f87334b8b736f","observation_id":"2446aa98-4e4f-453a-84e2-436b1a2a8a33","resolution":{"observed_at":"2026-08-11T21:45:11.439261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.420560Z","title":"Cheikh Youssef, A","venue":null,"work_id":"a232ca6b-897d-4a9c-9df2-137f8626da69","year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.892699Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:7654c5921ed297f683756818efb92fe6421e36945668d3ddf1a606fa7b9f2383","observation_id":"3bf0f642-0624-4c18-b885-de977ce05134","resolution":{"observed_at":"2026-08-11T21:45:11.425456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:09.897586Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.897586Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:570b606c607d2ce09f44d947d18a83380e4cb7fe6fc1965b92ae9351b542e168","observation_id":"f1dc980f-22a6-483d-b76c-4f6416783538","resolution":{"observed_at":"2026-08-11T21:45:09.897586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:09.902375Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.902375Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:77e7614397d3d9b0c8e0cb6583084238ab39f90c099739c510c6f7a9e2c93e0d","observation_id":"d422d952-13fb-484c-8976-fac8f8d821a2","resolution":{"observed_at":"2026-08-11T21:45:09.902375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12886","last_updated":"2023-12-04T05:43:53Z","snapshot_observed_at":"2026-08-11T00:54:34.965702Z","submitted_at":"2023-11-21T03:47:54Z","title":"AnimateAnything: Fine-Grained Open Domain Image Animation with Motion Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12886","snapshot_observed_at":"2026-08-11T21:45:09.906734Z","title":"Fine-grained open do- main image animation with motion guidance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.906734Z"},"links":{"cited_paper":"/paper/2311.12886","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:bacc0c73ef2f41adc358578a989a1c6c11d1f180c68bf5458244a6b7f832ce65","observation_id":"b93ae10d-05e5-4231-aa50-6a683b3c535d","resolution":{"observed_at":"2026-08-11T21:45:09.906734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.377419Z","title":"Rescaling egocentric vision: Collection, pipeline and chal- lenges for epic-kitchens-100","venue":null,"work_id":"f5ffa442-cc06-48db-8003-29a7acc91817","year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.914009Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:c600b889d767177380518d336723a67783e8bfe43561bbc8ba2688815569cfc9","observation_id":"a078f0a4-2dce-4c56-95c3-d08364ef75ad","resolution":{"observed_at":"2026-08-11T21:45:11.384219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.362742Z","title":"Learning universal policies via text-guided video genera- tion","venue":null,"work_id":"f6149691-3b27-4290-933f-e712a5e0fbc1","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.919008Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:c6379a334fd55325b293e8ddd0c2b0190210c5b5b4e1f7a1c5b0a26e89c251ce","observation_id":"af9eabd8-b54e-4094-8547-fa15793678a9","resolution":{"observed_at":"2026-08-11T21:45:11.367378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:09.924083Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.924083Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:78ffaa70c1eafe0307e73b15be493baf9f912f801c571ce0d3045c02a7b837d3","observation_id":"66797e2b-787c-43e0-ba36-820b7eeb3cd5","resolution":{"observed_at":"2026-08-11T21:45:09.924083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.337270Z","title":"Handrawer: Lever- aging spatial information to render realistic hands using a conditional diffusion model in single stage, 2025","venue":null,"work_id":"2a9582f7-af2e-4add-a583-974f63c030e7","year":2025},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.927920Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:f33c31c15ee66de65794bdf0c9298b40447a22b4cef3c3d69583431cb748c05d","observation_id":"c68ac1b6-f258-4cdc-a606-cdcb743c14bb","resolution":{"observed_at":"2026-08-11T21:45:11.342122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.324503Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"cd07d1e1-eafe-49b3-8e9c-9dbd47dbddf4","year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.932703Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:5228a7b54e4ff34088d00c1d3415c8d70e4bf53d83f9c489d603a5a435bea94b","observation_id":"5be0a0e2-f208-4406-9f00-0b9e5df9ebd9","resolution":{"observed_at":"2026-08-11T21:45:11.328972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.310880Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":"9bc6b9d7-4145-438f-a672-ab29da6a3ad4","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.937048Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:f993e41afb4cf6ff348959a76e1ee3e89dcfd6b808e9492dff9031e0a8ad5d42","observation_id":"300d4442-7dcd-420d-9ed7-4b57719550eb","resolution":{"observed_at":"2026-08-11T21:45:11.315625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:09.941469Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.941469Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:51982488c9ebe8691aa8112a573c22a72846f8afab019c18ca5b6593bed6a4e4","observation_id":"c172d233-926b-4cbf-be3a-8421f482e350","resolution":{"observed_at":"2026-08-11T21:45:09.941469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:09.947071Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.947071Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:0ca8bf41b673cdc220039b6b17a54c0834342b07dd9a59fb44c310bb3121057a","observation_id":"ec3f5388-06bb-44f9-8e5e-8ffcae4ad229","resolution":{"observed_at":"2026-08-11T21:45:09.947071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.272248Z","title":"Video dif- fusion models","venue":null,"work_id":"dd17c49e-5d99-4451-8e83-a23026f97a60","year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.952593Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:c99bf2228bcaeb46fc52d968bafd830f417c5dcf14f7129dd1995328a0909e60","observation_id":"0c3099ee-0f63-4835-b28c-08df527f70b3","resolution":{"observed_at":"2026-08-11T21:45:11.278384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.256125Z","title":"T2i-compbench: A comprehensive bench- mark for open-world compositional text-to-image genera- tion","venue":null,"work_id":"6043fb56-deef-4b59-9938-8217932a251f","year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.957306Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:990cfe082f420b192ba962f8d969608b9a8bfe88b73ea75f5d3645cd7ad56494","observation_id":"a0aa761a-7ed0-40bf-9aec-66ccbc44ea45","resolution":{"observed_at":"2026-08-11T21:45:11.261520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.239942Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":"13c44443-0ec2-40a2-a086-837cc8ab2e2e","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.961560Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:9977a1410a0ebb27fcae9850a868667e690bc2465fc28d5baafac36392c7166d","observation_id":"5824e7d4-8696-4c6c-a8a4-8a053a525956","resolution":{"observed_at":"2026-08-11T21:45:11.246127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13503","last_updated":"2024-11-20T17:54:41Z","snapshot_observed_at":"2026-08-12T19:44:40.357419Z","submitted_at":"2024-11-20T17:54:41Z","title":"VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13503","snapshot_observed_at":"2026-08-11T21:45:09.965337Z","title":"Vbench++: Comprehensive and ver- satile benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.965337Z"},"links":{"cited_paper":"/paper/2411.13503","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:6e8ffed9c2056899c99dfec4bf7b571533716088b14ce47bdc4c07c780271993","observation_id":"8f37f44a-9c29-430d-85bf-2d5840cbbf56","resolution":{"observed_at":"2026-08-11T21:45:09.965337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.225834Z","title":"Vid2robot: End-to- end video-conditioned policy learning with cross-attention transformers, 2024","venue":null,"work_id":"a76a0dc9-9756-40f8-bbcf-be6d7c2caf50","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.970349Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:2ef281790491a4f11cd5086aefa226b6573ed7376e0e2c83545bd5f308b4e6a2","observation_id":"c817a730-3f91-4b55-8beb-f5f1a6508de5","resolution":{"observed_at":"2026-08-11T21:45:11.230494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03849","last_updated":"2024-03-22T05:03:34Z","snapshot_observed_at":"2026-08-12T14:09:30.499067Z","submitted_at":"2023-12-06T19:02:40Z","title":"LEGO: Learning EGOcentric Action Frame Generation via Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03849","snapshot_observed_at":"2026-08-11T21:45:09.974729Z","title":"Lego: Learning egocentric action frame generation via visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.974729Z"},"links":{"cited_paper":"/paper/2312.03849","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:02e8b1833e2567fbdabf336f17443c069e478ed3c3dac5df8a9ed49efad24765","observation_id":"eb93ff5f-db30-46f1-9b59-6d6aebd881da","resolution":{"observed_at":"2026-08-11T21:45:09.974729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.213749Z","title":"Temporal convolutional networks for ac- tion segmentation and detection","venue":null,"work_id":"8a0934fd-1efc-45c0-92c3-84c2663dee59","year":2017},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.979486Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:f36f3167a2f68994df9785b4d4b28c5144258389fdb144465b541023fa2b3de9","observation_id":"680d6f3b-8e02-4a57-b672-610afca8998b","resolution":{"observed_at":"2026-08-11T21:45:11.217323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.198300Z","title":"Gradient-based learning applied to document recog- nition","venue":null,"work_id":"4761d065-7193-4e5b-8d92-25ac58ae4b87","year":1998},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.983851Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:ef3c5380b5f86ae7c8e5af254da4610f2c976e24242b45e64931b39943bf2169","observation_id":"e39195db-2bee-4e88-8eb2-6b62179a1336","resolution":{"observed_at":"2026-08-11T21:45:11.203636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:09.988588Z","title":"Holis- tic evaluation of text-to-image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.988588Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:87e8305cd4dedcc8c42b22d251eedd28834fda22718119ed0679f9a2371dea19","observation_id":"7b190191-8e12-4d35-ae9e-5f8621dff8e6","resolution":{"observed_at":"2026-08-11T21:45:09.988588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.170687Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"ce30cbab-59e6-4c98-ac6e-6491ce7a71f3","year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.993512Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:522fbff4d11da7f4588fdc25b188d64574a5478e7deaf69987e6ed8a74030ff9","observation_id":"ca687851-383c-4a8d-984f-15c92b7ccb87","resolution":{"observed_at":"2026-08-11T21:45:11.175203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.155081Z","title":"Egocentric video-language pretraining","venue":null,"work_id":"9ece51eb-fe4c-4ace-83f4-40bf0ae63c72","year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.997890Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:689740cf2cc2625a85e1803a65c6d5868d133c90572470fa94727f9be5f8c230","observation_id":"f94d3f16-8793-46ab-8654-9082073dac07","resolution":{"observed_at":"2026-08-11T21:45:11.160981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.002519Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.002519Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:82afbfb5b18cb1ce8dda8f15c578047651631fda25c188991c33fd1102b0381a","observation_id":"98c6eb90-b37a-4244-8bf4-5efb8029c341","resolution":{"observed_at":"2026-08-11T21:45:10.002519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01095","last_updated":"2025-05-19T07:56:56Z","snapshot_observed_at":"2026-07-29T20:17:21.488997Z","submitted_at":"2022-11-02T13:14:30Z","title":"DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01095","snapshot_observed_at":"2026-08-11T21:45:10.007032Z","title":"Dpm-solver++: Fast solver for guided sampling of diffusion probabilistic models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.007032Z"},"links":{"cited_paper":"/paper/2211.01095","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:e0dd9737f92e6523d0ca102c7bb03779cff3e9e47cb10e68aaf2e6c3663108ff","observation_id":"8d20e3a2-82c3-40c9-824d-5b1d9fec4651","resolution":{"observed_at":"2026-08-11T21:45:10.007032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.126982Z","title":"Handrefiner: Refining malformed hands in generated images by diffusion-based conditional inpainting","venue":null,"work_id":"43adfefc-ca10-4905-b938-38dba82031db","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.011270Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:2298c76ddabc35c02a8db48c6c9f81c44cd3f80663363bd1b92de604b8f2c3e5","observation_id":"50bc3a62-629e-481a-8aa1-fbb9cc8b7afb","resolution":{"observed_at":"2026-08-11T21:45:11.132941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-05T19:15:35.517082Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-11T21:45:10.017361Z","title":"Medi- apipe: A framework for building perception pipelines","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.017361Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:b3acd34d21e09702712e32d6fb3d8f445c8141d52783f2489083858969a7291c","observation_id":"df996d96-a8ef-47e7-a982-d9058f18d572","resolution":{"observed_at":"2026-08-11T21:45:10.017361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.113200Z","title":"Dexvip: Learning dexterous grasping with human hand pose priors from video","venue":null,"work_id":"8d5527af-a7ff-474f-a8e7-0e0cb9e4785e","year":2021},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.021924Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:e4983b7ee0e7bb12d3fae5a98c77b4f288bf1ab1fef0cf229c41e534cd29c53b","observation_id":"49015ec3-e604-4884-8243-cf92068f8b29","resolution":{"observed_at":"2026-08-11T21:45:11.117322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.06553","last_updated":"2019-07-09T20:25:22Z","snapshot_observed_at":"2026-07-06T07:08:12.503941Z","submitted_at":"2018-10-14T20:51:41Z","title":"Recipe1M+: A Dataset for Learning Cross-Modal Embeddings for Cooking Recipes and Food Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.06553","snapshot_observed_at":"2026-08-11T21:45:10.025263Z","title":"Recipe1m+: a dataset for learning cross-modal embeddings for cooking recipes and food images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.025263Z"},"links":{"cited_paper":"/paper/1810.06553","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:fdd3bb809861986019bd50ba0a21b7c8adc71b0d9638a73c551086ea386853f8","observation_id":"bf88c734-6f0a-4a9f-aa4c-b6d1cf86dbce","resolution":{"observed_at":"2026-08-11T21:45:10.025263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.028678Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.028678Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:0ab257fc4a719bd9b1cf8277402105b5e4a4ebec680558234a932b08a2bd4c89","observation_id":"86664d79-ab7f-40d2-b01b-9fddadd615b9","resolution":{"observed_at":"2026-08-11T21:45:10.028678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.088529Z","title":"Han- diffuser: Text-to-image generation with realistic hand ap- pearances","venue":null,"work_id":"dd72dc69-9883-4d28-a5d2-d3d81ad21cf8","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.032120Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:9f9d417724967c8fe9f4971849396a893151e4ac8e9dc2d158f60fc34bacaee5","observation_id":"fa91b37d-daa1-4561-938b-4830fd64619d","resolution":{"observed_at":"2026-08-11T21:45:11.095541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.072950Z","title":"Conditional image-to-video gener- ation with latent flow diffusion models","venue":null,"work_id":"97a24489-0d43-4574-a3f6-12bbe45db3b3","year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.036469Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:b2f4b815b6edd0be44079d95a31432d504db68c1e4aef7d299f350b98e2b2a4a","observation_id":"0af6a45f-b2e8-4f19-9e17-be6b9a04bc55","resolution":{"observed_at":"2026-08-11T21:45:11.078521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.056162Z","title":"Ti2v-zero: Zero-shot image condition- ing for text-to-video diffusion models","venue":null,"work_id":"88f6a817-e54f-4f8f-bb86-d62a0cace6b1","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.040254Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:402ea91e02958b8433c3cc9078fd5ec02116740b0f5f85e669886d4c1e0f1b09","observation_id":"f6768da8-c1d6-4744-bbc8-cf575ce84005","resolution":{"observed_at":"2026-08-11T21:45:11.061746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.043511Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.043511Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:a4330ec01687c9f2b78bf676a10f4638dd2b30e7aa1f3ffbeaae10c66a17e7a9","observation_id":"78ee2f4e-1f22-4847-8472-d2e9bcb3e993","resolution":{"observed_at":"2026-08-11T21:45:10.043511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.046644Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.046644Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:53a7c6fea670709cba5e72055050aa65f96879e000b77a4dfec6397e0a2be7c9","observation_id":"a4102e6b-ab42-4357-a7fb-06d1fcc38034","resolution":{"observed_at":"2026-08-11T21:45:10.046644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.050808Z","title":"The meccano dataset: Understanding human-object interactions from egocentric videos in an industrial-like domain","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.050808Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:e01941e2fd1de8ec53435333bc2f95ba10ff15f6af8a9ef2d7f7ddb59c2b2e83","observation_id":"e52dd587-8d4e-46dc-b45b-69cbee120526","resolution":{"observed_at":"2026-08-11T21:45:10.050808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.986657Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"fac44a87-f01b-4058-a2b7-08a96c1ffd7a","year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.055175Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:5f392e260b18c14dd3cf59912ef180edb4596196bc6df9ec5efc62dc736f88ab","observation_id":"ef77aa70-7a2d-415a-9c0f-a102233f68e6","resolution":{"observed_at":"2026-08-11T21:45:10.991089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.058737Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.058737Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:49b5c04e4aa1f365d28aeac053fb049899f09e36e71c5a269c5d7fd0425962ad","observation_id":"bc4e86e4-e2c6-4ed0-89e9-ecd873b53b03","resolution":{"observed_at":"2026-08-11T21:45:10.058737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-11T21:45:10.063091Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.063091Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:e69108187a3f7db8c22a90de903eed70042b9ad7ad045e2731912789be768270","observation_id":"6c642cb2-8f57-4ffd-9513-3129aa1ebdb9","resolution":{"observed_at":"2026-08-11T21:45:10.063091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.067305Z","title":"As- sembly101: A large-scale multi-view video dataset for un- derstanding procedural activities","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.067305Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:fd18bbc99906ce5896a899006b16996b4d37224d84d71611b695be7405a7cce4","observation_id":"53feb2f4-ee4d-4333-943d-3dbf01ed72a6","resolution":{"observed_at":"2026-08-11T21:45:10.067305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-11T21:45:10.071463Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.071463Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:48d792593009ac6d18d16a038b3e31177e88564eb033ae78f1b6146c6327dc1b","observation_id":"db523071-473f-4964-9366-d7e124177089","resolution":{"observed_at":"2026-08-11T21:45:10.071463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.954099Z","title":"Many turn to youtube for children’s content, news, how-to lessons.Pew Research Center, 7, 2018","venue":null,"work_id":"f442bdb3-6bd9-4cdd-b4e5-85d637f8160a","year":2018},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.079620Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:19c489c351b56afa286e9c6cd86e761de6865662a8f7b00d25d9dd59c01d988c","observation_id":"c4df0f93-d0e2-4c0e-b988-69f5664eb36d","resolution":{"observed_at":"2026-08-11T21:45:10.959083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-11T21:45:10.084373Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.084373Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:dc5c49e952379a43f334bf1117eeaa1c80c436aafc3925a8cf42e7983e54fe36","observation_id":"66cdd9d8-2910-4151-a238-2f0e5b04c7f3","resolution":{"observed_at":"2026-08-11T21:45:10.084373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10076","last_updated":"2025-02-09T05:57:42Z","snapshot_observed_at":"2026-08-12T22:24:12.192105Z","submitted_at":"2024-10-14T01:39:56Z","title":"VideoAgent: Self-Improving Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10076","snapshot_observed_at":"2026-08-11T21:45:10.088431Z","title":"Videoagent: Self-improving video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.088431Z"},"links":{"cited_paper":"/paper/2410.10076","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:8446caf5e3c83ebbd90529d4922082ceed469f78e9b4e799230d14284ea3f9c2","observation_id":"a897df8d-f6e3-4e7a-8dfe-13e88d87d733","resolution":{"observed_at":"2026-08-11T21:45:10.088431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.940478Z","title":"Genhowto: Learning to generate actions and state transformations from instructional videos","venue":null,"work_id":"4ef7357a-f164-4c42-a99e-fd781624ccf5","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.092424Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:ead6828db48745bd30f1e169749d6e5e845adc8342adfe34693a0b6ffb91db8a","observation_id":"c95c5cdd-8d6b-448d-83a9-3522f8228f47","resolution":{"observed_at":"2026-08-11T21:45:10.944483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.924576Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":"8c2de4ff-4345-463a-9e7c-ac4679e4b512","year":2019},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.097624Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:822d5443263150cc47351418a5109959a5b5558f6ba322972f72fb8cc76209b2","observation_id":"c43752f6-ee06-4057-b6f4-c3d3a596b5f7","resolution":{"observed_at":"2026-08-11T21:45:10.929599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.907071Z","title":"Long-term temporal convolutions for action recognition","venue":null,"work_id":"b92524aa-cdca-4d8c-a30a-976aa5b0060d","year":2017},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.101769Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:c9ef207094b9c39535070b1126fed9656bde4f9f7c96b4e31a9ada10dbfc80fc","observation_id":"1b24bb18-76bf-4fe2-9906-07aeb04a19af","resolution":{"observed_at":"2026-08-11T21:45:10.911202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.108198Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.108198Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:cff128aeaf422bb857587b08393a2b6c7fa5dd190c06f77730c1d8dc2c6dba64","observation_id":"31ee753b-b15c-464d-88bb-54425c944b60","resolution":{"observed_at":"2026-08-11T21:45:10.108198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.113909Z","title":"Imagen editor and editbench: Advancing and evaluating text-guided im- age inpainting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.113909Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:073e9199cdbf2a4eaef9f1891e24b2f141022d78dd5c6b6a85e522070a5103c0","observation_id":"0b87055f-1e6c-4f93-8fb3-8744c03b4455","resolution":{"observed_at":"2026-08-11T21:45:10.113909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.869926Z","title":"Holoassist: an egocentric human interaction dataset for interactive ai assistants in the real world supple- mentary material","venue":null,"work_id":"4ad6109f-22c9-465f-96f5-1b047b3628ad","year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.118962Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:b54f78daa71d16e5f418f27dafb69165f4ef2075b3610fc9ead60123e05997e3","observation_id":"57f8ec96-e070-4281-9377-522da41f2d4e","resolution":{"observed_at":"2026-08-11T21:45:10.878103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.853133Z","title":"Multi- modal augmented-reality assembly guidance based on bare- hand interface","venue":null,"work_id":"6e60eeb4-e966-4aa6-bcbc-d9a79eab467a","year":2016},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.123297Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:6e9ada2a0e79f7ab8008165b8b948938bf486169ecf10226ad24b10ce52dfd70","observation_id":"31f1c55b-a807-4f1e-80fe-b475490bfc37","resolution":{"observed_at":"2026-08-11T21:45:10.859282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.127496Z","title":"Holoassist: an egocen- tric human interaction dataset for interactive ai assistants in the real world","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.127496Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:bb5df2b4d3b05876dd2b9228a5d2857137714060895ffaa8a5a4932f9b8db784","observation_id":"01d2e141-519f-4a36-bfba-906867de73c2","resolution":{"observed_at":"2026-08-11T21:45:10.127496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.132365Z","title":"Videocomposer: Compositional video synthesis with motion controllability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.132365Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:98fadf72bba2e7efe1a8a1f06c6ec05d9f6976d189ee4bfe48ff811de96bf67f","observation_id":"d2f5d3fa-986b-484a-b3ef-a2dd0c6c8b6b","resolution":{"observed_at":"2026-08-11T21:45:10.132365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-12T21:36:33.591573Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-08-11T21:45:10.136640Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.136640Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:06bb3398101f2e97f4884075e25f2f72e135b9a230d50649785ccd97be67c61a","observation_id":"6f5f1db1-2755-4779-a441-58553b189d1e","resolution":{"observed_at":"2026-08-11T21:45:10.136640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.820006Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models","venue":null,"work_id":"5cfe2941-76c1-4373-9301-c30c88a4882d","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.141927Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:954483a68c634fe8fd6b456b27dc5fe0ff38fdd39a8618391834c5835e23918f","observation_id":"95626d99-19c3-4dac-a75d-04c1eacc7e6c","resolution":{"observed_at":"2026-08-11T21:45:10.825113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-08-12T08:17:36.702309Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-08-11T21:45:10.147322Z","title":"Towards a better metric for text-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.147322Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:d06b63aaae06e5d701bd8de9e4e7f54df712cbb9ecea8cc36992e12fc2b6bec0","observation_id":"c3a86d49-5613-41b7-80cf-553565c35d36","resolution":{"observed_at":"2026-08-11T21:45:10.147322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.804300Z","title":"Freeinit: Bridging initialization gap in video dif- fusion models","venue":null,"work_id":"4edf6d08-55ce-4d33-b943-61abf7deb143","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.152539Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:d66ec22075c6347f6a8ef9dab40728b8f19c702607886e68eb7c36695be3ec52","observation_id":"c2d1a377-f961-4b2d-9d36-2c0252e97de2","resolution":{"observed_at":"2026-08-11T21:45:10.809310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.786622Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"654a2b8d-e42c-4098-9498-aa1e0a73a857","year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.156459Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:c8af526adb33bb2412259b3f624a1a59f8f4ecbb1422aca90e43acf6973a25a5","observation_id":"a319beee-3af4-4f41-ba47-b358f3743d64","resolution":{"observed_at":"2026-08-11T21:45:10.791674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.770930Z","title":"X-gen: Ego-centric video prediction by watching exo-centric videos","venue":null,"work_id":"65c9a82c-9c15-41e4-a8cc-55b6f8c3a846","year":2025},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.161433Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:c43a76aff89cce1f5a5d69f333436c8178c5393f1b0a8f70dc79084af6b92632","observation_id":"69cbdec1-6388-4ac8-b1f9-b99551f26838","resolution":{"observed_at":"2026-08-11T21:45:10.775728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.754274Z","title":"Ad- vancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":"f0f8af3c-49ae-4844-9784-a675b8f87233","year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.166491Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:227342ed976bff8e0f0be41e863696b523ef34dde85c551d030607e3dd40f1d3","observation_id":"1ed1cdca-47e3-4de5-aa48-68d8ba40aacb","resolution":{"observed_at":"2026-08-11T21:45:10.761706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.734103Z","title":"Stat: Spatial-temporal attention mechanism for video cap- 11 tioning","venue":null,"work_id":"19b563cb-16bf-45e8-9079-b399f69b23fe","year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.172257Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:9652baf5a281b9a9a6dca157fd466e7c8a7357600cc57a2be90bbb54db32feb8","observation_id":"f616454d-f686-4b37-812b-d70680323439","resolution":{"observed_at":"2026-08-11T21:45:10.739904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-08-12T12:12:37.286762Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-08-11T21:45:10.177014Z","title":"Learn- ing interactive real-world simulators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.177014Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:1783877a447cb113fae386b991556cd230a16ab071287378277a3709294480dd","observation_id":"7fe80857-1b75-4ccd-bb03-8787d860ba96","resolution":{"observed_at":"2026-08-11T21:45:10.177014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15075","last_updated":"2024-01-26T18:57:54Z","snapshot_observed_at":"2026-08-13T04:33:50.593303Z","submitted_at":"2024-01-26T18:57:54Z","title":"Annotated Hands for Generative Models","version":1},"cited_work":{"arxiv_id":"2401.15075","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.15075","snapshot_observed_at":"2026-08-11T21:45:10.364563Z","title":"Annotated Hands for Generative Models","venue":"cs.CV","work_id":"e9cacb09-c0bd-4446-9448-0c03ca180a26","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.184737Z"},"links":{"cited_paper":"/paper/2401.15075","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:a0678ea803b81628c2c2a2e474e73da8d74c67f903b417a9fb1d919e0c29f31e","observation_id":"d4d2ce0d-5e36-412d-9e67-848dc9fd2a39","resolution":{"observed_at":"2026-08-11T21:45:10.372031Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T21:45:10.192103Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.192103Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:04c6c9eab5672c23ba3291a83c2d2bb435b49b258c6fcaceeb109490f2c29ddf","observation_id":"3b0d8d95-bca7-4ccd-9b57-b725e623dc4f","resolution":{"observed_at":"2026-08-11T21:45:10.192103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.713161Z","title":"Learning universal policies via text-guided video generation","venue":null,"work_id":"d2e36edd-f36c-48f8-9f5a-8d88f8bb164a","year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.200996Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:97275427bf0db7374f04f84e04e3c2815f478dbb2f05fcb7439a3d326f7feb78","observation_id":"eb9af77c-8673-4a21-9319-b37c2a7c5d11","resolution":{"observed_at":"2026-08-11T21:45:10.718568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08089","snapshot_observed_at":"2026-08-11T21:45:10.209618Z","title":"Dragnuwa: Fine-grained control in video generation by integrating text, image, and trajectory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.209618Z"},"links":{"cited_paper":"/paper/2308.08089","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:c9854f5b3325611afe9e31d35e280e0b6cef18ffe9196ba106fd9520c12258e0","observation_id":"833fe562-249e-434f-8fb5-ff90f3d117ad","resolution":{"observed_at":"2026-08-11T21:45:10.209618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.699168Z","title":null,"venue":null,"work_id":"c8899daf-f2c8-465f-b90b-985935bd6ee4","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.215010Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:84129c2c282ceeeffee609cb02c2e3b4c839632b9c6746c932080b99f4a65433","observation_id":"34151f3a-bd05-4fbf-9a39-1978b2539da7","resolution":{"observed_at":"2026-08-11T21:45:10.703802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.15001","last_updated":"2022-08-31T17:58:54Z","snapshot_observed_at":"2026-08-09T16:31:06.714132Z","submitted_at":"2022-08-31T17:58:54Z","title":"MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.15001","snapshot_observed_at":"2026-08-11T21:45:10.224664Z","title":"Motiondif- fuse: Text-driven human motion generation with diffusion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.224664Z"},"links":{"cited_paper":"/paper/2208.15001","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:5987bd3e53001a2c6dcc42c27254e477fa73427d2eab9c0d8e9d111640f50dd8","observation_id":"1800aa40-4ab1-4cab-85ee-30f1711d8c9e","resolution":{"observed_at":"2026-08-11T21:45:10.224664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.678300Z","title":"Pia: Your personalized image animator via plug-and-play modules in text-to-image models","venue":null,"work_id":"071b6de8-0fc7-4a37-8663-5a039742cb98","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.231845Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:9e9e9c2bcebc68ba9068f6116d48a38206eb6368ae5e049e54a47dc1daec7ec0","observation_id":"def0720d-1a4a-4ebb-835e-c95ad5a8c746","resolution":{"observed_at":"2026-08-11T21:45:10.683823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.663452Z","title":"Open-sora: Democratizing efficient video production for all, 2024","venue":null,"work_id":"94261fac-4485-49b5-aea5-ede1020cd263","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.237158Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:edb696f2f37072fe42cda37cad7e467cd823f76f6cc24d8802f90f89c64759e1","observation_id":"503325e1-b18b-4b60-b170-f8db274132fb","resolution":{"observed_at":"2026-08-11T21:45:10.668299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.638129Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":"bbd11a47-ab2f-4561-9187-014f6c52eec5","year":2018},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.243509Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:7bd5267fcecb9cb2e83dc0ed419d5cc1b37b6df0ff3f8f7b0b16b7cc85c480ed","observation_id":"180a3c7e-14d0-45b2-bee9-7b78ef2a8c7f","resolution":{"observed_at":"2026-08-11T21:45:10.645763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08328","last_updated":"2024-11-13T04:20:45Z","snapshot_observed_at":"2026-08-12T21:41:00.581974Z","submitted_at":"2024-11-13T04:20:45Z","title":"Motion Control for Enhanced Complex Action Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08328","snapshot_observed_at":"2026-08-11T21:45:10.247547Z","title":"Motion control for enhanced complex action video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.247547Z"},"links":{"cited_paper":"/paper/2411.08328","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:d8af78a380c1428888f86d4904a5b87a00ca09a920e5b2de58f4900878611fc7","observation_id":"e119dd37-e116-46a1-90e5-68fbe57e7a6b","resolution":{"observed_at":"2026-08-11T21:45:10.247547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T12:08:53.913708Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":1,"verified_fuzzy":42},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 0 inbound Pith citation observations for arXiv:2412.04189."}