{"as_of":"2026-08-13T08:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b5adbb9a64b6a312f224e1ff1b29faacb60b266b2c25e3eea71e754820515e0","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:04:09.060651Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T00:30:55.729900Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T00:32:18.226311Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"cited_work":{"arxiv_id":"2412.01987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01987","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Showhowto: Generating scene-conditioned step-by-step visual instructions","venue":null,"work_id":"751645e7-ed6b-4e8a-af22-69bb4f44bcd7","year":2024},"citing_paper":{"arxiv_id":"2503.13821","last_updated":"2026-04-03T20:02:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T01:57:48Z","title":"Stitch-a-Demo: Video Demonstrations from Multistep Descriptions","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-23T00:30:55.729900Z"},"links":{"cited_paper":"/paper/2412.01987","citing_paper":"/paper/2503.13821"},"observation_digest":"sha256:eb9aea981e7cf74c0e70ee2cf44baf740455c8c0148cad13083d13125b5473e4","observation_id":"273928a8-b33a-4626-bce9-409575dfca99","resolution":{"observed_at":"2026-05-23T00:32:18.229135Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"cited_work":{"arxiv_id":"2412.01987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01987","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Showhowto: Generating scene-conditioned step-by-step visual instructions","venue":null,"work_id":"751645e7-ed6b-4e8a-af22-69bb4f44bcd7","year":2024},"citing_paper":{"arxiv_id":"2604.26565","last_updated":"2026-04-29T11:51:35Z","snapshot_observed_at":"2026-08-10T21:10:06.962801Z","submitted_at":"2026-04-29T11:51:35Z","title":"DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-07T13:50:23.835653Z"},"links":{"cited_paper":"/paper/2412.01987","citing_paper":"/paper/2604.26565"},"observation_digest":"sha256:a2d1d41125b129b3e3824c4ce89fa58bd7128bab58185a7b9b6949ccff14a70f","observation_id":"ab65c9fd-487b-4646-9eea-77765388e187","resolution":{"observed_at":"2026-05-12T08:46:25.991899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.01987/citation-record","integrity":"/paper/2412.01987/integrity","json":"/paper/2412.01987/citation-record.json","paper":"/paper/2412.01987"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T00:04:08.631013Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.631013Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:eb6db6f568116f4f61f1a44975ba3cb74b2f857d3db00462806b5dbf2fa3990d","observation_id":"cbfc89c9-4c74-41e5-acbe-0ae8d7cc9fc5","resolution":{"observed_at":"2026-08-12T00:04:08.631013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:10.164751Z","title":"Ht-step: Aligning instructional articles with how-to videos","venue":null,"work_id":"a6ff6076-f239-47d4-9d64-755818025051","year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.639434Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:d1f30bb4fc3a469d3530b8ef7539d73288155ec1b335a546f79586e8c1e90db9","observation_id":"0474e1f2-d6b2-4e26-a975-3bf24cdf8c0b","resolution":{"observed_at":"2026-08-12T00:04:10.169513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:10.149752Z","title":"Introducing computer use, a new claude 3.5 son- net, and claude 3.5 haiku","venue":null,"work_id":"c2015451-958f-4cbc-9c3c-8d0a401f49db","year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.644101Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:133484d8cf0b53423d1cb7ed6e7910fbfe241d5f517ac49fb8a0d4f63028cf9d","observation_id":"8f61ac1d-c42a-4270-a247-83f6c736d298","resolution":{"observed_at":"2026-08-12T00:04:10.154558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:10.135650Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"ffc7d3fc-1dc4-44e5-993f-16a062678d80","year":2021},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.648560Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:9384bab92aa365ac82454bc7c1c65097e1f1d06e2f2965ddfb545aa518b7642a","observation_id":"875724f0-374e-43f8-b6f3-ef6ab842f263","resolution":{"observed_at":"2026-08-12T00:04:10.140176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:10.121445Z","title":"Whisperx: Time-accurate speech transcription of long- form audio","venue":null,"work_id":"159b1f34-e3be-47d4-a460-7620af66516a","year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.652991Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:7fbbccf15f3ffe12de9ba166c6d835b89e9c74f6951ae1a52953b100cb2a8964","observation_id":"8ab9f193-3f26-4f9d-a311-62485c7168ad","resolution":{"observed_at":"2026-08-12T00:04:10.126539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-13T04:36:44.594755Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-12T00:04:08.657233Z","title":"Lumiere: A space- time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.657233Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:15a4f1b0baeadaef52db5bb707762f87f2e15d11dd7f38bdf274898ebc519c71","observation_id":"cb136022-b1d8-437c-a9af-85786097d1b9","resolution":{"observed_at":"2026-08-12T00:04:08.657233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-08-13T00:43:11.476509Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-12T00:04:08.661872Z","title":"Gen2act: Hu- man video generation in novel scenarios enables generaliz- able robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.661872Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:e75ca55b427f058107026284955e369baade4ba24a493a2987302119ed75b3c3","observation_id":"2228cb1a-90c3-4c2f-af15-114b78151792","resolution":{"observed_at":"2026-08-12T00:04:08.661872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-12T00:04:08.670093Z","title":"Zero-shot robotic manipulation with pretrained image- editing diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.670093Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:a91976a481d7b832fd8258a07073bd27c1606b10b5f3918920d55717aabab336","observation_id":"628aaaac-5f4e-46f2-ac6e-73cfb7c3be57","resolution":{"observed_at":"2026-08-12T00:04:08.670093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T00:04:08.675581Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.675581Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:c3f2f943ff03936a35b8bb7101276a7bca6e881e130a20ef17111166e0763b80","observation_id":"746ffd17-70f9-4af0-a183-6a1a1a6b9442","resolution":{"observed_at":"2026-08-12T00:04:08.675581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:08.685044Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.685044Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:3be11129deed24c638c978d267718bdbb3f38727dea10b0f1a1155bee3a72c01","observation_id":"f136592c-ea7d-406d-809b-5d5afe95275f","resolution":{"observed_at":"2026-08-12T00:04:08.685044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10122","last_updated":"2024-05-16T14:22:20Z","snapshot_observed_at":"2026-08-13T00:05:47.887872Z","submitted_at":"2024-05-16T14:22:20Z","title":"Generating Coherent Sequences of Visual Illustrations for Real-World Manual Tasks","version":1},"cited_work":{"arxiv_id":"2405.10122","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.10122","snapshot_observed_at":"2026-08-12T00:04:09.425417Z","title":"Generating Coherent Sequences of Visual Illustrations for Real-World Manual Tasks","venue":"cs.CV","work_id":"ff46a372-8eba-416a-8708-24ba09b1681d","year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.697307Z"},"links":{"cited_paper":"/paper/2405.10122","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:50292a4c7b4d93c45e67eea2f28152d926964e8ab146977144e3e8fdcf221e11","observation_id":"06fae0db-32da-468c-a6bd-38a1976d1f43","resolution":{"observed_at":"2026-08-12T00:04:09.430891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:10.097185Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"a1bedecb-8113-4785-93e0-7128e6bf94f8","year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.704361Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:35a6a56e5e56bcf8a18736ef8e89ce7d443d44ea201835cbdef3ceaab44ab9b7","observation_id":"72bfeceb-e09b-43f6-b98c-ac53ebc28a20","resolution":{"observed_at":"2026-08-12T00:04:10.101887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:08.709987Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.709987Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:c04cacd74a36b46f8219cdf0b51f14f94caee4ce49338ca47cbd1c15baac2fd6","observation_id":"38ec8158-98fa-4360-8dc1-1a764f8a2779","resolution":{"observed_at":"2026-08-12T00:04:08.709987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-13T01:39:12.659510Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-12T00:04:08.714910Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.714910Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:ae79f13f92e3534f4124ed357cf1312fb7f3398cd48f232d09c5bb2c1408ae09","observation_id":"fb6aa962-a943-45e2-9180-a2aec0997299","resolution":{"observed_at":"2026-08-12T00:04:08.714910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:08.724998Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.724998Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:79f9d40bec673cfe72a564460f0dfb074170c96734123c6d751e8f5886827a33","observation_id":"9f601e5c-8a61-48e9-9bff-bd37a1e99ac1","resolution":{"observed_at":"2026-08-12T00:04:08.724998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:08.730901Z","title":"Seine: Short-to-long video diffusion model for generative transition and prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.730901Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:074166991369532d826ea8693368d037b5e03497137d2802e394080bf5e8faf6","observation_id":"3be16d03-b94e-4d79-aace-587c08d7e986","resolution":{"observed_at":"2026-08-12T00:04:08.730901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:10.053160Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":"a8bfa799-18fc-4310-a5ef-acfc421923d8","year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.735941Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:fe6ae3a122c7d3900b49cb00f71bc847ccbcca03b4cb65b4ed2263b2ac9d95a0","observation_id":"de56ccef-0ea9-4e96-a12d-695c9042cc4d","resolution":{"observed_at":"2026-08-12T00:04:10.058051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:10.038294Z","title":"Learning universal policies via text-guided video generation","venue":null,"work_id":"3f11b5f3-8aae-4648-955d-f11a69581356","year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.742913Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:6164e5d78e058df648e20a08b615816efaf99304dc53bfc1531c3b844c099ad4","observation_id":"d8a4ef4d-ce20-4221-a470-e5b41932c615","resolution":{"observed_at":"2026-08-12T00:04:10.043067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T00:04:08.747773Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.747773Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:047ce14f309e837a166539e9540ebad468eb61e3412db42b26bad1b0baac8e74","observation_id":"63ad7054-90a2-4ab5-abfb-c809dea7d116","resolution":{"observed_at":"2026-08-12T00:04:08.747773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:10.021990Z","title":"Step- former: Self-supervised step discovery and localization in instructional videos","venue":null,"work_id":"a3a2a2b1-7c56-4ab7-8832-3ddff2315317","year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.753963Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:c08e524e3ba8e302c89ac13b291411c877105c10b1a00ed54335be153b73231f","observation_id":"efc81969-1507-4b68-bb28-67ee39e1c0c9","resolution":{"observed_at":"2026-08-12T00:04:10.028020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-08-12T00:04:08.758855Z","title":"Data fil- tering networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.758855Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:5a32f1418199e0388e8191f339045f3d5a2ad4ae09937ad785256875bccf4bdb","observation_id":"f12d4f78-d0a0-4581-a0f7-9b5029f6f0f1","resolution":{"observed_at":"2026-08-12T00:04:08.758855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:08.763399Z","title":"Preserve your own correlation: A noise prior for video diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.763399Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:3722e8e1c4df4442f3571821854d38a69c094aef8d800c24744d4ff04aa48204","observation_id":"2df30a7a-d2c4-4f11-bc5e-911df71131bd","resolution":{"observed_at":"2026-08-12T00:04:08.763399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-12T00:04:08.767955Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.767955Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:b6ed3be74f191567e96f2dcd7737320f7a5b138a4747abcd41a56944f2e9f011","observation_id":"71c850b4-401d-4bf5-9ee1-348ffdf0f099","resolution":{"observed_at":"2026-08-12T00:04:08.767955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06662","last_updated":"2023-12-11T18:59:57Z","snapshot_observed_at":"2026-08-13T05:04:48.764860Z","submitted_at":"2023-12-11T18:59:57Z","title":"Photorealistic Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06662","snapshot_observed_at":"2026-08-12T00:04:08.772500Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.772500Z"},"links":{"cited_paper":"/paper/2312.06662","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:d8abd5ec3338dfcbaee7d67e45aef2706b1dcbfcb4d7b61d21944659e56f4ab7","observation_id":"087efbe0-b9a4-4ab9-9432-f7c3f38a3c80","resolution":{"observed_at":"2026-08-12T00:04:08.772500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.997823Z","title":"Temporal alignment networks for long-term video","venue":null,"work_id":"226c8a74-5690-449a-9cf3-d70200ea6afa","year":2022},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.778529Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:1e79a8e155f81b724ab055ef38c0f88aa1970cd600a64eb01c7a4890b20ac8a7","observation_id":"01f158c6-5bd0-4186-8ecd-12540da6f884","resolution":{"observed_at":"2026-08-12T00:04:10.001952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-12T12:48:31.714281Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-12T00:04:08.783762Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.783762Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:47fb75a0f57af54ed6ac9984d5888433e30fd881d98548757ac661415def0be6","observation_id":"d77c6347-6bce-4269-bd9d-e48011e07a49","resolution":{"observed_at":"2026-08-12T00:04:08.783762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:08.789267Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.789267Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:868c5cc423d04fa3574241e6abe6980ad6da4155f04afe7508976a102f9171ab","observation_id":"2b027e12-2a04-4346-9ad4-79bb40dc6edc","resolution":{"observed_at":"2026-08-12T00:04:08.789267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-12T00:04:08.793860Z","title":"Imagen video: High definition video generation with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.793860Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:9e2b2db1486ac058a42b873641e93015858eaf0abb8f5d56d2fcef006b3aa4d7","observation_id":"3abf3e7a-6051-4e66-9f39-dc79b95c8b6b","resolution":{"observed_at":"2026-08-12T00:04:08.793860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:08.800354Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.800354Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:87eb4025c1f35cd431bbd81f891b1151c814b58d49c617c84912a692c79a4c4d","observation_id":"26c9e021-b692-4deb-88b7-002fa62d32bd","resolution":{"observed_at":"2026-08-12T00:04:08.800354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.964104Z","title":"Make it move: controllable image-to-video generation with text de- scriptions","venue":null,"work_id":"1154df44-246b-4bb9-bed2-e7e6661d7250","year":2022},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.806210Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:e2d88b1b23288fe204b37ee4660769b12b1d6825e9e5e23488077ad3dbd6ed7a","observation_id":"b396e86c-3622-448c-8055-ac46ab252cf8","resolution":{"observed_at":"2026-08-12T00:04:09.969266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.949478Z","title":"An edit friendly ddpm noise space: Inversion and manipulations","venue":null,"work_id":"928a9ea1-371d-4137-b5ea-da6083c26bd0","year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.811584Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:aea4c144db4e7a00e7ad961ca92d9f45fe18ba7a24cfb0c90c681db9b0deb80e","observation_id":"9b7a549b-ad21-4a77-8b66-2143d34c7663","resolution":{"observed_at":"2026-08-12T00:04:09.953814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11013","last_updated":"2024-12-17T22:14:33Z","snapshot_observed_at":"2026-08-12T22:23:21.756722Z","submitted_at":"2024-10-14T19:05:38Z","title":"Incorporating Task Progress Knowledge for Subgoal Generation in Robotic Manipulation through Image Edits","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11013","snapshot_observed_at":"2026-08-12T00:04:08.817423Z","title":"Incorporating task progress knowledge for subgoal generation in robotic manipulation through image edits","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.817423Z"},"links":{"cited_paper":"/paper/2410.11013","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:1c4d5893b4ccbee259049c9c5951bef57cdfce05393f06d42fea42f4f087a8fc","observation_id":"7324c0f5-d6b0-43d8-ade9-fd63baecc2ec","resolution":{"observed_at":"2026-08-12T00:04:08.817423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.936055Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":"f3d78c25-2109-4a09-8ff7-1d65e12fed8f","year":2022},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.828636Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:7c35ec56d0a87c024a72118d50fb37da6039bea95097fc0e3ca3a6a27e6634ca","observation_id":"55037516-e7ce-47bd-bed1-a644e7532620","resolution":{"observed_at":"2026-08-12T00:04:09.940558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-12T00:04:08.833207Z","title":"Videopoet: A large language model for zero-shot video gen- eration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.833207Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:7e8350d7101654e3df35a45fa71fbd4add400b9f2b43959a3801ce56d8a22dc6","observation_id":"04de4a20-014e-45dd-9ebe-c5fb5bb9f704","resolution":{"observed_at":"2026-08-12T00:04:08.833207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03471","last_updated":"2024-10-17T15:12:44Z","snapshot_observed_at":"2026-08-13T06:31:48.389918Z","submitted_at":"2024-07-03T19:36:33Z","title":"Learning Action and Reasoning-Centric Image Editing from Videos and Simulations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03471","snapshot_observed_at":"2026-08-12T00:04:08.838693Z","title":"Learning action and reasoning-centric image editing from videos and simulations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.838693Z"},"links":{"cited_paper":"/paper/2407.03471","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:816dcf758f4688f985b3ab26bd81c67fb8dc7a3d1a7bf238abd900972bc9ab02","observation_id":"784a9e7e-f9ad-483e-b297-44665d9fe130","resolution":{"observed_at":"2026-08-12T00:04:08.838693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03849","last_updated":"2024-03-22T05:03:34Z","snapshot_observed_at":"2026-08-13T05:08:26.741654Z","submitted_at":"2023-12-06T19:02:40Z","title":"LEGO: Learning EGOcentric Action Frame Generation via Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03849","snapshot_observed_at":"2026-08-12T00:04:08.843887Z","title":"Lego: Learning egocentric action frame generation via visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.843887Z"},"links":{"cited_paper":"/paper/2312.03849","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:e54fef5bf3d7fe172a273d52aa659887d58a3f9fb1288abc4d5e09fb602900c8","observation_id":"97fb824f-cc38-46a4-880d-f76455855370","resolution":{"observed_at":"2026-08-12T00:04:08.843887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.922615Z","title":"Multi-sentence grounding for long- term instructional video","venue":null,"work_id":"d4d70bb4-ea18-40b0-973d-2d1259c9b80b","year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.848623Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:565896fe3500d4df3bda105ec8a4d5f4ed73915354b6ceface3f1e71f024a982","observation_id":"6cf761fe-5126-447f-9cd1-21b14f35bc65","resolution":{"observed_at":"2026-08-12T00:04:09.926952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-12T23:35:51.734823Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-12T00:04:08.852974Z","title":"Dreamitate: Real-world visuomotor policy learn- ing via video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.852974Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:d5160990a568126764ee31fef585753bf4cfb6655d3aeac3b8644a5adb741f5a","observation_id":"e15e0d37-d20b-425f-9fbd-a0e04fa81b58","resolution":{"observed_at":"2026-08-12T00:04:08.852974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.908820Z","title":"Learning to ground instructional articles in videos through narrations","venue":null,"work_id":"2b236536-a074-4dfe-8275-92e13ffad55e","year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.857693Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:f143ae1b695263878075aa9c098e39ffe4f14c8440e2b79ad47531613116eefa","observation_id":"2e6c8c9a-86e6-4774-bc4c-faed00a04766","resolution":{"observed_at":"2026-08-12T00:04:09.913479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.895028Z","title":"Vidm: Video implicit diffusion models","venue":null,"work_id":"8b1f796a-8616-4a18-8f38-a44b7b61d893","year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.861703Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:19334bb8e10b7c8696664d050c64a789d4b23e270e5cc19e8b3cb152a9262828","observation_id":"d71a7704-a7bb-4419-9c33-a5e13bd09666","resolution":{"observed_at":"2026-08-12T00:04:09.899081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.882404Z","title":"Generating illustrated instructions","venue":null,"work_id":"79e3c572-cbba-4315-b51d-0bea024a27e2","year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.865718Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:7ba9f73285f174a8fa1a6ec4f142427707211e1a94bc769b5a973092bd1876b2","observation_id":"b36f24c2-8541-4af3-847b-8808db6542bb","resolution":{"observed_at":"2026-08-12T00:04:09.886483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.867840Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"db2e5de1-f65a-496a-b0ba-e8645423b75c","year":2019},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.884360Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:339c2e93ca7691fecdc26717dc503025cbd91d8ef2e82a2a71380f96e8204b5e","observation_id":"3997a520-f7c9-4b35-8c17-146d1d48f8a8","resolution":{"observed_at":"2026-08-12T00:04:09.873064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.853666Z","title":"Visual reinforcement learn- ing with imagined goals","venue":null,"work_id":"ca7f304b-45bd-4f74-a8ef-47765cf9c6bc","year":2018},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.889614Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:05010fb5c39f0684535080618efd073c232a931bed3baee8e929014f73e3cbc3","observation_id":"75ab12e5-d43e-4af6-bc3b-3f0068300426","resolution":{"observed_at":"2026-08-12T00:04:09.858339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.839649Z","title":"Dinov2: Learning robust visual features without su- pervision","venue":null,"work_id":"1f9ec121-08e8-410c-9316-960122c1c708","year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.894028Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:b97cc347a5e3c2e08b3dca09e87b9175eca5cf5e628c9fd20de40cf1c8629a91","observation_id":"3159ebe7-26d7-4e29-a8c7-7056b9841d72","resolution":{"observed_at":"2026-08-12T00:04:09.844241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04337","last_updated":"2024-06-08T12:07:32Z","snapshot_observed_at":"2026-08-12T23:48:29.771467Z","submitted_at":"2024-06-06T17:59:44Z","title":"Coherent Zero-Shot Visual Instruction Generation","version":2},"cited_work":{"arxiv_id":"2406.04337","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04337","snapshot_observed_at":"2026-08-12T00:04:09.212828Z","title":"Coherent Zero-Shot Visual Instruction Generation","venue":"cs.CV","work_id":"1ac3375a-98ae-4c5b-a0c2-718944e7e613","year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.900527Z"},"links":{"cited_paper":"/paper/2406.04337","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:9fe4adc23c37cdd1e908782394a930bd8586878ed774f76d0e27310efc324432","observation_id":"91487550-b785-4f9b-98c3-6241dcfd339d","resolution":{"observed_at":"2026-08-12T00:04:09.220057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-10T21:41:31.247717Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-12T00:04:08.907577Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.907577Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:9c93812b63455bb4021f357bbf35e199d4cebb7a31741694d40c92913d784054","observation_id":"60140c13-e07b-4231-85d3-a63fc6abda67","resolution":{"observed_at":"2026-08-12T00:04:08.907577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.825089Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"51b40e05-119c-4c4e-8a9f-f70460e64afc","year":2021},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.913694Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:c40759dc659c7037bb6e618e2444fdf4c1dfde5a0b56186c763d30246ea86029","observation_id":"4619a875-76d8-4c97-b9cc-687d634fb7a6","resolution":{"observed_at":"2026-08-12T00:04:09.829895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.810541Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"ec381932-9b73-450a-86f2-53a144308d0b","year":2022},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.922999Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:18fe172f17428e966bb5fc47f57982f1a8e497fd649188975fa96907a8f11645","observation_id":"e2eb7c0b-4895-4727-8a31-4d58a0bef8ac","resolution":{"observed_at":"2026-08-12T00:04:09.815433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.795677Z","title":"Gen-3 alpha","venue":null,"work_id":"010311f8-b1c7-4d7c-a2e6-c7cc26509c63","year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.929037Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:49b39beb58f9fdea0260865b67624b38c8fe794ce239e32dd4d236a9eebe09da","observation_id":"ff5beb7d-edc1-49b3-b812-878915810340","resolution":{"observed_at":"2026-08-12T00:04:09.800306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.782369Z","title":"Howtocap- tion: Prompting llms to transform video annotations at scale","venue":null,"work_id":"acc3d2ad-5555-43cc-a4f1-9b83bccfc6be","year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.935087Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:8f38b7313f4c7354d113127128b159ca266773a1cbbb3c364edbe16119f1af87","observation_id":"abd3eec9-2225-48e8-a13b-a20ccc259fa1","resolution":{"observed_at":"2026-08-12T00:04:09.786673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.767263Z","title":"Ego4d goal-step: Toward hierarchical understanding of procedural activities","venue":null,"work_id":"ca11f806-d472-489d-9671-24aafcb5d320","year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.941594Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:25786e7f6ea2ead296199af7328a918cfbaa28d7decd8aff5b540502498307d8","observation_id":"d89dc2ff-12b3-47c0-9b6e-d4c0834ef508","resolution":{"observed_at":"2026-08-12T00:04:09.772416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.750291Z","title":"Multi-task learning of object states and state-modifying actions from web videos","venue":null,"work_id":"efd5682e-4f59-4d78-9d78-54c32283d6a7","year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.947814Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:6c58cd05a63b4e8b1af8903707f0418be2a60c5f64b31a31d46163fb91f4782e","observation_id":"f4c24efa-4fec-44fd-8d0f-eb90fd4941d9","resolution":{"observed_at":"2026-08-12T00:04:09.755919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.733649Z","title":"Genhowto: Learning to generate actions and state transformations from instructional videos","venue":null,"work_id":"610c847b-e566-470e-a017-fed596dd7274","year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.954781Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:6771e3cd460da910173021cb8710c12ebabcd7c43eb61df8be6e94f2063d5b98","observation_id":"91449512-da44-444c-9e3c-6da5db8539b9","resolution":{"observed_at":"2026-08-12T00:04:09.739336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.701473Z","title":"Coin: A large-scale dataset for comprehensive instructional video analysis","venue":null,"work_id":"29897dee-51d0-4d8e-becd-1dd6f254599d","year":2019},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.967511Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:66ce268dffd0c93660546d2c30e1a84707d64c7b06a7615b164332bd42980a88","observation_id":"a16c4a41-8d5a-4f5c-8f2b-4e07dd8542a1","resolution":{"observed_at":"2026-08-12T00:04:09.707756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.683426Z","title":"Videocomposer: Compositional video synthesis with motion controllability","venue":null,"work_id":"64122a03-4f97-48b1-9590-7a4dbaead395","year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.971997Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:0bee8ab9bb1804290d5d63d160650a62cfb99025e1b291663c10f283f19a41ff","observation_id":"23aa6fd0-2760-465d-912d-8f5aed6eb5e4","resolution":{"observed_at":"2026-08-12T00:04:09.688504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:08.978979Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.978979Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:db964675ddca0517528d9a7bc24589f0dcdbb9264d98c1212ccd4acde167bdc1","observation_id":"3205a1c7-a4b1-4f96-8dd6-048908a636d5","resolution":{"observed_at":"2026-08-12T00:04:08.978979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15208","last_updated":"2024-10-04T04:05:27Z","snapshot_observed_at":"2026-08-12T23:17:46.935553Z","submitted_at":"2024-07-21T16:15:02Z","title":"Flow as the Cross-Domain Manipulation Interface","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15208","snapshot_observed_at":"2026-08-12T00:04:08.983607Z","title":"Flow as the cross-domain manipulation interface","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.983607Z"},"links":{"cited_paper":"/paper/2407.15208","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:fdc1e93154b710fb4a482263336e7ea4e3e495d84d296e7bee1d41f02f1b0020","observation_id":"dd22c36a-6f25-4b61-93fb-ffc4df674270","resolution":{"observed_at":"2026-08-12T00:04:08.983607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.655054Z","title":"Learn- ing object state changes in videos: An open-world perspec- tive","venue":null,"work_id":"f5f558a9-65e3-47d1-9e8d-40cad4c49220","year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.988887Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:e565793417c9be770c4b738fc95768e528f746ea854c4546b1f70021ef7e0b16","observation_id":"ba9f1114-b91f-457a-b153-a3a3db55453b","resolution":{"observed_at":"2026-08-12T00:04:09.660696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.637411Z","title":"Unloc: A unified framework for video localization tasks","venue":null,"work_id":"61dfa3c3-4c93-47e9-9d44-b210ac9382de","year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.993253Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:47858deb627ff728aa888a9a3c84f7464870b1edb485b9c52d062486ba803918","observation_id":"1845b683-1324-44c6-bc0d-25ebc34d4a7d","resolution":{"observed_at":"2026-08-12T00:04:09.642664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.619642Z","title":"Dif- fusion probabilistic modeling for video generation","venue":null,"work_id":"c7e13aed-4ec1-4815-ad20-f9e58e6b90d4","year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.997859Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:59084ad9436e0774552206f8aab8ce192f3c1f33618afc8ca04136b8aba07a36","observation_id":"a2b2db66-34d9-4f6f-b6e8-e32ddb6aa599","resolution":{"observed_at":"2026-08-12T00:04:09.624772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.603419Z","title":"Learning interactive real-world simulators","venue":null,"work_id":"d3f15ca9-f891-48ac-b27c-31f785a955e2","year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:09.002378Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:fd465c6ad60aae7dc6d933e8e20833c70ac65899c6c9f9f544ba30cc1742b97e","observation_id":"3c955992-aea2-4564-a178-a26a2d839d06","resolution":{"observed_at":"2026-08-12T00:04:09.608529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.587155Z","title":"Visual goal-step inference using wikihow","venue":null,"work_id":"eaa72196-bc5c-44c8-8dce-92b22a9cc7bb","year":2021},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:09.006957Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:3362524d69f20e22b316daf6c1abf12afba5994f4a8189a51e4dcee4737ce3e7","observation_id":"bef5f001-9e54-445e-b330-9f7a4fb563b9","resolution":{"observed_at":"2026-08-12T00:04:09.592663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-12T00:04:09.011524Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:09.011524Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:e099ab5c9312cf0a7ba5e4cec3ca6cab8e22a29dbd196c6e13823e82ac04a71b","observation_id":"c7c52e77-656e-4c1e-a25e-74deb2d6c8bf","resolution":{"observed_at":"2026-08-12T00:04:09.011524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.569978Z","title":"Video probabilistic diffusion models in projected latent space","venue":null,"work_id":"904eec00-e6a2-4968-ac52-506af7dcdfb3","year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:09.016495Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:ea110f3aad5fe9a7ba602efe27273abc56c8575ce438f90a561f3e8e424386a3","observation_id":"a711e4fc-19a1-400b-b73e-8c4cd7eef45c","resolution":{"observed_at":"2026-08-12T00:04:09.575661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11550","last_updated":"2023-02-22T18:47:51Z","snapshot_observed_at":"2026-08-11T09:48:55.827823Z","submitted_at":"2023-02-22T18:47:51Z","title":"Scaling Robot Learning with Semantically Imagined Experience","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11550","snapshot_observed_at":"2026-08-12T00:04:09.020787Z","title":"Scaling robot learn- ing with semantically imagined experience","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:09.020787Z"},"links":{"cited_paper":"/paper/2302.11550","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:e6111c27afdd4599ea85e479554b81785bdabd8055dcfe226f04e6fcc9edc23a","observation_id":"c6ab4b64-56a5-4d2e-8b74-27373b76e153","resolution":{"observed_at":"2026-08-12T00:04:09.020787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.553699Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"0673645e-8d3e-4e71-91e9-4e89d29b130d","year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:09.025635Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:4e09b234ec82d2688ca7646fda5bcacf93c25c7c89a8e7375c58fb31fcca0a94","observation_id":"c37e19e9-9711-4bac-ab38-727aa59b8c3d","resolution":{"observed_at":"2026-08-12T00:04:09.558855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.045663Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:09.045663Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:11b86c95cffdb10f945d3f1f292bf33aa3a6a00d3c42d75256e6c7d29ffd101e","observation_id":"80dc2485-ed8d-4389-a1e3-0753cf4468de","resolution":{"observed_at":"2026-08-12T00:04:09.045663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-12T00:04:09.050387Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:09.050387Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:c42179577bfe46d9d8af0da575e7e85a791a2040fad5f6a34cd6e3bd52969e6b","observation_id":"73f4869a-77b4-4c89-baac-b08d423997fd","resolution":{"observed_at":"2026-08-12T00:04:09.050387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-12T00:04:09.055356Z","title":"Magicvideo: Efficient video generation with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:09.055356Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:29afb22c7e547bccf71b6babbd4aa1722f3c0d5c1a0c1c1627a677bb154bd052","observation_id":"85dda75d-30b6-47d7-ac36-27a93e83fce2","resolution":{"observed_at":"2026-08-12T00:04:09.055356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.526396Z","title":"Put some aluminum foil in there","venue":null,"work_id":"be4b3f5c-64db-4bd5-b29b-a0e0feacb924","year":2019},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:09.060651Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:1be751c0a09f79fd321afee31066a862fed429a37cffdc9021f8452ffbd1df12","observation_id":"10e75bc3-40ce-4afc-a621-b5d893492669","resolution":{"observed_at":"2026-08-12T00:04:09.531802Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:04:09.719022Z","title":null,"venue":null,"work_id":"17fd483c-5c78-4c4d-acba-b2c4f509999d","year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.960237Z"},"links":{"citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:78df9c163c19cec29501e54281f2cb80b52bef8182e305328093ab19937453f2","observation_id":"cef7d800-01de-4556-9f7b-c2b20a34323f","resolution":{"observed_at":"2026-08-12T00:04:09.723153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T00:43:50.014842Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":2,"verified_fuzzy":35},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 2 inbound Pith citation observations for arXiv:2412.01987."}