{"as_of":"2026-08-07T17:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:917a08ad3b57fc0781732ce5997f12861d1e7e6d096f1e1925dd2685f534b2d0","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:17:52.535638Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T11:39:15.308355Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T11:40:03.365977Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"cited_work":{"arxiv_id":"2507.03393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.03393","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked temporal interpolation diffusion for pro- cedure planning in instructional videos","venue":null,"work_id":"6f21819e-2146-4a85-ab78-efe8f2199936","year":2025},"citing_paper":{"arxiv_id":"2602.23058","last_updated":"2026-05-17T06:55:06Z","snapshot_observed_at":"2026-07-06T22:47:11.228912Z","submitted_at":"2026-02-26T14:42:53Z","title":"GeoWorld: Geometric World Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-21T11:39:15.308355Z"},"links":{"cited_paper":"/paper/2507.03393","citing_paper":"/paper/2602.23058"},"observation_digest":"sha256:419f75acdf22c570f8b060d873bffc6859fc83e3c95b1a79bc7729f90dea1948","observation_id":"bae7dbac-e650-43c0-80a0-234c5b759491","resolution":{"observed_at":"2026-05-21T11:40:03.367788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.03393/citation-record","integrity":"/paper/2507.03393/integrity","json":"/paper/2507.03393/citation-record.json","paper":"/paper/2507.03393"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.670477Z","title":"Uncertainty-aware anticipation of activities","venue":null,"work_id":"b90d280c-9f24-4fe9-a8ac-79e65d9b3b49","year":2019},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.199105Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:400ea19f4597cad45463bbd2562c57616144f7e4610a1d508bd8680bc0477d5f","observation_id":"a64842db-4e0b-41cc-a008-28119ecc1afc","resolution":{"observed_at":"2026-08-06T20:17:53.683835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.636980Z","title":"Unsupervised learning from narrated instruction videos","venue":null,"work_id":"f005d6de-c976-4a1f-82c5-68d97713bd5f","year":2016},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.208092Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:ab713adb287283ae79fd7bdc352fccda9caa219f4b07f541eaeb21bfb8dd7c62","observation_id":"dd041405-cbb9-4345-8054-be2064398bb8","resolution":{"observed_at":"2026-08-06T20:17:53.644308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.610484Z","title":"Trajectory prediction for robot navigation using flow-guided markov neural operator","venue":null,"work_id":"673ce92f-1abf-43b1-bb2f-2544b61d1687","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.214051Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:a783e2af5f92e61a336ffbe4c320cddbdb0b86df222be2e9891a930fe237bf48","observation_id":"7aaf30b4-e8a9-40a2-aa16-8ff6aefb4108","resolution":{"observed_at":"2026-08-06T20:17:53.617857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.576574Z","title":"Procedure planning in instructional videos via contextual modeling and model-based policy learning","venue":null,"work_id":"21ac8455-bf5c-4a41-b492-c0fe02b3d49e","year":2021},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.222266Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:1fe4347206e56910f37165eb89c2a9433357c2a7c27a279296c2ef4c7bca0c2f","observation_id":"d4e57798-ce33-426f-89de-4ade59526ac2","resolution":{"observed_at":"2026-08-06T20:17:53.587021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.230512Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.230512Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:40c3c6c30dc188c30fe02640c03080bd99cc8ed36808263b135eb544f0f8d060","observation_id":"b423e9c1-a232-441e-bdd7-6613e34267f6","resolution":{"observed_at":"2026-08-06T20:17:52.230512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.535059Z","title":"Procedure planning in instructional videos","venue":null,"work_id":"a0c36239-b116-485c-bd68-586af28dd534","year":2020},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.237145Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:fc94ed4dc1d054cc72ad16421dd3ad3d64c08b1615c706df2aefc2b322d55756","observation_id":"8c7fd138-979c-486a-80da-8f4ef2df3686","resolution":{"observed_at":"2026-08-06T20:17:53.543125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.507723Z","title":"Diffusion models in vision: A survey","venue":null,"work_id":"314405e1-b153-43fa-af1b-e5d3d6d3b0e1","year":2023},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.246350Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:519db5275df988c5a15ea25867ff878e4997385a2e0e58eb41c909f9b3bcb525","observation_id":"a8b9fef0-a6c7-423a-ad8d-29af28553e82","resolution":{"observed_at":"2026-08-06T20:17:53.513708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.481930Z","title":"Who let the dogs out? modeling dog behavior from visual data","venue":null,"work_id":"5e19c356-8983-44ae-8fd9-a594089fc75a","year":2018},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.254885Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:c41d2676c4a3f313f5ab466e6980049795efc22faec3937b104fdbcd4d43b982","observation_id":"35ea51d1-3637-4b95-8686-de870521cadf","resolution":{"observed_at":"2026-08-06T20:17:53.487943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.449647Z","title":"Masked diffusion transformer is a strong image synthesizer","venue":null,"work_id":"6a03a8fd-1267-4afc-ad5a-bf8988c90982","year":2023},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.265217Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:6d964c01ffcff9a94c4b85597c5350b1e9a48bb4c432cb6ae1500702ab1950dc","observation_id":"83952eff-6aa7-4403-8a67-35173b5f7960","resolution":{"observed_at":"2026-08-06T20:17:53.460478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.274142Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.274142Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:32dfbd93364cdb2f1fec8778bdda6aade59c5102d73044ab439486b1da19d953","observation_id":"0d6c1bea-b606-40c6-9de6-8378635b644c","resolution":{"observed_at":"2026-08-06T20:17:52.274142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14773","last_updated":"2025-04-16T13:38:58Z","snapshot_observed_at":"2026-08-06T14:42:35.046089Z","submitted_at":"2024-03-21T18:27:29Z","title":"StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14773","snapshot_observed_at":"2026-08-06T20:17:52.280946Z","title":"Streamingt2v: Consistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.280946Z"},"links":{"cited_paper":"/paper/2403.14773","citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:ecc430d5c1a07c4955d7b3db6d51eadaffab7e6cd5999aff40397267937fbf06","observation_id":"3f29c72f-c651-4c8b-a6de-661b549cb5d0","resolution":{"observed_at":"2026-08-06T20:17:52.280946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.397257Z","title":"Cnn architectures for large-scale audio classification","venue":null,"work_id":"33ef5a81-cca5-4145-b61c-b79ddfc95173","year":2017},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.288236Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:b1dc0ec422619d3389b9edb933c24d5376400cae3cce7b116ae54af835bb5c8a","observation_id":"35311ab0-0825-48ba-bd84-d8e64aa68cfc","resolution":{"observed_at":"2026-08-06T20:17:53.403875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.294299Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.294299Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:73397e5e405bcdaf4984a24f9cfb79eb07cf89c6fdc6805cf155f92fca147687","observation_id":"1be18652-4712-4de6-99f8-f02c64b07e13","resolution":{"observed_at":"2026-08-06T20:17:52.294299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.340855Z","title":"Videobooth: Diffusion-based video generation with image prompts","venue":null,"work_id":"f9067548-ef34-402e-90ab-c833c0bd17bd","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.299920Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:164d70e9a672f45f13000adb44cc0fbbf9a6aead08883e501709fcf35db485d8","observation_id":"e95561e4-c312-4a9b-9326-4700cd17b0b0","resolution":{"observed_at":"2026-08-06T20:17:53.350062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.315637Z","title":"Text2video-zero: Text-to-image diffusion models are zero-shot video generators","venue":null,"work_id":"5b39e06e-727e-4502-9796-69c315046a06","year":2023},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.306229Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:925555493362ac29c09a0a305b7bb1ccf6c26c2e3eab980305fc45151936aa77","observation_id":"5fffa332-02ce-4b58-bd61-3b691fa24d70","resolution":{"observed_at":"2026-08-06T20:17:53.325831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T20:17:52.313579Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.313579Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:e31061fbd9c6c77c7edb3c16d402c92374d08acdbd1bf4f0ad160cf7c8e31bad","observation_id":"ae40d730-8a00-4849-a7f0-8327e557c2ec","resolution":{"observed_at":"2026-08-06T20:17:52.313579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.293592Z","title":"Skip-plan: Procedure planning in instructional videos via condensed action space learning","venue":null,"work_id":"9f3bf885-6821-4245-b6b4-5c0edf63cf57","year":2023},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.319058Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:c7f47315a3cc2d262119a0d054c59917e06a15fbf7549c07ab4fe9f4f54953d0","observation_id":"3562e1d9-dfb9-4291-8659-0be736a9e6d6","resolution":{"observed_at":"2026-08-06T20:17:53.299813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.260938Z","title":"Bat: Behavior-aware human-like trajectory prediction for autonomous driving","venue":null,"work_id":"469167d9-5c7f-441d-bf5c-bf57aed895a4","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.325507Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:b9c283556c21e49222dc08ac7e233eddd36453c79922b32ffc43fa933c040be6","observation_id":"ea2c997b-14d0-4429-8370-f151cc5b3041","resolution":{"observed_at":"2026-08-06T20:17:53.268479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.330812Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.330812Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:1bb5dc08229213ce47255b3c25c127a982e85e9720c4274e1fdb992dc6eeefc1","observation_id":"12ebb59e-534e-4f3c-9642-e39c81cd360e","resolution":{"observed_at":"2026-08-06T20:17:52.330812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08681","last_updated":"2020-08-13T05:42:12Z","snapshot_observed_at":"2026-07-06T08:16:16.271286Z","submitted_at":"2019-08-23T06:22:06Z","title":"Mish: A Self Regularized Non-Monotonic Activation Function","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08681","snapshot_observed_at":"2026-08-06T20:17:52.339417Z","title":"Mish: A self regularized non-monotonic activation function","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.339417Z"},"links":{"cited_paper":"/paper/1908.08681","citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:5a5edc27dfc85ce7a1241449ab5f91032a42c0f50d00fc15ba20ed5c2779aba0","observation_id":"14dc7594-b590-424b-9a4a-e7106257ff0c","resolution":{"observed_at":"2026-08-06T20:17:52.339417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.220619Z","title":"Why not use your textbook? knowledge-enhanced procedure planning of instructional videos","venue":null,"work_id":"02224690-32a3-49b1-8040-659e0bb01a4d","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.345939Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:83c80b15ae45dca0ea52131e938b811eb2b712b7eed1e497d6a1638eab914874","observation_id":"93dadf9d-d90c-4498-b11f-c49e3298ff95","resolution":{"observed_at":"2026-08-06T20:17:53.229029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.199755Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":"c9abab13-d450-4456-bd9f-951ad25f0f88","year":2021},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.357367Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:404231edaa61b2095f5da75696d0a6e7779804dbcb15d40285718932afac2afa","observation_id":"12a7f428-521e-4b3d-b574-a5c6265bb632","resolution":{"observed_at":"2026-08-06T20:17:53.206160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.177737Z","title":"SCHEMA : State CH anges MA tter for procedure planning in instructional videos","venue":null,"work_id":"98294d6b-8a2e-425d-a23d-9eba13925475","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.363448Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:de30948b65e233a34abb48617c7338ecb76f7799a254bb9e6984cd95d063e9f7","observation_id":"3cb2a6e2-cf17-4283-8f78-424ac316d93c","resolution":{"observed_at":"2026-08-06T20:17:53.183062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.154175Z","title":"Self-regulated learning for egocentric video activity anticipation","venue":null,"work_id":"735c0467-5725-40dd-99b4-5dc8879010b8","year":2021},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.369571Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:9b3f2e4be5de192d1cd2b96d6f49586cc3fa1096003561b20ce9426fe46ea6c3","observation_id":"19d3a483-4c5b-4429-b04f-a65fabb455d7","resolution":{"observed_at":"2026-08-06T20:17:53.161952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.136429Z","title":"Uncertainty-boosted robust video activity anticipation","venue":null,"work_id":"31f2d533-55d6-4f44-938a-caa234a25e8d","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.376027Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:66b9375bce9e04b41822a68d7ca4a60f446186ccba214a7ab9865482e17817ed","observation_id":"06c791f7-7640-49b9-ad05-e2dd557b0fcb","resolution":{"observed_at":"2026-08-06T20:17:53.141419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.383132Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.383132Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:30011f1953ab8fb32d58bfa6654411736da0a35ebba00412f80c80138a11651a","observation_id":"59eee345-d7bd-4fe0-ba8c-2db173dac57b","resolution":{"observed_at":"2026-08-06T20:17:52.383132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.390658Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.390658Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:5794f49dad5655b71662351fa8a96e4d2012ea2718233c31ea4d74ff1b0a79cd","observation_id":"5915f15e-bfb7-48b4-9100-9e04f3cbab5c","resolution":{"observed_at":"2026-08-06T20:17:52.390658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.085805Z","title":"Robovqa: Multimodal long-horizon reasoning for robotics","venue":null,"work_id":"8b16657c-ae02-4a27-8716-954fb2a1633f","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.395774Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:3b459dd3065b824bbb7672b5353f6a8757878d74a151bdac7d159d001a86ce6c","observation_id":"c4c7dc85-7b88-47bb-81fa-a1e6d8de5bb8","resolution":{"observed_at":"2026-08-06T20:17:53.094166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.406714Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.406714Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:104ca109e6bf842c8157cdd44f20cb384ebe15d9917c65e51fb3b6debbed4777","observation_id":"9a501f62-4be8-45de-a6f1-90dd118d887d","resolution":{"observed_at":"2026-08-06T20:17:52.406714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.413318Z","title":"Universal planning networks: Learning generalizable representations for visuomotor control","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.413318Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:284ea28721db48a767a9d6d984afe73730262f5bacfb65609aff43c32aea647c","observation_id":"fd654e69-f889-4853-9be1-88eacd64e077","resolution":{"observed_at":"2026-08-06T20:17:52.413318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.037259Z","title":"Plate: Visually-grounded planning with transformers in procedural tasks","venue":null,"work_id":"35424e68-ab28-44ba-a9fe-0387004b599b","year":2022},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.417696Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:ceb7efe52d0f490e86d4b86d4d239db8867f7abe0448d12eb6bb458758cac04b","observation_id":"0cd7d96d-f4b3-4b1c-bb65-0faf353e5f1d","resolution":{"observed_at":"2026-08-06T20:17:53.042521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.426483Z","title":"Coin: A large-scale dataset for comprehensive instructional video analysis","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.426483Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:115ec53f0a9b4a8105fa5e828afd2d50b0249950e88ea675bc1f97c1f71622d7","observation_id":"0d351948-db3f-4fcc-9beb-0f4bb32ab753","resolution":{"observed_at":"2026-08-06T20:17:52.426483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.002724Z","title":"Event-guided procedure planning from instructional videos with text supervision","venue":null,"work_id":"f6c5de4e-ecee-4fff-b052-79434afdc944","year":2023},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.435029Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:6ac41b5b529a1391f76f3f0b061b1ec0dc9feec99325b0ce4dc9d1d3b3249006","observation_id":"241453a1-d267-4648-96eb-ad3b53f106de","resolution":{"observed_at":"2026-08-06T20:17:53.009073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.983013Z","title":"Pdpp: Projected diffusion for procedure planning in instructional videos","venue":null,"work_id":"5aa31f20-3082-458d-90eb-1bf5ce1b9e3f","year":2023},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.441527Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:e7f32a071dd19f149b5fc3ac794606462d908f4575b6bdc0113abc0a6a9794c8","observation_id":"be051ffe-2c32-404f-af81-4dbf3d2f515b","resolution":{"observed_at":"2026-08-06T20:17:52.989961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.964113Z","title":"Driving into the future: Multiview visual forecasting and planning with world model for autonomous driving","venue":null,"work_id":"da6d7595-b3c3-49bf-afdc-6bdcd54aa756","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.447149Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:14a56684fefdadd734e302e9de88cc4a08a6c3298047a93e33d9aeebfbca1076","observation_id":"91587db9-7d84-43dc-93eb-2979b7e766f0","resolution":{"observed_at":"2026-08-06T20:17:52.969798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.943746Z","title":"Art-v: Auto-regressive text-to-video generation with diffusion models","venue":null,"work_id":"ff1542fb-42ab-4cf1-aeec-1ad21a71100f","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.455036Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:ba2a0290cbd1a9f685f618caf7a225dbcab1b50d2abda675ad1631330f3bf7ec","observation_id":"c97636b0-dcbe-422b-9eac-71dfca472eb5","resolution":{"observed_at":"2026-08-06T20:17:52.949459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.925336Z","title":"Group normalization","venue":null,"work_id":"60145fca-9c8e-40b1-a2ba-d759f6d1ad5c","year":2018},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.462730Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:3dceb15c59267fb4496d5e59b4ac0e0c702df0287bc59e11e709674a6e25ac9b","observation_id":"1693e9be-50f3-4654-9795-5124c33454a1","resolution":{"observed_at":"2026-08-06T20:17:52.931341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.897582Z","title":"P3iv: Probabilistic procedure planning from instructional videos with weak supervision","venue":null,"work_id":"77afa4d2-df3d-441c-b895-3cec8ea6e17b","year":2022},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.483527Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:6f10b099da976266dd154bdb1164c51b531850bb8e2725c422f18545626771b3","observation_id":"314c4c29-97b8-462f-82dc-9781bd43a2e1","resolution":{"observed_at":"2026-08-06T20:17:52.904847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.878653Z","title":"Upscale-a-video: Temporal-consistent diffusion model for real-world video super-resolution","venue":null,"work_id":"73e912a2-75c3-4214-a26a-d3db47ec5bb2","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.488656Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:424ba32c7c329094940677579d250526f88c986d9de2d77600e68f22f5f73dd1","observation_id":"b3a0bc6c-19c9-45ce-a186-2b1457ae9ced","resolution":{"observed_at":"2026-08-06T20:17:52.883947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01434","last_updated":"2024-05-02T16:25:16Z","snapshot_observed_at":"2026-07-06T18:08:52.053005Z","submitted_at":"2024-05-02T16:25:16Z","title":"StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01434","snapshot_observed_at":"2026-08-06T20:17:52.500672Z","title":"Storydiffusion: Consistent self-attention for long-range image and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.500672Z"},"links":{"cited_paper":"/paper/2405.01434","citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:c260116b8721f3145b32d0a6d1886e6d93801b4c29a181f282c7c55fa6d2f07d","observation_id":"051811af-993f-4bb2-aaa3-46d2926584ad","resolution":{"observed_at":"2026-08-06T20:17:52.500672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.856858Z","title":"Cross-task weakly supervised learning from instructional videos","venue":null,"work_id":"812186c2-9434-47cc-a341-0404eb1c479f","year":2019},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.510789Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:e6e204358af85ed86abd06485f955146247f2edd9fc844f72b8097295d6ef007","observation_id":"e08d4ab5-fa42-4c65-8532-1f739e2125df","resolution":{"observed_at":"2026-08-06T20:17:52.865258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.518632Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.518632Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:0cfdfb39255984e767eedac6f463d53447e20384167d752c526d9a8eabd9ab20","observation_id":"298410d9-2d7a-442d-bf00-d6040b800b6a","resolution":{"observed_at":"2026-08-06T20:17:52.518632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.524832Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.524832Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:4b1e354325a78fa22fa2d2536f57c93c7ef605a5cfbe915f9f4ecdd3d1c2e999","observation_id":"726bb4bf-6ffb-4e61-b727-9c0cb962bb32","resolution":{"observed_at":"2026-08-06T20:17:52.524832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.530051Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.530051Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:60a7da5b44c0637b6e9929d785c63ae09b1631ab24fdbb8d6fd9e135f82374bf","observation_id":"4948da70-8cd9-4e36-9f49-48ae05895ea0","resolution":{"observed_at":"2026-08-06T20:17:52.530051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.535638Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.535638Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:a45fdb4ab541d84b7f2e9440563b2ff4a5e6e33c80b3536a0714b76f468e0059","observation_id":"262ac05c-78ac-4fc4-88de-ff955d5bbcd4","resolution":{"observed_at":"2026-08-06T20:17:52.535638Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:09:12.009417Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2507.03393."}