{"as_of":"2026-08-09T16:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7113abd0f608a5f1c951696c90b2a2cdfda05d32a9b21171af646d38f4603ea0","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:10:55.455485Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T03:42:54.620069Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T03:42:57.302590Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"cited_work":{"arxiv_id":"2502.07001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07001","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Polanía, Yi Yang, Chuhan Zhang, Rishabh Kabra, Anurag Arnab, and Mehdi S","venue":null,"work_id":"c9f45f9a-35a6-4e9c-a01e-63922b716060","year":2025},"citing_paper":{"arxiv_id":"2507.13942","last_updated":"2026-04-15T13:59:47Z","snapshot_observed_at":"2026-07-31T09:25:03.034282Z","submitted_at":"2025-07-18T14:14:19Z","title":"Frozen Forecasting: A Unified Evaluation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T03:42:54.620069Z"},"links":{"cited_paper":"/paper/2502.07001","citing_paper":"/paper/2507.13942"},"observation_digest":"sha256:1dbcf4de6cf0f14ffc8d1a4973f8a30f101d15644c19e8492c77c9583e5fea80","observation_id":"a2d5ddbd-90f3-4119-9328-a330dd5eaf9c","resolution":{"observed_at":"2026-05-19T03:42:57.304495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"cited_work":{"arxiv_id":"2502.07001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07001","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Polanía, Yi Yang, Chuhan Zhang, Rishabh Kabra, Anurag Arnab, and Mehdi S","venue":null,"work_id":"c9f45f9a-35a6-4e9c-a01e-63922b716060","year":2025},"citing_paper":{"arxiv_id":"2605.02134","last_updated":"2026-05-04T01:30:04Z","snapshot_observed_at":"2026-08-03T21:24:39.449239Z","submitted_at":"2026-05-04T01:30:04Z","title":"Video Generation with Predictive Latents","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-09T16:55:54.709581Z"},"links":{"cited_paper":"/paper/2502.07001","citing_paper":"/paper/2605.02134"},"observation_digest":"sha256:52c5e830583d1cb6f7d0c21911261852a74526b85621b98867234a859825a95e","observation_id":"0b36fdbc-3921-4f57-8d81-c211e5d371ff","resolution":{"observed_at":"2026-05-11T16:26:09.069938Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07001/citation-record","integrity":"/paper/2502.07001/integrity","json":"/paper/2502.07001/citation-record.json","paper":"/paper/2502.07001"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.539035Z","title":"Self-supervised learning from images with a joint-embedding predictive architecture","venue":null,"work_id":"7f077ff8-264b-4ab0-99a6-f49b5747a6db","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.116949Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:ba4df4e5332440add053258e5c6c2a7b705a4fde86db4d8271735a9502138653","observation_id":"603821a0-9355-48c5-9aeb-a0481d66b0c7","resolution":{"observed_at":"2026-08-08T14:10:56.543774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.524085Z","title":"Video diffusion models learn the struc- ture of the dynamic world","venue":null,"work_id":"44a8f526-d63b-4daf-94d4-63fa27bcfb9d","year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.122254Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:2c731b9de3e539b1fdfa1619a847e55466435e1760e68997e180a8b865f70f75","observation_id":"cf7f64f8-25c1-4c34-910c-da56a3c62b98","resolution":{"observed_at":"2026-08-08T14:10:56.529087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11337","last_updated":"2024-02-17T17:08:16Z","snapshot_observed_at":"2026-07-06T17:31:37.574049Z","submitted_at":"2024-02-17T17:08:16Z","title":"Learning by Reconstruction Produces Uninformative Features For Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11337","snapshot_observed_at":"2026-08-08T14:10:55.127624Z","title":"Learning by recon- struction produces uninformative features for perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.127624Z"},"links":{"cited_paper":"/paper/2402.11337","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:29b9d5e7a3f8e499e53fda7c11a6937fe19bf588c552f888b22f2c0803a5432d","observation_id":"84998fb5-9c41-4862-ad36-25ae68f7595f","resolution":{"observed_at":"2026-08-08T14:10:55.127624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.509052Z","title":"Label-efficient se- mantic segmentation with diffusion models","venue":null,"work_id":"bed6fe24-09ea-4984-b4a2-c7b34c4bff72","year":2022},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.133861Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:8ad074581384ead9b36f3c9814ac2a25f9ab944170b037865b12a4c4c480d2a3","observation_id":"e8f2fc10-1067-4eb7-b442-9c176f7863b6","resolution":{"observed_at":"2026-08-08T14:10:56.513716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-07T02:30:11.447693Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08471","snapshot_observed_at":"2026-08-08T14:10:55.138930Z","title":"Revisiting feature prediction for learn- ing visual representations from video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.138930Z"},"links":{"cited_paper":"/paper/2404.08471","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:240a1b95a6b4893c440371f85f34380ed3f47291f0ac29be61a22a2508cb8119","observation_id":"a21fbcaf-e472-4e30-a2ab-a570cd1ceb2a","resolution":{"observed_at":"2026-08-08T14:10:55.138930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-08T14:10:55.144179Z","title":"Stable Video Diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.144179Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:0dcefd1cd84709a75c227626c1d7377c29891e3dd41a24103a73b5ff95d9b4c3","observation_id":"65321793-a5fe-4987-8f30-8828dc9fc8d7","resolution":{"observed_at":"2026-08-08T14:10:55.144179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.494094Z","title":"Deep regression on manifolds: a 3D rota- tion case study","venue":null,"work_id":"1433411f-5eb3-4d01-a875-d6a1ddc2c507","year":2021},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.149974Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:079289088ad59bbe648c945de890e29e74f2ed77c5f9e98e8b693526958be5ff","observation_id":"ae5814d3-b1c7-4258-a241-1b50a0120411","resolution":{"observed_at":"2026-08-08T14:10:56.499007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.477224Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"515c380c-92f3-4815-9488-2c4226f9a21c","year":2021},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.154906Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:033d4191d26bf6e049c8053154d389779ab5a9babed755622d4a1eef134a249a","observation_id":"2b88fef2-7f80-42e0-b5a4-fc00d09576d3","resolution":{"observed_at":"2026-08-08T14:10:56.482929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.159745Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.159745Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:d700e2df2b0e4769620f669bbf54a96710e8f3e1aed05d707242d405d9de2c6b","observation_id":"2c952667-f4b4-437d-946e-a2045f6b52b9","resolution":{"observed_at":"2026-08-08T14:10:55.159745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-08T14:10:55.165909Z","title":"A short note on the kinetics-700 human action dataset","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.165909Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:de7cdcbea34d803a9615c433f69db3dca7c7452c54d018f690a535aa85b6eed1","observation_id":"ddf9d714-8dfe-4364-b1e4-2a330064446e","resolution":{"observed_at":"2026-08-08T14:10:55.165909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15212","last_updated":"2025-07-09T16:58:07Z","snapshot_observed_at":"2026-08-06T10:25:48.518948Z","submitted_at":"2024-12-19T18:59:51Z","title":"Scaling 4D Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15212","snapshot_observed_at":"2026-08-08T14:10:55.171296Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.171296Z"},"links":{"cited_paper":"/paper/2412.15212","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:0f937f40bc2b48df7611ac65398084a617770509132f28ecfc9b8ac794390b57","observation_id":"647ea506-fb21-412f-8709-191a86556497","resolution":{"observed_at":"2026-08-08T14:10:55.171296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.448664Z","title":null,"venue":null,"work_id":"cfb334d2-d1fb-4e96-95c0-951b927c3dba","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.176297Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:8367494622dbb4a3e601f1721ddabed975e70ee8575d513998c07042a1f15b69","observation_id":"fd97b2ea-81ad-4ab1-84fb-bf8e4fc288ed","resolution":{"observed_at":"2026-08-08T14:10:56.454616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-09T14:40:36.849154Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-08T14:10:55.182071Z","title":"Pali-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.182071Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:fb1efb05947e610f025a759d2cef359ac69b3085296155ed1f5917b351f1b8d2","observation_id":"62146370-3bbb-4834-85ed-c1be60865c89","resolution":{"observed_at":"2026-08-08T14:10:55.182071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.432629Z","title":"Text-to-image diffusion mod- els are zero shot classifiers","venue":null,"work_id":"06e8ad83-a913-4229-a632-1410615da276","year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.187263Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:4a29d9dd246ca73045f684b1a0927fd78f96ca4f40b7f9bd1d6530853c52ac92","observation_id":"c7fff663-46f1-4cee-9c79-59e461514fc6","resolution":{"observed_at":"2026-08-08T14:10:56.437657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.415190Z","title":"Chang, Manolis Savva, Maciej Hal- ber, Thomas Funkhouser, and Matthias Nießner","venue":null,"work_id":"4af8d44d-d1cc-4efc-a8d8-a9c20102cb5f","year":2017},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.191848Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:0a9385892cbcaee03563c2bdef6f8bf04fb399443e015bf575fce7eb149e8179","observation_id":"6babfe3c-9302-4e56-9aee-1c71d713bea9","resolution":{"observed_at":"2026-08-08T14:10:56.421615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.398361Z","title":"Depth map prediction from a single image using a multi-scale deep net- work","venue":null,"work_id":"9f2aa87e-b853-408e-b2e0-dcbdc67073c0","year":2014},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.196339Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:ba21471c797cb71fa8b87c7915cd1fa96ada14a43ef381172cffa9317177b5d3","observation_id":"ceb7d32a-da1d-453d-bd88-0f0e747d5aa5","resolution":{"observed_at":"2026-08-08T14:10:56.404034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.200902Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.200902Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:4e65bb7610286e26524b0f01503c98271380aed2a1922d36113249e324f53693","observation_id":"a71f2f6c-c156-4b51-a343-bf48d93d0515","resolution":{"observed_at":"2026-08-08T14:10:55.200902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.369072Z","title":"Masked autoencoders as spatiotemporal learners","venue":null,"work_id":"4903a9de-cc54-43d2-84ed-0eb6cad38b49","year":null},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.206228Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:62f597d52362c784b2058f6b5a850814c686bd6c570287121488c1ce2ce6a685","observation_id":"48a5b6a2-1bea-47c0-9fda-cc34bcdc70fc","resolution":{"observed_at":"2026-08-08T14:10:56.374861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00783","last_updated":"2024-06-30T17:59:58Z","snapshot_observed_at":"2026-08-03T19:11:51.277524Z","submitted_at":"2024-06-30T17:59:58Z","title":"Diffusion Models and Representation Learning: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00783","snapshot_observed_at":"2026-08-08T14:10:55.211931Z","title":"Diffusion mod- els and representation learning: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.211931Z"},"links":{"cited_paper":"/paper/2407.00783","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:d2ea526ee973c80844d81b83424075683969e5c415d00e2972f314cbd1229391","observation_id":"ade7fd2f-118a-4d8b-a295-b245f66e7678","resolution":{"observed_at":"2026-08-08T14:10:55.211931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.349516Z","title":"Something Something","venue":null,"work_id":"73c9c563-588d-4fdd-8d2c-f7149e0c008b","year":2017},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.217130Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:641dcb2a4f9d8c69b0f60e56b93c95d338ab1fcfcf56c9c9e7fd05a9ec8c3762","observation_id":"16a378de-c69e-41e8-8dcc-8909361ab035","resolution":{"observed_at":"2026-08-08T14:10:56.354536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.332551Z","title":"Kubric: A scalable dataset generator","venue":null,"work_id":"87388ee1-f3a4-486b-b9db-7dc0cd0c6e9d","year":2022},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.222921Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:88bee9d5923d999eaaf25e0edaf0b45a2e21e2d870faea72f50c6a5a3e4e1a27","observation_id":"20c8d60a-5b6a-427b-b8fd-cfcf907d1c47","resolution":{"observed_at":"2026-08-08T14:10:56.338487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.315244Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":"93cc3b18-5274-4ef5-98da-01241af44118","year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.227765Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:c02a346dd10c38171930ada61c2635a39fd7c00307e67ce47b5a4e8b802f02c0","observation_id":"8d92fef7-1769-4742-b1e0-aeed694afa2b","resolution":{"observed_at":"2026-08-08T14:10:56.321232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.298733Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"6e0f21fa-4c9c-434b-af36-9260730f3c5e","year":2022},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.232445Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:afcd602c731c98bf3f4d9379cdbb1719b2df7f1f32060392053463aa9789b568","observation_id":"7302ca0f-4509-4216-a41e-7b1fd9d63e17","resolution":{"observed_at":"2026-08-08T14:10:56.303949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.283115Z","title":"Unsupervised keypoints from pretrained diffusion models","venue":null,"work_id":"d8800939-e00f-4bb1-8374-90e8b6c187e8","year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.237362Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:cb635b40293bf65a34911f87b20cd1c0940a648775d6533f62aee98fd39d9d3c","observation_id":"737ae461-0659-4691-a059-b1c40a504c27","resolution":{"observed_at":"2026-08-08T14:10:56.288117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.242828Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.242828Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:bb532bd625e318bdc6adee7c744e38d793cc6225f67b52c4e2cedb1ddb034050","observation_id":"a2be131a-35d6-40b5-873b-dd347fdbb184","resolution":{"observed_at":"2026-08-08T14:10:55.242828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02095","last_updated":"2024-11-27T07:59:25Z","snapshot_observed_at":"2026-08-07T23:17:31.541423Z","submitted_at":"2024-09-03T17:52:03Z","title":"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02095","snapshot_observed_at":"2026-08-08T14:10:55.247542Z","title":"Depthcrafter: Generating consistent long depth sequences for open-world videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.247542Z"},"links":{"cited_paper":"/paper/2409.02095","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:c82fccb753adbe58636fd2c022c48c36435bf3bb3ed2d66ca96412de12731d7a","observation_id":"a32fe247-85c8-4dc7-8b9e-4ab376ec1002","resolution":{"observed_at":"2026-08-08T14:10:55.247542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.255222Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":"b4c54cb1-8f2a-4bae-8fb6-3a8c3dbbeea1","year":2022},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.252875Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:853bed0f395726f2efa128a43304736cb466e4322b50a75fa935864c8b081d25","observation_id":"68812302-5910-4492-ada0-0d5cf32723e1","resolution":{"observed_at":"2026-08-08T14:10:56.261203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.238586Z","title":"Your diffusion model is secretly a zero-shot classifier","venue":null,"work_id":"9fd1f47b-e3bb-443f-9b43-ae9a8af33fc5","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.257709Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:2eaa4d1b9af50525859040a852026c250820f7b281fa3f4f06c97462cb5f25a6","observation_id":"87a222f0-25fc-41b2-bad7-3d32451b08f8","resolution":{"observed_at":"2026-08-08T14:10:56.243722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-08T14:10:55.263104Z","title":"Sora: A review on background, technology, limitations, and opportunities of large vision models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.263104Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:9a1712b964d59c79fa551cd8e89773f3e6b2f6a031cd08c5187ea79b5e99d3d9","observation_id":"c3a21647-dd1e-4432-8077-36b0cb0d8030","resolution":{"observed_at":"2026-08-08T14:10:55.263104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.221648Z","title":"Diffusion hyperfeatures: Search- ing through time and space for semantic correspondence","venue":null,"work_id":"7e0d9f6f-004f-4103-9bed-8ebe446647fa","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.268287Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:1641e27e2a130b5e38d2249dcf2312cbbeee89cdf940286ba14bb62fc65ecd4d","observation_id":"fe5d3173-800e-4721-9961-1d22c15a3088","resolution":{"observed_at":"2026-08-08T14:10:56.226488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.206390Z","title":"Understanding deep image representations by inverting them","venue":null,"work_id":"069e2083-b822-4749-a922-9d8b78a7391a","year":null},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.272944Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:e24aea6d73c3642212aaf4ca82634043ef508c51f8011e55c0006109c8d28dd0","observation_id":"db54a12f-71f6-4882-b412-13304013a4d5","resolution":{"observed_at":"2026-08-08T14:10:56.211266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.189634Z","title":"Lexicon3d: Probing vi- sual foundation models for complex 3d scene understanding","venue":null,"work_id":"d7a0eb7d-5b5f-49f3-bd7f-2f851527363e","year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.277612Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:073b572fcbeb2b3d3cd05b728366e5f4fbb5f95015806df0d66ff8cd46b17b05","observation_id":"f6c3539d-ca5e-4a6c-b193-e525ed96fc62","resolution":{"observed_at":"2026-08-08T14:10:56.194835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.173460Z","title":"NeRF: Representing scenes as neural radiance fields for view syn- thesis","venue":null,"work_id":"21da2594-75d2-4925-9e32-56c125196df7","year":2020},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.282206Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:df6387c6b9fa206fcedd104784a28e7d33d4f91a47840416b4fb7ee82bc33a8e","observation_id":"24f582d3-87f7-4921-a4c4-d2b6ba373ad6","resolution":{"observed_at":"2026-08-08T14:10:56.178589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08702","last_updated":"2023-07-17T17:59:40Z","snapshot_observed_at":"2026-08-07T23:37:36.441503Z","submitted_at":"2023-07-17T17:59:40Z","title":"Diffusion Models Beat GANs on Image Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08702","snapshot_observed_at":"2026-08-08T14:10:55.286821Z","title":"Diffusion models beat GANs on image classification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.286821Z"},"links":{"cited_paper":"/paper/2307.08702","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:d0de7fe315f256dd2a25c2db63b2540045ba4c9fbd05403585a2d90b04b36d16","observation_id":"7cc0493e-586f-4637-b833-9ad2376161ba","resolution":{"observed_at":"2026-08-08T14:10:55.286821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.156968Z","title":"DiffTAD: Temporal action detection with proposal denoising diffusion","venue":null,"work_id":"7c179d41-d583-4c75-8ae2-cbd5415bacb4","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.291762Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:2199baf8e1f5d6bdcd74d658fff4e2734f83d5a370331309d24cca37291bbc17","observation_id":"41f6959e-fb2f-4959-a742-3f5306b03908","resolution":{"observed_at":"2026-08-08T14:10:56.162756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.296307Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.296307Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:ea0a7c6ec87b128716b320c82bfabc11f3d002343e025973d039f3aeda8c983a","observation_id":"297db8f9-bf23-4d29-abec-819a1b70cac8","resolution":{"observed_at":"2026-08-08T14:10:55.296307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.131199Z","title":"Self-supervised video pretraining yields robust and more human-aligned visual representations","venue":null,"work_id":"b4748936-9e9b-4deb-9ed3-b32e47b798dd","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.301353Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:bac6d872bb098ed90074815288c4243fa33d5dde5003126f348a842105828ba6","observation_id":"1bcfb7f4-2bf5-4b4b-98e8-0b52de14c06d","resolution":{"observed_at":"2026-08-08T14:10:56.136122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.115646Z","title":"Per- ception Test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":"1d4d4bfe-3791-42f5-800f-7b864b53c3db","year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.306794Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:538941e36a9f52cbf64ce4376b6aabff533cb9c061b135286b94f43bf44b2aaa","observation_id":"08856bea-5579-4067-91d6-e9ddf695b466","resolution":{"observed_at":"2026-08-08T14:10:56.120448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.311336Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.311336Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:a51c53551c0a9378165fb87ec230aa58f6f8cc35923bad34dc725be2da35f1bd","observation_id":"babb581f-0cb3-4ed5-a5c6-ed0d335fa9bc","resolution":{"observed_at":"2026-08-08T14:10:55.311336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-08T14:10:55.315744Z","title":"The 2017 DA VIS challenge on video object segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.315744Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:a0841bf5361d4bf7b162ee34ab22466d4bb7b4a191072d979b9c301729b01954","observation_id":"08672b8d-6e27-4aa5-a28f-9001a1def01e","resolution":{"observed_at":"2026-08-08T14:10:55.315744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.320638Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.320638Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:e922842491dad20fa508b292eec708d4cfa920da0f92d6ff99090d626d0cd640","observation_id":"a81a3c84-5fe0-4f51-a6bc-e6a6fb922909","resolution":{"observed_at":"2026-08-08T14:10:55.320638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.326083Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.326083Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:3c2db964d93a48636aeb4740f80b060e89edada37f286dee39d350c51d22a548","observation_id":"a5c0f855-667d-4bca-8468-481b32e18231","resolution":{"observed_at":"2026-08-08T14:10:55.326083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.068129Z","title":"U- Net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":"8d824540-a038-4b9d-a246-830541fd6623","year":2015},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.331019Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:c99dfe4fce73c5f50a30772fdedb11c295641be02ef93b0cb85f36d254883d9f","observation_id":"116c1a14-2760-4986-a65c-d87aa487f408","resolution":{"observed_at":"2026-08-08T14:10:56.074226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.051645Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":"e31e7a8e-8151-476f-a4b1-f4fcaa666e5d","year":2015},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.335679Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:9f8a3bdd7bf226264678756fde591e44a6434e52d71ada1a8e22bd7fce87cbf7","observation_id":"dbfba91e-e117-43b3-a687-098d0627e39b","resolution":{"observed_at":"2026-08-08T14:10:56.056491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.035987Z","title":"Scene representation transformer: Geometry-free novel view syn- thesis through set-latent scene representations","venue":null,"work_id":"c4b36d38-2add-495d-8e1a-5fc31ec6d090","year":null},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.340453Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:2dd14e9be54112917f6417df92cad840d57557a4090a83bc3337e1a7ac35baa6","observation_id":"c6ab9844-88b4-41a7-b0c7-50e4d4d98c4c","resolution":{"observed_at":"2026-08-08T14:10:56.041323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.020498Z","title":"Only time can tell: Discovering temporal data for temporal modeling","venue":null,"work_id":"cf23db0c-a463-4a42-af57-5962e2e08aa0","year":2021},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.345836Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:844e2079f0efdfd334e57ed1a07934b2fef0b0794c3d3fa7e55ca6d386c09fdd","observation_id":"3b8c6641-290a-4a7d-8e5b-11179bae4712","resolution":{"observed_at":"2026-08-08T14:10:56.025424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07198","last_updated":"2023-11-13T09:38:30Z","snapshot_observed_at":"2026-07-06T16:46:30.470666Z","submitted_at":"2023-11-13T09:38:30Z","title":"MonoDiffusion: Self-Supervised Monocular Depth Estimation Using Diffusion Model","version":1},"cited_work":{"arxiv_id":"2311.07198","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07198","snapshot_observed_at":"2026-08-08T14:10:55.556457Z","title":"MonoDiffusion: Self-Supervised Monocular Depth Estimation Using Diffusion Model","venue":"cs.CV","work_id":"28d67ea4-ee19-44d5-9d30-6024ba6a13e2","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.350854Z"},"links":{"cited_paper":"/paper/2311.07198","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:166b420c1ab6eb8719f8a25a26abc5f5ae1eebff4aefc7006f8ad5d513011a5e","observation_id":"6fb7003e-13f5-43c8-bb60-fff423a83da4","resolution":{"observed_at":"2026-08-08T14:10:55.563436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.355636Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.355636Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:48e7342f7a34b0506689d5329099935564997740b884e7e1611fb9e982a35939","observation_id":"f154804d-1108-4532-90cb-1f8bf6e6e25a","resolution":{"observed_at":"2026-08-08T14:10:55.355636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.993863Z","title":"Scalability in perception for autonomous driving: Waymo Open Dataset","venue":null,"work_id":"145237d9-20cb-4fc7-88b8-c7e91ee5072b","year":2020},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.360284Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:4a31e4220642a0d398329b3bdb35d9cd1ad1cc5f08aaba489206a16053c658f2","observation_id":"7b302f72-d9ab-45a3-bb7e-53a11f481eb2","resolution":{"observed_at":"2026-08-08T14:10:55.998842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.978878Z","title":"Emergent correspondence from image diffusion","venue":null,"work_id":"496e504a-9cba-431d-af1f-f781505f3b95","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.364835Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:75780a96a90513cf890fef2aa6b9c63b50452eb8f49cc65db034baf07712ce4e","observation_id":"23f0ce83-05b5-4ff3-bb97-8c14bd76ba9e","resolution":{"observed_at":"2026-08-08T14:10:55.984019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.963887Z","title":"VideoMAE: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"48318430-f685-44f7-8c57-318c8aab79e8","year":2022},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.369731Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:13aea8d3dd139ffb276ed94354e292d28b55389ac46112b6417c9d03089005d4","observation_id":"ea064e57-1183-4773-92f6-55510f4c043b","resolution":{"observed_at":"2026-08-08T14:10:55.968978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-08T14:10:55.374419Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.374419Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:c63207b7b39aee3dfe6849bdc92f62edd209ea1c70676746e41c46790d6611b2","observation_id":"2ffa4df1-3728-42d1-89f9-fbbfc6e56103","resolution":{"observed_at":"2026-08-08T14:10:55.374419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.948893Z","title":"Neural discrete representation learning","venue":null,"work_id":"af39a95a-8c88-474d-8233-92ae4e53a854","year":2017},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.379343Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:699a139f0a1e1cfd79da113206ef32a53b1a769bbeec5a8a07a77b3af519de8d","observation_id":"94445917-140d-4ed1-83c5-d54ac64332f1","resolution":{"observed_at":"2026-08-08T14:10:55.953590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.933529Z","title":"The iNaturalist species classification and detection dataset","venue":null,"work_id":"ce350872-88d4-4071-8dd7-bb6a88a5c140","year":2018},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.383979Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:ce8828a1ecd13df78258187520f3eb39375d42f1878a7b9c6aa10d0fa5dacdc4","observation_id":"958500c9-b3bb-4d5f-9c02-e736c5693d7a","resolution":{"observed_at":"2026-08-08T14:10:55.938315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.917775Z","title":"Hudson, Thomas Albert Keck, Joao Carreira, Alexey Doso- vitskiy, Mehdi S","venue":null,"work_id":"f2530685-7c68-441c-a31c-790a0bb77a78","year":null},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.389085Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:9fd259b076e476b0277b14b4e4a030d34d19aff093b7ee157ccfe2093825f5d2","observation_id":"af177f6d-7537-46b7-923d-127918f55d41","resolution":{"observed_at":"2026-08-08T14:10:55.923033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.902390Z","title":"Attention is all you need","venue":null,"work_id":"722f2b98-d711-4e87-bd49-d701145db3d5","year":2017},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.393683Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:47779f539a863145a7c94ea165f887a588043a994c55616a4065492e50246199","observation_id":"3c76d85f-a3a4-41f4-b74a-885ad9d09450","resolution":{"observed_at":"2026-08-08T14:10:55.907171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.886408Z","title":"VideoMAE v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"b9e67632-f2cd-4533-86f9-6c51f293b2c3","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.398243Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:2fb92ad7a2cbe411f0889000ba0dd29bebb8b297ed4fd207919a9f314344ac6e","observation_id":"7502c86a-a9a9-438b-82d0-d8af2e1c7a85","resolution":{"observed_at":"2026-08-08T14:10:55.891728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07860","last_updated":"2025-04-20T04:48:38Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:23:33Z","title":"Controlling Space and Time with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07860","snapshot_observed_at":"2026-08-08T14:10:55.402609Z","title":"Controlling space and time with dif- fusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.402609Z"},"links":{"cited_paper":"/paper/2407.07860","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:e967ccb753316134c6abd343b549a2c6e9f0f53e44f59bd45bcfc584db13f594","observation_id":"2f9ede65-af59-4efc-aee6-1dbd688e7143","resolution":{"observed_at":"2026-08-08T14:10:55.402609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.869418Z","title":"Denoising diffusion autoencoders are unified self-supervised learners","venue":null,"work_id":"dc1fa155-2190-4698-8493-99ac8218b198","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.407888Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:793782b6a20f9a8a24e1f5587271863307347c605889e6310abb9912987d8860","observation_id":"0fe87e0a-d124-4519-87a1-eba6c744e2ac","resolution":{"observed_at":"2026-08-08T14:10:55.874562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.852958Z","title":"Open-vocabulary panop- tic segmentation with text-to-image diffusion models","venue":null,"work_id":"2fc4e492-d85c-4289-a7ea-c2c26136c3b3","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.412593Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:7d99e5a101914140fdb3430ff41304acd6d1c6a2f683d9a1312656ed3530b95f","observation_id":"a6a4e390-b173-415c-9063-ac78ec4bac71","resolution":{"observed_at":"2026-08-08T14:10:55.858262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.837357Z","title":"Diffusion Model as Rep- resentation Learner","venue":null,"work_id":"215fbb6a-4fd4-4601-b62f-5a2f7c186254","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.417404Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:20d284f0f78c10a6d9f022e742d9792d401d958ded0ed3b2614b554ea9800c01","observation_id":"27edcb1a-eb8b-4d72-8352-ff598a435d7b","resolution":{"observed_at":"2026-08-08T14:10:55.842384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.821241Z","title":"Gundavarapu, Luca Ver- sari, Kihyuk Sohn, David Minnen, Yong Cheng, Vigh- nesh Birodkar, Agrim Gupta, Xiuye Gu, Alexander G","venue":null,"work_id":"1fe80ee0-ef0f-486f-ac41-10e583061480","year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.421970Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:65a5390fe5fea0ea610cfb1a094e9180b8422819309019f8f92bac186cb0d6e2","observation_id":"b0ac0337-c4a8-47d4-ba5a-16d07178cb95","resolution":{"observed_at":"2026-08-08T14:10:55.826303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.804404Z","title":"A tale of two features: Stable diffusion complements DINO for zero-shot semantic correspondence","venue":null,"work_id":"4db3b70c-6798-4bfe-9708-e00b3e91d3e9","year":null},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.426588Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:b53ae598066c5054e021a537f1b7e018fb16d0e2f442b6e1f7d9205729816c79","observation_id":"af5a3197-f2c1-4c5a-901f-b84be0514da7","resolution":{"observed_at":"2026-08-08T14:10:55.809804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13142","last_updated":"2023-08-25T02:35:54Z","snapshot_observed_at":"2026-07-06T16:10:15.694898Z","submitted_at":"2023-08-25T02:35:54Z","title":"A Survey of Diffusion Based Image Generation Models: Issues and Their Solutions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13142","snapshot_observed_at":"2026-08-08T14:10:55.431225Z","title":"A survey of diffusion based image generation models: Issues and their solutions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.431225Z"},"links":{"cited_paper":"/paper/2308.13142","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:a97b30027c3dd91e828ad0bb6f5ceddf181639cae3d208890ec204ab7bd7a49f","observation_id":"adc973b1-8a9f-4c9f-810d-c9d4f59e998a","resolution":{"observed_at":"2026-08-08T14:10:55.431225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.788344Z","title":null,"venue":null,"work_id":"c6f365ea-a858-468c-a402-d6d212e7778d","year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.437068Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:a2efe776f267b781b027a380d9ccde8aab5b796387d93bbed9a8734fcb2d6f14","observation_id":"54c34bff-d2ce-477f-8bfd-a6ac1a5c169a","resolution":{"observed_at":"2026-08-08T14:10:55.793939Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.441538Z","title":"Unleashing text-to-image diffusion models for visual perception","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.441538Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:b5a3ee697b4d4c09a2d92156f99716b5cc48d3e521c541543dfcc1d664fe6650","observation_id":"1462df58-ed28-4474-a511-dcab881afb14","resolution":{"observed_at":"2026-08-08T14:10:55.441538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.761312Z","title":"Places: A 10 million image database for scene recognition","venue":null,"work_id":"9b77be4b-6abb-4113-9149-f174909e579a","year":2017},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.446497Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:b33ca6c0bc9634a021f9672d46980e7bc3eb2abb5df8c4486f44292953352198","observation_id":"0f76226c-d04b-4335-801b-81acca099df6","resolution":{"observed_at":"2026-08-08T14:10:55.767105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.744304Z","title":"Stereo magnification: Learning view syn- thesis using multiplane images","venue":null,"work_id":"111ceef5-09a2-4e3a-8ced-f0e0355b55cd","year":2018},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.450982Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:517dc045dd579b8579f6be1b006ee6307101d11a96367adf4e86facc609a91ef","observation_id":"3b551034-2701-48cf-a3d5-164bf2b1f3d6","resolution":{"observed_at":"2026-08-08T14:10:55.750105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12042","last_updated":"2024-07-06T04:32:58Z","snapshot_observed_at":"2026-08-09T15:23:31.528051Z","submitted_at":"2024-03-18T17:59:58Z","title":"Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12042","snapshot_observed_at":"2026-08-08T14:10:55.455485Z","title":"squeezing some- thing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.455485Z"},"links":{"cited_paper":"/paper/2403.12042","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:46b4d6af098826fa79f5d0f0ec22f5f904255045b8f7fa4169f31611f04016cb","observation_id":"6e333442-b790-49a6-871e-4f4bcf9c06e7","resolution":{"observed_at":"2026-08-08T14:10:55.455485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":42},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 2 inbound Pith citation observations for arXiv:2502.07001."}