{"as_of":"2026-08-17T05:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1791b1f6a45c45147bcf35b40767df58018dc692832a24472c2c8b0d449f28f6","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:13:40.206348Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:51:02.404616Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:28:38.483958Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":"2506.17220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17220","snapshot_observed_at":"2026-07-03T16:28:38.483958Z","title":"Emergent temporal correspondences from video diffusion transformers","venue":null,"work_id":"8be5667b-9bb1-4948-aea6-b3458f899dc7","year":2025},"citing_paper":{"arxiv_id":"2605.12587","last_updated":"2026-05-12T17:59:27Z","snapshot_observed_at":"2026-08-13T07:47:23.900604Z","submitted_at":"2026-05-12T17:59:27Z","title":"TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-14T21:28:12.151547Z"},"links":{"cited_paper":"/paper/2506.17220","citing_paper":"/paper/2605.12587"},"observation_digest":"sha256:ea1de037ef2cf21edce48d70fe39c7c84e277596f03ecf0e434ee23ad322b666","observation_id":"1a61c6d2-5b04-48cc-8f92-960d16369481","resolution":{"observed_at":"2026-05-14T21:29:28.981190Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":"2506.17220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17220","snapshot_observed_at":"2026-07-03T16:28:38.483958Z","title":"Emergent temporal correspondences from video diffusion transformers","venue":null,"work_id":"8be5667b-9bb1-4948-aea6-b3458f899dc7","year":2025},"citing_paper":{"arxiv_id":"2605.30231","last_updated":"2026-05-28T17:00:52Z","snapshot_observed_at":"2026-08-13T05:41:06.302698Z","submitted_at":"2026-05-28T17:00:52Z","title":"Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T07:47:52.739735Z"},"links":{"cited_paper":"/paper/2506.17220","citing_paper":"/paper/2605.30231"},"observation_digest":"sha256:7e1a4e07403a2d588d5a47d924012cef7d2834acae42a89c6a05761cbcb2366c","observation_id":"080a97df-cd2c-4677-92d0-e4204c1d6f08","resolution":{"observed_at":"2026-06-29T07:53:13.652234Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":"2506.17220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17220","snapshot_observed_at":"2026-07-03T16:28:38.483958Z","title":"Emergent temporal correspondences from video diffusion transformers","venue":null,"work_id":"8be5667b-9bb1-4948-aea6-b3458f899dc7","year":2025},"citing_paper":{"arxiv_id":"2607.01869","last_updated":"2026-07-02T08:25:38Z","snapshot_observed_at":"2026-07-07T00:07:23.664493Z","submitted_at":"2026-07-02T08:25:38Z","title":"QWERTY: Training-Free Motion Control via Query-Warped Video Diffusion Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-03T16:19:51.348169Z"},"links":{"cited_paper":"/paper/2506.17220","citing_paper":"/paper/2607.01869"},"observation_digest":"sha256:8baf4a60a7aa3d5c16445c47df8554e9885e0fd84cf9e663cd5371b5d5467b99","observation_id":"4aaee8e3-0ee6-43c6-a899-01dbf60d87fa","resolution":{"observed_at":"2026-07-03T16:28:38.485470Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17220","snapshot_observed_at":"2026-07-14T07:11:45.493916Z","title":"arXiv preprint arXiv:2506.17220 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11081","last_updated":"2026-07-13T04:44:14Z","snapshot_observed_at":"2026-08-16T16:50:21.464152Z","submitted_at":"2026-07-13T04:44:14Z","title":"Controlling Motion Transfer in Diffusion Transformers via Attention Heads","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T07:11:45.493916Z"},"links":{"cited_paper":"/paper/2506.17220","citing_paper":"/paper/2607.11081"},"observation_digest":"sha256:db62f1eec128bbc86dfa13e609127d39867caeed93d36e5407ea3344657f009a","observation_id":"f2c825ce-0016-4433-b2f9-1252f9b3732f","resolution":{"observed_at":"2026-07-14T07:11:45.493916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17220","snapshot_observed_at":"2026-08-04T16:51:02.404616Z","title":"Emergent temporal correspondences from video diffusion trans- formers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02006","last_updated":"2026-08-06T02:18:15Z","snapshot_observed_at":"2026-08-09T23:10:03.885825Z","submitted_at":"2026-08-03T10:06:45Z","title":"ASTRA: Asynchronous Spatio-Temporal Reconstruction via Trajectory Alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:02.404616Z"},"links":{"cited_paper":"/paper/2506.17220","citing_paper":"/paper/2608.02006"},"observation_digest":"sha256:70f597ebb401ea3a15989ae28abb20860a2289f3244495f0c9e9e36a67ffa6de","observation_id":"08d76611-dc7a-47f3-b541-efa44cb57232","resolution":{"observed_at":"2026-08-04T16:51:02.404616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17220/citation-record","integrity":"/paper/2506.17220/integrity","json":"/paper/2506.17220/citation-record.json","paper":"/paper/2506.17220"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T03:30:12.735656Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T19:13:38.587882Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.587882Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:d98ff0504f5ee926caa4942d3b731e3277060c6b4361fd3ee4b57fc9098f056f","observation_id":"d667174f-0174-4d1c-8067-ee8edf5577a8","resolution":{"observed_at":"2026-08-15T19:13:38.587882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:38.618161Z","title":"Self-rectifying diffusion sampling with perturbed-attention guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.618161Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:9bea6e5a5d33bd10807160f7bdebc600e7798dcb737ad507abe0fcef218d0b9d","observation_id":"9aa4e928-019a-4e95-b902-deff9ee5bf74","resolution":{"observed_at":"2026-08-15T19:13:38.618161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09072","last_updated":"2024-12-12T08:58:20Z","snapshot_observed_at":"2026-08-14T23:57:27.758940Z","submitted_at":"2024-12-12T08:58:20Z","title":"Cross-View Completion Models are Zero-shot Correspondence Estimators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09072","snapshot_observed_at":"2026-08-15T19:13:38.624015Z","title":"Cross-view completion models are zero-shot correspondence estimators.arXiv preprint arXiv:2412.09072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.624015Z"},"links":{"cited_paper":"/paper/2412.09072","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:0f2205564905adddbd8d955a20ec3e36781ea128fec2e814a2acc85597a58687","observation_id":"720025fd-2594-439a-b772-c81b13b132b4","resolution":{"observed_at":"2026-08-15T19:13:38.624015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08477","last_updated":"2023-04-18T03:27:52Z","snapshot_observed_at":"2026-08-16T15:39:48.920549Z","submitted_at":"2023-04-17T17:57:06Z","title":"Latent-Shift: Latent Diffusion with Temporal Shift for Efficient Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08477","snapshot_observed_at":"2026-08-15T19:13:38.630126Z","title":"Latent-shift: Latent diffusion with temporal shift for efficient text-to-video generation.arXiv preprint arXiv:2304.08477, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.630126Z"},"links":{"cited_paper":"/paper/2304.08477","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:0f99b12309b407116828575993e08a25d1633d25a7b1455e095cbf39fbaca929","observation_id":"3157be52-84b8-44d4-8a19-d22a302d83ec","resolution":{"observed_at":"2026-08-15T19:13:38.630126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13575","last_updated":"2024-08-24T12:58:08Z","snapshot_observed_at":"2026-08-16T13:45:02.758469Z","submitted_at":"2024-08-24T12:58:08Z","title":"Can Visual Foundation Models Achieve Long-term Point Tracking?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13575","snapshot_observed_at":"2026-08-15T19:13:38.635364Z","title":"Can visual foundation models achieve long-term point tracking?arXiv preprint arXiv:2408.13575, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.635364Z"},"links":{"cited_paper":"/paper/2408.13575","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:2dc4c5908b9636d774384e52e4e207725a2ada40fe9f298beebff2f3d9dca9ad","observation_id":"11ae0dc1-4dd1-446a-babc-ed4975cb84be","resolution":{"observed_at":"2026-08-15T19:13:38.635364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-16T12:52:49.101262Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-15T19:13:38.640365Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.640365Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:e546051bf4147302dded5007e838da23334f8e6fc76fcc57182cb9f18a1bde5a","observation_id":"2a0cbfe5-1465-4cfa-a541-fc5924e52bc5","resolution":{"observed_at":"2026-08-15T19:13:38.640365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:38.691658Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.691658Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:09e7cf2dd98ca56927f1f49c4559fbbee16ee1e69825cbcbe22872291660629e","observation_id":"ef334008-58c0-411b-a554-718ab610f3d6","resolution":{"observed_at":"2026-08-15T19:13:38.691658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18597","last_updated":"2025-03-26T09:05:41Z","snapshot_observed_at":"2026-08-16T12:59:57.130892Z","submitted_at":"2024-12-24T18:51:19Z","title":"DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18597","snapshot_observed_at":"2026-08-15T19:13:38.703145Z","title":"DiTCtrl: Exploring attention control in multi-modal diffusion transformer for tuning-free multi-prompt longer video generation.arXiv preprint arXiv:2412.18597, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.703145Z"},"links":{"cited_paper":"/paper/2412.18597","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:7be48072697593332f1c83cbc80af24ad58558bd31744a1770aeabaf26a9b471","observation_id":"80b36b94-06f3-443d-8076-d2abc153124a","resolution":{"observed_at":"2026-08-15T19:13:38.703145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-16T08:46:49.392959Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"cited_work":{"arxiv_id":"2412.16155","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16155","snapshot_observed_at":"2026-08-15T19:13:40.995213Z","title":"Can Generative Video Models Help Pose Estimation?","venue":"cs.CV","work_id":"1231c1d0-9a12-4d56-931b-8d6da8759b27","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.707597Z"},"links":{"cited_paper":"/paper/2412.16155","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:159a97900cab3f17dbc465f360fb3cf517f1363756b10b90e843f46ab3890700","observation_id":"335da015-e5d6-4308-bdd9-aaed01a63ee9","resolution":{"observed_at":"2026-08-15T19:13:41.000631Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:38.713091Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.713091Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:9b5db16e0223c7b8b3dbc999f336eeb88fcf62892b3ef842925ae22c705b3fdc","observation_id":"372abf9e-fd1f-441e-9c52-77ac313b2de7","resolution":{"observed_at":"2026-08-15T19:13:38.713091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-13T21:01:04.724772Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-08-15T19:13:38.718442Z","title":"VideoJAM: Joint appearance-motion representations for enhanced motion generation in video models.arXiv preprint arXiv:2502.02492, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.718442Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:3f2d7e90d4a38aa5e885ae016cd30ac5a57d149f05660d0b273633ec793a739b","observation_id":"0fd63fc9-ed9e-40b9-9262-05af6cc1665e","resolution":{"observed_at":"2026-08-15T19:13:38.718442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-13T01:39:12.659510Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-15T19:13:38.722682Z","title":"Videocrafter1: Open diffusion models for high-quality video generation.arXiv preprint arXiv:2310.19512, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.722682Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:f608793a6fe8c2a9e8322a91818536825dc92a070e8d2aa1f1a1009ed0ed9b2e","observation_id":"d4d86ce4-71c2-4fc2-9461-af681ef6d2de","resolution":{"observed_at":"2026-08-15T19:13:38.722682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.951302Z","title":"CATs: Cost aggregation transformers for visual correspondence.NeurIPS, 34:9011–9023, 2021","venue":null,"work_id":"05ae9249-eb97-42b7-8428-b4a936f346be","year":2021},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.802609Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:3b9d708c701f58caadd6ab1a94d42b6d98caa11f7ab3023612a6edbc8cc03bfe","observation_id":"bcdcf13c-4af2-49d1-94e9-10333f1a0245","resolution":{"observed_at":"2026-08-15T19:13:43.959581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.932165Z","title":"CATs++: Boosting cost aggregation with convolutions and transformers.IEEE TPAMI, 45(6):7174–7194, 2022","venue":null,"work_id":"2c4f9b93-c85f-47ad-9e38-d83ad3cba8fb","year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.848794Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:239559d9b5f01477eeb7a0d54e40028324ce333eeed7bdc3534f05014c3f086f","observation_id":"fe13b774-46d7-4f59-bffd-1e143e5c33d8","resolution":{"observed_at":"2026-08-15T19:13:43.939150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14687","last_updated":"2025-04-20T17:37:02Z","snapshot_observed_at":"2026-08-16T11:40:50.391195Z","submitted_at":"2025-04-20T17:37:02Z","title":"Seurat: From Moving Points to Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14687","snapshot_observed_at":"2026-08-15T19:13:38.852878Z","title":"Seurat: From moving points to depth","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.852878Z"},"links":{"cited_paper":"/paper/2504.14687","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:a9ce2e878e0eb74d74c4b3f7ffebc80bfdec7bb07e456498557580053f7be4e0","observation_id":"f68ddba8-690b-4958-9c7b-a8d7b7341831","resolution":{"observed_at":"2026-08-15T19:13:38.852878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.722411Z","title":"Local all-pair correspondence for point tracking","venue":null,"work_id":"f3e0e044-b187-4d3c-8cc9-2b5802b0defa","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.858121Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:60574cc7f5516463b3c9e7db29c59717d6c09311141bdbedb08048024601481d","observation_id":"7a7c5bfc-ea72-47f3-a3b7-ad22484a8d66","resolution":{"observed_at":"2026-08-15T19:13:43.822039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-15T19:13:38.862232Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.862232Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:9ba705fb9753e0c0e6098f619723ebd643fc9431b7b2258b8822a12b1838142d","observation_id":"f3395634-0928-47da-80e6-ccc2e5a1dfaa","resolution":{"observed_at":"2026-08-15T19:13:38.862232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.657519Z","title":"TAP-Vid: A benchmark for tracking any point in a video.NeurIPS, 35:13610–13626, 2022","venue":null,"work_id":"de3dfd47-0c6e-4572-9baf-5537d8470f99","year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.867585Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:7bee26abdfeb5f2c7026e64cd324022afab492971a5b296a9841f780bb84d162","observation_id":"3c986a74-a6b8-4b9a-9803-2689d37ccb7a","resolution":{"observed_at":"2026-08-15T19:13:43.695873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.577974Z","title":"TAPIR: Tracking any point with per-frame initialization and temporal refinement","venue":null,"work_id":"68ceccaf-d1cf-4935-b433-e040e90b85b1","year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.934649Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:4a55eb3bb8e7c6d28e0516d3dba2b969991eb511c8f967ee05a9248673ff6f21","observation_id":"a82932e7-36cb-41f1-8319-32a377a32d9a","resolution":{"observed_at":"2026-08-15T19:13:43.611186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:38.961511Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.961511Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:a55469c1ba671d66702ecb3fa059f98f891ef6699429727c14f846a6c4b2bca0","observation_id":"3b2003ff-6fbb-4af5-abe0-8df9aa9156a3","resolution":{"observed_at":"2026-08-15T19:13:38.961511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.400593Z","title":"Perceptual quality assessment of smartphone photography","venue":null,"work_id":"35790db5-8d77-4746-b5e4-d5c2c31a654a","year":2020},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.967025Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:303545053f8c9605692baa045145f0c9b1a991fc89d52e7dd3e810c2cbea7a7f","observation_id":"33f5eb86-6c04-40e5-8b71-137af0883265","resolution":{"observed_at":"2026-08-15T19:13:43.452787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10314","last_updated":"2024-05-16T17:59:05Z","snapshot_observed_at":"2026-08-15T07:34:03.035482Z","submitted_at":"2024-05-16T17:59:05Z","title":"CAT3D: Create Anything in 3D with Multi-View Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10314","snapshot_observed_at":"2026-08-15T19:13:38.971715Z","title":"Barron, and Ben Poole","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.971715Z"},"links":{"cited_paper":"/paper/2405.10314","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:416d39279f34d7cb14f4aae2cbe9ffcebaa70036bbefbf52334f70707e024ba6","observation_id":"3e921545-138c-4ded-b054-d57a6a7305d5","resolution":{"observed_at":"2026-08-15T19:13:38.971715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02700","last_updated":"2025-03-27T21:38:09Z","snapshot_observed_at":"2026-08-15T08:14:12.017325Z","submitted_at":"2024-12-03T18:59:56Z","title":"Motion Prompting: Controlling Video Generation with Motion Trajectories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02700","snapshot_observed_at":"2026-08-15T19:13:38.975658Z","title":"Motion prompting: Controlling video generation with motion trajectories.arXiv preprint arXiv:2412.02700, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.975658Z"},"links":{"cited_paper":"/paper/2412.02700","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:b046b60ab493290c4d788330b24876320688be5c84524c039a38085e2f451d10","observation_id":"6066171c-b810-4915-9367-280e54f8c5e5","resolution":{"observed_at":"2026-08-15T19:13:38.975658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.385015Z","title":"Mochi 1: A new SOTA in open-source video generation models, 2023","venue":null,"work_id":"e2e2e441-23ac-428e-b5e3-2186afc95574","year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.980746Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:720590989f55baea7f88f361b6b07079f98033b73e9718f996ba0cf3847069d9","observation_id":"8eb2c98d-a25a-4595-8494-b293fdb143bf","resolution":{"observed_at":"2026-08-15T19:13:43.390377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.299472Z","title":"SparseCtrl: Adding sparse controls to text-to-video diffusion models","venue":null,"work_id":"94b72695-d080-488a-9459-592512749354","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.985936Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:66f07b29a30199aa40aca86acbe97c2fdbf4f344ca0424f2c02df64bf6bdd2a4","observation_id":"66fcffc3-04b9-4896-a1ae-75e4fe170bab","resolution":{"observed_at":"2026-08-15T19:13:43.328877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-15T19:13:38.990688Z","title":"AnimateDiff: Animate your personalized text-to-image diffusion models without specific tuning.arXiv preprint arXiv:2307.04725, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.990688Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:aec7cd1e91f9cfb2afad3a8acfa48d99b16fde400d66367faed31f1d4b0f2cf8","observation_id":"f442abc9-75f3-4fd7-aab7-3498a74b3651","resolution":{"observed_at":"2026-08-15T19:13:38.990688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-15T19:13:39.011253Z","title":"LTX-Video: Realtime video latent diffusion.arXiv preprint arXiv:2501.00103, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.011253Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:f55f36dd2488114b35e9da61d2f11a2af36b2ce23970150831ce2537e0b56d25","observation_id":"2e4c1763-768f-4813-940e-81297155648d","resolution":{"observed_at":"2026-08-15T19:13:39.011253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.284323Z","title":"Harley, Zhaoyuan Fang, and Katerina Fragkiadaki","venue":null,"work_id":"cd542e72-4988-44d2-a426-1babb4f7dba4","year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.083506Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:92c5a67925a28004419c42e43c6a673f8dffcb6157172100b645321f1db1c0b4","observation_id":"5a0beaf0-fc71-4364-83ec-60bcfb33eb53","resolution":{"observed_at":"2026-08-15T19:13:43.289520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-13T08:59:59.906684Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-15T19:13:39.114343Z","title":"Latent video diffusion models for high-fidelity long video generation.arXiv preprint arXiv:2211.13221, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.114343Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:d68bc2bfdeedc11c071ac00f84acc0650f968b7981a118e9c0cb436a3d183379","observation_id":"39821cab-3ba0-4fd2-bd7a-cb7c7ce76a6e","resolution":{"observed_at":"2026-08-15T19:13:39.114343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.183304Z","title":"Unsupervised semantic correspondence using stable diffusion.NeurIPS, 36:8266–8279, 2023","venue":null,"work_id":"8fe51a70-c232-4673-a580-e41a3f83ca55","year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.119451Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:700483b2a1b29a710b2ec935df81d30b1b98e76523940b0e8a4dddc48e705425","observation_id":"fa35a892-0df5-42c6-a7dc-19ae6d5ac23a","resolution":{"observed_at":"2026-08-15T19:13:43.273165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.169126Z","title":"Denoising diffusion probabilistic models.NeurIPS, 33:6840– 6851, 2020","venue":null,"work_id":"d679d987-f989-45b7-b019-fe3126aa921e","year":2020},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.124777Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:78a0e749e033a3e894aab31890884786d867b45e33cfde748cf95f5796559613","observation_id":"f6413a89-f3da-4fe7-9c0a-af2769bdb820","resolution":{"observed_at":"2026-08-15T19:13:43.173878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.08742","last_updated":"2022-09-20T04:51:13Z","snapshot_observed_at":"2026-08-16T16:31:38.230918Z","submitted_at":"2022-09-19T03:33:35Z","title":"Integrative Feature and Cost Aggregation with Transformers for Dense Correspondence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.08742","snapshot_observed_at":"2026-08-15T19:13:39.128864Z","title":"Integrative feature and cost aggregation with transformers for dense correspondence.arXiv preprint arXiv:2209.08742, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.128864Z"},"links":{"cited_paper":"/paper/2209.08742","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:41be30ddfe4f35ee94ebfe31e573c8c28a90cef3c12cbaa7418d1f732f950877","observation_id":"a2b514bb-3489-4d12-aec4-a5e0e0e5c9c6","resolution":{"observed_at":"2026-08-15T19:13:39.128864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.036821Z","title":"Cost aggregation with 4D convolutional swin transformer for few-shot segmentation","venue":null,"work_id":"b3967084-93ab-4564-81ad-5e35726b032d","year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.133584Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:70d7c84ca473d15c831febd8577221fe83cebefafe2c9b71684365a23bab6d9f","observation_id":"bc77ebad-7518-4716-baae-0ec19155cd71","resolution":{"observed_at":"2026-08-15T19:13:43.119740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.020220Z","title":"Unifying correspondence pose and nerf for generalized pose-free novel view synthesis","venue":null,"work_id":"1d33c276-cbf2-4bb3-8800-8b1c86500a6b","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.138210Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:a22cacc819e6218a7fd1be7aa5d7ac97400c417d5511be5b607a3f455a66214b","observation_id":"2ac08c4b-4c11-499f-b871-f4435aab7cf2","resolution":{"observed_at":"2026-08-15T19:13:43.025900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.923505Z","title":"Deep matching prior: Test-time optimization for dense correspon- dence","venue":null,"work_id":"722391d1-ef3e-4c82-80eb-51cc2b204e11","year":2021},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.142769Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:d0bed56a4d3e975edbe766fb47a65e42c5229c917b1824308d128e7340f71dbb","observation_id":"cc1d3be2-47d3-45a3-9939-c21ebe4ca8cf","resolution":{"observed_at":"2026-08-15T19:13:43.008580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.819732Z","title":"Neural matching fields: Implicit representation of matching fields for visual correspondence.NeurIPS, 35:13512–13526, 2022","venue":null,"work_id":"7044e24a-711f-4717-89fd-f2a64e6c31e3","year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.147536Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:44c5401968c55481e6ea7cdc0c2e252365892f13aab4ae8abfae0de1e12bbcf0","observation_id":"811b445e-ace6-4c39-b735-28bb56fe30a3","resolution":{"observed_at":"2026-08-15T19:13:42.825966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.803175Z","title":"VBench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"a74caef0-97af-43a5-9587-1f18d4bc0a31","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.197835Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:f4340ba6e2ba5381d82d8d4c0fc0b61aaa54a24ea29bbf729f237aee2a190119","observation_id":"e6b06d83-a966-4503-8475-c1bdbed5c6da","resolution":{"observed_at":"2026-08-15T19:13:42.808548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.777336Z","title":"Space-time correspondence as a contrastive random walk","venue":null,"work_id":"3dfd4bc1-e0b8-4637-9e2e-ffd7d8405b5f","year":2020},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.235267Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:4c89f51e7a164346304d642cf3e70a95a2f71cf2a9911bd1a6d73793b0d60e40","observation_id":"e511ab6b-bbc3-4577-9c92-8c89d679f741","resolution":{"observed_at":"2026-08-15T19:13:42.789974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06016","last_updated":"2025-04-07T11:16:47Z","snapshot_observed_at":"2026-08-11T20:03:50.332267Z","submitted_at":"2024-12-08T18:21:00Z","title":"Track4Gen: Teaching Video Diffusion Models to Track Points Improves Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06016","snapshot_observed_at":"2026-08-15T19:13:39.257714Z","title":"Track4Gen: Teach- ing video diffusion models to track points improves video generation.arXiv preprint arXiv:2412.06016, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.257714Z"},"links":{"cited_paper":"/paper/2412.06016","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:34e8e3e87784336270385cf5b9474a034beeac5881def5567c23c9635e862d87","observation_id":"f1b61264-22c8-40db-9f42-360642c5195a","resolution":{"observed_at":"2026-08-15T19:13:39.257714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03150","last_updated":"2025-03-18T07:31:49Z","snapshot_observed_at":"2026-08-16T04:35:28.437141Z","submitted_at":"2024-12-04T09:17:47Z","title":"Appearance Matching Adapter for Exemplar-based Semantic Image Synthesis in-the-Wild","version":2},"cited_work":{"arxiv_id":"2412.03150","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03150","snapshot_observed_at":"2026-08-15T19:13:40.710529Z","title":"Appearance Matching Adapter for Exemplar-based Semantic Image Synthesis in-the-Wild","venue":"cs.CV","work_id":"1a1ea09e-4b53-4a1e-9ffa-d9c2ee1875e1","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.262818Z"},"links":{"cited_paper":"/paper/2412.03150","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:b19aaff60301b5f28b5a3f009829ccd4dd8349d32a5518381ca681c4a565078c","observation_id":"97805d44-ad69-4e2d-9d20-55c463834da5","resolution":{"observed_at":"2026-08-15T19:13:40.767937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11831","last_updated":"2024-10-15T17:56:32Z","snapshot_observed_at":"2026-08-16T13:09:05.029047Z","submitted_at":"2024-10-15T17:56:32Z","title":"CoTracker3: Simpler and Better Point Tracking by Pseudo-Labelling Real Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11831","snapshot_observed_at":"2026-08-15T19:13:39.267934Z","title":"CoTracker3: Simpler and better point tracking by pseudo-labelling real videos.arXiv preprint arXiv:2410.11831, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.267934Z"},"links":{"cited_paper":"/paper/2410.11831","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:7da5df1d73b9edb2886e9502816edab82b36943e941c19f29b1bb29a7435b9f5","observation_id":"ba5f69c1-c466-4e7d-b68a-8fe2c5615902","resolution":{"observed_at":"2026-08-15T19:13:39.267934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.762009Z","title":"CoTracker: It is better to track together","venue":null,"work_id":"3406a079-357c-4ae1-afef-85420721b463","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.274246Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:39f0d46227b0a5126b780ce4aec9ae8a6d8d4b8ff41c413182f78c271d071b9a","observation_id":"143386ba-99a7-4f30-8a62-e8a69ddb0e33","resolution":{"observed_at":"2026-08-15T19:13:42.766778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.718940Z","title":"MUSIQ: Multi-scale image quality transformer","venue":null,"work_id":"c1066890-c5fa-4cec-95ef-35017142356b","year":2021},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.278977Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:0a8e598a70fe50b79f58af0c8bc8ce9a96ee4d3439a891ab94396977b5117eca","observation_id":"26c5ddf7-c618-4537-88d2-59aec05fd1b8","resolution":{"observed_at":"2026-08-15T19:13:42.750973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12218","last_updated":"2025-04-20T14:33:55Z","snapshot_observed_at":"2026-08-14T13:31:51.787116Z","submitted_at":"2025-01-21T15:39:40Z","title":"Exploring Temporally-Aware Features for Point Tracking","version":2},"cited_work":{"arxiv_id":"2501.12218","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12218","snapshot_observed_at":"2026-08-15T19:13:40.636377Z","title":"Exploring Temporally-Aware Features for Point Tracking","venue":"cs.CV","work_id":"2d69a497-0529-4a73-abe7-6f45eea64de1","year":2025},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.283076Z"},"links":{"cited_paper":"/paper/2501.12218","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:654b1c94c504a3cb779ff8c9332c8df4bb67485559192328f20f441a2944ac5b","observation_id":"81b736a7-1451-4379-9744-d565a8ab7b78","resolution":{"observed_at":"2026-08-15T19:13:40.678647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.658535Z","title":"MoDiTalker: Motion-disentangled diffusion model for high-fidelity talking head generation","venue":null,"work_id":"15825499-142a-4d0d-a519-2b428b667914","year":2025},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.288344Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:022cc3d2f84497da6a028ec1d681d462fd0b57c1b097ec9ffedfd0017cdb9d81","observation_id":"4058f211-7f87-4e58-bc0b-f97b9417d45a","resolution":{"observed_at":"2026-08-15T19:13:42.663115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.642025Z","title":"Berg, Wan-Yen Lo, et al","venue":null,"work_id":"fc50078b-da23-4748-b57c-be9751fe29cd","year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.330619Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:ce8dcde484f8062e6f2779845252d1cda9cdccf6ab5137602f986ee80c8f4d95","observation_id":"4d731154-c6f7-4fd7-a74d-711eefd5279b","resolution":{"observed_at":"2026-08-15T19:13:42.648010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-15T19:13:39.411683Z","title":"HunyuanVideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.411683Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:a447a0ab4d48a3b35fbd7077d2b291547fc6dcbdd9edeb5048187a4a98c0d2de","observation_id":"6a6e781b-c4ef-4a0f-81ae-4189cd7c8c4c","resolution":{"observed_at":"2026-08-15T19:13:39.411683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.510124Z","title":"Kling: Video generation by kuaishou, 2024","venue":null,"work_id":"748ac689-cb4c-4ea2-99db-aa2027ff75dd","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.487395Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:50770855835143a87e27703038a79d179063e35e873a950983654565fabca8ce","observation_id":"596a9e4f-4bc8-49c1-bb5d-4b7a3741329a","resolution":{"observed_at":"2026-08-15T19:13:42.573897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.494121Z","title":"Efficient spatially sparse inference for conditional gans and diffusion models.NeurIPS, 35:28858–28873, 2022","venue":null,"work_id":"c64791a3-db02-4718-b384-83fcbf45af67","year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.491851Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:6b696512d975dd9cb3170fae454684a9724021dbde91423fb2022fada4b08449","observation_id":"0fbe97fc-80df-44af-ac1b-57d4c8b2c169","resolution":{"observed_at":"2026-08-15T19:13:42.499942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.332818Z","title":"Spatial-then-temporal self-supervised learning for video correspondence","venue":null,"work_id":"a52eefc8-9049-4ca5-b225-199ac2cf2d9f","year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.500695Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:857ad5e29d4368025c16eaa4ce48bc142f45cafa3d7231178dfae4adec8c96d7","observation_id":"ccd121ab-a919-48be-b891-2ad6528f30c2","resolution":{"observed_at":"2026-08-15T19:13:42.443079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16767","last_updated":"2025-06-25T07:19:44Z","snapshot_observed_at":"2026-08-16T13:22:49.851326Z","submitted_at":"2024-08-29T17:59:40Z","title":"ReconX: Reconstruct Any Scene from Sparse Views with Video Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16767","snapshot_observed_at":"2026-08-15T19:13:39.506088Z","title":"ReconX: Reconstruct any scene from sparse views with video diffusion model.arXiv preprint arXiv:2408.16767, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.506088Z"},"links":{"cited_paper":"/paper/2408.16767","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:15b702a4f11ceec8250e742844ede1934ff0809edf1fc5b2df9038679cf564cf","observation_id":"90a6b606-ee26-4627-a0b7-53dd9999f42f","resolution":{"observed_at":"2026-08-15T19:13:39.506088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-15T19:13:39.510944Z","title":"Sora: A review on background, technology, limitations, and opportunities of large vision models.arXiv preprint arXiv:2402.17177, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.510944Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:0741449afa91767c58a4eeebe24fddd420e18051cd933a1410c5c434156e2641","observation_id":"7d77039e-0df3-4b17-ab88-82f11ccd6125","resolution":{"observed_at":"2026-08-15T19:13:39.510944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.316599Z","title":"Not all diffusion model activations have been evaluated as discriminative features.NeurIPS, 37:55141–55177, 2025","venue":null,"work_id":"fedc4354-4c9b-4ae2-a942-e2713c1bc3d3","year":2025},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.515483Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:27547fe6c9d387c3032c9b69896e9a0f2c6615641fc53ba60ee9aa8fc4563fe2","observation_id":"9990f26c-fd8a-4df9-9c8f-f7930005e5c7","resolution":{"observed_at":"2026-08-15T19:13:42.322221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.233755Z","title":"DreamMatcher: appearance matching self-attention for semantically-consistent text-to-image personalization","venue":null,"work_id":"20afa1a5-53ba-4ad0-bb3f-3dfe69800775","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.583898Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:aa5d6481df44ad6cff050e82471e66c826a1d0e794d3ff39d427c03ce6398597","observation_id":"bdfb7234-6734-47f1-a680-c4c1a4c41309","resolution":{"observed_at":"2026-08-15T19:13:42.305310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19094","last_updated":"2024-01-25T07:10:41Z","snapshot_observed_at":"2026-08-16T15:28:17.651716Z","submitted_at":"2023-05-30T14:58:24Z","title":"Diffusion Model for Dense Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19094","snapshot_observed_at":"2026-08-15T19:13:39.669281Z","title":"Diffusion model for dense matching.arXiv preprint arXiv:2305.19094, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.669281Z"},"links":{"cited_paper":"/paper/2305.19094","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:827c1eb2a75b3a48b3a995af2df78d643ff26c67400b61c2d72f7e173c1ceb03","observation_id":"e796b727-caed-4871-bbb2-6f58a84a91ed","resolution":{"observed_at":"2026-08-15T19:13:39.669281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15406","last_updated":"2025-03-24T07:28:09Z","snapshot_observed_at":"2026-08-16T12:48:32.519117Z","submitted_at":"2025-03-19T16:45:47Z","title":"Visual Persona: Foundation Model for Full-Body Human Customization","version":2},"cited_work":{"arxiv_id":"2503.15406","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.15406","snapshot_observed_at":"2026-08-15T19:13:40.406708Z","title":"Visual Persona: Foundation Model for Full-Body Human Customization","venue":"cs.CV","work_id":"b20365a3-acaf-4bdd-9f8e-2a57c40b331e","year":2025},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.674774Z"},"links":{"cited_paper":"/paper/2503.15406","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:9ff17ffba995a693b05b259f478d23920ec08f580262a0840d0aecb9ac662d6b","observation_id":"191a8596-d505-4d96-8833-0028ceff3908","resolution":{"observed_at":"2026-08-15T19:13:40.557927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-15T19:13:39.679605Z","title":"DINOv2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.679605Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:1ed807674a63271ce41766a8c19f96819283f59239c4eecbce943c87aec9af0e","observation_id":"03198abf-ae6d-4fdc-92e2-e155a9838b2c","resolution":{"observed_at":"2026-08-15T19:13:39.679605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:39.685451Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.685451Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:419005df6a91a2ee958bbc0eca7a332127075c93059bcf6be139d3d528b54902","observation_id":"8a8467e4-cf6f-4b84-ad33-ef018b3f5a5e","resolution":{"observed_at":"2026-08-15T19:13:39.685451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-15T19:13:39.691810Z","title":"SDXL: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.691810Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:aa57fcb62da45d2dd6ff72962324e71336f7c615441ac135fcffda640ea0c588","observation_id":"84d46051-60bd-412a-8cee-78d597477bd1","resolution":{"observed_at":"2026-08-15T19:13:39.691810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.206628Z","title":"Movie Gen: A cast of media foundation models, 2025","venue":null,"work_id":"8b228333-f117-4a4b-abf6-044102aa9644","year":2025},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.699881Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:4d7c62e7b9e762600a2f82d72b9e06a77ae17e16ad202ef101241a65d59734d9","observation_id":"750dd959-4eea-4cbf-9a44-9decd7879ccf","resolution":{"observed_at":"2026-08-15T19:13:42.212793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-15T19:13:39.788381Z","title":"The 2017 DA VIS challenge on video object segmentation.arXiv preprint arXiv:1704.00675, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.788381Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:13ed33fe13f80519c42a3362fdbc49dac0cf7c6da75b3133e05ea42aec242507","observation_id":"4397c251-e36b-43cf-bd37-2209c9cc56f1","resolution":{"observed_at":"2026-08-15T19:13:39.788381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.175345Z","title":"Semantics meets temporal correspondence: Self- supervised object-centric learning in videos","venue":null,"work_id":"b9e77a85-6b35-4ba2-95c3-6713c5b8324b","year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.817315Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:31ca5184844ff62f39f9d1a62542ef01dced74c76249807ffe2c276659156fb8","observation_id":"b6960061-cde2-4743-af19-2e8370c0d9b4","resolution":{"observed_at":"2026-08-15T19:13:42.195229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:39.823600Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.823600Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:3caead43c6871fdde1629b5f382bfd05142c1d72255269c13167eeaf19704cb6","observation_id":"594e3340-0fdb-4d73-b40a-217b69f0ee06","resolution":{"observed_at":"2026-08-15T19:13:39.823600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.133716Z","title":null,"venue":null,"work_id":"9b906fe0-f533-4d9b-a98f-3f409a40e6ef","year":2020},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.828902Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:ffda81f02f1f98a3283c4b7fd6bcad67e53c0d9fae4abe6a2ee178d98daff445","observation_id":"72d7111e-42c4-46b6-98cf-274ae5656bbe","resolution":{"observed_at":"2026-08-15T19:13:42.139594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:39.833861Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.833861Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:945d6a89f9774a8bf7383b91913313942e89822e18665420ad3473d144b0d431","observation_id":"efd69bfd-d978-403d-83cb-c3d94b1630e5","resolution":{"observed_at":"2026-08-15T19:13:39.833861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.108795Z","title":"Introducing Gen-3 Alpha, 2024","venue":null,"work_id":"a348dd52-9a87-4ada-9fbd-fd6ec462fe00","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.839671Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:e28106ceb53ca9764f9adc58fa398b16656c8d7fcf2614d8cadf83434ac8c08f","observation_id":"8780f1eb-469a-457e-a5f2-f2445ab3bb97","resolution":{"observed_at":"2026-08-15T19:13:42.114305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-15T19:13:39.844362Z","title":"Make-A-Video: Text-to-video generation without text-video data.arXiv preprint arXiv:2209.14792, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.844362Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:1f6c3b49afa9c742f38942a0f35e7cebbc17419dd952d383323eb7a360db102f","observation_id":"e6912f63-954a-4a6f-a455-71737afcc15e","resolution":{"observed_at":"2026-08-15T19:13:39.844362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-15T19:13:39.881217Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.881217Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:8187a1db2d74fde78bfcf0d9ade670a5bed3f680148fb9ec8f77435cabff98c9","observation_id":"80d30d88-9235-4a58-9c54-838715681181","resolution":{"observed_at":"2026-08-15T19:13:39.881217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:39.933730Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.933730Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:cff6a870b957c4aa445f255a4f265ff4c975fdf694a5010a1668b6f740c5230b","observation_id":"0633a4b2-2e23-4b0e-b10c-82f32bd4e20d","resolution":{"observed_at":"2026-08-15T19:13:39.933730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04928","last_updated":"2024-11-07T18:07:31Z","snapshot_observed_at":"2026-08-16T13:02:01.454341Z","submitted_at":"2024-11-07T18:07:31Z","title":"DimensionX: Create Any 3D and 4D Scenes from a Single Image with Controllable Video Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04928","snapshot_observed_at":"2026-08-15T19:13:39.939649Z","title":"Dimen- sionX: Create any 3D and 4D scenes from a single image with controllable video diffusion.arXiv preprint arXiv:2411.04928, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.939649Z"},"links":{"cited_paper":"/paper/2411.04928","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:27c80d23167148c0b2c44d8dba98a397297d65f763b8f7fec5b5ca7fbc8513e7","observation_id":"aa8f1fe9-27d9-4348-a6a6-401f47abb153","resolution":{"observed_at":"2026-08-15T19:13:39.939649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.050283Z","title":"Emergent correspondence from image diffusion.NeurIPS, 36:1363–1389, 2023","venue":null,"work_id":"866f2841-a638-4b16-bd7b-d60bfeaf9231","year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.945033Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:9f8b0747dac1b2221426e1e7ea0c4d29608afaa0dd6e15251a0d206c4256a67e","observation_id":"92a5006e-b65d-4fbd-b4c1-dc643758d51d","resolution":{"observed_at":"2026-08-15T19:13:42.089298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:41.900620Z","title":"RAFT: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":"592923a0-6b59-40cc-8b0b-b5b2685bd523","year":2020},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.949243Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:d380993b16990bd6667ea4ed42875a78d9ac336cb7e42bd4de04b1c6e6149ada","observation_id":"35976cb2-6e83-47ba-831d-4df7642ab946","resolution":{"observed_at":"2026-08-15T19:13:41.950837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:41.884752Z","title":"GLU-Net: Global-local universal network for dense flow and correspondences","venue":null,"work_id":"8a82c74f-fb84-47e1-ba61-d845f8c8a5fc","year":2020},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.953490Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:dfbf2b9319971c00b52903eabe31f13a69791c85f3a8555bfbb7bbe1438f5604","observation_id":"7f3bdeda-b99e-4963-974e-65f05a75398c","resolution":{"observed_at":"2026-08-15T19:13:41.890337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:41.631946Z","title":"Learning accurate dense correspon- dences and when to trust them","venue":null,"work_id":"2a85ab4c-b777-4f2d-bd27-92273ec5af96","year":2021},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.018213Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:7f0e134ee07bf2f7d727307f42de10b6e3778821ea247707f3e2b84ec285d6b9","observation_id":"f088dc25-a18d-4988-b2cc-7efb65d16c2f","resolution":{"observed_at":"2026-08-15T19:13:41.770708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:41.583381Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"2cfdb962-1dd0-4ae3-a395-57d58731e7f1","year":2017},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.045840Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:0fa591f562109ca3bee5f3304a9795e7fa2826eb5d4a2e13eae749f1f02b8bca","observation_id":"16e739dc-0e71-4631-a8ad-9e3b5aad1253","resolution":{"observed_at":"2026-08-15T19:13:41.621054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18613","last_updated":"2024-12-18T21:21:07Z","snapshot_observed_at":"2026-08-15T16:20:45.318050Z","submitted_at":"2024-11-27T18:57:16Z","title":"CAT4D: Create Anything in 4D with Multi-View Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18613","snapshot_observed_at":"2026-08-15T19:13:40.050744Z","title":"Barron, and Aleksander Holynski","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.050744Z"},"links":{"cited_paper":"/paper/2411.18613","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:66de44f2e56fa17855d47b24290306bffbe44d274e68e4b704a8e7e642b5ce80","observation_id":"56f38322-c7d3-47af-ba9d-df34764ed62e","resolution":{"observed_at":"2026-08-15T19:13:40.050744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14864","last_updated":"2024-11-12T01:31:41Z","snapshot_observed_at":"2026-08-16T13:50:03.452370Z","submitted_at":"2024-05-23T17:59:40Z","title":"Video Diffusion Models are Training-free Motion Interpreter and Controller","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14864","snapshot_observed_at":"2026-08-15T19:13:40.056138Z","title":"Video diffusion models are training-free motion interpreter and controller.arXiv preprint arXiv:2405.14864, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.056138Z"},"links":{"cited_paper":"/paper/2405.14864","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:a0dfd359b9b14df542c3d10770cf652afba030d0ec63c7545362913b7bf54974","observation_id":"71215075-cecb-4c25-8509-20f0bfe36853","resolution":{"observed_at":"2026-08-15T19:13:40.056138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:41.491037Z","title":"DynamiCrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"8e42c522-fa26-4cbe-88bd-2f5cf1e1c309","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.061077Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:0101d6c1a7096d45d854bf0bd4f432e04dfb0de1285ee0229459dbd4c76f9923","observation_id":"434068e2-d2e7-4a0e-966c-968658c06bd0","resolution":{"observed_at":"2026-08-15T19:13:41.496368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:41.259261Z","title":"Rethinking self-supervised correspondence learning: A video frame-level similarity perspective","venue":null,"work_id":"01771541-605a-4bf0-a1de-42be17be50e5","year":2021},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.065360Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:2cd49ea70f3121e9760b86c80e9c941f7409290aa7f2773ca9f46b9dd8b62318","observation_id":"5f0bf968-ae86-41b8-81db-55c7770c86f0","resolution":{"observed_at":"2026-08-15T19:13:41.342982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-15T19:13:40.190379Z","title":"CogVideoX: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.190379Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:646e61a0e8174cab869c213f360e809d124660becc82318ae7ca6fbb9ced2959","observation_id":"326fb110-3160-487c-9171-65cf122024e0","resolution":{"observed_at":"2026-08-15T19:13:40.190379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:41.234578Z","title":"A tale of two features: Stable diffusion complements dino for zero-shot semantic correspondence.NeurIPS, 36:45533–45547, 2023","venue":null,"work_id":"d7ee23e6-fd2f-4e8f-8d70-85cbf80f2c5c","year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.196336Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:b584f7f55beaa9be5747b67844aa2ffc262d8fb2ca3c2e3fae9ce420233fe6c7","observation_id":"5616778c-5335-475e-84ff-dc368a19dc30","resolution":{"observed_at":"2026-08-15T19:13:41.248103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01821","last_updated":"2024-12-02T18:58:23Z","snapshot_observed_at":"2026-08-14T17:37:06.716611Z","submitted_at":"2024-12-02T18:58:23Z","title":"World-consistent Video Diffusion with Explicit 3D Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01821","snapshot_observed_at":"2026-08-15T19:13:40.201882Z","title":"World-consistent video diffusion with explicit 3D modeling.arXiv preprint arXiv:2412.01821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.201882Z"},"links":{"cited_paper":"/paper/2412.01821","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:0466656621a3602b59f94f92e01ae37ec82dfe5c4ed4e1498d174a529ff40f49","observation_id":"bab06ec1-95da-4441-aae9-cdc3817c1259","resolution":{"observed_at":"2026-08-15T19:13:40.201882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-15T19:13:40.206348Z","title":"Open-Sora: Democratizing efficient video production for all.arXiv preprint arXiv:2412.20404, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.206348Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:ae248d0189d3418bac26268c8508fa8d23880ce8c42e816f589599d8293d4e2e","observation_id":"2a288842-bd80-40f9-ab84-029626272ace","resolution":{"observed_at":"2026-08-15T19:13:40.206348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T13:42:56.567515Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":42,"verified_exact":3,"verified_fuzzy":37},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 5 inbound Pith citation observations for arXiv:2506.17220."}