{"as_of":"2026-08-11T21:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7dc41f172dcd0cb6403427bbce9aca724f833c177e5fa9a6f72f9c2b642ddb9a","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:23:41.484020Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T19:00:44.243335Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"cited_work":{"arxiv_id":"2501.08682","doi":"10.48550/arxiv.2501.08682","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Realvvt: Towards photorealistic video virtual try-on via spatio-temporal consistency","venue":"ArXiv.org","work_id":"c99a32ef-1239-4121-8929-5b051119fec8","year":2025},"citing_paper":{"arxiv_id":"2511.18957","last_updated":"2026-04-13T02:31:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T10:19:56Z","title":"Eevee: Towards Close-up High-resolution Video-based Virtual Try-on","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T06:34:45.045267Z"},"links":{"cited_paper":"/paper/2501.08682","citing_paper":"/paper/2511.18957"},"observation_digest":"sha256:a87392692478b53a5374f94881b91c433b15191d11bf2129edaeb590457c0d6d","observation_id":"cb931202-32af-476a-97a6-f8f71ed70c7e","resolution":{"observed_at":"2026-05-17T06:39:10.564830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"cited_work":{"arxiv_id":"2501.08682","doi":"10.48550/arxiv.2501.08682","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Realvvt: Towards photorealistic video virtual try-on via spatio-temporal consistency","venue":"ArXiv.org","work_id":"c99a32ef-1239-4121-8929-5b051119fec8","year":2025},"citing_paper":{"arxiv_id":"2512.20340","last_updated":"2026-04-29T12:00:44Z","snapshot_observed_at":"2026-08-02T10:18:36.960036Z","submitted_at":"2025-12-23T13:15:31Z","title":"The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T20:06:30.109866Z"},"links":{"cited_paper":"/paper/2501.08682","citing_paper":"/paper/2512.20340"},"observation_digest":"sha256:544840f1f312131a0f94697089b8bd6db3bce56b6a8f315fa5303f9e32f85643","observation_id":"c504a272-756e-4e04-b20f-0bfaf4d54e58","resolution":{"observed_at":"2026-05-16T20:08:22.943585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"cited_work":{"arxiv_id":"2501.08682","doi":"10.48550/arxiv.2501.08682","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Realvvt: Towards photorealistic video virtual try-on via spatio-temporal consistency","venue":"ArXiv.org","work_id":"c99a32ef-1239-4121-8929-5b051119fec8","year":2025},"citing_paper":{"arxiv_id":"2604.27958","last_updated":"2026-04-30T14:53:44Z","snapshot_observed_at":"2026-08-10T21:43:59.725969Z","submitted_at":"2026-04-30T14:53:44Z","title":"TripVVT: A Large-Scale Triplet Dataset and a Coarse-Mask Baseline for In-the-Wild Video Virtual Try-On","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-07T05:43:04.644875Z"},"links":{"cited_paper":"/paper/2501.08682","citing_paper":"/paper/2604.27958"},"observation_digest":"sha256:50ebf2dcab006a0607c5afc4088adab12269f85c511acb2a6192c0beaa0b9bda","observation_id":"e0287f82-ae83-4d57-9d15-1cc25eb3eb4a","resolution":{"observed_at":"2026-05-09T05:05:12.414338Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"cited_work":{"arxiv_id":"2501.08682","doi":"10.48550/arxiv.2501.08682","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Realvvt: Towards photorealistic video virtual try-on via spatio-temporal consistency","venue":"ArXiv.org","work_id":"c99a32ef-1239-4121-8929-5b051119fec8","year":2025},"citing_paper":{"arxiv_id":"2606.08514","last_updated":"2026-08-04T12:17:45Z","snapshot_observed_at":"2026-08-11T09:27:50.623738Z","submitted_at":"2026-06-07T08:40:43Z","title":"OmniTryOn: Video Try-On Anything at Once!","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T19:00:44.243335Z"},"links":{"cited_paper":"/paper/2501.08682","citing_paper":"/paper/2606.08514"},"observation_digest":"sha256:3394af198191e3d743dad2cdfe662c6b2fe10c6f85cb9204de0085ab885e2619","observation_id":"6058e754-7fc3-4422-bf35-3cb623eac8e9","resolution":{"observed_at":"2026-07-02T22:17:26.409824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.08682/citation-record","integrity":"/paper/2501.08682/integrity","json":"/paper/2501.08682/citation-record.json","paper":"/paper/2501.08682"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-10T20:23:40.716948Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.716948Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:10c43596169825ac58da76ccbe7edd3af0778e9bcea20be12e7bdd53fe9f3f0f","observation_id":"7518a99d-d4de-40b5-8042-847ad32b2daf","resolution":{"observed_at":"2026-08-10T20:23:40.716948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:43.278644Z","title":"Elucidating the design space of diffusion-based generative models,","venue":null,"work_id":"6129a879-c2e4-40e9-a220-48aa61028d94","year":2022},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.733448Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:0d4f9e7c6050fe8dd39106aeef6b1c49ba24717d6bc1122812ce55c8ed6d0a64","observation_id":"550e779a-d7f2-43a7-b9d4-1e113b29ed14","resolution":{"observed_at":"2026-08-10T20:23:43.284218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-10T20:23:40.739601Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.739601Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:a8b138dd58ace3b9ba64cb5de127b227b20e8d5fa3fac255cbf19dfaa48baf61","observation_id":"befa29aa-189f-4a4a-b5f7-b7ba7fa4cdde","resolution":{"observed_at":"2026-08-10T20:23:40.739601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:43.261923Z","title":"Single stage virtual try-on via deformable attention flows,","venue":null,"work_id":"d2f096ce-7d97-4ef9-a986-569645347d73","year":2022},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.745924Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:3d141582cabf83bcf55fa145a78e35ea6684be1f54bf882dcbc7f9fc3db9495e","observation_id":"060082d7-6318-4df1-80e0-7eb74315284f","resolution":{"observed_at":"2026-08-10T20:23:43.267878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:43.200935Z","title":"Sapiens: Foundation for human vision models,","venue":null,"work_id":"e222a627-f5d6-41c9-9ba2-c77e5410be2d","year":2025},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.799954Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:7f5df1810d771ed7af76728fec3ed2619e082dc7e78c66e4b93afe6b3d9484a5","observation_id":"48563e53-3878-442d-b91e-0dc33e566a53","resolution":{"observed_at":"2026-08-10T20:23:43.236033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:43.184016Z","title":"Animate anyone: Consistent and controllable image- to-video synthesis for character animation,","venue":null,"work_id":"c117bf77-351c-4fbc-95ac-149bb8ade96e","year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.846489Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:2548a49da1a05be6edfd1b177cd9ae9c341ac326a24e94f1ac7d6896abe161e0","observation_id":"791e8503-54c9-457f-b44b-3bb8b5e9a340","resolution":{"observed_at":"2026-08-10T20:23:43.189360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:43.126767Z","title":"Dress code: High-resolution multi-category virtual try-on,","venue":null,"work_id":"ff1cdae8-a038-40ec-b1ce-339d0c3be807","year":2022},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.851934Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:92a3214123c265686e104bb424334edc9aadcec5a3a5b15a67424fbca37ae78a","observation_id":"b29a7acb-c54a-473d-9087-e49e16b3010b","resolution":{"observed_at":"2026-08-10T20:23:43.154725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:43.109855Z","title":"Rerender a video: Zero-shot text-guided video-to-video translation,","venue":null,"work_id":"52d9e596-4aca-4967-a64b-8e84b1d83245","year":2023},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.858531Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:906d190cbd24094db917d22af55f4661f26000095eae5dab468235466936a180","observation_id":"c6e2d118-5801-42ba-8f0f-1947efebec8d","resolution":{"observed_at":"2026-08-10T20:23:43.115482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:43.030787Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":"36d59b6c-e17d-49da-8ba5-3afc71709a92","year":2021},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.863638Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:6c7fcad2cba3e61497d5371e6fea132f44093bafc278d8592011082bf6f84036","observation_id":"b1cb9d71-ce1a-440f-a14e-723fc00fd856","resolution":{"observed_at":"2026-08-10T20:23:43.050704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:43.014388Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"03a5ac28-df7b-48f9-ae80-4d8d2cac5ae4","year":2021},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.924733Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:cad00031f1996ef3b667ae620ecedbda3e1c1a21e32c3dad6dbc36dc186b5276","observation_id":"f5bdd9a6-5a08-434c-84f0-435e5a41f38b","resolution":{"observed_at":"2026-08-10T20:23:43.019924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-10T20:23:40.952598Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.952598Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:8cc27ae3c8bf803300db7097dee3cc2f0d2f9504166831a5b57346a32bc487d8","observation_id":"40034013-c75a-417a-bada-db14c0134e48","resolution":{"observed_at":"2026-08-10T20:23:40.952598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01779","last_updated":"2024-03-07T06:35:35Z","snapshot_observed_at":"2026-08-10T19:02:55.763306Z","submitted_at":"2024-03-04T07:17:44Z","title":"OOTDiffusion: Outfitting Fusion based Latent Diffusion for Controllable Virtual Try-on","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01779","snapshot_observed_at":"2026-08-10T20:23:40.958697Z","title":"Ootdiffusion: Out- fitting fusion based latent diffusion for controllable virtual try-on,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.958697Z"},"links":{"cited_paper":"/paper/2403.01779","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:8096e27e0b287752a740596576510afaad4bc68d8639cc84f75ee0b6f82ff879","observation_id":"480e9800-5630-407a-84e5-374a1174f5e9","resolution":{"observed_at":"2026-08-10T20:23:40.958697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.948745Z","title":"Gpd-vvto: Preserving garment details in video virtual try- on,","venue":null,"work_id":"c9555910-4bb0-4da2-b9c6-dfd9c18e0a18","year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.021799Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:928bc7152e58b4d4dd65be09139756afbff762361859b5f409bca0c60113aece","observation_id":"71ef351b-32bf-4cc8-b46d-ffdac378aa70","resolution":{"observed_at":"2026-08-10T20:23:42.983205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-10T20:23:41.051508Z","title":"Latte: Latent diffusion transformer for video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.051508Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:4bd128dfd018d4cc05654e455041ec55eedff92c00bfaaff55f027ca952f0e32","observation_id":"83084fb9-fac4-43c7-adc0-cd10c3698f56","resolution":{"observed_at":"2026-08-10T20:23:41.051508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.931365Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":"d8bc5680-1455-4741-8f2b-6a517ddc7e8a","year":2022},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.057309Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:8547f093d4249a7da6d07d4a40688ddd717f44cf2c9ede7d7319e938257737e5","observation_id":"e010788b-c20d-48e4-9449-70010462bff5","resolution":{"observed_at":"2026-08-10T20:23:42.937876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18326","last_updated":"2024-06-07T16:02:10Z","snapshot_observed_at":"2026-08-10T19:02:57.409528Z","submitted_at":"2024-05-28T16:21:03Z","title":"VITON-DiT: Learning In-the-Wild Video Try-On from Human Dance Videos via Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18326","snapshot_observed_at":"2026-08-10T20:23:41.063202Z","title":"Viton-dit: Learning in-the-wild video try-on from human dance videos via diffusion transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.063202Z"},"links":{"cited_paper":"/paper/2405.18326","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:3e85807f0ff11d92499f4c3bf9d6674f4dd8315860ac320ce8a46235e3861c71","observation_id":"798c1a56-b1dc-4320-ac8c-04b2d4b277e7","resolution":{"observed_at":"2026-08-10T20:23:41.063202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.856235Z","title":"Tunnel try-on: Excavating spatial- temporal tunnels for high-quality virtual try-on in videos,","venue":null,"work_id":"62c8768d-ff9c-4ce6-bbbe-20eb0769edcc","year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.068622Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:0ac730df7b306a2ed7499937edfb87438e67617711da2aaffc156f05c9cbec87","observation_id":"d3a4cd6a-4147-4605-9a4a-5bcbf9082ae6","resolution":{"observed_at":"2026-08-10T20:23:42.886479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.840789Z","title":"Clothformer: Tam- ing video virtual try-on in all module,","venue":null,"work_id":"c0646325-08e6-4c7c-8df5-9098aa2b18ae","year":2022},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.073473Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:aacd410c50b738739199ccd61f1fa117808db2e47fca26e20b26688813ad31c1","observation_id":"69f62e6b-464d-4c5b-b2a9-ba8f1a416c24","resolution":{"observed_at":"2026-08-10T20:23:42.845582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.752992Z","title":"Improving diffusion models for authentic virtual try-on in the wild,","venue":null,"work_id":"12216a17-3394-4100-aaa8-08e93bae6904","year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.077891Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:75c2a17007c2acee36bc2cc9cffbb81e24c84fd2ff17d3ca7944d3911aa2c026","observation_id":"8e9446ca-ff3b-483e-86b0-e44e767e08ed","resolution":{"observed_at":"2026-08-10T20:23:42.819282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.736629Z","title":"Stablevi- ton: Learning semantic correspondence with latent diffusion model for virtual try-on,","venue":null,"work_id":"00595a5e-9838-4366-8a7b-bb41a81872a6","year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.141373Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:117a8b9fc046c4ed751ea2c7d3eb45f551b66cd1b7b5e37ac5ab401d102421a3","observation_id":"1c3237f3-1c29-45e4-aeab-6679c72b1333","resolution":{"observed_at":"2026-08-10T20:23:42.742148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.626605Z","title":"Dit: Self- supervised pre-training for document image transformer,","venue":null,"work_id":"13497e3d-7b8e-4096-9868-52d3cab83e6c","year":2022},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.207875Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:c9a7ab2a392eebb6d7f5f3de7e065686397d6c7f43050dfaefe443d2f1ff7674","observation_id":"2ec9f07f-b1bf-487a-83c9-6a5aa6ad3b21","resolution":{"observed_at":"2026-08-10T20:23:42.679155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.610734Z","title":"Flownet: Learning optical flow with convolutional net- works,","venue":null,"work_id":"0bf58746-8bdc-4e53-a7dd-fc662e87ab6e","year":2015},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.212780Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:d5a4ee7eaf7999f9ea0d06b5e36491256209ed8482c22c0ebf7a31b2c6c61fb6","observation_id":"7ced8ebe-d9a9-4397-bc07-1699087ad35e","resolution":{"observed_at":"2026-08-10T20:23:42.615996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.527465Z","title":"Shineon: Illuminating design choices for practical video-based virtual clothing try-on,","venue":null,"work_id":"55f3f93a-fc94-492a-a02c-e6e08ba020e3","year":2021},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.218167Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:fd892de2e8a9ef329be9959b2176cc554e9fff4bf6ed05483453a65324128fdd","observation_id":"572c88e9-71b4-4d9b-827c-a47eb318a226","resolution":{"observed_at":"2026-08-10T20:23:42.599265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.510265Z","title":"Mv-ton: Memory-based video virtual try-on network,","venue":null,"work_id":"e2e5e61e-3a24-4701-81ad-35d05911d609","year":2021},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.223168Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:1de464911526d11b83e7299dfc3a10fdb614f06ef56be437cae8925bd31c4a9e","observation_id":"5d77c051-aaf5-4a6d-8522-4146242327b9","resolution":{"observed_at":"2026-08-10T20:23:42.515659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.448911Z","title":"Fw-gan: Flow-navigated warping gan for video virtual try- on,","venue":null,"work_id":"a687f267-bf81-469b-b719-d56c81d4b191","year":2019},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.228081Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:e170d142c9acb2982894c7a4f71e59a3a69fb38f4b6f1b0a1642c04758216e59","observation_id":"1f4ad7c9-c713-490d-a639-36fd86fcd7b8","resolution":{"observed_at":"2026-08-10T20:23:42.482507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.424954Z","title":"Gentron: Diffusion transformers for image and video generation,","venue":null,"work_id":"3e23f711-5b0a-41a9-a750-9cd8b3d978e8","year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.233133Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:056fd7a8994da5c55e4d3d860909ec979f0a1397fe767da0848f76e8bee32ba4","observation_id":"98820a1f-14bb-422e-a67c-d46580be4b95","resolution":{"observed_at":"2026-08-10T20:23:42.436364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01595","last_updated":"2024-09-03T04:29:59Z","snapshot_observed_at":"2026-07-06T19:09:32.189008Z","submitted_at":"2024-09-03T04:29:59Z","title":"DiVE: DiT-based Video Generation with Enhanced Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01595","snapshot_observed_at":"2026-08-10T20:23:41.238260Z","title":"Dive: Dit-based video generation with enhanced control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.238260Z"},"links":{"cited_paper":"/paper/2409.01595","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:4012d0050664f37c79f64496f43aa317d9f6baac8099e40fda9ac76373a1d684","observation_id":"5ae0294a-2efd-4915-874f-05503c61c6a3","resolution":{"observed_at":"2026-08-10T20:23:41.238260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-10T20:23:41.243874Z","title":"Sora: A review on back- ground, technology, limitations, and opportunities of large vision models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.243874Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:efb81dabbac16768abfafe0958335ec54b7884bc1e3dd7d32021ada9de70264d","observation_id":"6933059d-7d9f-4a4d-acfa-8daed6c78319","resolution":{"observed_at":"2026-08-10T20:23:41.243874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12346","last_updated":"2023-03-22T07:10:09Z","snapshot_observed_at":"2026-08-11T12:02:39.988539Z","submitted_at":"2023-03-22T07:10:09Z","title":"NUWA-XL: Diffusion over Diffusion for eXtremely Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12346","snapshot_observed_at":"2026-08-10T20:23:41.249291Z","title":"Nuwa-xl: Diffusion over dif- fusion for extremely long video generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.249291Z"},"links":{"cited_paper":"/paper/2303.12346","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:7e36b9138758a34fbcdc9b0d316745b915b50ddff14c2eb413a8a15512b936ee","observation_id":"8739ab18-7fd0-4818-be72-d880f5617086","resolution":{"observed_at":"2026-08-10T20:23:41.249291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.339201Z","title":"Trip: Temporal residual learning with image noise prior for image-to-video diffusion models,","venue":null,"work_id":"8d18937c-999a-4bea-92d8-2d644209ed73","year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.254119Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:25820c880cef5d2db666674f21a08f83adeb4896e0df05ddbadc5034c7750219","observation_id":"93c28c2b-f510-4270-ab7e-0afb0e787922","resolution":{"observed_at":"2026-08-10T20:23:42.398694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-10T00:51:42.114461Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-10T20:23:41.258890Z","title":"Latent video diffusion models for high-fidelity long video genera- tion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.258890Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:b418799b819eb2deee532f8d70ef40332a91a496fc99e5b1f52b522a0aed6cef","observation_id":"71dd5b71-2eb1-4d9c-b646-7440dc726f38","resolution":{"observed_at":"2026-08-10T20:23:41.258890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.321849Z","title":"Multi-concept customization of text-to-image diffu- sion,","venue":null,"work_id":"5734cead-1afc-431c-8139-29c59b71f87c","year":2023},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.264121Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:606c483729a440e86ea89083e1f45b8ab8a3a1758209865f32667c0049512d57","observation_id":"ce4f4262-4437-4568-b641-e7dc5013a8d3","resolution":{"observed_at":"2026-08-10T20:23:42.328075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05967","last_updated":"2024-07-17T18:38:23Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:59:40Z","title":"Distilling Diffusion Models into Conditional GANs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05967","snapshot_observed_at":"2026-08-10T20:23:41.268741Z","title":"Distill- ing diffusion models into conditional gans,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.268741Z"},"links":{"cited_paper":"/paper/2405.05967","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:50b3b3f1e1f36b9c50d6b2a9f99a88b007892c9e3100fe71a7e253ee592311c6","observation_id":"8ed88b5e-5cc5-43eb-9b1c-cb701fe6c125","resolution":{"observed_at":"2026-08-10T20:23:41.268741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.240397Z","title":"Toward characteristic-preserving image-based virtual try- on network,","venue":null,"work_id":"0f524c18-6c8f-4972-8cce-441554a172b1","year":2018},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.280868Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:9656c182611f8c6fbb73b0b6162f030256cbde5ec5e3b0ca0c95a11cfe8628d9","observation_id":"44fece41-f004-493a-b349-5d3cf8640c70","resolution":{"observed_at":"2026-08-10T20:23:42.302802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.212459Z","title":"High- resolution virtual try-on with misalignment and occlusion- handled conditions,","venue":null,"work_id":"0e53f277-6b1a-4929-9991-b14d8e32c058","year":2022},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.336274Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:86cbb0be52370e28ce0d9c733bad57e5b80b2316125ce85508ba8750efee0a9a","observation_id":"8374b284-19a3-4721-93c4-0c4fc3eb2d0d","resolution":{"observed_at":"2026-08-10T20:23:42.217866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.132273Z","title":"Ladi-vton: Latent diffusion textual- inversion enhanced virtual try-on,","venue":null,"work_id":"d1527c6b-3cf3-4c8a-a172-b31bf7132051","year":2023},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.398737Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:efad8742bb7f46d971266f2e42281ad176d4f4faa0783eaa5dedbfd5254e912f","observation_id":"47c9771c-594a-4c43-a5b4-72d9329e894c","resolution":{"observed_at":"2026-08-10T20:23:42.199086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.112146Z","title":"Tam- ing the power of diffusion models for high-quality virtual try- on with appearance flow,","venue":null,"work_id":"35c1fbf1-240a-4020-982c-6a29af0a25b7","year":2023},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.428921Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:a6ed7a17f561f71d30c8f838a73a33da735a251c3bced11b3ee537ee2a9e044d","observation_id":"8c839f01-dd03-4c51-995b-338fa2e623cc","resolution":{"observed_at":"2026-08-10T20:23:42.118515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.059384Z","title":"Viton-hd: High- resolution virtual try-on via misalignment-aware normaliza- tion,","venue":null,"work_id":"39d7804a-7455-414e-882f-a11aa7b46e42","year":2021},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.435225Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:e55e0ab50472bf9da1137c55762c3889d98a3c62cdc5dc6e620232f11d5bd1cf","observation_id":"5482fa6b-05da-47f6-8a76-a93a23448634","resolution":{"observed_at":"2026-08-10T20:23:42.083295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-10T20:23:41.440256Z","title":"Sam 2: Segment anything in images and videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.440256Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:cdeee3181271aae74caa31d23631f9779b62c8df8c302b59073754d3c3dc9def","observation_id":"647f8ce2-7440-4285-b1af-88ee7cc734b9","resolution":{"observed_at":"2026-08-10T20:23:41.440256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10625","last_updated":"2024-07-15T11:21:03Z","snapshot_observed_at":"2026-08-04T16:35:50.550791Z","submitted_at":"2024-07-15T11:21:03Z","title":"WildVidFit: Video Virtual Try-On in the Wild via Image-Based Controlled Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10625","snapshot_observed_at":"2026-08-10T20:23:41.445965Z","title":"Wild- vidfit: Video virtual try-on in the wild via image-based con- trolled diffusion models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.445965Z"},"links":{"cited_paper":"/paper/2407.10625","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:280b3371a20c18f0d280de7a057fa1e74abf6357c3b29cec70a8fcff12c5d966","observation_id":"433d9b05-bee6-4858-89fc-35278f4053e8","resolution":{"observed_at":"2026-08-10T20:23:41.445965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.030360Z","title":"Cat-dm: Controllable accelerated virtual try-on with diffu- sion model,","venue":null,"work_id":"10e4e376-f7cf-43b9-ae0a-0ac8491bf32a","year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.451757Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:978266ff69b729a0f7a230227e731d747cf26bcd11ab51ab5ab2529486c73d16","observation_id":"0d4582a0-57f0-4dcf-a4bd-20ca3c36c912","resolution":{"observed_at":"2026-08-10T20:23:42.046765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:41.946428Z","title":"Multimodal garment designer: Human- centric latent diffusion models for fashion image editing,","venue":null,"work_id":"3c5d6ff2-3db0-4113-a2d9-32b08e6acf82","year":2023},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.457069Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:1a16d6bedbec4f75e348f765ef7a3731e8e0b201150d0028951b3edad1593057","observation_id":"b8168b2c-a642-422c-8268-9603ad672aff","resolution":{"observed_at":"2026-08-10T20:23:41.966118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:41.929424Z","title":"Paint by example: Exemplar-based image editing with diffusion models,","venue":null,"work_id":"02ce08b6-2981-4a72-928d-0002d37d9e5d","year":2023},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.462209Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:390134f037deaeb0a9c4e10d46a0810659f433dbb0e81db3ba5fdd3f18291c85","observation_id":"ec3d2185-6b87-4195-9aff-73d7949f0f55","resolution":{"observed_at":"2026-08-10T20:23:41.934849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11794","last_updated":"2024-05-28T04:08:09Z","snapshot_observed_at":"2026-07-06T18:16:33.179338Z","submitted_at":"2024-05-20T05:28:22Z","title":"ViViD: Video Virtual Try-on using Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11794","snapshot_observed_at":"2026-08-10T20:23:41.467754Z","title":"Vivid: Video virtual try-on using diffusion models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.467754Z"},"links":{"cited_paper":"/paper/2405.11794","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:e3f299b225443408d7459de3d036a5e22dc710318e84468b040a48cecc7a83c3","observation_id":"814bbeae-7d9b-4220-a198-0a969c59d755","resolution":{"observed_at":"2026-08-10T20:23:41.467754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:41.893126Z","title":"Fresco: Spatial- temporal correspondence for zero-shot video translation,","venue":null,"work_id":"3896f0f1-4509-4459-b2f3-e17ca515b9c8","year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.473455Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:c8174a44842364de3232187b57bbb5a97b875549cb51f0df083e0a1659d33854","observation_id":"fd6e0799-3c37-4d05-a737-8bdc91831b0b","resolution":{"observed_at":"2026-08-10T20:23:41.916071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:41.812531Z","title":"Lvcd: reference-based lineart video colorization with diffusion models,","venue":null,"work_id":"0564aa63-dc47-4985-888b-45b7a81cc546","year":null},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.478486Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:6decda63afe8a7c052c04c0cfb287d0d3198e98c496e3dd40ac2e001ea8c9c09","observation_id":"9c4ea21c-aaf8-448e-ae38-421aefa52545","resolution":{"observed_at":"2026-08-10T20:23:41.819877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:41.761964Z","title":"Detectron2,","venue":null,"work_id":"be4ceb0e-0e2f-4f75-8380-80d88d5bfe6b","year":2019},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.484020Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:a4516e2164bbc6d092e6eec7d6012a11fc5f33dc9c3fe6da7642a5bd7fdede0c","observation_id":"4b5c0654-a605-497c-ab96-a0ab08d6ca5a","resolution":{"observed_at":"2026-08-10T20:23:41.799815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T03:36:42.819929Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 4 inbound Pith citation observations for arXiv:2501.08682."}