{"as_of":"2026-08-09T08:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:95915b1a8f0167cc6cf070e5329a46c7384e7690a7db5790ce15d7b5477c1e56","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:14:34.525958Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:59:34.754260Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T09:31:03.169272Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"cited_work":{"arxiv_id":"2506.08529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08529","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Liftvsr: Lifting image diffusion to video super-resolution via hybrid temporal modeling with only 4×rtx 4090s","venue":null,"work_id":"d3780d81-b8aa-43ab-90bd-0f79c347dc3b","year":2025},"citing_paper":{"arxiv_id":"2604.10551","last_updated":"2026-04-12T09:43:13Z","snapshot_observed_at":"2026-07-31T13:48:07.780101Z","submitted_at":"2026-04-12T09:43:13Z","title":"NTIRE 2026 Challenge on Short-form UGC Video Restoration in the Wild with Generative Models: Datasets, Methods and Results","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T15:59:34.754260Z"},"links":{"cited_paper":"/paper/2506.08529","citing_paper":"/paper/2604.10551"},"observation_digest":"sha256:5aaf4cc38bb07aa968ab3d90b61b098531d38069a20a218f04ae5e0b51da1c4f","observation_id":"9713a6bc-b414-4d03-a6d6-007a2a6dbbe7","resolution":{"observed_at":"2026-05-11T09:31:03.174967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"cited_work":{"arxiv_id":"2506.08529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08529","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Liftvsr: Lifting image diffusion to video super-resolution via hybrid temporal modeling with only 4×rtx 4090s","venue":null,"work_id":"d3780d81-b8aa-43ab-90bd-0f79c347dc3b","year":2025},"citing_paper":{"arxiv_id":"2604.15911","last_updated":"2026-04-17T10:11:39Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:11:39Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","version":1},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:29.706249Z"},"links":{"cited_paper":"/paper/2506.08529","citing_paper":"/paper/2604.15911"},"observation_digest":"sha256:698635464bd0eacedc68913702a69c982b2af6821369fb0a41be58241411e12e","observation_id":"454a408e-0199-4c18-ba13-ae1c39c62372","resolution":{"observed_at":"2026-05-10T09:03:25.623144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08529/citation-record","integrity":"/paper/2506.08529/integrity","json":"/paper/2506.08529/citation-record.json","paper":"/paper/2506.08529"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T05:14:34.244361Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.244361Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:c1f29d2bc108fecd56fd69ee0ec1cc76050a515dca72ad51ae0052c6cc746073","observation_id":"c76ed59d-4ca7-4c08-94e4-21e50292ba13","resolution":{"observed_at":"2026-08-07T05:14:34.244361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06847","last_updated":"2023-07-04T15:30:58Z","snapshot_observed_at":"2026-08-04T07:10:33.535606Z","submitted_at":"2021-06-12T20:00:32Z","title":"Video Super-Resolution Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06847","snapshot_observed_at":"2026-08-07T05:14:34.249123Z","title":"Video super-resolution transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.249123Z"},"links":{"cited_paper":"/paper/2106.06847","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:4a59c5061753c3e14d2df4f0f51af4e1d6dc276217d0ea48fdaf0baa1d937376","observation_id":"4b789f84-6495-496a-ba69-ea7a934f7bd0","resolution":{"observed_at":"2026-08-07T05:14:34.249123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.340635Z","title":"Basicvsr: The search for essential components in video super-resolution and beyond","venue":null,"work_id":"7becfb49-202f-439a-bd1e-0b0462be3bae","year":2021},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.254370Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:70b25571a289d408dd8fa8379d2306531ce1d15b08e29f47854969b583411198","observation_id":"8c95482c-fc2f-48ef-be1f-61c02689399b","resolution":{"observed_at":"2026-08-07T05:14:35.344606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.328784Z","title":"Basicvsr++: Improv- ing video super-resolution with enhanced propagation and alignment","venue":null,"work_id":"fc88d78a-300b-499f-9303-916a6443385b","year":2022},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.258261Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:5d6b0dabb6e3781b62ffb7b530cc49292d1ce153d84fb980cbd26c7aa0a93463","observation_id":"804337dc-0e2c-4147-8d75-9cd22c0b28f5","resolution":{"observed_at":"2026-08-07T05:14:35.332558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.318328Z","title":"Investigating tradeoffs in real-world video super-resolution","venue":null,"work_id":"58a0cd7b-3ab3-4ff9-87f1-6213b7c6c9ad","year":2022},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.262754Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:084250b9a84a6a91fe3290a1f3c86e8fb987cb1135c9e8c51508a502aae2ed2a","observation_id":"799dfc8e-41ba-4b79-8614-fbf183f98de0","resolution":{"observed_at":"2026-08-07T05:14:35.322084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.266889Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion.Advances in Neural Information Processing Systems, 37:24081–24125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.266889Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:32a34eebf364e09e1e99e29e19931e0a186690d03e53c461f1694f125f6fc572","observation_id":"9e4a3ce7-5754-41c4-82a7-c6d273d83471","resolution":{"observed_at":"2026-08-07T05:14:34.266889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05252","last_updated":"2024-01-10T16:27:38Z","snapshot_observed_at":"2026-08-07T04:04:46.527670Z","submitted_at":"2024-01-10T16:27:38Z","title":"PIXART-{\\delta}: Fast and Controllable Image Generation with Latent Consistency Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05252","snapshot_observed_at":"2026-08-07T05:14:34.271509Z","title":"Pixart- δ: Fast and controllable image generation with latent consistency models.arXiv preprint arXiv:2401.05252, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.271509Z"},"links":{"cited_paper":"/paper/2401.05252","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:ef7a38769fef8ed262b8b47d0c4e263f28063a25d8a6843ae7158ee997a1df05","observation_id":"5b5d6997-33e8-4582-9c22-d54a6034dc19","resolution":{"observed_at":"2026-08-07T05:14:34.271509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T05:14:34.275537Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.275537Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:5d947cf82aa428b2ed0ebdb9f2b4ddceac6b3dabcf57c30cc0fe8c780b878531","observation_id":"9868468e-6fe0-42f7-9126-e1e766ca8e77","resolution":{"observed_at":"2026-08-07T05:14:34.275537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05922","last_updated":"2024-02-29T21:06:58Z","snapshot_observed_at":"2026-07-06T16:30:00.114521Z","submitted_at":"2023-10-09T17:59:53Z","title":"FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05922","snapshot_observed_at":"2026-08-07T05:14:34.279736Z","title":"Flatten: optical flow-guided attention for consistent text-to-video editing.arXiv preprint arXiv:2310.05922, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.279736Z"},"links":{"cited_paper":"/paper/2310.05922","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:332c2ed77f35c44f821b1f133ccace6920caaa211c004d3ec5497006d9488101","observation_id":"a5a06b3d-4e3a-4fd6-ae6d-5f3294dad8c4","resolution":{"observed_at":"2026-08-07T05:14:34.279736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.283519Z","title":"Deformable convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.283519Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:48f667166bb6518dc849401086cea2a46de229bd74f9cc52db5ce559e1389814","observation_id":"6ded8fce-5149-4939-815e-f27e5a586714","resolution":{"observed_at":"2026-08-07T05:14:34.283519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-07T05:14:34.287017Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning.arXiv preprint arXiv:2307.04725, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.287017Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:4788aa6d1b5870cf6e66067750bd85a625a8279344e4375d8ddcbb169fb97596","observation_id":"53c0e1c3-0820-4e92-b4a5-9139fe07311f","resolution":{"observed_at":"2026-08-07T05:14:34.287017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07667","last_updated":"2024-07-10T13:46:08Z","snapshot_observed_at":"2026-08-07T00:56:39.117883Z","submitted_at":"2024-07-10T13:46:08Z","title":"VEnhancer: Generative Space-Time Enhancement for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07667","snapshot_observed_at":"2026-08-07T05:14:34.291389Z","title":"Venhancer: Generative space-time enhancement for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.291389Z"},"links":{"cited_paper":"/paper/2407.07667","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:9608ae433b6fda3b926e52f9aadd622b58351e1984e5b5cac7bca3477820af37","observation_id":"382341be-928a-49ef-8c2e-c78819859806","resolution":{"observed_at":"2026-08-07T05:14:34.291389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-07T05:14:34.295772Z","title":"Prompt-to-prompt image editing with cross attention control.arXiv preprint arXiv:2208.01626, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.295772Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:d9eee2fd85f398bd1d7e19f06b3ccd5a6e9622a63ec498d57cf06792a9cecbb7","observation_id":"10dfdbe4-914e-4e83-bdfa-66ee0c1d1ef9","resolution":{"observed_at":"2026-08-07T05:14:34.295772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.300472Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.300472Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:8159ce4fe22ef80a3a0daeef19c3078be5c9510ca42efb193fdb8c5c93c3a32f","observation_id":"2eb57c28-37b9-423b-a8b8-98ac69f18f88","resolution":{"observed_at":"2026-08-07T05:14:34.300472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.304183Z","title":"Video diffusion models.Advances in Neural Information Processing Systems, 35:8633–8646, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.304183Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:242bff963f2eb8e551e0b180a82a163de091b41eafdfb3d3d78e853da9fad579","observation_id":"5756e8d8-336b-4dd9-8513-23772704fd55","resolution":{"observed_at":"2026-08-07T05:14:34.304183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.282909Z","title":"Video super-resolution via bidirectional recurrent convolutional networks.IEEE transactions on pattern analysis and machine intelligence, 40(4):1015–1028, 2017","venue":null,"work_id":"6ccd5ece-285c-4e72-ab8f-fe55a78e78af","year":2017},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.309012Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:f2f458628c1bd8085269f531e187af6348debc650e429f5cca7609874f41058b","observation_id":"fae20e88-139c-4d5e-b6c6-cfec856fef5f","resolution":{"observed_at":"2026-08-07T05:14:35.286916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.271549Z","title":"Video super- resolution with recurrent structure-detail network","venue":null,"work_id":"db0f5491-9196-41d6-8d12-4e00f66b6d40","year":2020},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.313488Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:618d2be65268ab53916af4e482417396c6b4ff549e591fc795b50646608a3e21","observation_id":"2093db6e-655d-4ebc-a7df-a4bb0e4deee7","resolution":{"observed_at":"2026-08-07T05:14:35.275330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.260329Z","title":"Deep video super-resolution network using dynamic upsampling filters without explicit motion compensation","venue":null,"work_id":"f95d6907-b327-42a0-8bdf-56467fa15f6c","year":2018},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.316868Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:5b5b4f515b2548ca2545756a89813dc00f6f3b6353d56fd50ef438190ef50e5b","observation_id":"e78d8ce5-7349-4ee2-8ce2-37f332e66c19","resolution":{"observed_at":"2026-08-07T05:14:35.264523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.320650Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.320650Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:7a386f6474099c777b6e88d19913a4821084382b505851740d4986f56cb2307b","observation_id":"de0bf5f4-bc12-47f1-97e2-b6c809f586a7","resolution":{"observed_at":"2026-08-07T05:14:34.320650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.324620Z","title":"Imagic: Text-based real image editing with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.324620Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:980a2a13c81da27533f0d35a139989d6e6846c80a9c0b56dea0adce5561d28ea","observation_id":"82e40795-7f73-4e93-9a02-dd8e95604632","resolution":{"observed_at":"2026-08-07T05:14:34.324620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.328458Z","title":"Musiq: Multi-scale image quality transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.328458Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:de196699e90ca0cfb552b876e8b3c92210a34d35a6d7b4757e9feaeb4870afd7","observation_id":"91e51ae7-42a4-4d33-ab00-5b6a8f799de5","resolution":{"observed_at":"2026-08-07T05:14:34.328458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.230503Z","title":"Mucan: Multi-correspondence aggregation network for video super-resolution","venue":null,"work_id":"eca1b5b9-da26-4eda-bcbf-1e924dc70cd3","year":2020},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.331830Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:de134b7ff9f00fcf46f9aa9e7874feceb8784b7ab12963e00af60a677533c86a","observation_id":"8dac9286-8ebd-45b3-92a4-10a51b942ccd","resolution":{"observed_at":"2026-08-07T05:14:35.234619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10110","last_updated":"2025-03-08T08:15:43Z","snapshot_observed_at":"2026-07-06T20:22:23.609336Z","submitted_at":"2025-01-17T10:53:03Z","title":"DiffVSR: Revealing an Effective Recipe for Taming Robust Video Super-Resolution Against Complex Degradations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10110","snapshot_observed_at":"2026-08-07T05:14:34.335250Z","title":"Diffvsr: Enhancing real-world video super-resolution with diffusion models for advanced visual quality and temporal consistency.arXiv preprint arXiv:2501.10110, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.335250Z"},"links":{"cited_paper":"/paper/2501.10110","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:a80c0a23fb89058386d695592c3243df2dce77dfce43f8cd72a0d9bb53d3de1e","observation_id":"df1b1c42-9b8b-42c2-b6b6-04fc4fcd5c65","resolution":{"observed_at":"2026-08-07T05:14:34.335250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.339139Z","title":"Lsdir: A large scale dataset for image restoration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.339139Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:fbe91121786fd35494c5ce528b343e110f07481b0b3691a050dd4c3f8ac38960","observation_id":"bc9caeaa-f1e0-4125-8d50-c5bcfd47b2a7","resolution":{"observed_at":"2026-08-07T05:14:34.339139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.213245Z","title":"Vrt: A video restoration transformer.IEEE Transactions on Image Processing, 2024","venue":null,"work_id":"ebf83047-771d-460e-b55f-3d555ae7c3c1","year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.343476Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:8946536e3e1f9726463fa6d1fb4fb5a0989c8fd55fa87ceedac096fd964f5458","observation_id":"fb9724d2-1ac1-4eeb-8aab-9c74218e3147","resolution":{"observed_at":"2026-08-07T05:14:35.217089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.201308Z","title":"Recurrent video restoration transformer with guided deformable attention.Advances in Neural Information Processing Systems, 35:378–393, 2022","venue":null,"work_id":"73126e6c-0b14-474c-ad20-c8f8ad68b5a4","year":2022},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.346812Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:aadb68bf5405e641ce73c1b0fd2844b9f61a6d2dfb0a799dc5cf67d6ac95e4be","observation_id":"da59c639-71d2-421a-b2e7-cd1b37b03231","resolution":{"observed_at":"2026-08-07T05:14:35.205218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.351185Z","title":"Enhanced deep residual networks for single image super-resolution","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.351185Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:3be29e9c2e6bf8b8e376db94fae699510326bc87641e7f8548fa98a6981c382d","observation_id":"565ee97e-c92a-401f-b3d1-48d9bb6094ec","resolution":{"observed_at":"2026-08-07T05:14:34.351185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.354493Z","title":"Diffbir: Toward blind image restoration with generative diffusion prior","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.354493Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:3da7ffe87ba06d5bf526cb5d53b3b0e4d00add25ad49c0b832bcf629c34e7875","observation_id":"4a664250-3e2e-47de-9f2b-0715b7d23974","resolution":{"observed_at":"2026-08-07T05:14:34.354493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.177832Z","title":"Learning trajectory-aware trans- former for video super-resolution","venue":null,"work_id":"b9343c27-46a8-4925-8d2a-87db92969aa5","year":2022},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.358493Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:368cf4a6a7492d21301bd51cca4a656b823a61ac65224af0dafa8d387771f454","observation_id":"3e8af4c4-b5de-45b2-acfc-b125f3857a79","resolution":{"observed_at":"2026-08-07T05:14:35.181706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.362080Z","title":"Video-p2p: Video editing with cross-attention control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.362080Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:a8388a666d6855d1e7bdddb35d7c4564616c780a5f9e9b92617283e4133c6dc0","observation_id":"914ca01e-15d3-4a11-9c66-4e53c29c46cc","resolution":{"observed_at":"2026-08-07T05:14:34.362080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.365334Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.365334Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:656247580ecfa4228a9192257ac35b58e7a83385527cfd5e16ec5e5f85852d7d","observation_id":"63adb5fa-a844-40ef-8c03-f06533a2e996","resolution":{"observed_at":"2026-08-07T05:14:34.365334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.369644Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps.Advances in Neural Information Processing Systems, 35:5775–5787, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.369644Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:c8cba0bc4ca2a167ee92f39be78e0f9ef126f7fb1618812661ded745fd256bfc","observation_id":"41342b3f-8813-476b-b273-718352b73270","resolution":{"observed_at":"2026-08-07T05:14:34.369644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-07T05:14:34.373824Z","title":"Latte: Latent diffusion transformer for video generation.arXiv preprint arXiv:2401.03048, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.373824Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:9abe4f29763497e3a4d07fec7386690045a55fb8036a080d9c8d91970010220f","observation_id":"ee6ea7ef-32eb-4116-86f7-d130725692c3","resolution":{"observed_at":"2026-08-07T05:14:34.373824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.149206Z","title":"Ntire 2019 challenge on video deblurring and super-resolution: Dataset and study","venue":null,"work_id":"f11fbfe1-2aa6-489b-8b72-1f9fdeb182b3","year":2019},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.378094Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:a64d813bfe9169a0857f7e854c9ed96307593d3068bac5eff6af7113acc48242","observation_id":"fd35daac-9868-4cdf-af26-bab68133503b","resolution":{"observed_at":"2026-08-07T05:14:35.152991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-07T05:14:34.381705Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.381705Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:2ff06063ffbcb17b6fa489875274871f45e430b89072bb588e347517c57e8882","observation_id":"3e16e134-656c-432e-bda3-539eba90c7d5","resolution":{"observed_at":"2026-08-07T05:14:34.381705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.385740Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.385740Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:563db5bd15ccae14a1ba8868eec8c85bad8a3e3b23b8a67adb9fea1cfa7a0716","observation_id":"719aff2d-39a8-4622-9457-939439580efe","resolution":{"observed_at":"2026-08-07T05:14:34.385740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.389674Z","title":"Fatezero: Fusing attentions for zero-shot text-based video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.389674Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:5118eb96fc43ef089e6bf7cf7a9f9597116287b560e52e4d737bf02130c23837","observation_id":"d77ebd67-cb59-4c52-9bf5-82dfeb0e93d8","resolution":{"observed_at":"2026-08-07T05:14:34.389674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.393207Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.393207Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:f6ad306b8cae6108ce3cecb4aa511534c10ce33ba1681253c04eb2aa541380ce","observation_id":"885da697-5666-45e0-bc15-e26172ce5c7d","resolution":{"observed_at":"2026-08-07T05:14:34.393207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.117876Z","title":"Frame-recurrent video super- resolution","venue":null,"work_id":"9fbc8c02-0a2f-467b-b800-951287387213","year":2018},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.397393Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:0264cd8aaf0eecb38dbc75e8eaf307f0d81d3b2798553d4a82cd261b60303c64","observation_id":"61376603-961d-476b-814e-082895cef0c6","resolution":{"observed_at":"2026-08-07T05:14:35.122310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T05:14:34.401516Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.401516Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:b5da54be69fe2073fd4b6ec6ab930b623dc4394aa6fb97eff1fe04cbd008267f","observation_id":"7a65a4ff-1df3-4ed1-bcd3-2e5b5d276809","resolution":{"observed_at":"2026-08-07T05:14:34.401516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.405534Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.405534Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:da0c51385af987c0ade846815c9c422495f5b7289b89b3ab601dad1f56e6d32d","observation_id":"bbba172e-7e5b-457b-84cc-394ebf6a2d43","resolution":{"observed_at":"2026-08-07T05:14:34.405534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.099127Z","title":"Detail-revealing deep video super-resolution","venue":null,"work_id":"9b255b52-ff8d-4b23-bf2c-9d086b74313f","year":2017},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.409902Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:8c6597ade31e7c095c72ab7b7ce4fc7082d94351e5dbb9936ef260fa48ee932a","observation_id":"98c59845-36e7-448f-994c-c7ef6cbaa8a8","resolution":{"observed_at":"2026-08-07T05:14:35.103685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.087391Z","title":"Tdan: Temporally-deformable alignment network for video super-resolution","venue":null,"work_id":"3a1c776c-072c-4a52-b278-6350c0806619","year":2020},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.413955Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:b3f2b19fc0104c20dd2f9376835d00496b5d36e1d2e41d5b1ea1087deba7f73b","observation_id":"16070d1c-b154-43d7-9783-06896cae23f1","resolution":{"observed_at":"2026-08-07T05:14:35.091233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.417751Z","title":"Ntire 2017 challenge on single image super-resolution: Methods and results","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.417751Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:f44dca1080a4e24238d64f9006fe72a144e5c24ba7b9bc2b26773c395ca5f4dc","observation_id":"aebf7027-e6f0-400e-9327-79fdc8ac8280","resolution":{"observed_at":"2026-08-07T05:14:34.417751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.067912Z","title":"Deformable non-local network for video super-resolution.IEEE Access, 7:177734–177744, 2019","venue":null,"work_id":"58b0cec2-c778-4e4e-9896-9c7068f36c3c","year":2019},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.422328Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:68f8f105092632e81d1641bb0426104874c28a32806e5ecf2da119644285143d","observation_id":"8b81ab2a-3e5d-40f6-8a1c-1dfc32601a09","resolution":{"observed_at":"2026-08-07T05:14:35.072693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.426245Z","title":"Exploring clip for assessing the look and feel of images","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.426245Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:5bed7b24f61e26e569f72737f65e2d66ffd0f1fcfe41c551b06f6439c29100d4","observation_id":"34240715-ac62-48f9-a9da-f908de70d521","resolution":{"observed_at":"2026-08-07T05:14:34.426245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01320","last_updated":"2025-03-22T07:44:02Z","snapshot_observed_at":"2026-07-06T20:15:49.954077Z","submitted_at":"2025-01-02T16:19:48Z","title":"SeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video Restoration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01320","snapshot_observed_at":"2026-08-07T05:14:34.430493Z","title":"Seedvr: Seeding infinity in diffusion transformer towards generic video restoration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.430493Z"},"links":{"cited_paper":"/paper/2501.01320","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:0b2772a10178dd4c1594cfa256e2a05e3b557279a59cf14fe0327faa63b34c90","observation_id":"75eb13e1-e828-4652-8794-2ee5303f3f75","resolution":{"observed_at":"2026-08-07T05:14:34.430493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.434921Z","title":"Exploiting diffusion prior for real-world image super-resolution.International Journal of Computer Vision, 132(12):5929–5949, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.434921Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:5b6335e75a4b08822fce7e59b5a84b303c6d75f406fc7ef3aad46037bb5f61cf","observation_id":"3f35847c-4f91-4691-a373-dc76af9b4120","resolution":{"observed_at":"2026-08-07T05:14:34.434921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.439340Z","title":"Edvr: Video restoration with enhanced deformable convolutional networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.439340Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:e073118b81c85a0d37e48f672639c8f15dd7fee1c9ad668cce3fd73c24d07738","observation_id":"30305726-bf7f-47da-8dd3-10c069bc9d17","resolution":{"observed_at":"2026-08-07T05:14:34.439340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.443341Z","title":"Real-esrgan: Training real-world blind super-resolution with pure synthetic data","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.443341Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:c1e92cef76d2ff00f1c91108620be3b825d7f253a8859b2cab45178ba6989392","observation_id":"379338ea-fdca-4d57-9896-6a499c3f6b30","resolution":{"observed_at":"2026-08-07T05:14:34.443341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.447814Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.447814Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:b2d54370d04a5114355850876c11b8023ae5dec76da8f4c35bccffdb94d7ac0b","observation_id":"97904ae3-6ba1-4064-ac93-4eeaa036d09e","resolution":{"observed_at":"2026-08-07T05:14:34.447814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.025411Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"b6657d3c-5d96-4444-8922-fad734d592f1","year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.451910Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:447ba36c30d206b546888c891001cb80768fddb65211654507b573c8b61f2207","observation_id":"6b9d2e34-1655-4e09-ab85-730707ef5d52","resolution":{"observed_at":"2026-08-07T05:14:35.028989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.014209Z","title":"One-step effective diffusion network for real-world image super-resolution.Advances in Neural Information Processing Systems, 37:92529–92553, 2024","venue":null,"work_id":"dc4fb838-143d-4f99-ac23-d5687aaf5696","year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.456528Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:22559c4b2d600f7d65a40d9bc3b59e63c80e1dff3feca7e678c24056f2fd8b2a","observation_id":"81f99a4d-23d4-4305-93e9-60ef314c29f8","resolution":{"observed_at":"2026-08-07T05:14:35.018151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.002700Z","title":"Animesr: Learning real-world super- resolution models for animation videos.Advances in Neural Information Processing Systems, 35:11241–11252, 2022","venue":null,"work_id":"02d8b350-435c-4e63-a3c5-550aa62da4a3","year":2022},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.461000Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:361056602555fb0cfe47caacbd71397f36162a0fedf648c60c4014f42a3b2b4b","observation_id":"d7904011-d320-47d4-917f-17094510024e","resolution":{"observed_at":"2026-08-07T05:14:35.007343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.990804Z","title":"Diffir: Efficient diffusion model for image restoration","venue":null,"work_id":"6164a62a-0384-43d2-85d9-f4d089aa22a1","year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.465435Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:ac02f4bd883a5f5fc19c863178d10411a284eaa42c97df8f99cfb1939e70bd05","observation_id":"0cfed318-eeba-4040-9bfd-e3265328673a","resolution":{"observed_at":"2026-08-07T05:14:34.995322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02976","last_updated":"2025-01-06T12:36:21Z","snapshot_observed_at":"2026-07-06T20:17:02.560950Z","submitted_at":"2025-01-06T12:36:21Z","title":"STAR: Spatial-Temporal Augmentation with Text-to-Video Models for Real-World Video Super-Resolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02976","snapshot_observed_at":"2026-08-07T05:14:34.469795Z","title":"Star: Spatial-temporal augmentation with text-to-video models for real-world video super-resolution.arXiv preprint arXiv:2501.02976, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.469795Z"},"links":{"cited_paper":"/paper/2501.02976","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:5e6978bb3297104e3d9374b36101a5cff9e41819ca5bdd24c05477210dab4630","observation_id":"8ae9a46f-81e3-4b1a-9ef3-e620afd1251a","resolution":{"observed_at":"2026-08-07T05:14:34.469795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.474576Z","title":"Easyanimate: A high-performance long video generation method based on transformer architecture.arXiv preprint arXiv:2405.18991, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.474576Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:7d8076fec1cb9f6e024814fab2e01c4e4fc94ecb61f8cc07c3e082db458bea57","observation_id":"6340dd44-c98f-475b-946c-b10c7a0198d9","resolution":{"observed_at":"2026-08-07T05:14:34.474576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.979975Z","title":"Video enhancement with task-oriented flow.International Journal of Computer Vision, 127:1106–1125, 2019","venue":null,"work_id":"9cd92cc9-2ec7-457d-bfd4-c70826ee2683","year":2019},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.479115Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:0cf70eac348a089992df56424d1544389d5a879a9df2cde6078904d8812262cc","observation_id":"ad0fe9b3-eb28-4481-8801-ca1c23dbec34","resolution":{"observed_at":"2026-08-07T05:14:34.983828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.484538Z","title":"Rerender a video: Zero-shot text-guided video-to-video translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.484538Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:7f96bbcbd81b7f2d844b70b7161f7674195a1ff5a519ea198cc3b4d71808406c","observation_id":"947f9ff3-08c7-47b5-b5f8-3ff2d7f8fee7","resolution":{"observed_at":"2026-08-07T05:14:34.484538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.961345Z","title":"Motion-guided latent diffusion for temporally consistent real-world video super-resolution","venue":null,"work_id":"598118d7-6ed9-4dd2-b285-b9ef616ac596","year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.488794Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:f2c08e2b040027ba0ddfe2046fd598a75940fb4a7f64f5f988a434561035af7b","observation_id":"eee86b28-8378-407b-9700-76c5cd6a6fac","resolution":{"observed_at":"2026-08-07T05:14:34.965606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T05:14:34.493215Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.493215Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:c233c699655b21c154915c227d406797c975dd5395b9f6a95f32cd06606f0bc5","observation_id":"c71a0c62-3945-4d7a-ae0f-353f56984755","resolution":{"observed_at":"2026-08-07T05:14:34.493215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.948932Z","title":"Progressive fusion video super-resolution network via exploiting non-local spatio-temporal correlations","venue":null,"work_id":"ca854bfc-cc3d-41ca-b084-fbf7dc54f49a","year":2019},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.498183Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:b7b2be3177fa72741c750146a55f1fe31aa64580a249cce9a3e0644497270208","observation_id":"c2b05cf7-0b8e-4c8d-b715-44a78c224fc4","resolution":{"observed_at":"2026-08-07T05:14:34.953597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.935932Z","title":"A feature-enriched completely blind image quality evaluator.IEEE Transactions on Image Processing, 24(8):2579–2591, 2015","venue":null,"work_id":"a60e3724-8892-4213-adab-c0163beb96be","year":2015},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.502843Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:c86b5748662b45c3d282b007c2763886d70336b612dab0f0e653f6ba6ef32298","observation_id":"613710f8-2784-4f20-934c-6f27193c8315","resolution":{"observed_at":"2026-08-07T05:14:34.940622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.507372Z","title":"The unrea- sonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.507372Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:5cc1eefef0c6703091d7e8e2c3fb76def02d9c5ee3860d98eda2d74543015189","observation_id":"b9b54d82-a0a0-47c1-af32-6ff45a3a5c9d","resolution":{"observed_at":"2026-08-07T05:14:34.507372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.918194Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models","venue":null,"work_id":"e277ca80-73d3-4583-b3ef-8b543d49cee0","year":null},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.511849Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:94b4a9c12eb5d309189766e31acc3e6e1c49a0d854b93233f2f36e68fa04b7e1","observation_id":"7b12eaa6-c816-467d-b5b6-fc971eb143f8","resolution":{"observed_at":"2026-08-07T05:14:34.922215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.906693Z","title":"Realviformer: Investigating attention for real-world video super-resolution","venue":null,"work_id":"f8798eb3-c9ea-43c1-a113-2054f2fb85c5","year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.516682Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:bafb94823e344c0dabe7d0313f215641cd5698b109ea134d3bee21fea3ece580","observation_id":"20aa31d7-4751-42be-8f9e-6b44a38f1ffb","resolution":{"observed_at":"2026-08-07T05:14:34.910598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.893517Z","title":"Upscale- a-video: Temporal-consistent diffusion model for real-world video super-resolution","venue":null,"work_id":"b0acf46a-43c6-412d-b19b-7fdf728fa3ac","year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.521194Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:0752d4a3441b2d3c57a40a0da45af51487e7a0f5b864fbacf04399bb81debb5b","observation_id":"ac740761-24b5-49e1-b7a9-b174762e11c6","resolution":{"observed_at":"2026-08-07T05:14:34.898930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-07-06T10:02:45.105181Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-07T05:14:34.525958Z","title":"Deformable detr: Deformable transformers for end-to-end object detection.arXiv preprint arXiv:2010.04159, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.525958Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:f3e09632b8205f5bdd60d83a0da66c25409cf53f02bbbd2de6c126315da74bac","observation_id":"8253209a-f15b-4109-8aa9-f62985b08e33","resolution":{"observed_at":"2026-08-07T05:14:34.525958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:18:30.945693Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 2 inbound Pith citation observations for arXiv:2506.08529."}