{"as_of":"2026-08-08T08:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:70984e8cd1a16b1a66a4b42f51437a187c01f100f5f691daeba9d9451b8e389b","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:19:02.457827Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.00289/citation-record","integrity":"/paper/2508.00289/integrity","json":"/paper/2508.00289/citation-record.json","paper":"/paper/2508.00289"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T10:18:56.826240Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:56.826240Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:7facb25989ed037554b580f35688c00c423d363da987993a4a734b89018792b0","observation_id":"61f32914-3bf4-4ef5-99a5-9ed11e27bdd0","resolution":{"observed_at":"2026-08-06T10:18:56.826240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:18:56.952634Z","title":"Universal guidance for diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:56.952634Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:f44a8e2388e4d6af8d1af14cf381e13d2d74251208db57b6bf63e5787d6f753f","observation_id":"97ff0b24-2483-4afe-b4c9-ff89109da48c","resolution":{"observed_at":"2026-08-06T10:18:56.952634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08587","last_updated":"2022-02-17T11:07:55Z","snapshot_observed_at":"2026-08-05T18:06:18.533236Z","submitted_at":"2022-02-17T11:07:55Z","title":"Gradients without Backpropagation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08587","snapshot_observed_at":"2026-08-06T10:18:57.082183Z","title":"Gradients without backprop- agation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:57.082183Z"},"links":{"cited_paper":"/paper/2202.08587","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:4763fe15376d8b83838e088c70a32c4e4d2647c6c44c04afc640db90371cf376","observation_id":"65cb2da8-1ade-4ef7-9343-8835e291098a","resolution":{"observed_at":"2026-08-06T10:18:57.082183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:11.570992Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"fc6e2b96-cc54-47b1-a4ff-79603136c6f5","year":2020},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:57.192695Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:5c11c7d80e72f069bd8ba5e2e863ef24783b3069ec85f936201ca0b23a03e912","observation_id":"5e741762-9efd-4d2e-9896-cd1944370230","resolution":{"observed_at":"2026-08-06T10:19:11.702942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-06T10:18:57.269811Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:57.269811Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:0f59a576ea058cfc76f66ad84cdfcfc998f8b976993cbd6d8f498f976e4849fd","observation_id":"85c9296b-5c14-4974-a0a9-539afb891a64","resolution":{"observed_at":"2026-08-06T10:18:57.269811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05922","last_updated":"2024-02-29T21:06:58Z","snapshot_observed_at":"2026-07-06T16:30:00.114521Z","submitted_at":"2023-10-09T17:59:53Z","title":"FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05922","snapshot_observed_at":"2026-08-06T10:18:57.439470Z","title":"Flatten: optical flow- guided attention for consistent text-to-video editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:57.439470Z"},"links":{"cited_paper":"/paper/2310.05922","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:f0a8f6504f60c4f02b721544a60b1602e86fa880cf8a49c7e9cf943b9fac35b5","observation_id":"6613ac4e-a0ee-4d69-888d-5f7d6afcd8a9","resolution":{"observed_at":"2026-08-06T10:18:57.439470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:11.282651Z","title":"Tweedie’s formula and selection bias","venue":null,"work_id":"4faf1505-0878-414f-8c5e-e5886648b08e","year":2011},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:57.613325Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:dda89b49c4b9bf4e4d88702f9723d243998c4612a8710450eec5cbb737efc26d","observation_id":"4794412c-6459-41b2-8565-d8ec71da7764","resolution":{"observed_at":"2026-08-06T10:19:11.424128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:11.042369Z","title":"Douceur, Jon Howell, and Jared Saul","venue":null,"work_id":"c8915c04-f4ce-49d4-b7e6-fc9afdb9f1d5","year":2007},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:57.724040Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:5f83256afaa7da2f1676b5092dd81bece372a0895dd5f10db9eb6884c4f3f824","observation_id":"e045067b-375a-4c81-9083-815f84451c25","resolution":{"observed_at":"2026-08-06T10:19:11.166560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:10.691149Z","title":"Can forward gra- dient match backpropagation? In International Conference on Machine Learning, pages 10249–10264","venue":null,"work_id":"ec88cd3c-e58d-4a95-8833-8f4d87005c16","year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:57.821630Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:579abd3910f35b2bc63e2cca87e4fc4a1979a1479ff53ad1478695c7e3cc8391","observation_id":"e1f4623e-a616-43d3-b1b2-ef71f27d9dbc","resolution":{"observed_at":"2026-08-06T10:19:10.878163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:10.424932Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"525648c0-6949-4cd8-b320-9282d0bf544a","year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:57.972339Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:329bf3a3df0d8ca48b111170a4971ac8afbf9b7dc3cf9172aa562209bbffd87f","observation_id":"780e7832-8161-4df9-8f09-8a3602faf2b3","resolution":{"observed_at":"2026-08-06T10:19:10.534267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:10.014025Z","title":"Animatediff: Animate your personalized text-to- image diffusion models without specific tuning","venue":null,"work_id":"4ca7f84c-211a-4992-872d-ca80516d50b2","year":2024},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:58.085809Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:fd6a35130752794ec9b1f7a953df1fe1e985e13b72e433c1411e919d8d2f8e50","observation_id":"353fe7c7-d430-439c-a0c6-2b15c9063727","resolution":{"observed_at":"2026-08-06T10:19:10.212799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:09.694773Z","title":"Manifold preserving guided diffusion","venue":null,"work_id":"646ed645-0324-41ce-84f0-60db5ececdfa","year":2024},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:58.205603Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:15cc8e3b292db769ba95a083a73af33ace382bd8da3c489ce1fbf15b6f5b0721","observation_id":"0c7c502e-e2ee-4244-aa30-ef2f52fa8d91","resolution":{"observed_at":"2026-08-06T10:19:09.868357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:09.395139Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"6999c5b8-cdb7-443a-89df-9d1312a9a157","year":2020},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:58.394471Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:06006411cda59b392d8f0150b42158fae1e1abaffe996e8215dc8e0664290fc6","observation_id":"e5f97f8a-a3fc-42d4-af10-67abb484eccc","resolution":{"observed_at":"2026-08-06T10:19:09.502025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:09.129081Z","title":"Deep learning face attributes in the wild","venue":null,"work_id":"3f505eeb-4a86-4ebc-b11b-73be84c53982","year":2015},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:58.564074Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:a08a1c3abe11a56da056bda23d0f122f1c0eb8f9cd263dbcc8d9e12dcd98758d","observation_id":"ca448dae-a797-4ecf-91a5-667456f374ad","resolution":{"observed_at":"2026-08-06T10:19:09.273484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-08-08T06:35:17.078531Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-06T10:18:58.687765Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equa- tions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:58.687765Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:77e8b728a59559dd5d5eb1e229f450a2f05c5b2275f7b8ddcd31845e972d1a92","observation_id":"109e8f0a-ab82-41a2-97a5-9426a5050ddd","resolution":{"observed_at":"2026-08-06T10:18:58.687765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:18:58.787547Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:58.787547Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:b16ccb09385d27c37b97e7f7f7eafa3a87622fad27aac6d903e9bfffcbce4052","observation_id":"bc306bb7-b91a-4b83-871f-8e77b75dd7e2","resolution":{"observed_at":"2026-08-06T10:18:58.787547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:08.795332Z","title":"Patel, and Tim K","venue":null,"work_id":"8ed3b3be-2111-408b-b1e2-1a2e84d59554","year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:58.894322Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:6bb90bf65d40355f238b79127c232580f1b2886418a14a80029b4b39256d1d81","observation_id":"f701c130-ba86-49e1-8dc5-720392997abb","resolution":{"observed_at":"2026-08-06T10:19:08.928742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:08.500284Z","title":"Steered diffusion: A generalized framework for plug- and-play conditional image synthesis","venue":null,"work_id":"f6229827-44b9-4294-a310-becc81471a47","year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:59.035988Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:2cfb780a75a3ae536867fb582d3692f4be544e433ae948955258a26dac3c06aa","observation_id":"b664519c-6427-4068-9362-0873ec69e3ca","resolution":{"observed_at":"2026-08-06T10:19:08.636474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:08.113483Z","title":"Ditto: Diffusion inference-time t- optimization for music generation","venue":null,"work_id":"1b156a99-1673-4468-856b-ddc1700075cf","year":2024},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:59.138737Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:7e6e6b5958325c9f0bb1822efb9069e6fb1107c2c31c66e33d53cefbdccee6a3","observation_id":"84481e46-f891-4932-a068-bdd3f63dc99d","resolution":{"observed_at":"2026-08-06T10:19:08.310674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:07.824152Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":"13cf78a7-3564-4102-a93b-5db7b16e65cf","year":2017},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:59.271633Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:7e20301fdbc878c69fb53eb2f8f0c7ed9bdd14481a77c969182cf7c1bce95f0e","observation_id":"e8293c18-bbc8-4b46-83b0-03320f0856f9","resolution":{"observed_at":"2026-08-06T10:19:07.937331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:07.554089Z","title":"Styleclip: Text-driven manipulation of stylegan imagery","venue":null,"work_id":"9d44f7ff-406a-4f4b-88b7-cf530af7dbe7","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:59.412916Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:4eb083312ca99fae880e640cdb32ba12a92d971545fc4a2c7ea3a0f8beb2afbd","observation_id":"6f0f0cf5-2519-4903-bfe6-a7ba4f508d54","resolution":{"observed_at":"2026-08-06T10:19:07.673876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03310","last_updated":"2023-03-02T03:08:10Z","snapshot_observed_at":"2026-08-03T21:19:53.943778Z","submitted_at":"2022-10-07T03:52:27Z","title":"Scaling Forward Gradient With Local Losses","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03310","snapshot_observed_at":"2026-08-06T10:18:59.548616Z","title":"Scaling forward gradient with local losses","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:59.548616Z"},"links":{"cited_paper":"/paper/2210.03310","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:153dbb1ff70e747826865aa3777a57f07980b1672c9cb7615b1f7b0510b7d1e7","observation_id":"f431413d-636f-4661-9c85-40a0ccca9d2d","resolution":{"observed_at":"2026-08-06T10:18:59.548616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T10:18:59.650703Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:59.650703Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:5c3edd4345b8eb25a0b8c949508ec14f6dfd4d62caae813b6c6853b99d65a64c","observation_id":"05ce7fb0-539f-4024-a778-1b7e3702cfcc","resolution":{"observed_at":"2026-08-06T10:18:59.650703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:07.278276Z","title":"Loss-guided diffusion models for plug-and-play controllable generation","venue":null,"work_id":"b1b2f1eb-f19c-4f1c-a8b7-eed90aeb0ed6","year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:59.799031Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:5cbf13808a8e46040485880014cf2409775d873d0764f77df7cd2e35cc48f253","observation_id":"5b7dfdf3-f96a-4646-af6a-c4f7a011a005","resolution":{"observed_at":"2026-08-06T10:19:07.430315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-06T10:18:59.912795Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:59.912795Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:b801f576aaf1b679077f40adcf6f2dcbe564112890d221dad42e4cf1cf34043f","observation_id":"d0929762-7452-4243-8153-6d1db2256879","resolution":{"observed_at":"2026-08-06T10:18:59.912795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-06T10:19:00.091556Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:00.091556Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:2c33375f7c2a80a23fed5109bea3d191de75af29cecab63553b13bafde37daf6","observation_id":"ed4047d1-92d2-4b7a-bcc7-8cc58542da2f","resolution":{"observed_at":"2026-08-06T10:19:00.091556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12446","last_updated":"2022-12-22T17:13:50Z","snapshot_observed_at":"2026-08-04T21:56:50.767696Z","submitted_at":"2022-11-22T18:02:49Z","title":"EDICT: Exact Diffusion Inversion via Coupled Transformations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12446","snapshot_observed_at":"2026-08-06T10:19:00.213508Z","title":"Edict: Ex- act diffusion inversion via coupled transformations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:00.213508Z"},"links":{"cited_paper":"/paper/2211.12446","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:b0e93f2e5b481b945d47931c1dac2e410e62a47c34020bf08050ef145f81e8b9","observation_id":"3cc2f208-d7cc-4330-aaea-86349019cc39","resolution":{"observed_at":"2026-08-06T10:19:00.213508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:07.061484Z","title":"End-to-end diffusion latent optimization improves classifier guidance","venue":null,"work_id":"97b95c58-c1d0-4446-8b34-4f7dffeedb18","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:00.336983Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:f66236bf6b83046f7019769a19995396fa462d84c71cf89e941a9317441ae07e","observation_id":"78aa970c-3d51-492f-99c1-2bbb2c9ab251","resolution":{"observed_at":"2026-08-06T10:19:07.137812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:06.622419Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":"d2e8ccf7-de0b-4523-bd1b-62866f918154","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:00.614727Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:84aaf0928ab462565e05dd7cd6d12fb07042df27327863b5b67e42142d16a714","observation_id":"99ed74fa-e27b-4e31-a287-b25c27dc2ee7","resolution":{"observed_at":"2026-08-06T10:19:06.744134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:06.331573Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"ed58322e-1d63-458a-9482-49f76656a083","year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:00.710597Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:79bdcc29444feedac06b98bece23ede826d4fc5ee07b094189bbf690961aa66c","observation_id":"ea998301-69ef-477d-a762-6a86dd3169c6","resolution":{"observed_at":"2026-08-06T10:19:06.458827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:06.052991Z","title":"Cvpr 2023 text guided video editing competition, 2023","venue":null,"work_id":"c2e18bfa-5d07-4185-9dbd-3f6d60506248","year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:00.838968Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:f982dff23fa88e95f35238d3ccd5b0b891c76a990d401f79e82ddf07746ed37b","observation_id":"8bec9df8-22b1-4dad-bf9e-1b9172dcf155","resolution":{"observed_at":"2026-08-06T10:19:06.190487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:05.791295Z","title":"Seeing and hearing: Open-domain visual- audio generation with diffusion latent aligners","venue":null,"work_id":"83244ec1-f7ea-4bde-91d4-da768055b3a0","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:00.953443Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:8c278e9132bbcf72970302241006af37e5be90b6705595346966e33b30c6774b","observation_id":"044e5235-c78a-4483-8093-2f2414993387","resolution":{"observed_at":"2026-08-06T10:19:05.917568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T10:19:01.037098Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:01.037098Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:65fe3531409c79a56da3e821af101d594830e991311ff4ce7cc2cb4d377110ec","observation_id":"25503311-d8e4-4b04-bb5f-b1719b6d39e0","resolution":{"observed_at":"2026-08-06T10:19:01.037098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:05.472445Z","title":"Diverse and aligned audio-to-video genera- tion via text-to-video model adaptation, 2023","venue":null,"work_id":"607c0efc-8383-4cae-9e20-f825ea29828a","year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:01.163520Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:8f7ac8e57064e7a94633cca591c03d714738384dd2c71ff2e5efff63ea5818ee","observation_id":"6167f9db-803e-41b5-8ee3-9628d404505e","resolution":{"observed_at":"2026-08-06T10:19:05.634407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:05.137210Z","title":"Tfg: Unified training-free guidance for diffusion models","venue":null,"work_id":"7c6f5b55-4a08-42a7-a2ce-cc8f3b63b88d","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:01.311418Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:08dc34017c452dc9b5dcc05da590a08fe693e6a54badd0a0ab4a04add5e9418b","observation_id":"7cfc12ab-ee6c-498c-83d7-65717fb6f311","resolution":{"observed_at":"2026-08-06T10:19:05.321040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:04.482725Z","title":"Freedom: Training-free energy-guided condi- tional diffusion model","venue":null,"work_id":"6c5fddff-40b1-438e-be3c-8e4f3c71708b","year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:01.596884Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:a93c07804d06b2286c55b6f2798d68f90eb08c8fb109e324a41ca06f5acc889a","observation_id":"f0c7fe81-8da2-4468-b3eb-380fd05c7921","resolution":{"observed_at":"2026-08-06T10:19:04.670407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:04.194457Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"d025c5a4-0749-4b50-b843-c205c3f5512f","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:01.748117Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:c311ce4794e3371f297cc6d3f60b7026edd60a54e96afe6efb2d257a17213549","observation_id":"536b11ec-c3a9-494b-b212-70f0c23e8c2f","resolution":{"observed_at":"2026-08-06T10:19:04.314085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:03.954286Z","title":"Let f : Rm − →Rn","venue":null,"work_id":"a8063078-22e4-464d-8e79-bfadeb88ff00","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:01.905666Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:7ebb0a1d926a524f4857ec646ed7a48ea31ab90115308fdbba90960781dcb6b2","observation_id":"712f5a20-7764-4359-a4a4-f09137e3f6f0","resolution":{"observed_at":"2026-08-06T10:19:04.092191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:03.648059Z","title":"In all experiments, we em- ploy AnimateDiff [11] with epiCRealism 2 as the base text- to-image model to generate 16 frames 8fps","venue":null,"work_id":"a82ff1b0-e8ab-4efa-90a3-bd82977ac8ec","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:02.041513Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:f3e7ba2c26bc0df64a411f84c752c047b52f74d5aaf2be7bbf8c414ab65835f4","observation_id":"497cee0c-5b7c-429f-bc98-83ce86c2c8f6","resolution":{"observed_at":"2026-08-06T10:19:03.806570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:03.344411Z","title":"A bird in a forest","venue":null,"work_id":"dad877d8-e820-4930-b2b2-680d0cabc298","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:02.169544Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:2b858af2d0e8ae2e535859caa3842d50ccc7c061bb694834f8451570da2a877b","observation_id":"ad2b222c-fb6a-40cc-b1c5-8c00e1f73c1a","resolution":{"observed_at":"2026-08-06T10:19:03.496573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:03.136768Z","title":"However, since our primary focus is text- to-video tasks, we do not explore this aspect in depth but provide evidence of its applicability","venue":null,"work_id":"da163c5c-302b-4292-8fa8-0921ca6ef426","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:02.326749Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:0a95bfeaead860e04d24854fc1bba3d20fa1cb73492dc1c06d521a75b5884b0a","observation_id":"554474bf-cd2d-4e37-87b8-6eb1402f756a","resolution":{"observed_at":"2026-08-06T10:19:03.243478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:02.852659Z","title":"Following [35], for super resolution, and deblurring tasks, we use the CAT-DDPM diffusion model trained on the CAT dataset [8]","venue":null,"work_id":"0a0777b8-790e-463d-9ddf-8d3cef27c4f7","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:02.457827Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:46da1f0e3ff127683c47a6f8943d56e4393c71d4e7eb3ec3f0393d141267e579","observation_id":"9cc8f007-c6f9-46bb-bc68-7ac05ac747c9","resolution":{"observed_at":"2026-08-06T10:19:02.964526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:06.862387Z","title":null,"venue":null,"work_id":"2d09e5d9-70a2-4f8f-88e9-543acd5e0d14","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:00.464586Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:3d9364d54014d43be2068a87f764f6fd9c1cf17d0444740d84f19c62609cec2d","observation_id":"1fa22e79-3b2e-423f-934b-7d712ac44f24","resolution":{"observed_at":"2026-08-06T10:19:06.976010Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:04.806072Z","title":null,"venue":null,"work_id":"27623b79-3648-4667-9387-e7566035ad4f","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:01.475513Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:01ddd3cd2fbf51fe9331860d514e973e679e2838b86f7d19bda16d7792821ad2","observation_id":"f2631690-0718-47f1-babf-55c4a7fb9daf","resolution":{"observed_at":"2026-08-06T10:19:04.970152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:51:13.741961Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":14,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2508.00289."}