{"as_of":"2026-08-11T09:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1841deaa7e3c0310b8968e91814020208cb47f31560537ec8a62d854cd7e32f8","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:02:43.468347Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T08:06:27.191812Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-29T08:13:15.767173Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"cited_work":{"arxiv_id":"2601.12066","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.12066","snapshot_observed_at":"2026-06-29T08:13:15.767173Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","venue":"cs.CV","work_id":"e406cc2b-faf1-49cf-b9b3-82452b90c154","year":2026},"citing_paper":{"arxiv_id":"2605.30045","last_updated":"2026-05-28T14:58:36Z","snapshot_observed_at":"2026-08-02T08:49:19.518638Z","submitted_at":"2026-05-28T14:58:36Z","title":"GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T08:06:27.191812Z"},"links":{"cited_paper":"/paper/2601.12066","citing_paper":"/paper/2605.30045"},"observation_digest":"sha256:af31861b8b161f1adac32c41eb52cb8835c0085ee8144d7801c3b483e9790430","observation_id":"f64a1b89-4da8-42f6-a0ea-bdfd74fdcf4a","resolution":{"observed_at":"2026-06-29T08:13:15.768386Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2601.12066/citation-record","integrity":"/paper/2601.12066/integrity","json":"/paper/2601.12066/citation-record.json","paper":"/paper/2601.12066"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T10:02:41.439147Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:41.439147Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:342f2d8ed01be7e19dbbdb7873ecdccf095db70fab0e4bcd0f6ae3627918c437","observation_id":"a88afd3c-6177-48e4-b014-ff3f90b51277","resolution":{"observed_at":"2026-08-03T10:02:41.439147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:02:42.145678Z","title":"In practical implementation, time-dependent coefficients (e.g., ¯αtor at, bt, ct) are typically precomputed and retrieved from a schedule table for computational efficiency","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:42.145678Z"},"links":{"citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:90b505ac9a30754fd6945527bea5379152217cdf9b3f8bfeb5c709e5a502604c","observation_id":"0b52cd02-cc22-4f9b-a9ed-bc3518c2ab40","resolution":{"observed_at":"2026-08-03T10:02:42.145678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-03T10:02:41.603223Z","title":"T., Ben-Hamu, H., Nickel, M., and Le, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:41.603223Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:2c66000e2882a7da16c3f7df8d06ab7d8d0cdd1f5f6462262b7c1402b699d6af","observation_id":"c406866d-1284-4a7b-a86b-9645b0d3d4cc","resolution":{"observed_at":"2026-08-03T10:02:41.603223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-03T10:02:41.684396Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:41.684396Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:55f142914f7a5a9824006218860a1523cf9d80b58f4c2a2eb41f6df2aa28fe39","observation_id":"9928931d-e477-4e1c-b8f7-91fecd1c2415","resolution":{"observed_at":"2026-08-03T10:02:41.684396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14589","last_updated":"2023-12-22T10:26:31Z","snapshot_observed_at":"2026-08-07T06:33:09.230185Z","submitted_at":"2023-12-22T10:26:31Z","title":"Non-Denoising Forward-Time Diffusions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14589","snapshot_observed_at":"2026-08-03T10:02:41.766710Z","title":"Non-denoising forward-time diffusions.arXiv preprint arXiv:2312.14589,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:41.766710Z"},"links":{"cited_paper":"/paper/2312.14589","citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:9d4f751f0b71ab0ebd040ebba904a983855dfb36bd383f7f554014a508088ef2","observation_id":"558e4ea7-882e-4bd0-a77e-b0e3eef68885","resolution":{"observed_at":"2026-08-03T10:02:41.766710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-03T10:02:41.907536Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:41.907536Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:890a5bbef7c4066d423f870e910348182dd3f067c8a1382c1574fde91124df8f","observation_id":"fe81f6bd-7389-4280-8ea1-36a7c090f41a","resolution":{"observed_at":"2026-08-03T10:02:41.907536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T10:02:41.984057Z","title":"Qwen3 Tech- nical Report.arXiv preprint arXiv:2505.09388, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:41.984057Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:fe8009e49d45a4cbac60b3ecb0ca2d933e765b0bcc769e6826459316407c4f7f","observation_id":"d96ea9c5-c2d3-4698-9df0-993545473e18","resolution":{"observed_at":"2026-08-03T10:02:41.984057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24873","last_updated":"2025-05-30T17:59:45Z","snapshot_observed_at":"2026-08-09T19:41:31.193880Z","submitted_at":"2025-05-30T17:59:45Z","title":"MiniMax-Remover: Taming Bad Noise Helps Video Object Removal","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24873","snapshot_observed_at":"2026-08-03T10:02:42.036296Z","title":"Denoising diffusion bridge models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:42.036296Z"},"links":{"cited_paper":"/paper/2505.24873","citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:0b66f058ffac784b6531496c038e47ab87078e3252070ae1fbc96a2c53e8c510","observation_id":"d2be03b6-092d-4af4-8837-256f21d96f04","resolution":{"observed_at":"2026-08-03T10:02:42.036296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:02:42.118215Z","title":"Pseudo Code for the Training and inference of BridgeRemoval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:42.118215Z"},"links":{"citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:ce1e7df8e21a225e27660d8fe54fe069757a03d1661732d370957f2d34b76494","observation_id":"856165b0-3c75-4333-8c40-d7c2b9d22af6","resolution":{"observed_at":"2026-08-03T10:02:42.118215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:02:42.218330Z","title":"(18) Assuming the underlying process is a VP-SDE with Gaussian transition kernels: p(zt|z0) =N(z t;α tz0, σ2 t I), p(zT |zt) =N zT ; αT αt zt, σ2 T − α2 T α2 t σ2 t I","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:42.218330Z"},"links":{"citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:5893be731b48c3320fce0f9d6615e7e622975b2c2acaa71805b30ad93b8c8398","observation_id":"1de171d0-3b7f-438e-94e4-4cdbc6042acf","resolution":{"observed_at":"2026-08-03T10:02:42.218330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:02:42.330347Z","title":"Thus, Eq","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:42.330347Z"},"links":{"citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:4e19d9be2ef115547ec1b680cdc1298253c39b63653e7c34ce54c58da2fc1e2a","observation_id":"3f8ea8f3-3617-4020-9325-411c2a2bc34a","resolution":{"observed_at":"2026-08-03T10:02:42.330347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:02:42.490318Z","title":"As the number of inference steps increases, CLIP-T gradually improves while PSNR steadily decreases","venue":null,"work_id":null,"year":2086},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:42.490318Z"},"links":{"citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:e1916ac1e52b1267681faa0af5476143758c209cdb711e401fa217769d56ad38","observation_id":"8cef6074-eaf1-45fc-846a-eda15f097f04","resolution":{"observed_at":"2026-08-03T10:02:42.490318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:02:42.610029Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:42.610029Z"},"links":{"citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:9e0b8dcce691ab68b4cf27c3031e25b6198e8c4f2dcf61f8e6972a64811ce4fb","observation_id":"85de7f2f-c165-4145-a9c4-4c3764b79459","resolution":{"observed_at":"2026-08-03T10:02:42.610029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:02:42.723042Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:42.723042Z"},"links":{"citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:a526f843c60ce7f45c59b3b6f7d648c31bc69b1b896a2e49f134fe64129404df","observation_id":"737b5ba0-5e56-41cb-8264-5d0ab0d76e9d","resolution":{"observed_at":"2026-08-03T10:02:42.723042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:02:42.845093Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:42.845093Z"},"links":{"citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:c4ce8eb139e36693f6be52b16c37078ef0de4724c0569b5cd5346326ae870090","observation_id":"7f6182ff-8c4f-43e8-897d-9eb4fc683f4a","resolution":{"observed_at":"2026-08-03T10:02:42.845093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:02:42.932641Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:42.932641Z"},"links":{"citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:bfe0c33119c3184b86248bada71c62047d239f4a4b127cd64bf220fa2e955fda","observation_id":"d22f5ec1-514d-495b-91c5-a709aa26c48d","resolution":{"observed_at":"2026-08-03T10:02:42.932641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:02:43.092942Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:43.092942Z"},"links":{"citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:8991f8720ecdd638ee8b8ef2ddd2e030e24a50c1a58f6da2b847f40c09a4e5b3","observation_id":"647848c0-fd8e-46e4-85f5-64ebad28a9a0","resolution":{"observed_at":"2026-08-03T10:02:43.092942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:02:43.218821Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:43.218821Z"},"links":{"citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:07c17186c426b9499dd849067e2afb55d4f5554d8008694aed571cbffb0ecc18","observation_id":"f4d44413-8278-4d68-bb1f-3957edaf2c96","resolution":{"observed_at":"2026-08-03T10:02:43.218821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:02:43.306127Z","title":"This video is from the DA VIS dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:43.306127Z"},"links":{"citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:3b49940e9b6763cf3ff576e15afd5840fbe99758079148462d285f7a031f3e51","observation_id":"3e202367-665a-4763-bbdb-85c20fd67ced","resolution":{"observed_at":"2026-08-03T10:02:43.306127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:02:43.468347Z","title":"As shown in Tables 5 and 6, V ACE achieves relatively high scores on Temporal Flickering and Imaging Quality, yet this does not indicate effective object removal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:43.468347Z"},"links":{"citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:af91e7390f6ec80d70c778d0f491f8c733e3a7265567a1600939f9a3af6c59b0","observation_id":"d4ee4636-ac59-4ae9-8584-bf7a305c3e9e","resolution":{"observed_at":"2026-08-03T10:02:43.468347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-03T10:02:41.851372Z","title":"SDXL: Im- proving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:41.851372Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:22ef8a98a42f1233be57f29e906eb60295514f1715a92ca45385caa2afe175a7","observation_id":"9f480668-ca63-477a-a49b-fdfc34ce8ffe","resolution":{"observed_at":"2026-08-03T10:02:41.851372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03491","last_updated":"2023-12-06T13:31:55Z","snapshot_observed_at":"2026-08-08T13:12:23.695657Z","submitted_at":"2023-12-06T13:31:55Z","title":"Schrodinger Bridges Beat Diffusion Models on Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03491","snapshot_observed_at":"2026-08-03T10:02:41.325605Z","title":"Schrodinger bridges beat diffusion models on text-to- speech synthesis.arXiv preprint arXiv:2312.03491,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:41.325605Z"},"links":{"cited_paper":"/paper/2312.03491","citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:2b1d3e747f0f2b5f9926407c1210f6824485eb8175604d219917b6ac7900b05f","observation_id":"5015c5b1-94ec-497f-800c-a158de67736b","resolution":{"observed_at":"2026-08-03T10:02:41.325605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10018","last_updated":"2025-01-17T08:03:02Z","snapshot_observed_at":"2026-08-10T19:21:31.009289Z","submitted_at":"2025-01-17T08:03:02Z","title":"DiffuEraser: A Diffusion Model for Video Inpainting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10018","snapshot_observed_at":"2026-08-03T10:02:41.522899Z","title":"Bridge-SR: Schr¨odinger bridge for efficient sr","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:41.522899Z"},"links":{"cited_paper":"/paper/2501.10018","citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:4ba0db99c0f026565728a1f6fc27bfe2cb1cd9bdc4009f037404e5df9d5e7f91","observation_id":"4ebd48b7-d5d3-4ae8-b49e-c774297cc2e5","resolution":{"observed_at":"2026-08-03T10:02:41.522899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:02:41.388025Z","title":"LoRA-Edit: Controllable first-frame-guided video editing via mask-aware lora fine-tuning.arXiv preprint arXiv:2506.10082,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:41.388025Z"},"links":{"citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:5a21f5e71c39c8ef68bd7e3e6bf41009419c260b8bcbe4afc3395bb863c5b760","observation_id":"9d0a7ea3-bd81-4f5b-8824-f73a841fcbfe","resolution":{"observed_at":"2026-08-03T10:02:41.388025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:02:41.265049Z","title":"L., Ma, S., Zeng, Y ., Liu, Z., Xu, Y ., Shen, Y ., and Chen, Q","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T10:02:41.265049Z"},"links":{"citing_paper":"/paper/2601.12066"},"observation_digest":"sha256:c584f745815ec17783e2bc963b4854438c1bf1c9430a543d9e2639cc979cc85d","observation_id":"dc4b1de2-69cd-48cf-812f-4c5ebff73e78","resolution":{"observed_at":"2026-08-03T10:02:41.265049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.12066","last_updated":"2026-06-26T11:40:12Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T19:19:20.803921Z","submitted_at":"2026-01-17T14:22:14Z","title":"Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 1 inbound Pith citation observation for arXiv:2601.12066."}