{"as_of":"2026-08-08T01:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:76a4abaf2fa36a221ca647807415a063d0a7302b77839286136a2bd6f58a744a","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:42:01.742085Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T08:06:27.191812Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:13:15.764565Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"cited_work":{"arxiv_id":"2506.12853","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12853","snapshot_observed_at":"2026-06-29T08:13:15.764565Z","title":"and Hui, Z","venue":null,"work_id":"c96db0a1-3eee-4af9-985c-a006c12899fd","year":2025},"citing_paper":{"arxiv_id":"2603.21901","last_updated":"2026-05-11T11:26:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-23T12:23:35Z","title":"CLEAR: Context-Aware Learning with End-to-End Mask-Free Inference for Adaptive Video Subtitle Removal","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T00:39:15.790131Z"},"links":{"cited_paper":"/paper/2506.12853","citing_paper":"/paper/2603.21901"},"observation_digest":"sha256:5736bf760b264e747d8baef5f13a205758d6892e34f039b9ad93cb2e255890c2","observation_id":"97933a7e-95b9-450b-a998-2f41a4d87ec0","resolution":{"observed_at":"2026-05-15T00:39:35.679421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"cited_work":{"arxiv_id":"2506.12853","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12853","snapshot_observed_at":"2026-06-29T08:13:15.764565Z","title":"and Hui, Z","venue":null,"work_id":"c96db0a1-3eee-4af9-985c-a006c12899fd","year":2025},"citing_paper":{"arxiv_id":"2605.30045","last_updated":"2026-05-28T14:58:36Z","snapshot_observed_at":"2026-08-02T08:49:19.518638Z","submitted_at":"2026-05-28T14:58:36Z","title":"GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T08:06:27.191812Z"},"links":{"cited_paper":"/paper/2506.12853","citing_paper":"/paper/2605.30045"},"observation_digest":"sha256:551cfc48c8c670be9b14faf164b9a56666a2316584537b7795aa5d33ede10077","observation_id":"c6e7c9ce-3d05-4f72-b280-60117090d07c","resolution":{"observed_at":"2026-06-29T08:13:15.766085Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12853/citation-record","integrity":"/paper/2506.12853/integrity","json":"/paper/2506.12853/citation-record.json","paper":"/paper/2506.12853"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:00.389964Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.389964Z"},"links":{"citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:20141d5e7291c9a83549b263fca55c50c84ee19bc020d9e3fc4c9ca223f70dea","observation_id":"3483ca62-74a1-4e0d-84ba-3c21b377a598","resolution":{"observed_at":"2026-08-07T00:42:00.389964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T00:42:00.453980Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.453980Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:d9ecb4c3729ddc49bcf9c34461a3e6650a98573e1ca8cbc743ca46a32baa8561","observation_id":"53f16d1d-dc0d-4c48-abef-6605b054644b","resolution":{"observed_at":"2026-08-07T00:42:00.453980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:00.539849Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.539849Z"},"links":{"citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:ed8760787fcb509f400529eab7ab8f815ec30eb55b34896b565efb61cc5fdd48","observation_id":"67c50ec6-a683-4cec-82d1-e7701c31d11e","resolution":{"observed_at":"2026-08-07T00:42:00.539849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-07T00:42:00.591297Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.591297Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:ace137b66ba078e8dc738f542652cc9a1042d4e31f025549b6f20092cde11666","observation_id":"3e7f663e-c012-4bf3-9005-89fe071663b0","resolution":{"observed_at":"2026-08-07T00:42:00.591297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-07T00:42:00.641831Z","title":"Ltx-video: Realtime video latent diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.641831Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:8595000f46e2a3aab169106ed353a2be1dad636c3195513de75f838514d0083d","observation_id":"ee97c058-2ea8-454b-a0ba-4012299d007b","resolution":{"observed_at":"2026-08-07T00:42:00.641831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T00:42:00.695623Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.695623Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:e2799888e2b96ba09f0a27483c9482cf30222e258798811baad23ef11d73fcb6","observation_id":"8caa6034-e3c3-437b-b8fb-59371aa0ed6b","resolution":{"observed_at":"2026-08-07T00:42:00.695623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10018","last_updated":"2025-01-17T08:03:02Z","snapshot_observed_at":"2026-08-06T16:39:48.582832Z","submitted_at":"2025-01-17T08:03:02Z","title":"DiffuEraser: A Diffusion Model for Video Inpainting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10018","snapshot_observed_at":"2026-08-07T00:42:00.744948Z","title":"Diffueraser: A diffusion model for video inpainting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.744948Z"},"links":{"cited_paper":"/paper/2501.10018","citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:389b2952f497d304105c1371bfb7f2e3c252aeeba779d33ec28e46c7152b0fba","observation_id":"caec44e0-8720-4554-94b9-469e9107e8b2","resolution":{"observed_at":"2026-08-07T00:42:00.744948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T00:42:00.808194Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.808194Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:1a6077ffe26f2927dc18a6e22e0f1e4da978135c9e00edf30b6368f9643b65ee","observation_id":"bb869301-bdcf-47b5-bf86-f559623a30b7","resolution":{"observed_at":"2026-08-07T00:42:00.808194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:02.790309Z","title":"Fuseformer: Fusing fine-grained information in transformers for video inpainting","venue":null,"work_id":"0f6e9b36-0bcf-402f-ba08-ff529236ed76","year":2021},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.901619Z"},"links":{"citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:6a564483fcbe61638dbffd3c13c1199f4bb5e9de2606e1d3e952bc6f2a10f245","observation_id":"e518d056-4dfd-4cd7-adaa-13d0761ebfff","resolution":{"observed_at":"2026-08-07T00:42:02.904955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:00.948590Z","title":"A benchmark dataset and evaluation methodology for video object segmentation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.948590Z"},"links":{"citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:34ada4f85e9f77b93f21007670ee9a01e56ae348657a34a7cac2aa1406ad3267","observation_id":"54dc4eef-3242-4a4a-bc00-e7799952ecbd","resolution":{"observed_at":"2026-08-07T00:42:00.948590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:01.013801Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.013801Z"},"links":{"citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:7536eac8d263f05fdd3f8f1e7ea2e4b68e1501f2135ac4419610608298448f8d","observation_id":"91ae787f-d58e-4b4f-b9fe-9062b07118ce","resolution":{"observed_at":"2026-08-07T00:42:01.013801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:01.099668Z","title":"Sam 2: Segment anything in images and videos, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.099668Z"},"links":{"citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:1c0ed6aa34c068f4c2230678489854be8551683651aee619470cf6b26058448c","observation_id":"5d89be9f-e883-4ec5-82b5-ac9fe4c4b544","resolution":{"observed_at":"2026-08-07T00:42:01.099668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-07T00:42:01.243679Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.243679Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:593dab77ba13b14bf5a07ce2928d117ba1cd3089d5156867438b3ccaf41508bb","observation_id":"75211975-9bbd-4e64-b978-3649f0ec11d7","resolution":{"observed_at":"2026-08-07T00:42:01.243679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T00:42:01.340005Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.340005Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:607a536de88e241edeb92e51f49f71b095cd8b008c114fb8bf63e759eed213b8","observation_id":"109b83bc-d7bc-42a0-a6de-a15e43cc009d","resolution":{"observed_at":"2026-08-07T00:42:01.340005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T00:42:01.390837Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.390837Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:30388facb9dd8098c6c79cc936dadb3e8f410773a96225dcb3db70219e594a7d","observation_id":"2fef8977-4eda-493b-9afd-2474a34a432e","resolution":{"observed_at":"2026-08-07T00:42:01.390837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:02.364097Z","title":"Learning joint spatial-temporal transformations for video inpainting","venue":null,"work_id":"714d17ba-31b5-4575-a995-d887502bb006","year":2020},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.526322Z"},"links":{"citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:89304ca1ea8d64bfc7e1b0919643ffb53d4cff92300dbf6a1751369e5c513df9","observation_id":"a2dd6f99-90b5-4012-99ed-15d4a0f124de","resolution":{"observed_at":"2026-08-07T00:42:02.553991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:02.122875Z","title":"Propainter: Improving propagation and transformer for video inpainting","venue":null,"work_id":"a820c6f9-6e75-4041-8dbf-fef575049c30","year":2023},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.742085Z"},"links":{"citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:d13f27820acd001076de937aef73bb2c25c380e8b9f861e3e2ddc57f84701f48","observation_id":"b668a2d2-770f-4aa4-8e00-51b4780f253c","resolution":{"observed_at":"2026-08-07T00:42:02.238566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T00:35:19.063913Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 2 inbound Pith citation observations for arXiv:2506.12853."}