Pith. sign in

Paper Citation Record · LEDGER

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal

As of 5 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2604.27322.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2604.27322 v1

Coverage vector

measured 29 of 29 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-07T09:12:13.460169Z

measured 29 of 29 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

29 of 29 outbound references displayed

  • verified exact9
  • verified fuzzy19
  • unresolved1
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 27971ffd-5916-4281-96c6-641702a5ed35 · outbound

This paper cites Videopainter: Any- length video inpainting and editing with plug-and-play con- text control.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Videopainter: Any- length video inpainting and editing with plug-and-play con- text control

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.609308Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:7b2e2f7329f38020598074f78feb64ab7abd3732fbc6fb3171c357978867376d

Observation 8b2f663a-a196-45ff-ad94-c02b1365387d · outbound

This paper cites Dit4sr: Taming diffusion transformer for real-world image super-resolution.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Dit4sr: Taming diffusion transformer for real-world image super-resolution

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.612307Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:e016f5cb574461f73eded8a5590208257527c17961b2aa4db0fa42ef7ccf1f98

Observation 1a3a73f1-396a-4dab-bca6-e215fb1087df · outbound

This paper cites Scaling recti- fied flow transformers for high-resolution image synthesis.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Scaling recti- fied flow transformers for high-resolution image synthesis

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.599889Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:995fc1c4590389cd7f6c9613a7220181cd5c93ba196c744e555db2652656d0e8

Observation 5238bb53-07cb-4d26-88e8-8d378f7169a6 · outbound

This paper cites When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-12T09:46:27.901967Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:810f0f6528ee5e19e739178c8243923a0967cb7bd4eee3fd76693d4e85107566

Observation 41f3ffe4-f1fe-4ad0-81f4-76905fad3f41 · outbound

This paper cites Dit4edit: Dif- fusion transformer for image editing.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Dit4edit: Dif- fusion transformer for image editing

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.605644Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:3a64295c92d4e79741a49c5a628b77f08e3f5085ca4d3bda8c1f99ba6bffb0cd

Observation 594290b6-1342-4950-985d-50a564883b0e · outbound

This paper cites Vbench: Comprehensive bench- mark suite for video generative models.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Vbench: Comprehensive bench- mark suite for video generative models

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.597057Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:14756598074285a4357e347ae1109641ba30d637d49ae1f156b1fce7044691eb

Observation d7220e8c-ab5f-4fea-9a7c-3beca9de7cee · outbound

This paper cites Vace: All-in-one video creation and editing.ICCV.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Vace: All-in-one video creation and editing.ICCV

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.588747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:f45c26f29ac797966ad1c7303d385962866d1c8e4db445cf7757268f55e4e8e3

Observation 3a03f13d-1e38-44a2-9d4e-03a83c6f29d5 · outbound

This paper cites Dual prompting image restora- tion with diffusion transformers.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Dual prompting image restora- tion with diffusion transformers

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.591893Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:2c44d345e9e1c70ace82248c6458056831309e93889f0258b089673e960a9846

Observation d34e8401-0280-41ac-83e1-1bd016ac684f · outbound

This paper cites Magiceraser: Erasing any objects via semantics-aware control.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Magiceraser: Erasing any objects via semantics-aware control

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.594554Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:384fee51a26db6ae7c85f1ea1360a1afa24610d0edf0625c6bc3dfdb206e1914

Observation 0b1f6359-30fc-4c2f-9386-2ddffc54cf34 · outbound

This paper cites DiffuEraser: A Diffusion Model for Video Inpainting.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal DiffuEraser: A Diffusion Model for Video Inpainting

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-12T09:46:27.907977Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:9ec33616c23476580188ed14bf5e53fa003fb6b6f82cf53cc34704901ff4222f

Observation ef448042-426f-49a6-9fd7-19e05a98d52c · outbound

This paper cites Decoupled Weight Decay Regularization.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Decoupled Weight Decay Regularization

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-05-12T09:46:27.926278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:a8e667d5e246f2f193a38867cbedb5225bfdd764496d7eb4216ac9c5fa114afb

Observation 9f0e3821-3f37-4149-803d-0e3f2f35a580 · outbound

This paper cites Grig: Data-efficient generative residual image inpainting.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Grig: Data-efficient generative residual image inpainting

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.602608Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:f23b36c947785fc8d813cddc1bada529ce64eaeef3582db49e9844cd37338c96

Observation bbe2f0c0-0b14-4b4c-bbb1-35d37d6ab05d · outbound

This paper cites Ultraled: Learning to see everything in ultra-high dynamic range scenes.arXiv preprint arXiv:2510.07741.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Ultraled: Learning to see everything in ultra-high dynamic range scenes.arXiv preprint arXiv:2510.07741

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-05-12T09:46:27.921167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:a50158494386eece24612bb99c05b6a8bb5a7a45edceb383eeea92f4a892ec9d

Observation 58ab5244-c399-4179-a9c5-90f0d6ee9db2 · outbound

This paper cites Rose: Remove objects with side effects in videos.NeurIPS.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Rose: Remove objects with side effects in videos.NeurIPS

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.615170Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:7184ee2749589fa71ae58a7ff194900097b7790ab7926c113071a144d54626bc

Observation bd32d6d2-2b06-4e1d-aacd-16b6c47e0719 · outbound

This paper cites Gross, and Alexander Sorkine- Hornung.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Gross, and Alexander Sorkine- Hornung

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.577085Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:93ba74078932b361a1af5bef1950a0f83329f62b870f7fb49608aa634da9ac83

Observation ad82d0fc-38c1-478b-9018-7842ea32abb4 · outbound

This paper cites Unified transformed t-svd us- ing unfolding tensors for visual inpainting.Computational Visual Media.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Unified transformed t-svd us- ing unfolding tensors for visual inpainting.Computational Visual Media

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.585970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:257e725dd837b6d3df8f8aa0c77e9532f2245c1afcec7e0dad6f77f1e776f523

Observation 74bbdbbd-a049-4f14-98a9-5062f1714711 · outbound

This paper cites Robust unsupervised deep learning for nonblind image deconvolu- tion with inaccurate kernels.TNNLS.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Robust unsupervised deep learning for nonblind image deconvolu- tion with inaccurate kernels.TNNLS

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.570506Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:178721397f5dd526fdb7575c1383e38b2c172043d3a755d34cae5e539a7dd944

Observation 11372d12-6da6-4b42-9cb9-d2708bb9bb9c · outbound

This paper cites Camedit: Continuous cam- era parameter control for photorealistic image editing.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Camedit: Continuous cam- era parameter control for photorealistic image editing

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.573646Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:cf17142142a2380791de0d15ed663f12901d99cb249f09dad835ebc2d69cc15b

Observation 41d586cf-d7c5-41eb-a917-efdc39c06995 · outbound

This paper cites Disentangle to fuse: Towards content preservation and cross-modality con- sistency for multi-modality image fusion.TIP.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Disentangle to fuse: Towards content preservation and cross-modality con- sistency for multi-modality image fusion.TIP

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.580080Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:3f8add4e88e593eacf8bdbcd67dce4978331e2b4b1f24ab3a15fc631a982e3d0

Observation e1388fe0-f6a8-4fd8-b98c-8f67532be440 · outbound

This paper cites Wan: Open and Advanced Large-Scale Video Generative Models.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Wan: Open and Advanced Large-Scale Video Generative Models

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-05-12T09:46:27.958098Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:907552348aa449677862ff5dca610f9f09d54158cbce20e7d1a9e82cbf49bb16

Observation 4c0175cd-39a7-4a0c-b05b-fe3b399160a4 · outbound

This paper cites Vtinker: Guided flow upsampling and texture mapping for high-resolution video frame interpolation.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Vtinker: Guided flow upsampling and texture mapping for high-resolution video frame interpolation

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-05-12T09:46:27.952397Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:cb897ff99bb152694b9814773dbad611a0608329fb712c7e7bb3b52caddf2e61

Observation e4a4008a-e0c2-44d0-a905-3c3e29861545 · outbound

This paper cites Improved video vae for latent video diffusion model.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Improved video vae for latent video diffusion model

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.561618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:7a24f3e42c268fbbb20d439568d526453f461bedaec7fe2706c05eacd2851f75

Observation 060bc62b-c9bf-4756-a4a0-2f6b6e69e453 · outbound

This paper cites YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-12T09:46:27.935892Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:e7cda458e6d09708f1d23caa5e48eddcd4432b9f72cb09298479bd135bcbb4f2

Observation 9aeadeb2-12f8-44e8-8017-13fe3d27b7f3 · outbound

This paper cites CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-05-12T09:46:27.942783Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:9a4bdfae50ccc36edb42290ba0b95dcbb71846c96f5fea548a6d8d368f6518ea

Observation ac587384-6989-4e60-8db6-e2e833589bc7 · outbound

This paper cites Efros, Eli Shecht- man, and Oliver Wang.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Efros, Eli Shecht- man, and Oliver Wang

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.564749Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:b9ccf03c12224b45891bc2c770daf45d53bc204ecb7fa5ed91a93178b765a285

Observation 162cf907-ab8f-410a-a656-0bac14ff1c92 · outbound

This paper cites an unresolved cited work.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-05-27T08:28:50.567568Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:327258b9dff7d2350cd97b88d6e49f2016a866c3eb6b436c5f01a58ed52a83c4

Observation 74f876d0-af63-4dc5-a260-0805486c5240 · outbound

This paper cites OutDreamer: Video Outpainting with a Diffusion Transformer.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal OutDreamer: Video Outpainting with a Diffusion Transformer

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-12T09:46:27.915463Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:c03fc529f497512a1e0058f189e1883dd75486018791f41f6a935c6afd1a9028

Observation 52c9cf51-1755-493e-a7d6-a9d629368211 · outbound

This paper cites Propainter: Improving propagation and transformer for video inpainting.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Propainter: Improving propagation and transformer for video inpainting

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.582717Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:5d09ff161e7c2e40804181810e76dd7c9543d1eaf9173b44cb1f7520ab631a3b

Observation 6d7057ad-3021-4f55-8898-d756f7b477be · outbound

This paper cites Minimax-remover: Taming bad noise helps video object removal.NeurIPS.

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Minimax-remover: Taming bad noise helps video object removal.NeurIPS

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T08:28:50.618776Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T09:12:13.460169Z digest=sha256:6f3c5b8d88ab319d569f0f478c958235fcb6cde379e96ac8798f940112d0b7f7

Pith citing papers

No inbound Pith citation observations are available.