Pith. sign in

Paper Citation Record · LEDGER

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation

As of 5 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2604.14630.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2604.14630 v1

Coverage vector

measured 29 of 29 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-10T12:32:11.911775Z

measured 30 of 30 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-10T12:32:11.911775Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-05-11T11:51:01.047996Z

Reference resolution

29 of 29 outbound references displayed

  • verified exact5
  • verified fuzzy23
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation cdf7d36e-0706-46f8-9420-a768af89e465 · outbound

This paper cites CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-05-11T11:51:01.052968Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:8ec980b96354554c67ac9b9922405e8d97c52e9b40b1d86261bbcbc63899bc4f

Observation ad51c3f4-aace-410f-b90e-099fe6d021f3 · outbound

This paper cites Two- stream architectures that combine these cues are widely ex- plored.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Two- stream architectures that combine these cues are widely ex- plored

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.979842Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:301733045357b5520dc372430684dd18fb61bcba52d4705d0ecd88a9c5e7cb8b

Observation 3c0733f1-60e9-41ea-9b8c-2bcf0af0171d · outbound

This paper cites Task Formulation In UVOS, the objective is to generate binary segmentation masksMfrom each input video sequence.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Task Formulation In UVOS, the objective is to generate binary segmentation masksMfrom each input video sequence

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.975153Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:a14b9a83e0bb3aa722c4aa4663f9dbc0d4d4e2801f1e0958fe7644140bca75e0

Observation c6cadc4d-14ec-4d2e-8bfb-2afefc7d5d34 · outbound

This paper cites The evaluation datasets include the DA VIS 2016 [19] validation set (D), the FBMS [22] test set (F), the YouTube-Objects [23] (Y), and Long-Videos [24] dataset (L).

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation The evaluation datasets include the DA VIS 2016 [19] validation set (D), the FBMS [22] test set (F), the YouTube-Objects [23] (Y), and Long-Videos [24] dataset (L)

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.955130Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:b9ae3ab6dadaf84bd7ef2efa01c30025c693b4a640199e0fb53c75d876ee904d

Observation aebe1be2-a29c-4fd2-8573-095837f47e91 · outbound

This paper cites CMTM outperforms state-of-the-art methods, demonstrating significant improvements in segmentation accuracy.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation CMTM outperforms state-of-the-art methods, demonstrating significant improvements in segmentation accuracy

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.957806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:2894baaf5da698a4fc5cf07e6f3e5ff33d69a001efb0a889207612b12cfcb099

Observation 92c40142-f587-48cb-9bce-431d360437ec · outbound

This paper cites Matnet: Motion-attentive transition net- work for zero-shot video object segmentation.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Matnet: Motion-attentive transition net- work for zero-shot video object segmentation

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.960274Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:1c9bbb9cc9e19a5c8299407d9898df59777e57dbe63a42e8ab7d183c41281212

Observation bc837542-53d2-4b28-9a53-8bf9c7e67572 · outbound

This paper cites Full-duplex strategy for video object segmentation.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Full-duplex strategy for video object segmentation

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.971623Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:1870e1af3f7ddf94e1afd8c86a4ea3d5c04e20a72a1e010eda47361f15dd0cf5

Observation b7e0050f-ba6e-4862-91e2-c149b924263a · outbound

This paper cites Learning motion- appearance co-attention for zero-shot video object seg- mentation.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Learning motion- appearance co-attention for zero-shot video object seg- mentation

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.939322Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:0f6588ebcef4c3a278ec0182d62781589e0f1e5cf9c037de42eaabe95e1e3dd6

Observation 87df2317-d50e-4335-9a6c-a7746ed8930f · outbound

This paper cites Deep transport network for unsuper- vised video object segmentation.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Deep transport network for unsuper- vised video object segmentation

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.947765Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:7bbaa59b77c538601569ec8ad9bbb9b9e7cb2e35c23c98b8e8b03e8e7a81a964

Observation 46c5a147-0b44-479e-8d9b-7e0a86d66614 · outbound

This paper cites Reciprocal trans- formations for unsupervised video object segmentation.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Reciprocal trans- formations for unsupervised video object segmentation

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.943880Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:69517e7ff575432e2291a0e32641d2762c817978fbbae535cbd2e5454ff65c5f

Observation 33491325-c423-4a94-83b4-bdec68083626 · outbound

This paper cites Hierarchical feature alignment network for unsupervised video object seg- mentation.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Hierarchical feature alignment network for unsupervised video object seg- mentation

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.948850Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:65768ca3947dc4c087cba2be49d0e90c120d7a4be822eb4befdfef3e3c9d3e37

Observation 71db6232-bea3-4010-92de-9259e6f1a31b · outbound

This paper cites Guided slot at- tention for unsupervised video object segmentation.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Guided slot at- tention for unsupervised video object segmentation

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.923163Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:1be08e4fd9e6f6729bcf41a5e88ebe25fe4251335081ecd9e13310fbb5c2f3c3

Observation 4dd41f10-d90f-4bc6-8db3-361227d5f7d0 · outbound

This paper cites Improving Unsupervised Video Object Segmentation via Fake Flow Generation.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Improving Unsupervised Video Object Segmentation via Fake Flow Generation

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-05-11T11:51:01.059549Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:1b58e611e69249ed11fa4c9f4460a0831f356d99722e250796d5148954868cc7

Observation 81693d5b-aa09-46a7-b4f4-4d8712b2dcc6 · outbound

This paper cites Deep residual learning for image recognition.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Deep residual learning for image recognition

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.919306Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:5c77f3411f848241987b70afc4e07c6649764f232418fad3e51c3dba84873177

Observation b7435767-ecce-442b-803e-cfd5eb8cb291 · outbound

This paper cites D2conv3d: Dynamic dilated convolu- tions for object segmentation in videos.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation D2conv3d: Dynamic dilated convolu- tions for object segmentation in videos

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.944202Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:2b302716c06ec603c1cb6b7af94b89f464c335e4edff21130cc7420bcd31ccd5

Observation 713050ee-5d23-41c0-86fc-9137755ad231 · outbound

This paper cites Video classification with channel-separated con- volutional networks.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Video classification with channel-separated con- volutional networks

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.962740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:a698224dcbb3dbc12b34a0de284d463251af72ccd8db29f658f41b819a425869

Observation 7343eac6-c990-42f5-b0d0-662aaecf2e39 · outbound

This paper cites Itera- tively selecting an easy reference frame makes unsuper- vised video object segmentation easier.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Itera- tively selecting an easy reference frame makes unsuper- vised video object segmentation easier

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.965960Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:c9b96ad8bfd0ff43f08a71512f368a7f8e82346a06142da9f7b1097859f1e6b9

Observation 8d674490-d77d-47b6-83a6-691fab5a1a13 · outbound

This paper cites Segformer: Sim- ple and efficient design for semantic segmentation with transformers.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Segformer: Sim- ple and efficient design for semantic segmentation with transformers

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.977691Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:b1de12fd5a67af76f44fb9664f324b65006b2d84ed19217436f8b10dc4e964a2

Observation 150fcedc-7b4c-4b70-a1df-794470d256a8 · outbound

This paper cites Unsupervised video object segmentation with online adversarial self-tuning.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Unsupervised video object segmentation with online adversarial self-tuning

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.937159Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:d24abec5989781880d3fd183efb22d2f67ae2384758b805aefaae3c38beb976b

Observation c4882ae3-b47b-4cb9-a9b0-f93aafcba563 · outbound

This paper cites MobileViT: Light-weight, General-purpose, and Mobile-friendly Vision Transformer.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation MobileViT: Light-weight, General-purpose, and Mobile-friendly Vision Transformer

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-20T20:46:35.272401Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:8f07b160f43002a63f7d6d977d2ba0a04d020d7b33912458d322e883a85f6afa

Observation c8b3e3a2-83eb-4270-b04a-9bf30f54772a · outbound

This paper cites Simulflow: Simultaneously extract- ing feature and identifying target for unsupervised video object segmentation.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Simulflow: Simultaneously extract- ing feature and identifying target for unsupervised video object segmentation

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.939959Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:011e2a35fe7d6c7ffd19bbd6285769183144d9b3dbc463ad94b3deb5f40f5e20

Observation 2a0ff1cf-742d-4a52-99f2-a2fe87267039 · outbound

This paper cites Generalizable fourier augmen- tation for unsupervised video object segmentation.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Generalizable fourier augmen- tation for unsupervised video object segmentation

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.926387Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:5363db134cc5d52be8be0ef0ff725e5baaaa231309f406d658a04c1bfa5a4138

Observation 1b41aa70-6c34-4efd-b843-4fb0c7de53ad · outbound

This paper cites YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-11T11:51:01.038342Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:544b42d80094402d9c870e4f47fcb355687e56a9721274d08ad7ad799079899c

Observation 7a0e0aec-6184-48f0-9c66-abb7c483ef82 · outbound

This paper cites The 2017 DAVIS Challenge on Video Object Segmentation.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation The 2017 DAVIS Challenge on Video Object Segmentation

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-05-13T23:55:08.958205Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:327b78eff2c4e7333e5b33e38144ff09a5f44febe3cd30e1667264e614911516

Observation 10cf0872-39b5-4957-ac46-96b3bb7fa40c · outbound

This paper cites Learning to detect salient objects with image-level supervision.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Learning to detect salient objects with image-level supervision

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.951138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:a97388d7c614d22109221c13d66a4a5304ee6c941750617eebed8f91bd815666

Observation cf4066db-e7be-4da9-a655-c8eb8b4932d4 · outbound

This paper cites Adam: A Method for Stochastic Optimization.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Adam: A Method for Stochastic Optimization

Reference 26

Resolution
verified exact
local_arxiv, observed 2026-05-11T11:51:00.988619Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:a5e69b8e829660c6433bfe0341fd436e24da21170e0fefd94ce68914ae50dacd

Observation 4572ec8e-8889-421d-aab7-13d0f6641db3 · outbound

This paper cites Segmen- tation of moving objects by long term video analysis.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Segmen- tation of moving objects by long term video analysis

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.968968Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:3ff502c9799875158df6a0c337a88d67211d42a1a4c0fdc20eb709d33455708b

Observation 3410c907-bb07-473a-b76c-d3381b030421 · outbound

This paper cites Learning object class detectors from weakly annotated video.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Learning object class detectors from weakly annotated video

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.934366Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:ba40239b9e9ae4155fedd5217be6e57aa82a26bdcfb72b404c15c6aee64c7c81

Observation 1617ad17-8a94-46cd-b153-ab8c60e88f70 · outbound

This paper cites Video object segmentation with adaptive feature bank and uncertain-region refinement.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation Video object segmentation with adaptive feature bank and uncertain-region refinement

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T07:23:00.946331Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:045e5d9d1a726cb952080b7c3f7a7afda434a12ebe8c48d85ebab886aaecc59e

Pith citing papers

Observation cdf7d36e-0706-46f8-9420-a768af89e465 · inbound

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation cites this paper.

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-05-11T11:51:01.052968Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T12:32:11.911775Z digest=sha256:8ec980b96354554c67ac9b9922405e8d97c52e9b40b1d86261bbcbc63899bc4f