{"as_of":"2026-08-05T21:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9034f73b1c84dc7fea832569ada634558f780918c51604fcf9a2008a9c3d96c9","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T12:32:11.911775Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T12:32:11.911775Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-11T11:51:01.047996Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"cited_work":{"arxiv_id":"2604.14630","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.14630","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","venue":"cs.CV","work_id":"1d66e7bb-a75e-44f6-8a5f-b49776ff0f3e","year":2026},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"cited_paper":"/paper/2604.14630","citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:8ec980b96354554c67ac9b9922405e8d97c52e9b40b1d86261bbcbc63899bc4f","observation_id":"cdf7d36e-0706-46f8-9420-a768af89e465","resolution":{"observed_at":"2026-05-11T11:51:01.052968Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.14630/citation-record","integrity":"/paper/2604.14630/integrity","json":"/paper/2604.14630/citation-record.json","paper":"/paper/2604.14630"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"cited_work":{"arxiv_id":"2604.14630","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.14630","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","venue":"cs.CV","work_id":"1d66e7bb-a75e-44f6-8a5f-b49776ff0f3e","year":2026},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"cited_paper":"/paper/2604.14630","citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:8ec980b96354554c67ac9b9922405e8d97c52e9b40b1d86261bbcbc63899bc4f","observation_id":"cdf7d36e-0706-46f8-9420-a768af89e465","resolution":{"observed_at":"2026-05-11T11:51:01.052968Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Two- stream architectures that combine these cues are widely ex- plored","venue":null,"work_id":"1e54165e-8bc1-4745-ba7b-74fe7718107c","year":null},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:301733045357b5520dc372430684dd18fb61bcba52d4705d0ecd88a9c5e7cb8b","observation_id":"ad51c3f4-aace-410f-b90e-099fe6d021f3","resolution":{"observed_at":"2026-05-19T07:23:00.979842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Task Formulation In UVOS, the objective is to generate binary segmentation masksMfrom each input video sequence","venue":null,"work_id":"ea0cdda3-cc69-4d31-94e5-4e0f39494522","year":2016},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:a14b9a83e0bb3aa722c4aa4663f9dbc0d4d4e2801f1e0958fe7644140bca75e0","observation_id":"3c0733f1-60e9-41ea-9b8c-2bcf0af0171d","resolution":{"observed_at":"2026-05-19T07:23:00.975153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The evaluation datasets include the DA VIS 2016 [19] validation set (D), the FBMS [22] test set (F), the YouTube-Objects [23] (Y), and Long-Videos [24] dataset (L)","venue":null,"work_id":"471369ad-ada9-4a8a-851e-b85f3bfd1146","year":2016},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:b9ae3ab6dadaf84bd7ef2efa01c30025c693b4a640199e0fb53c75d876ee904d","observation_id":"c6cadc4d-14ec-4d2e-8bfb-2afefc7d5d34","resolution":{"observed_at":"2026-05-19T07:23:00.955130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CMTM outperforms state-of-the-art methods, demonstrating significant improvements in segmentation accuracy","venue":null,"work_id":"300cc7c4-142c-4651-ad8e-1f154bc326c2","year":2024},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:2894baaf5da698a4fc5cf07e6f3e5ff33d69a001efb0a889207612b12cfcb099","observation_id":"aebe1be2-a29c-4fd2-8573-095837f47e91","resolution":{"observed_at":"2026-05-19T07:23:00.957806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Matnet: Motion-attentive transition net- work for zero-shot video object segmentation","venue":null,"work_id":"792d9b11-081d-474f-9708-989721b08c4b","year":2020},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:1c9bbb9cc9e19a5c8299407d9898df59777e57dbe63a42e8ab7d183c41281212","observation_id":"92c40142-f587-48cb-9bce-431d360437ec","resolution":{"observed_at":"2026-05-19T07:23:00.960274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Full-duplex strategy for video object segmentation","venue":null,"work_id":"358bb4aa-2162-45f3-98c4-84c20a061876","year":2021},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:1870e1af3f7ddf94e1afd8c86a4ea3d5c04e20a72a1e010eda47361f15dd0cf5","observation_id":"bc837542-53d2-4b28-9a53-8bf9c7e67572","resolution":{"observed_at":"2026-05-19T07:23:00.971623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning motion- appearance co-attention for zero-shot video object seg- mentation","venue":null,"work_id":"007c6ae6-0c1d-450c-8cf3-68223862a80e","year":2021},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:0f6588ebcef4c3a278ec0182d62781589e0f1e5cf9c037de42eaabe95e1e3dd6","observation_id":"b7e0050f-ba6e-4862-91e2-c149b924263a","resolution":{"observed_at":"2026-05-19T07:23:00.939322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep transport network for unsuper- vised video object segmentation","venue":null,"work_id":"87f4d162-219a-408c-94d4-6debb4639621","year":2021},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:7bbaa59b77c538601569ec8ad9bbb9b9e7cb2e35c23c98b8e8b03e8e7a81a964","observation_id":"87df2317-d50e-4335-9a6c-a7746ed8930f","resolution":{"observed_at":"2026-05-19T07:23:00.947765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reciprocal trans- formations for unsupervised video object segmentation","venue":null,"work_id":"5123eb30-41bf-4f0e-9924-cd78da76514c","year":2021},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:69517e7ff575432e2291a0e32641d2762c817978fbbae535cbd2e5454ff65c5f","observation_id":"46c5a147-0b44-479e-8d9b-7e0a86d66614","resolution":{"observed_at":"2026-05-19T07:23:00.943880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical feature alignment network for unsupervised video object seg- mentation","venue":null,"work_id":"bab94b36-9ab8-469e-942d-4ca6504affa2","year":2022},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:65768ca3947dc4c087cba2be49d0e90c120d7a4be822eb4befdfef3e3c9d3e37","observation_id":"33491325-c423-4a94-83b4-bdec68083626","resolution":{"observed_at":"2026-05-19T07:23:00.948850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Guided slot at- tention for unsupervised video object segmentation","venue":null,"work_id":"80b776ce-33ea-4b89-b066-2839565391f3","year":2024},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:1be08e4fd9e6f6729bcf41a5e88ebe25fe4251335081ecd9e13310fbb5c2f3c3","observation_id":"71db6232-bea3-4010-92de-9259e6f1a31b","resolution":{"observed_at":"2026-05-19T07:23:00.923163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11714","last_updated":"2024-07-16T13:32:50Z","snapshot_observed_at":"2026-08-03T11:40:04.706433Z","submitted_at":"2024-07-16T13:32:50Z","title":"Improving Unsupervised Video Object Segmentation via Fake Flow Generation","version":1},"cited_work":{"arxiv_id":"2407.11714","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.11714","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving unsupervised video object segmentation via fake flow generation","venue":null,"work_id":"0e47ca9e-e6b7-416d-b901-57d867b8c862","year":2024},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"cited_paper":"/paper/2407.11714","citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:1b58e611e69249ed11fa4c9f4460a0831f356d99722e250796d5148954868cc7","observation_id":"4dd41f10-d90f-4bc6-8db3-361227d5f7d0","resolution":{"observed_at":"2026-05-11T11:51:01.059549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"7ef40542-442a-4b0d-8ccb-5f2963d4a543","year":2016},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:5c77f3411f848241987b70afc4e07c6649764f232418fad3e51c3dba84873177","observation_id":"81693d5b-aa09-46a7-b4f4-4d8712b2dcc6","resolution":{"observed_at":"2026-05-19T07:23:00.919306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D2conv3d: Dynamic dilated convolu- tions for object segmentation in videos","venue":null,"work_id":"bc24ec49-84b7-41cf-a94f-e8dae3dd3918","year":2022},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:2b302716c06ec603c1cb6b7af94b89f464c335e4edff21130cc7420bcd31ccd5","observation_id":"b7435767-ecce-442b-803e-cfd5eb8cb291","resolution":{"observed_at":"2026-05-19T07:23:00.944202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video classification with channel-separated con- volutional networks","venue":null,"work_id":"173980f0-999a-41a5-8443-253890010785","year":2019},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:a698224dcbb3dbc12b34a0de284d463251af72ccd8db29f658f41b819a425869","observation_id":"713050ee-5d23-41c0-86fc-9137755ad231","resolution":{"observed_at":"2026-05-19T07:23:00.962740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Itera- tively selecting an easy reference frame makes unsuper- vised video object segmentation easier","venue":null,"work_id":"98dbc0c6-bda2-4ef4-b7a5-2758a8b7c9eb","year":2022},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:c9b96ad8bfd0ff43f08a71512f368a7f8e82346a06142da9f7b1097859f1e6b9","observation_id":"7343eac6-c990-42f5-b0d0-662aaecf2e39","resolution":{"observed_at":"2026-05-19T07:23:00.965960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segformer: Sim- ple and efficient design for semantic segmentation with transformers","venue":null,"work_id":"518d76b7-5a0e-4275-b17a-1c29b0fefe91","year":2021},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:b1de12fd5a67af76f44fb9664f324b65006b2d84ed19217436f8b10dc4e964a2","observation_id":"8d674490-d77d-47b6-83a6-691fab5a1a13","resolution":{"observed_at":"2026-05-19T07:23:00.977691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised video object segmentation with online adversarial self-tuning","venue":null,"work_id":"c36cd291-64c0-490b-a1b7-c0a61ca7e7c6","year":2023},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:d24abec5989781880d3fd183efb22d2f67ae2384758b805aefaae3c38beb976b","observation_id":"150fcedc-7b4c-4b70-a1df-794470d256a8","resolution":{"observed_at":"2026-05-19T07:23:00.937159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02178","last_updated":"2022-03-04T17:17:31Z","snapshot_observed_at":"2026-07-06T11:54:38.041673Z","submitted_at":"2021-10-05T17:07:53Z","title":"MobileViT: Light-weight, General-purpose, and Mobile-friendly Vision Transformer","version":2},"cited_work":{"arxiv_id":"2110.02178","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.02178","snapshot_observed_at":"2026-07-04T17:20:01.055534Z","title":"MobileViT: Light-weight, General-purpose, and Mobile-friendly Vision Transformer","venue":"cs.CV","work_id":"bb34ff1e-5fb7-4912-a744-a89c92c028f7","year":2021},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"cited_paper":"/paper/2110.02178","citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:8f07b160f43002a63f7d6d977d2ba0a04d020d7b33912458d322e883a85f6afa","observation_id":"c4882ae3-b47b-4cb9-a9b0-f93aafcba563","resolution":{"observed_at":"2026-05-20T20:46:35.272401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simulflow: Simultaneously extract- ing feature and identifying target for unsupervised video object segmentation","venue":null,"work_id":"9928d86f-a1d4-4da3-9030-098fe011d2d1","year":2023},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:011e2a35fe7d6c7ffd19bbd6285769183144d9b3dbc463ad94b3deb5f40f5e20","observation_id":"c8b3e3a2-83eb-4270-b04a-9bf30f54772a","resolution":{"observed_at":"2026-05-19T07:23:00.939959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generalizable fourier augmen- tation for unsupervised video object segmentation","venue":null,"work_id":"23f40823-ad92-4899-a8ab-58380d755e6b","year":2024},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:5363db134cc5d52be8be0ef0ff725e5baaaa231309f406d658a04c1bfa5a4138","observation_id":"2a0ff1cf-742d-4a52-99f2-a2fe87267039","resolution":{"observed_at":"2026-05-19T07:23:00.926387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.03327","last_updated":"2018-09-06T04:19:45Z","snapshot_observed_at":"2026-07-06T07:00:12.122241Z","submitted_at":"2018-09-06T04:19:45Z","title":"YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark","version":1},"cited_work":{"arxiv_id":"1809.03327","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.03327","snapshot_observed_at":"2026-07-08T02:04:26.310872Z","title":"YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark","venue":"cs.CV","work_id":"2798c43d-6f6c-445b-8a43-14cba092aa4b","year":2018},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"cited_paper":"/paper/1809.03327","citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:544b42d80094402d9c870e4f47fcb355687e56a9721274d08ad7ad799079899c","observation_id":"1b41aa70-6c34-4efd-b843-4fb0c7de53ad","resolution":{"observed_at":"2026-05-11T11:51:01.038342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":"1704.00675","doi":"10.48550/arxiv.1704.00675","metadata_source":"pith","pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","venue":"cs.CV","work_id":"e062a88c-5ea8-4ba0-97f0-3aae55fee107","year":2017},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:327b78eff2c4e7333e5b33e38144ff09a5f44febe3cd30e1667264e614911516","observation_id":"7a0e0aec-6184-48f0-9c66-abb7c483ef82","resolution":{"observed_at":"2026-05-13T23:55:08.958205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to detect salient objects with image-level supervision","venue":null,"work_id":"14dbf3d4-491d-4566-baae-c80c028e7790","year":2017},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:a97388d7c614d22109221c13d66a4a5304ee6c941750617eebed8f91bd815666","observation_id":"10cf0872-39b5-4957-ac46-96b3bb7fa40c","resolution":{"observed_at":"2026-05-19T07:23:00.951138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:a5e69b8e829660c6433bfe0341fd436e24da21170e0fefd94ce68914ae50dacd","observation_id":"cf4066db-e7be-4da9-a655-c8eb8b4932d4","resolution":{"observed_at":"2026-05-11T11:51:00.988619Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segmen- tation of moving objects by long term video analysis","venue":null,"work_id":"b9525321-d0ac-4fdd-99b9-3f0a3eea868a","year":2013},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:3ff502c9799875158df6a0c337a88d67211d42a1a4c0fdc20eb709d33455708b","observation_id":"4572ec8e-8889-421d-aab7-13d0f6641db3","resolution":{"observed_at":"2026-05-19T07:23:00.968968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning object class detectors from weakly annotated video","venue":null,"work_id":"3d4bbb7a-931b-4f5f-ad4f-8f2c8a54c289","year":2012},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:ba40239b9e9ae4155fedd5217be6e57aa82a26bdcfb72b404c15c6aee64c7c81","observation_id":"3410c907-bb07-473a-b76c-d3381b030421","resolution":{"observed_at":"2026-05-19T07:23:00.934366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video object segmentation with adaptive feature bank and uncertain-region refinement","venue":null,"work_id":"e55368ec-fc56-4092-b187-1a7b6706d174","year":2020},"citing_paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T12:32:11.911775Z"},"links":{"citing_paper":"/paper/2604.14630"},"observation_digest":"sha256:045e5d9d1a726cb952080b7c3f7a7afda434a12ebe8c48d85ebab886aaecc59e","observation_id":"1617ad17-8a94-46cd-b153-ab8c60e88f70","resolution":{"observed_at":"2026-05-19T07:23:00.946331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.14630","last_updated":"2026-04-16T05:14:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:14:32Z","title":"CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":5,"verified_fuzzy":23},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2604.14630."}