{"as_of":"2026-08-04T09:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c90eb506a56a7dc614dc05d31337f41c831bfad5623cae99f1f94617c93a4f54","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T07:18:20.281383Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.12006/citation-record","integrity":"/paper/2605.12006/integrity","json":"/paper/2605.12006/citation-record.json","paper":"/paper/2605.12006"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.15385","last_updated":"2024-11-16T09:02:05Z","snapshot_observed_at":"2026-08-02T13:31:25.648396Z","submitted_at":"2024-10-20T13:00:24Z","title":"LoRA-IR: Taming Low-Rank Experts for Efficient All-in-One Image Restoration","version":2},"cited_work":{"arxiv_id":"2410.15385","doi":"10.48550/arxiv.2410.15385","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15385","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Lora-ir: taming low-rank experts for efficient all-in-one image restoration","venue":null,"work_id":"178d14af-8a1d-4b46-a322-96fef973c807","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"cited_paper":"/paper/2410.15385","citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:bf14f2c5bb5c367502639bef582199bfda598143bedee9259c55c27fb8320deb","observation_id":"c3b1e7ad-72f8-4f6a-ba13-3336b9a3781d","resolution":{"observed_at":"2026-05-13T07:22:29.347632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Refereverything: Towards seg- menting everything we can speak of in videos","venue":null,"work_id":"00e7515d-1388-4aee-8724-9449bc027f0b","year":2025},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:406c47ebfe9957343b4caf4ca5839101115f54dbd9a5cb79ad0af29d0ee0254b","observation_id":"f4ebf87a-d13b-4c55-a283-1cfd372bd42a","resolution":{"observed_at":"2026-05-13T08:32:32.178304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generalized foggy- scene semantic segmentation by frequency decoupling","venue":null,"work_id":"dc31a3aa-6414-4621-ba82-a40ad1b46457","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:b69a22a2fe44526b5940aef35e2c84d95a291f1ef05fe16cce30aa2a39e6e391","observation_id":"97fd307f-c211-4401-b9fb-42063a9eed85","resolution":{"observed_at":"2026-05-13T08:32:32.193435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RobustSAM: segment anything robustly on de- graded images","venue":null,"work_id":"203ce409-37a0-4b1d-9d97-d236d4965e4f","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:464f16abd028123229dad8fff4f0237330412db01340cd618b8d282d11194348","observation_id":"d2f1ee66-a7c2-4972-abeb-8a0901870e83","resolution":{"observed_at":"2026-05-13T08:32:32.166628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Putting the object back into video object segmentation","venue":null,"work_id":"bc8f7610-0a93-48c0-ad50-fea6c98d4f34","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:72166384c5a988136775f5da1bfe146dc93e58219e5e4553c0d09e2fe46fe7e1","observation_id":"b287e054-d22c-4b67-af3b-15338ca3c251","resolution":{"observed_at":"2026-05-13T08:32:32.170734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the effective- ness of layernorm tuning for continual learning in vision transformers","venue":null,"work_id":"b1325478-025a-4b59-9b15-edb0f3e5765c","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:914cde661a6ece131988454265dbe3354e305afa8f1e8fada61e21132e33f4c7","observation_id":"06117325-b41c-4bc9-87f4-db16173a9225","resolution":{"observed_at":"2026-05-13T08:32:32.190266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MOSE: A new dataset for video object segmentation in complex scenes","venue":null,"work_id":"6e1551aa-cffd-49c8-a253-fbcdde07e5a5","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:d5810966ed4cbe97629cf4d07a7acbef3189895fd5447bf849c265ae45ce3ad6","observation_id":"1dcc3bc4-9121-4e5f-b56b-5fa98da5c5eb","resolution":{"observed_at":"2026-05-13T08:32:32.174419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sam2long: Enhancing sam 2 for long video segmentation with a training-free memory tree","venue":null,"work_id":"056350e3-65a5-4687-9d54-0f1eb10268ba","year":2025},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:8a3bd967bcf74b7515b089e1e517e8decc1df1638f3da5fdda12e3542aae68b5","observation_id":"23e9dbd0-6f79-4c8a-8c75-49ff57c92a27","resolution":{"observed_at":"2026-05-13T08:32:32.186753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Switch transformers: Scaling to trillion parameter models with sim- ple and efficient sparsity.Journal of Machine Learning Re- search, 23(120):1–39","venue":null,"work_id":"77f19f15-4211-475f-817e-a52f81acaec4","year":2022},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:f1f3a14618895830b36d4b87a0bd6c686040a401f3da8479f0897c96f2dd9bdd","observation_id":"1bb27c12-6168-4b11-8a8a-ee9e7cb867e5","resolution":{"observed_at":"2026-05-13T08:32:32.182910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Devos: Flow-guided deformable trans- former for video object segmentation","venue":null,"work_id":"885b197e-9e01-45f3-9321-84345508db1b","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:9022a22ceaa26cf951fbf35f4fdf0e88661cf1ff8ebdd1fd79196b5f10405259","observation_id":"1c034f49-02d8-4579-8080-9973fd40a49f","resolution":{"observed_at":"2026-05-13T08:32:32.275053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vanishing-point-guided video semantic segmentation of driving scenes","venue":null,"work_id":"ba123bf6-7ae6-4ad1-8b2f-8c2838125ab1","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:46c1cdbed6c4d8045f553fc2a6ab81222ad221f24d1e261729e5103b14353374","observation_id":"ebf724fc-02f1-47da-b9a6-1755d2fb2e58","resolution":{"observed_at":"2026-05-13T08:32:32.201338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X-prompt: Multi-modal visual prompt for video object segmentation","venue":null,"work_id":"535c8b5b-7469-448f-803a-73185ceec64a","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:20af91e795622e31d9ba9052614940aebd9dad7f585580b7cd76eec0c948fcae","observation_id":"83412c25-d660-4313-b939-d57e6ad666b7","resolution":{"observed_at":"2026-05-13T08:32:32.256384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benchmarking neu- ral network robustness to common corruptions and perturba- tions","venue":null,"work_id":"85648d95-fdd6-49c6-87f5-281d69e0ac5e","year":2019},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:381baf58ad224ca038d6efa04b3b3c8af9a36245d260507e85fa727d0d9523bb","observation_id":"2fa3b0ce-8c20-4109-9c2f-3e4ef1182028","resolution":{"observed_at":"2026-05-13T08:32:32.296462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":"916feac6-e9e3-4f62-a8ac-7e41f1a3a0a3","year":2022},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:97572f83acbdb855eb3f3d868424f49bf522892776ac9187e73385a0bef36d57","observation_id":"8c8cbe77-76b5-492d-aa3e-d52858243567","resolution":{"observed_at":"2026-05-13T08:32:32.241075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Categorical repa- rameterization with gumbel-softmax","venue":null,"work_id":"a374caf9-37d3-47d0-975c-5fc728fa9e40","year":2017},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:2db2d4bf2e92c87e79a08155ec19483c50d36c1f889e8cdffe9cdf918d3e373c","observation_id":"962a4751-31d9-45ec-807e-6f9eefd298ab","resolution":{"observed_at":"2026-05-13T08:32:32.227158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yuille, and Li Cheng","venue":null,"work_id":"9042a617-de93-44a1-a01c-a8fb8c901f51","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:2cd1a0ac92fbd8340a928510b67d6162ed10def1a9300bb928e0b9665c5b4326","observation_id":"44022748-5d26-45bc-9b52-81281f78f708","resolution":{"observed_at":"2026-05-13T08:32:32.312393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segment anything in high quality","venue":null,"work_id":"f19ff36c-c130-498a-964e-d5d755379f3f","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:9298cbeb3b1211875e8ccfa426fc23c5e511b04107d62c774fe296c917fc4051","observation_id":"4be7473d-96cf-4b02-ad9f-3b6e3021bee1","resolution":{"observed_at":"2026-05-13T08:32:32.230365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Event-guided deblurring of unknown exposure time videos","venue":null,"work_id":"d6a0b766-6aa4-49ab-afe4-8734fa0fe40a","year":null},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:9dc61ec4e3fb10cd7a3da81202dce5b0715f43b7364a349f9d3ecea9b7f5fdfb","observation_id":"d7098849-95ac-4195-b374-2429b0265f87","resolution":{"observed_at":"2026-05-13T08:32:32.249482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ex- ploring temporally dynamic data augmentation for video recognition","venue":null,"work_id":"c7dcf4c0-ed1b-4ed6-8574-f562e8f2534e","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:2a7a6e4801fd39c10c825776af80a1f947fca0efd751133bcdee9b44ee440982","observation_id":"837bcd43-7f7a-43e5-830b-0e557ddd8e17","resolution":{"observed_at":"2026-05-13T08:32:32.315980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segment any- thing","venue":null,"work_id":"8d004aa5-f6fb-4ad2-a519-f9574d93e2a5","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:44b631a888339dbf95f36809ed2aeeb1860e9eb5dd5971d5e12d9fd1a102126a","observation_id":"0c95e41a-45d5-4a1d-a38a-11cbf2fab0d1","resolution":{"observed_at":"2026-05-13T08:32:32.219976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fifo: Learn- ing fog-invariant features for foggy scene segmentation","venue":null,"work_id":"ce109be2-232a-4255-8662-e429c529de38","year":2022},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:4db177a275b95a454f5b193ce8af15a5521bad4174ca5ac62618576570c3be15","observation_id":"e409864e-759a-47bc-9d84-999a3e50a117","resolution":{"observed_at":"2026-05-13T08:32:32.259787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human pose estimation in extremely low-light con- ditions","venue":null,"work_id":"841bf8c7-eb6b-4897-9905-a56feaa14650","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:874d31803333951379b37c65d1b1525eb71b894eabea301fa4c102f926e09351","observation_id":"21bbcc0c-3cbe-4933-8f93-d54e93c6a398","resolution":{"observed_at":"2026-05-13T08:32:32.306058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frest: Feature restoration for semantic segmentation under multiple adverse conditions","venue":null,"work_id":"5a68ff40-70d0-4880-a24c-0cadb87c71e9","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:c6660e1bfa266cd34319243adcb82d33998bcf62743de58a7ac187934df236bf","observation_id":"4088cf77-ebe0-4a8c-a9d7-7a811ea42d28","resolution":{"observed_at":"2026-05-13T08:32:32.272704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GaRA-SAM: Robustifying segment anything model with gated-rank adaptation","venue":null,"work_id":"f064b7a3-17e3-48a4-be46-d2aaacb78708","year":2025},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:36baf7ea2e4775c457a8f9cfa2c1a0f1528a870e00a7156452dbfd8d6e575e78","observation_id":"05750ca0-c7bc-45fa-b798-f7f11a53c078","resolution":{"observed_at":"2026-05-13T08:32:32.293056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04981","last_updated":"2025-06-03T13:37:22Z","snapshot_observed_at":"2026-07-06T21:05:25.007191Z","submitted_at":"2025-04-07T12:09:18Z","title":"TestDG: Test-time Domain Generalization for Continual Test-time Adaptation","version":2},"cited_work":{"arxiv_id":"2504.04981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04981","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Testdg: Test-time domain general- ization for continual test-time adaptation","venue":null,"work_id":"4c0af44b-4f96-47cc-b899-6b71b18fbb7b","year":2025},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"cited_paper":"/paper/2504.04981","citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:0c1db7b8a0e1b3f3d5fad74a6959d8f8ca51620657c5cda1adfc190e10db4d98","observation_id":"471b77c6-55f6-48a5-8691-7bd43d998ae7","resolution":{"observed_at":"2026-05-13T07:22:29.363471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All-In-One Image Restoration for Unknown Corruption","venue":null,"work_id":"133e81ae-0417-4368-9160-40f871436aec","year":2022},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:5102792f112d5cca38dd86ea569f605db6c2815d586a0e92fa44eaec5e78a2ba","observation_id":"d0aa955b-06af-4929-b469-1fe2d7b79ee4","resolution":{"observed_at":"2026-05-13T08:32:32.223781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Event-assisted low-light video object segmentation","venue":null,"work_id":"0320962e-6ad2-4a4a-b71e-62af2370fb10","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:d01a62a647f740f8c595d958a69818d8d09564d690ab2cc3b5382c242ccca248","observation_id":"5a2001cb-f722-43b0-bc12-c9722e7e7177","resolution":{"observed_at":"2026-05-13T08:32:32.212872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"UniVS: Unified and universal video segmentation with prompts as queries","venue":null,"work_id":"380f632f-5aec-4923-8186-858c4b037f19","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:74414cd3331ca44c0faa3d5481004086ae841aaa10e82c18d600ece9e816857b","observation_id":"924f8546-8ea6-4c73-aed5-0cfd60ef8d37","resolution":{"observed_at":"2026-05-13T08:32:32.302613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning spatial-semantic fea- tures for robust video object segmentation","venue":null,"work_id":"d7d70ee3-7128-4203-adc9-f45a4dd9edb7","year":null},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:ad8d2f0988807c7f5cacbe7ffbbd1929b82a33e93ec64b806ea586d5fb5ffb0e","observation_id":"451bdd40-eefa-4754-8869-a89238548cf0","resolution":{"observed_at":"2026-05-13T08:32:32.269703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unified open-world segmentation with multi-modal prompts","venue":null,"work_id":"a37cdc9e-4b1f-4a5f-89ef-f2aa0bf862f2","year":2025},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:1741cd95acbd88402a675b883928840d35c29b9903dab4cced59520348a20775","observation_id":"0744971c-7515-4555-9881-db282eb71e2d","resolution":{"observed_at":"2026-05-13T08:32:32.216032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"409fa2f6-d745-4dd8-85f1-4b7f5ca77bb8","year":2019},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:eb5cd75edc75710ef894420fb0d446bc5567195f489b88e38aa8b3a21f40e736","observation_id":"5385a13a-e530-474b-8423-3e392c2ea89b","resolution":{"observed_at":"2026-05-13T08:32:32.299395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image segmenta- tion using text and image prompts","venue":null,"work_id":"ed3adb89-7dc9-4892-923e-e3193738656e","year":2022},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:9a9ed589abcfb86ab5c83b139fd1f27988e2357f272c32ec33cf3bc6c781f049","observation_id":"9822aab2-f841-4052-a37c-73dd505f0606","resolution":{"observed_at":"2026-05-13T08:32:32.237266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sam- i2v: Upgrading sam to support promptable video segmen- tation with less than 0.2% training cost","venue":null,"work_id":"bda4ee03-7535-4a00-aebf-8a633425fb90","year":2025},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:02d24e6b9cacfbe166125878a72e30ef080dd37e461dfbfaa52180bebe8cbe16","observation_id":"4150c7e0-2e51-4534-b694-4cdcb139d2ca","resolution":{"observed_at":"2026-05-13T08:32:32.233382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A benchmark dataset and evaluation methodology for video object segmentation","venue":null,"work_id":"3a54c5a9-32b5-4d05-962b-1a61fe09186b","year":2016},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:0787397f239236d0474c62c6d0c9524297bdc03d9df7f490f2a4f01c85a81816","observation_id":"e6d52516-e1ad-4670-8666-305bf7e977f3","resolution":{"observed_at":"2026-05-13T08:32:32.279515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PromptIR: Prompting for all-in-one image restoration","venue":null,"work_id":"0b88a567-a33e-4ffa-92ea-9b25e223d7c7","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:ce99ff5b232cfb895d1d9fddfe3d2a118e6937a314fc422cdf41421a3298691d","observation_id":"08267615-6cc6-4a1b-89df-48b67561175a","resolution":{"observed_at":"2026-05-13T08:32:32.205304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08682","last_updated":"2022-12-09T14:53:21Z","snapshot_observed_at":"2026-07-06T14:19:11.158464Z","submitted_at":"2022-11-16T05:31:49Z","title":"Parameter-Efficient Tuning on Layer Normalization for Pre-trained Language Models","version":3},"cited_work":{"arxiv_id":"2211.08682","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.08682","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parameter-efficient tuning on layer normalization for pre- trained language models.arXiv preprint arXiv:2211.08682","venue":null,"work_id":"749e678b-1b29-48ed-865b-5b0e884a39c0","year":2022},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"cited_paper":"/paper/2211.08682","citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:bec44c26635268752196d0c1c2417919425f3f324ed965e501f1bf47a836fabe","observation_id":"ed97106a-f7cc-4c1b-983c-347f2da12998","resolution":{"observed_at":"2026-05-13T07:22:29.378488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SAM 2: Segment anything in images and videos","venue":null,"work_id":"1c453fb8-2aad-4d66-a324-6e23ecbbe1c6","year":2025},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:2b538afc7c2cdea524d82995acd63f6c99ea7ce0db83c9806dd50c54191f05d1","observation_id":"5339354b-47ab-4f7c-83cc-0600e851451b","resolution":{"observed_at":"2026-05-13T08:32:32.285160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ACDC: The adverse conditions dataset with correspondences for se- mantic driving scene understanding","venue":null,"work_id":"2a125e18-3a31-4b4e-82a9-c341f377aa13","year":2021},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:e0e2e6d30cb941903b981a1e402f5c74fd439ea8f2261d36ff4062fc4e25905d","observation_id":"97a45742-1061-49bb-b54f-fc154599dd0c","resolution":{"observed_at":"2026-05-13T08:32:32.262738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ACDC: The adverse condi- tions dataset with correspondences for robust semantic driv- ing scene perception.IEEE Transactions on Pattern Analysis and Machine Intelligence","venue":null,"work_id":"2c6e8ecf-9ab8-4ecb-a22a-e5952dc1ebce","year":2025},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:a25a4653865297a66c726baf981abdc4e14a41fd2995e6d6c4eb7c77f893e067","observation_id":"c28ce58f-0d40-4dea-ae9e-8ff25441644e","resolution":{"observed_at":"2026-05-13T08:32:32.253479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kernelized memory network for video object segmentation","venue":null,"work_id":"ead3544e-d35b-4484-97d3-5520a1a542e0","year":2020},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:fbca632b8cc92fd8a328e8e7bf8cb843a319116b0d1a8fbfc75019a72ebbf81a","observation_id":"168e561f-9b6e-4c09-9b20-77cbaccfcbcc","resolution":{"observed_at":"2026-05-13T08:32:32.277389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Urie: Universal image enhancement for visual recognition in the wild","venue":null,"work_id":"2fc5a354-6ae1-47d2-a909-fc99ab2e9458","year":2020},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:e3f5749a27bfdfb421c335677d5984262bab63963664ebdb394b4eded83d157a","observation_id":"b34773af-bc6d-4d2a-82a5-92cec3dacc4f","resolution":{"observed_at":"2026-05-13T08:32:32.266686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning video object segmentation with visual memory","venue":null,"work_id":"6fc19268-4134-4cad-973d-5cdcedff7e13","year":2017},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:7d6d92d6ce1c6faeaf034520e5eea6142a0fee3bb46b7b7ecf21653eafb1a8ba","observation_id":"a9e602ac-e6d7-4235-80ae-810836643ed3","resolution":{"observed_at":"2026-05-13T08:32:32.245063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning motion patterns in videos","venue":null,"work_id":"3d5f4a2e-aa66-4bb2-a930-5a0cfd683999","year":2017},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:0882da011c4afc1d3e02f9f29432bddf34c8e33630fc7f45c02de422ac7925f4","observation_id":"f8d0548f-5e56-4ad1-8cdc-826104cefa6e","resolution":{"observed_at":"2026-05-13T08:32:32.288936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video segmentation via object flow","venue":null,"work_id":"87aee393-f792-4f5f-aa0b-55255583034e","year":2016},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:8f8ce37bd1bcdcae0194d405950fe3caaaaea479db8f824e371f7764b12eb320","observation_id":"374b87df-cc1a-40bf-b26c-6401fde53bc8","resolution":{"observed_at":"2026-05-13T08:32:32.208743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20284","last_updated":"2024-03-29T16:53:11Z","snapshot_observed_at":"2026-07-06T17:53:11.000124Z","submitted_at":"2024-03-29T16:53:11Z","title":"LayerNorm: A key component in parameter-efficient fine-tuning","version":1},"cited_work":{"arxiv_id":"2403.20284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.20284","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Layernorm: A key component in parameter-efficient fine-tuning","venue":null,"work_id":"a00c6a11-e3cc-4aef-8106-b624405f3c6d","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"cited_paper":"/paper/2403.20284","citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:005115b1690aeb7a951eb4250da85867efd43c626db4c1f18e37987aa92e73b3","observation_id":"eebc040e-517a-4396-af86-b7d6380f7f0a","resolution":{"observed_at":"2026-05-13T07:22:29.384386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient track anything","venue":null,"work_id":"cb382d98-92bb-4ddc-b122-c93ab25500bf","year":2025},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:0bdca62e27fe97f6a664c7719f7166d9746f7d7ec2fff8d2f0102b4914877623","observation_id":"5386cf7c-0861-4054-bdd7-a2bf35d6a36b","resolution":{"observed_at":"2026-05-13T08:32:32.281975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.03327","last_updated":"2018-09-06T04:19:45Z","snapshot_observed_at":"2026-07-06T07:00:12.122241Z","submitted_at":"2018-09-06T04:19:45Z","title":"YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark","version":1},"cited_work":{"arxiv_id":"1809.03327","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.03327","snapshot_observed_at":"2026-07-08T02:04:26.310872Z","title":"YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark","venue":"cs.CV","work_id":"2798c43d-6f6c-445b-8a43-14cba092aa4b","year":2018},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"cited_paper":"/paper/1809.03327","citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:e4f1d019e36c3980453a3c4127a6fdbff25300f70d864efdb4d2d63004fb46db","observation_id":"73302bf2-b071-4a48-9048-9338e3dbac4c","resolution":{"observed_at":"2026-05-13T07:22:29.355364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11420","last_updated":"2023-12-18T18:21:43Z","snapshot_observed_at":"2026-07-06T17:04:46.288600Z","submitted_at":"2023-12-18T18:21:43Z","title":"Tuning LayerNorm in Attention: Towards Efficient Multi-Modal LLM Finetuning","version":1},"cited_work":{"arxiv_id":"2312.11420","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11420","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tuning layernorm in attention: Towards efficient multi-modal llm finetuning","venue":null,"work_id":"7923c4a9-522a-4c50-88a7-01ace4da7b23","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"cited_paper":"/paper/2312.11420","citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:c55c5d363393d67476865db6d28013e0d6cd7fc40d76f6e85d83cf9df1930c40","observation_id":"85c87951-1c27-4c23-a30a-974909a0c7dc","resolution":{"observed_at":"2026-05-13T07:22:29.372361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rmem: Re- stricted memory banks improve video object segmentation","venue":null,"work_id":"44a9ff99-4e5b-4e60-93cc-4fd82221394f","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:163486abba91a4c0aca2415f4b8c35bc74f748d22f1067e99bb510ad18e0d7eb","observation_id":"8bc5faea-0b56-4967-b548-58eb5614df2a","resolution":{"observed_at":"2026-05-13T08:32:32.197118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segment everything everywhere all at once","venue":null,"work_id":"00f291bb-15e4-420e-8029-f058c7e78716","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:056c7db5b43cdf42bf93a5a6f874c5e903db688b8320a304e12249c8089ee157","observation_id":"cc76d622-ce00-4126-a9fb-6290cb500c91","resolution":{"observed_at":"2026-05-13T08:32:32.309365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":6,"verified_fuzzy":44},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2605.12006."}