{"as_of":"2026-08-14T09:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23e628b30776d5ec80147408255a5a454042ca553e563e993c56fa9ad1c71167","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:22:03.651594Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.10950/citation-record","integrity":"/paper/2604.10950/integrity","json":"/paper/2604.10950/citation-record.json","paper":"/paper/2604.10950"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.08020","last_updated":"2023-09-14T20:31:06Z","snapshot_observed_at":"2026-08-13T10:13:21.476804Z","submitted_at":"2023-09-14T20:31:06Z","title":"Temporal-aware Hierarchical Mask Classification for Video Semantic Segmentation","version":1},"cited_work":{"arxiv_id":"2309.08020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.08020","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporal-aware hierarchical mask classi- fication for video semantic segmentation","venue":null,"work_id":"6a4e3e40-5d51-4ac3-a05f-45d9c31516d5","year":2023},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"cited_paper":"/paper/2309.08020","citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:7900727bf93c3c0db75424db005db4c1fd02806dd819b3dbc03c419eba38c0d5","observation_id":"2340345f-fc48-4e17-be70-d4d0b2cc5532","resolution":{"observed_at":"2026-05-11T09:00:58.791560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Contrastive test-time adaptation","venue":null,"work_id":"2b9e24fa-05d8-444a-8c0a-24f86a520887","year":2022},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:c4f74ed4b17822563ea6f84d50cdaec31761d6a1795d184bc5043c774c73bbf9","observation_id":"b1b7282d-c040-40b7-b1fd-a307094e690b","resolution":{"observed_at":"2026-05-17T15:49:55.697009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Per- pixel classification is not all you need for semantic segmen- tation.Advances in neural information processing systems, 34:17864–17875","venue":null,"work_id":"78801b92-5c7c-45c9-8bde-7a399dee5dfc","year":2021},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:379755d7cd2d0b2c1968166b7b2a08e85815fbc34e5612d786005abf57a94165","observation_id":"f7d57924-089e-4d59-8697-f929d664e7ef","resolution":{"observed_at":"2026-05-17T15:49:55.648488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":"4c32fe0e-3c8b-44c2-b0c7-693db83aff1a","year":2022},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:b9369ca718f2c0e6d4420054478773b3442cf5c8478bee7ddc5edbb1e711ec0c","observation_id":"fa35eab2-9c4d-4a87-a79a-0b163e5a838d","resolution":{"observed_at":"2026-05-17T15:49:55.740145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finding meaning in points: Weakly super- vised semantic segmentation for event cameras","venue":null,"work_id":"97465800-8c2a-40fc-ab7c-b7d7eb50614b","year":null},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:b291628d3bdc9062ff5e9d4afa0588caceddfd4878206f1077e4452d59efc22e","observation_id":"87f3cf09-204d-40b5-81ea-f275acff1f2f","resolution":{"observed_at":"2026-05-17T15:49:55.712913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"To adapt or not to adapt? real- time adaptation for semantic segmentation","venue":null,"work_id":"23d44d5b-9727-4ee6-bb0f-63a7e8011d0b","year":2023},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:73af8034f5a8ded383cbdba41fe3e774aa16e1391d050a3baf9461d501e640c2","observation_id":"58f7de57-c3a3-4b50-9c3d-b4418d975b20","resolution":{"observed_at":"2026-05-17T15:49:55.705563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":"6dfb092d-7c9b-450f-ba12-ad458f4f6b1c","year":2016},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:0da19466d908b005b70d5c41bff1ca6e3c05a4126db8fac5e7ce516991b6c087","observation_id":"ac510213-2e48-4d02-851d-0e5b2845c867","resolution":{"observed_at":"2026-05-17T15:49:55.719620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Every frame counts: Joint learning of video segmentation and optical flow","venue":null,"work_id":"623c0a74-64b4-4480-816a-4e0e20afd58a","year":2020},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:657b41bc1757956ec7896e818e6d85dc182871da23940a1efcbf0583a5fb2cfa","observation_id":"2d145831-c3de-443a-9ef1-5a8f59315b02","resolution":{"observed_at":"2026-05-17T15:49:55.665465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flownet: Learning optical flow with convolutional networks","venue":null,"work_id":"5625c1a2-5611-4b64-bc6b-1e1d051b8f60","year":2015},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:881c4ae1b22792fc2920d5e986330a1ef37f0243e424b5d7953b3d16fcf9f5cc","observation_id":"01a5d76e-4abc-4d0b-aa91-7434d92570eb","resolution":{"observed_at":"2026-05-17T15:49:55.757310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uncertainty reduction for model adaptation in semantic segmentation","venue":null,"work_id":"0461d298-2056-4ec1-ae28-df621590e095","year":2021},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:24cdca2829eb703c21a9d1e210f1609b6864045e229aeb320598154a7d9db1ff","observation_id":"cfce804e-d3fa-4e29-886e-3c9115466028","resolution":{"observed_at":"2026-05-17T15:49:55.693035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Se- mantic video cnns through representation warping","venue":null,"work_id":"498f458d-5027-4eac-950d-1648e55d502c","year":2017},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:2c220b1bd1f2d14be5d1d48f63c85f8d0ee70763ef23fdecc5b80439362ea999","observation_id":"8cde8358-5572-4aad-9c89-4767a79fb0ca","resolution":{"observed_at":"2026-05-17T15:49:55.688836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video segmentation with superpixels","venue":null,"work_id":"0dbbe912-a307-433e-b593-27018b85c1d0","year":2012},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:1fffb1e9943c9f3060c1405738cec98cee960f909d0adf969f9071f1eb4dd4d7","observation_id":"d2e0d78a-4792-4707-90e3-fafc1a12efb8","resolution":{"observed_at":"2026-05-17T15:49:55.737035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Superpixel-based video ob- ject segmentation using perceptual organization and location prior","venue":null,"work_id":"f7f9d46e-6d5f-46f9-bcba-8ca8b66b896a","year":2015},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:8d33796dce9ad2f5d34358bea1e3b0a89fb5b9ff420ffec2c5d91f7122d91d04","observation_id":"56d64b20-77cd-44f3-9b46-8bff50dedb0a","resolution":{"observed_at":"2026-05-17T15:49:55.709553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vanishing-point-guided video semantic segmentation of driving scenes","venue":null,"work_id":"ba123bf6-7ae6-4ad1-8b2f-8c2838125ab1","year":2024},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:30db203474e9e863dac6bf128b4aab1a42f2f8f0f6b97da6022a5e7203969fae","observation_id":"cfef93fe-d76d-44da-b2e8-220b73200e75","resolution":{"observed_at":"2026-05-17T15:44:55.237374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploiting temporal state space sharing for video se- mantic segmentation","venue":null,"work_id":"083f086d-ae34-41b1-8865-26c5c1e49fe0","year":null},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:7e08ac2f7d42566739bd2435ceaeb6be9422e5e0db1a0184c79c36373cceb765","observation_id":"abc894bb-24e8-4ec0-931b-032bf6f9895e","resolution":{"observed_at":"2026-05-17T15:44:55.233194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporally distributed networks for fast video semantic segmentation","venue":null,"work_id":"53c3aadb-6ead-4d42-a368-826ca6c2acbb","year":2020},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:143033c16e19e80cd5bd97a969c7f0fa8ef7dcc0fc40d04037f61a5d2aee0d16","observation_id":"989b305d-be1f-4258-9c8a-465a9478b054","resolution":{"observed_at":"2026-05-17T15:44:55.240513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Min- vis: A minimal video instance segmentation framework without video-based training.Advances in Neural Informa- tion Processing Systems, 35:31265–31277","venue":null,"work_id":"0c8f7002-f3a6-42bb-a398-b780c495153d","year":2022},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:e2d09324812b1e280eed0409635351c92bb179584cef0f47664a19843a9a6344","observation_id":"e2f487f8-fb52-4281-85b4-f30a02b1caa0","resolution":{"observed_at":"2026-05-17T15:49:55.747651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient uncertainty estimation for se- mantic segmentation in videos","venue":null,"work_id":"7b554b33-8a3c-4125-a5b2-dbf4545d68ea","year":2018},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:58176922581217543e12e53280e2636363e0aca1721aa62ce8a8d83d43cfba78","observation_id":"98b03f69-eeb8-4418-8b6c-84e0a7daba69","resolution":{"observed_at":"2026-05-17T15:44:55.225670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accel: A corrective fusion network for efficient semantic segmenta- tion on video","venue":null,"work_id":"c7537d2d-ba47-4905-8a73-ffed09fd7e9d","year":2019},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:651101874efe79e90687ba4764705fff28d8748f03879fc40918df55f231649e","observation_id":"a912cde0-b507-4f9f-b38c-275bfd0bc529","resolution":{"observed_at":"2026-05-17T15:44:55.229157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Talos: Enhancing semantic scene completion via test-time adaptation on the line of sight.Advances in Neural Information Processing Systems, 37:74211–74232","venue":null,"work_id":"1a348e02-35a7-4c0c-821b-934d0c7667cf","year":2024},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:2aacf9fc8d351b6cfc4d285feee39d38c45fe7ff68835bca2e378de551f64a1f","observation_id":"f908b736-f173-4edd-b363-46bffee42a7f","resolution":{"observed_at":"2026-05-17T15:44:55.215874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video scene parsing with predictive feature learn- ing","venue":null,"work_id":"c260b4e1-27ed-4f01-b076-b7056ab4f79c","year":2017},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:c658090d882eef56805ba34893e0d8ec78a45ce830ad34963a7077957e36bf45","observation_id":"2612273c-7f62-4f43-b140-6b93a78b88d5","resolution":{"observed_at":"2026-05-17T15:44:55.219123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved image boundaries for better video segmentation","venue":null,"work_id":"8ed48159-d65d-4983-a7e0-f803b4a1114e","year":2016},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:162b0f7ffdbf6cda96a939c5e9b5b3c07fc2f85a37083e0cc6ca813c82989d29","observation_id":"4ffcaa7b-afde-4887-b536-c5e0c510c094","resolution":{"observed_at":"2026-05-17T15:49:55.723241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dc-tta: Divide-and-conquer framework for test-time adaptation of interactive segmenta- tion","venue":null,"work_id":"0c3794af-a8d9-4858-b65a-cf1f8a706e2b","year":2025},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:c63bc0a3d4859058c152c212d3dd83d164ed70ee437d99aa6de3a74e46da19e3","observation_id":"31bd749a-32c9-498b-80a9-79b9d725e198","resolution":{"observed_at":"2026-05-17T15:49:55.701887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segment any- thing","venue":null,"work_id":"8d004aa5-f6fb-4ad2-a519-f9574d93e2a5","year":2023},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:a551f89e8121f720b9867600bac4359da68170051fe87d5f74aebe87f3718bc2","observation_id":"1f5a15aa-a93d-4a99-bca6-1293854c25eb","resolution":{"observed_at":"2026-05-17T15:49:55.674545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From sam to cams: Ex- ploring segment anything model for weakly supervised se- mantic segmentation","venue":null,"work_id":"751fd401-1570-4391-ad89-cbaa0e30c597","year":2024},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:1d43906f656743f2210c89c6931792bf61f9b33640c285becbe035c5a486ead5","observation_id":"464d4267-0ea6-45f4-9e21-b2080c4adfad","resolution":{"observed_at":"2026-05-17T15:49:55.678975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wish: Weakly super- vised instance segmentation using heterogeneous labels","venue":null,"work_id":"9a7973ec-eb59-486d-97f0-8d8a79539ea1","year":2025},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:acf59260c2f127855c1f6dd03dda61d07e926d9d123dfaaff17fc0cf8c172738","observation_id":"6f21180a-973f-4ea6-b468-7fb9086e5d3f","resolution":{"observed_at":"2026-05-17T15:49:55.634191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unlocking the potential of ordinary classifier: Class-specific adversarial erasing frame- work for weakly supervised semantic segmentation","venue":null,"work_id":"b54fca54-a246-43a2-ad15-02e359ba60e7","year":2021},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:93e6f19f5743c0ef39533b1fe432f346d7cc673ea71ba78344bc861848f7e07a","observation_id":"fa20cd0a-6167-43c9-b4f6-64346a5a2520","resolution":{"observed_at":"2026-05-17T15:49:55.733550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weakly supervised semantic segmentation via adversarial learning of classifier and reconstructor","venue":null,"work_id":"9b428ccd-4074-4ac6-a338-888ba1dfedae","year":2023},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:d20a4fd072aa97fdda65ec955c68a07a0844d188bbe89f55f5703cf2c6945baa","observation_id":"baa3ce70-2031-4000-ae16-dcb0cf33dd22","resolution":{"observed_at":"2026-05-17T15:49:55.661303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Phase concentration and shortcut suppression for weakly supervised semantic segmentation","venue":null,"work_id":"afdd5c73-6540-4dd4-b706-42fb76373239","year":null},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:fe15be73570bdac237281f7fbd159d1e8dd249e092e62a78a100ce1e6af1830c","observation_id":"3f14df5e-cddf-4c8d-917c-019dd93eeea4","resolution":{"observed_at":"2026-05-17T15:49:55.639074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gsvnet: Guided spatially-varying convolution for fast semantic seg- mentation on video","venue":null,"work_id":"4e8604c0-710d-45d4-9c5c-e101020b2f51","year":2021},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:f0aa6fba38f1f40b46850dc053ff2162e90badc704865181f7d7466f767ddef5","observation_id":"0df29407-c52f-4203-b34f-296061a2e029","resolution":{"observed_at":"2026-05-17T15:49:55.760908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video semantic segmentation via sparse temporal transformer","venue":null,"work_id":"a4dd8967-4966-4792-bffe-787b29080c9c","year":null},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:56ce32d6d242a2abc30d57fe561e166359d49c0a9794e2832640d1bf012badc6","observation_id":"05714047-1acf-4920-9bc2-cab5a50fc79e","resolution":{"observed_at":"2026-05-17T15:49:55.657500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Low-latency video se- mantic segmentation","venue":null,"work_id":"2f50d103-9d84-42af-86a1-36dc698e595e","year":2018},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:ba19d7aa3444517ce966cd324144d893fcea89e0a2ac515278847b732d84400e","observation_id":"f085a657-c4f7-45d3-8728-976861932abb","resolution":{"observed_at":"2026-05-17T15:49:55.653334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Do we really need to access the source data? source hypothesis transfer for un- supervised domain adaptation","venue":null,"work_id":"2ead0abd-caf7-4978-8c5d-3a12a39b2891","year":2020},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:fe65d14ea186f861224ec281e4879a62566787351a8bb09e05a3245ae79213fb","observation_id":"d2ed0273-b99d-44d3-b2c8-f6dad5197fa7","resolution":{"observed_at":"2026-05-17T15:49:55.669291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10469","last_updated":"2024-08-21T00:39:38Z","snapshot_observed_at":"2026-08-12T23:01:03.426552Z","submitted_at":"2024-08-20T00:45:13Z","title":"LSVOS Challenge 3rd Place Report: SAM2 and Cutie based VOS","version":2},"cited_work":{"arxiv_id":"2408.10469","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.10469","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2408.10469 (2024)","venue":null,"work_id":"ebd88957-6d57-4c8b-9078-189c39b15a6d","year":2024},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"cited_paper":"/paper/2408.10469","citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:e921c9baa2b91e4cab7c63ca57c3554ad56d3ae990afe78614d41f4e0df7d022","observation_id":"e77a1071-fd04-4c22-8cc2-31dd3732aae4","resolution":{"observed_at":"2026-05-11T09:00:58.803383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient semantic video segmentation with per-frame inference","venue":null,"work_id":"bea4c7d3-1c74-4a97-94ad-da89686309c9","year":2020},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:5e959075437be7b44ce6d15ba5dcebed3323f7244c6dff23ec4cad6f1d6c4ec0","observation_id":"cbf0a29f-929c-417f-9993-bf5c066faed9","resolution":{"observed_at":"2026-05-17T15:49:55.716274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatio-temporal pixel- level contrastive learning-based source-free domain adapta- tion for video semantic segmentation","venue":null,"work_id":"a75d004c-ab1a-4e1c-bc99-64a51f4ebb58","year":2023},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:629d5702deb17596319ef663fde6df10ef479e2b7aa9d3350c3738ef9fd0429f","observation_id":"83a5c999-191e-4246-a236-159730fa266e","resolution":{"observed_at":"2026-05-17T15:49:55.726893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vspw: A large-scale dataset for video scene parsing in the wild","venue":null,"work_id":"204ab3a9-973b-47be-8d8e-9fedf85cbba0","year":2021},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:39881b87e6eef729fe4343a23977e2093186bb2b9fc3aefd91245b08328d5625","observation_id":"12daf757-f1e7-4d9b-97da-dc55d2b87bd2","resolution":{"observed_at":"2026-05-17T15:49:55.643571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semantic video segmentation by gated recurrent flow propagation","venue":null,"work_id":"7b9fef89-26ad-4780-91fb-e9034a9abd81","year":2018},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:2c907e4395dfa12af07249da473cce8fcf05344a0269b2414adf554887bf874c","observation_id":"14cf8f29-1ee1-4927-b528-c9fd2a18e197","resolution":{"observed_at":"2026-05-17T15:49:55.683991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards stable test-time adaptation in dynamic wild world","venue":null,"work_id":"eddcfb74-0f1e-4100-8a6f-df8c5d8410d9","year":2023},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:1c5b9cada666286169e1893474c2dfa8162f25b41d08ffcbce82ce1da08c44f3","observation_id":"d348d0df-ed40-4e83-b558-7bcd0c4e0e5d","resolution":{"observed_at":"2026-05-17T15:44:55.212107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10125","last_updated":"2024-08-24T13:07:51Z","snapshot_observed_at":"2026-08-12T23:01:18.685190Z","submitted_at":"2024-08-19T16:13:14Z","title":"Video Object Segmentation via SAM 2: The 4th Solution for LSVOS Challenge VOS Track","version":2},"cited_work":{"arxiv_id":"2408.10125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.10125","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video object segmentation via sam 2: The 4th solution for lsvos challenge vos track","venue":null,"work_id":"8b592292-875d-4c6a-bebc-11a9b525012b","year":2024},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"cited_paper":"/paper/2408.10125","citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:e2085fff0681780d1164429535fb2453b1d62b67c767114620620aac3bb20f0c","observation_id":"b4ec74c1-f1aa-4606-8f39-071a75c3f271","resolution":{"observed_at":"2026-05-11T09:00:58.763801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Real-time, accurate, and consistent video semantic segmentation via unsupervised adaptation and cross-unit de- ployment on mobile device","venue":null,"work_id":"703c439f-6c58-4e4d-b9b2-e84bc4e40d32","year":2022},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:a1878d3cc56495f597943dacf89f34d3b98a7e1f116b7fbae578284c79c1c5ca","observation_id":"1bdafb32-69a4-4aba-bb64-5251c90e7dcd","resolution":{"observed_at":"2026-05-17T15:44:55.195532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Local memory attention for fast video semantic segmentation","venue":null,"work_id":"d81796d3-282e-4bbd-8d3b-e7ac0f10956b","year":2021},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:33fd89444e59cf66a7fc9e920c8b1c731362046793b04c01a8629eb7f5041331","observation_id":"cb834412-86b5-41ca-a60c-bd7464331e8e","resolution":{"observed_at":"2026-05-17T15:44:55.205077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:9a5ec8845abe9439633028cf50ef4874d8657d6614b931264a2b23d1afe35596","observation_id":"e1315f48-7278-4698-95c4-b0f9e0fd7d41","resolution":{"observed_at":"2026-05-11T09:00:58.781073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Motion-state alignment for video semantic segmentation","venue":null,"work_id":"5435a689-b5f5-4e6d-8fcd-8135be700cc4","year":2023},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:2e62a7d44235a260ba2f610c2f573b2538ae859951ddad3cf14c133a6481aa4e","observation_id":"0eeb066d-9691-47d0-9982-3be3dccdc030","resolution":{"observed_at":"2026-05-17T15:44:55.198662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Coarse-to-fine feature mining for video se- mantic segmentation","venue":null,"work_id":"3f893001-0689-4a2f-89b2-0c8720c0c65a","year":2022},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:596f5ed2d49fb8a72e7bb47651d40faf3ed4d02051aa6f20c4815128567a5ec9","observation_id":"f0905360-6ca0-4cdd-bf78-580548983e12","resolution":{"observed_at":"2026-05-17T15:44:55.185806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mining relations among cross-frame affinities for video semantic segmentation","venue":null,"work_id":"252c2703-0b4d-403e-ba5a-885967365097","year":2022},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:b19abba6a2cac72c03389c462089dd710af825bc396a902c944d7c29bcb6f213","observation_id":"5741aace-732b-4fe6-bb16-cf08b0e27485","resolution":{"observed_at":"2026-05-17T15:44:55.189009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning local and global temporal contexts for video semantic segmentation.IEEE Transactions on Pattern Analysis and Machine Intelligence","venue":null,"work_id":"629bd09a-8f75-402a-8206-f07ba5a24aa7","year":2024},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:573beaba8b5e5751719d91d9b141a93ec0347ce0f49d7c662fb646432a082f18","observation_id":"ae8b9fb8-b64c-4040-8709-9976d2c28d52","resolution":{"observed_at":"2026-05-17T15:44:55.182685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tesla: Test-time self-learning with automatic adversarial augmentation","venue":null,"work_id":"691bfff3-bb67-453a-8b07-69e99a2689fa","year":2023},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:add038ef42e78d68987613c2dff9c4ad8a90a677f203f54decddb091e67a4a37","observation_id":"6e1e8ff9-e025-4c4a-8d8a-91360da1c03d","resolution":{"observed_at":"2026-05-17T15:44:55.179366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12447","last_updated":"2024-08-22T14:43:02Z","snapshot_observed_at":"2026-08-14T08:10:29.126743Z","submitted_at":"2024-08-22T14:43:02Z","title":"The 2nd Solution for LSVOS Challenge RVOS Track: Spatial-temporal Refinement for Consistent Semantic Segmentation","version":1},"cited_work":{"arxiv_id":"2408.12447","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.12447","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2408.12447 (2024)","venue":null,"work_id":"2a7c1655-6bca-4855-aa78-8cfa9fa94924","year":2024},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"cited_paper":"/paper/2408.12447","citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:d5739471a3e3848a72a738719c03115fd8ba840b21512b20c6861d70c2f03123","observation_id":"75c0aae2-eb43-48e9-9e4b-f615378ca406","resolution":{"observed_at":"2026-05-11T09:00:58.775625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised semantic seg- mentation by contrasting object mask proposals","venue":null,"work_id":"68530761-712c-435b-87ab-7c5e7fa74f76","year":2021},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:ef86ec85182f38014b3658f3c2794a3e8f4ac01ff00dc77f5d6fcf91ae18287d","observation_id":"6cd2aa0c-0159-4f0e-abf5-d88db5670cac","resolution":{"observed_at":"2026-05-17T15:44:55.222460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multiple hypothesis video segmentation from superpixel flows","venue":null,"work_id":"e9293c17-07f8-4f34-bd31-303599dfeb3e","year":2010},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:0432eb1711d2dafa41c6f73aa95f5a9a7630d8f9a8e4d8d2c71575c16e54c4a5","observation_id":"9ac29b5e-d194-4b4d-87f4-9735280cb377","resolution":{"observed_at":"2026-05-17T15:44:55.192273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the road to online adaptation for semantic image segmentation","venue":null,"work_id":"193a1f65-6575-40d7-af41-420ccd3dc7cc","year":2022},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:17cf1e19da96cced250d027d2dd0532eadce041ee8eb320c126e80afb3876ab4","observation_id":"cbc4d598-0084-4757-a2e7-f5303e1a3b78","resolution":{"observed_at":"2026-05-17T15:44:55.201917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10726","last_updated":"2021-03-18T17:58:01Z","snapshot_observed_at":"2026-08-14T09:05:55.324880Z","submitted_at":"2020-06-18T17:55:28Z","title":"Tent: Fully Test-time Adaptation by Entropy Minimization","version":3},"cited_work":{"arxiv_id":"2006.10726","doi":"10.48550/arxiv.2006.10726","metadata_source":"pith","pith_arxiv_id":"2006.10726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tent: Fully Test-time Adaptation by Entropy Minimization","venue":"cs.LG","work_id":"7f343a70-32a2-42dc-945a-66a6feb179fb","year":2020},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"cited_paper":"/paper/2006.10726","citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:233805fd7b0e9aa3d8088c1667d088f66110a161c2a8e49d03df01aed8906c8c","observation_id":"93f18233-fd76-4003-9d0e-be13755b198a","resolution":{"observed_at":"2026-05-16T10:09:24.402331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporal memory attention for video semantic segmentation","venue":null,"work_id":"b63f42f5-a1eb-488d-92f7-5e12f00c0983","year":2021},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:458e258e9e012f850f2d24519eeb3896225db206fa0c0d35b4d64a286c849c27","observation_id":"6386d510-8ee9-41db-bb73-4398deee9b63","resolution":{"observed_at":"2026-05-17T15:44:55.176235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual test-time domain adaptation","venue":null,"work_id":"71cffb16-cea7-4a09-b574-06a59cea443b","year":2022},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:0860f95bce079197229553155e3a3172461af65c09ccf7c85f6f29fbe1a06336","observation_id":"5f299a24-f405-4371-8031-fd48b4f0170d","resolution":{"observed_at":"2026-05-17T15:44:55.169846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamically instance- guided adaptation: A backward-free approach for test-time domain adaptive semantic segmentation","venue":null,"work_id":"4fdaa612-4c51-4174-bf7e-fb86ab5b2b84","year":2023},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:927607d14080f5c5c92deab67327f4cbfb896f643f8b1e2ce3d35824123698d6","observation_id":"2767484c-ed6f-4c98-8d37-a51d9ff90ff3","resolution":{"observed_at":"2026-05-17T15:44:55.160332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual test-time domain adaptation via dynamic sample selection","venue":null,"work_id":"cb65e891-aad4-464f-95f9-81201f2cacaa","year":2024},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:ddef038f71c5fe039621bdf298bc60dfa0c080c106c435d5764d6ff66885acf7","observation_id":"0c92cdff-97a5-4967-af82-b3e2e9d334c3","resolution":{"observed_at":"2026-05-17T15:44:55.166788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mask propagation for efficient video semantic segmentation","venue":null,"work_id":"c56e88ca-4d38-4085-b238-6f57893f68bc","year":2023},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:7941a3dc0a74e150e9eda1732085ae72245db309aa3db158d9d7e80c1b6ee3b2","observation_id":"be298149-f507-4d17-bdfb-f96a26edefa2","resolution":{"observed_at":"2026-05-17T15:44:55.163635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segformer: Simple and efficient design for semantic segmentation with transform- ers.Advances in neural information processing systems, 34: 12077–12090","venue":null,"work_id":"0a7d5426-e87d-4f62-844e-fafc8df7b12c","year":2021},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:8f2daf20f19cfd5dc3d77670dda8e3b00ca547273b1b2be41caac9ee7112ffe0","observation_id":"09cc2565-5437-476b-b5a7-32f2d6d386c7","resolution":{"observed_at":"2026-05-17T15:49:55.730508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f8745d88-30c1-406e-9da8-dc219c4ca086","year":2024},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:0741787a6c19ea378c6233b62a1c828df4dc960df3d4e6597214cb1178b085e6","observation_id":"b572f900-2a22-4cb7-8f1f-316aa9ac7ecb","resolution":{"observed_at":"2026-05-17T15:49:55.753683Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Entitysam: Segment everything in video","venue":null,"work_id":"d1b941ca-3621-4699-8336-f02a9b235223","year":2025},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:58bc0040449ec5af137864ab31fd5ef3cdb32eff28c59b9658ab7d7e24c07d6c","observation_id":"7c0f0201-952c-4a47-9d65-d7ec2b8c3ddb","resolution":{"observed_at":"2026-05-17T15:49:55.617641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adversarial erasing frame- work via triplet with gated pyramid pooling layer for weakly supervised semantic segmentation","venue":null,"work_id":"cf684201-0254-4039-a6a9-cb8bdd5b6f35","year":2022},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:282c9d41905e63ba63898f53053ed16deef1cfe5c26fec070b801c9795117a26","observation_id":"607b5e8d-99fb-494c-8563-67a1cfa210d2","resolution":{"observed_at":"2026-05-17T15:49:55.743768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion-guided weakly super- vised semantic segmentation","venue":null,"work_id":"a8de8503-ee93-4137-8fc0-b4a0e19018e5","year":2024},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:4dbc9cb8c31a243db3eb70d175010d2b92a1b8ddddfd186b5d3e50d4bb1d1e5f","observation_id":"994d288f-224c-4178-877a-92fbbeabc5dc","resolution":{"observed_at":"2026-05-17T15:49:55.629819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Class tokens infusion for weakly supervised semantic segmentation","venue":null,"work_id":"714aabaf-cff7-4a01-af8d-3aaa9fd585c7","year":2024},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:b49ea4ec34c8374cfe3a01e92588c6b8c73ed43957ed90ba8c9172fbcea4b4c8","observation_id":"d3d2cc35-e499-4d91-8130-98ba255c196d","resolution":{"observed_at":"2026-05-17T15:49:55.750936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04593","last_updated":"2024-08-08T17:08:57Z","snapshot_observed_at":"2026-08-12T23:06:25.578649Z","submitted_at":"2024-08-08T17:08:57Z","title":"SAM 2 in Robotic Surgery: An Empirical Evaluation for Robustness and Generalization in Surgical Video Segmentation","version":1},"cited_work":{"arxiv_id":"2408.04593","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04593","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2408.04593 (2024)","venue":null,"work_id":"3a6f187b-af5f-4b62-82ee-9bdbf5bf3d9b","year":2024},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"cited_paper":"/paper/2408.04593","citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:9f42a9ac8841abcbbfc7b9f6edb7f4ad3c7b2a9c82c5c1081908c133d077fc3a","observation_id":"c561b15b-f9a1-409f-b8d8-5dfa9adaae05","resolution":{"observed_at":"2026-05-11T09:00:58.817814Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Object- contextual representations for semantic segmentation","venue":null,"work_id":"cc8904dd-b2f1-4c17-a73b-784f8b4d29cc","year":2020},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:856bf9b284bd3a6bc509b3cdf7cea656cf815227a4a34639008da31e75ef250a","observation_id":"4c63cea5-cd61-469a-b017-d4e4bcba6900","resolution":{"observed_at":"2026-05-17T15:44:55.156772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16902","last_updated":"2025-05-19T03:40:10Z","snapshot_observed_at":"2026-08-12T23:42:52.632511Z","submitted_at":"2024-09-25T13:10:03Z","title":"Underwater Camouflaged Object Tracking Meets Vision-Language SAM2","version":5},"cited_work":{"arxiv_id":"2409.16902","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.16902","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards underwater camouflaged ob- ject tracking: An experimental evaluation of sam and sam 2","venue":null,"work_id":"02275ca9-6373-429a-91c3-cc8f95609e24","year":2024},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"cited_paper":"/paper/2409.16902","citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:eb61ad960a6fa08f4d18ac9a92854b4a2de3e3f92ed93fb75262dc36a4c90035","observation_id":"9c529518-e553-460c-8a8f-e7852100e0ea","resolution":{"observed_at":"2026-05-11T09:00:58.768562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12889","last_updated":"2024-08-23T07:51:10Z","snapshot_observed_at":"2026-08-12T22:58:49.238951Z","submitted_at":"2024-08-23T07:51:10Z","title":"Unleashing the Potential of SAM2 for Biomedical Images and Videos: A Survey","version":1},"cited_work":{"arxiv_id":"2408.12889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.12889","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2408.12889 (2024)","venue":null,"work_id":"64991bdf-3ec8-4e1c-ab4d-f9e3d49e7996","year":2024},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"cited_paper":"/paper/2408.12889","citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:2da23bb622effed863f11aa77ebfa5d22189a54b6fd87807f0635f70ce010f15","observation_id":"62538aad-0a3a-4f87-bc20-65f32cb2c62e","resolution":{"observed_at":"2026-05-11T09:00:58.826021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Auxadapt: Stable and efficient test-time adaptation for temporally consistent video semantic segmentation","venue":null,"work_id":"3c8b9b75-64cb-42d1-a8ee-2ef27adac229","year":2022},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:d284abd59c1b642f62dac421ffcd1700cc1057609d4796b7ebc456b87745c7e8","observation_id":"d87f0420-74f2-4b20-a8dd-29b5bc2873a0","resolution":{"observed_at":"2026-05-17T15:44:55.173000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:31:42.395652Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":"ff369fcc-fa0b-4113-8574-0761cffc851c","year":null},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:0786cf500a50b462c5cefb4a897100250b5982c967a3121f9295aae5eb0abd73","observation_id":"50a20b6a-5fdb-4ab6-8582-ba284a02e445","resolution":{"observed_at":"2026-05-17T15:44:55.208786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18653","last_updated":"2025-05-10T02:48:36Z","snapshot_observed_at":"2026-08-12T22:36:09.006324Z","submitted_at":"2024-09-27T11:35:50Z","title":"When SAM2 Meets Video Camouflaged Object Segmentation: A Comprehensive Evaluation and Adaptation","version":2},"cited_work":{"arxiv_id":"2409.18653","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.18653","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When sam2 meets video camouflaged object segmentation: A comprehensive eval- uation and adaptation","venue":null,"work_id":"960a3320-46c0-4618-849a-af8853e0abd4","year":2024},"citing_paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:03.651594Z"},"links":{"cited_paper":"/paper/2409.18653","citing_paper":"/paper/2604.10950"},"observation_digest":"sha256:eb25ce2c359793b59216badaa2314111417afe2fe01f86c0c4adb1af0c8bce96","observation_id":"e4951577-bde0-4548-9b4f-2aa9f5376c4a","resolution":{"observed_at":"2026-05-11T09:00:58.796445Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.10950","last_updated":"2026-04-14T08:11:15Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T04:58:10.025479Z","submitted_at":"2026-04-13T03:47:08Z","title":"Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":9,"verified_fuzzy":60},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2604.10950."}