{"as_of":"2026-08-07T09:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1572ad68178b8ac3ca5df0c3eff9c72aa1ff09cd629fe9b34640e558ef01fe94","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T10:58:35.439139Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24598/citation-record","integrity":"/paper/2607.24598/integrity","json":"/paper/2607.24598/citation-record.json","paper":"/paper/2607.24598"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.307255Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.307255Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:bf45ee6c55570636fafc9d87d20329298e89953b8997380648e7a088f60cc10b","observation_id":"9c6e4cba-285d-4aca-9f4f-69d2451f5679","resolution":{"observed_at":"2026-07-31T10:58:33.307255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.372720Z","title":"Masked-attention mask transformer for universal image segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.372720Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:a80437fab0c28d1529f9e1a816686bf4b643b7c4ea54ab643fbbca353a2eaa34","observation_id":"783767c4-e0a9-41eb-8d43-9dc6540b20bc","resolution":{"observed_at":"2026-07-31T10:58:33.372720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.442996Z","title":"Seq- former: Sequential transformer for video instance seg- mentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.442996Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:319ec75df670e7e687d7ffab280e99a31d957c10e006f14e72481a1dc6b2c5c2","observation_id":"c0dffed0-01e2-4cd8-991a-8f1d2156eda3","resolution":{"observed_at":"2026-07-31T10:58:33.442996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.507883Z","title":"In defense of online models for video instance segmen- tation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.507883Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:6b1445a81bf2dfd9235fe0f04a0b81411ca26c9b12d0f1db22d3cbf18f342b56","observation_id":"edab6910-923a-4518-829d-456e7422eb8a","resolution":{"observed_at":"2026-07-31T10:58:33.507883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.563503Z","title":"Visage: Video instance segmentation with appearance-guided enhancement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.563503Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:d5e36d98009893cf9af332990452470978cdf60ec07ef549d173fb9c1cbc36b5","observation_id":"f6140898-49e4-45a2-89e1-0776227811ac","resolution":{"observed_at":"2026-07-31T10:58:33.563503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.635832Z","title":"Minvis: A minimal video instance segmentation framework without video-based training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.635832Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:4f90aeb90fbce1c2069f44147274392082d01ae8d75e9760bd7ce4c691f711f7","observation_id":"cad1075c-6918-4e50-b9af-4f7feefa43ae","resolution":{"observed_at":"2026-07-31T10:58:33.635832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.705270Z","title":"A generalized framework for video instance segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.705270Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:684b3f78040ffc75d14f9896bf6d8ec44748adafe9b9fe203be9eedbbc4347ab","observation_id":"0638f34a-3217-4976-9a95-1cf2a0de0319","resolution":{"observed_at":"2026-07-31T10:58:33.705270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.789588Z","title":"Tcovis: Tempo- rally consistent online video instance segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.789588Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:e1875e9f88aa0d55edeb19e446195de7488a2257da427184990d2bf2e78090f3","observation_id":"9954900b-112e-4a4f-9718-3aaf940cf07a","resolution":{"observed_at":"2026-07-31T10:58:33.789588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.869090Z","title":"Dvis: Decoupled video instance segmentation framework,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.869090Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:5ca04160f5504eafe56e09d29625cf1d90ef3dab81e4c9e78b99baa3230e2847","observation_id":"badad673-7af7-42ad-b5f5-5b0db16e7ccb","resolution":{"observed_at":"2026-07-31T10:58:33.869090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.931745Z","title":"Cavis: Context-aware video instance segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.931745Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:3155b6932b301c89a7c5f8d4cdcc0362d25a23b127e02a26e43e4259e4685032","observation_id":"c0cd4b19-15fb-4dc5-89f2-9b1ab9a4ef37","resolution":{"observed_at":"2026-07-31T10:58:33.931745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.010812Z","title":"Lidar-camera fusion for video panoptic segmentation without video training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.010812Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:cff2da02bdaefd432f89ace4e989f33209ca654db379c6138c6aa3c879df81e9","observation_id":"c2a5ba52-1077-4d4e-a978-98dde57fd80a","resolution":{"observed_at":"2026-07-31T10:58:34.010812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.07394","last_updated":"2026-06-05T15:32:48Z","snapshot_observed_at":"2026-08-02T20:31:00.881598Z","submitted_at":"2026-06-05T15:32:48Z","title":"Mind the Gap: Disentangling Performance Bottlenecks in Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.07394","snapshot_observed_at":"2026-07-31T10:58:34.054265Z","title":"Mind the gap: Disentangling performance bottlenecks in video instance segmentation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.054265Z"},"links":{"cited_paper":"/paper/2606.07394","citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:5bf7d4f94f6aef1dd46e5b420aaccf77c1761fee2a55c5d52ce821b71493b405","observation_id":"9247b755-fd73-4a75-b7a3-067759679792","resolution":{"observed_at":"2026-07-31T10:58:34.054265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.159602Z","title":"Per-pixel classification is not all you need for semantic segmen- tation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.159602Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:238ca97f247096e3ec3971fd14fd1688c45ec3e2c97824cf1afd3a8853c99393","observation_id":"100d4823-7740-47bb-b767-03d1f9bd81aa","resolution":{"observed_at":"2026-07-31T10:58:34.159602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.218847Z","title":"Video instance segmen- tation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.218847Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:644859344e0e107fdc09aaa4f1246da245b5df96576d5ad67198ede13521b2f4","observation_id":"068634c6-7b7c-4737-8d88-a5f282de9e9b","resolution":{"observed_at":"2026-07-31T10:58:34.218847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.280427Z","title":"Crossover learning for fast on- line video instance segmentation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.280427Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:ad339d3d1652b00729860ed0e7dbd43b7d0218e9f858107df523aedc2d34f457","observation_id":"a9d0b735-d0e4-4712-ab2a-c591dbf00c07","resolution":{"observed_at":"2026-07-31T10:58:34.280427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.363325Z","title":"VidEoMT: Your ViT is secretly also a video segmentation model,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.363325Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:991002c7cb7c15e3eb2f27a4cb67dfd89905dce68db4e2cd2e7c002224b0dd85","observation_id":"c17f4dd9-4c37-4692-87e0-ac930d6af10e","resolution":{"observed_at":"2026-07-31T10:58:34.363325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15266","last_updated":"2023-09-18T14:46:11Z","snapshot_observed_at":"2026-07-06T16:11:47.380913Z","submitted_at":"2023-08-29T12:51:04Z","title":"NOVIS: A Case for End-to-End Near-Online Video Instance Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.15266","snapshot_observed_at":"2026-07-31T10:58:34.447852Z","title":"NOVIS: A case for end-to-end near- online video instance segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.447852Z"},"links":{"cited_paper":"/paper/2308.15266","citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:93175a03e4b2cb87fc319b87001259c796c0dc69e553b8d3d0173f25f5c15acd","observation_id":"22ed96f8-91dd-426a-8984-e0eb69d43288","resolution":{"observed_at":"2026-07-31T10:58:34.447852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.511329Z","title":"Efficient video instance segmentation via tracklet query and proposal,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.511329Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:bc64c5652750f9e10ba79fe2ded1a0ed4cc04f43ef6f541575585ef70b7723e6","observation_id":"4e50b678-002c-4c99-a734-38665b8b0936","resolution":{"observed_at":"2026-07-31T10:58:34.511329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.582870Z","title":"Ctvis: Con- sistent training for online video instance segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.582870Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:6c7f74b2c2c52f2212d04cf029acc6f204f809bfd6c7c951f8b085b40b063f90","observation_id":"376b6020-655d-4a71-a00a-60b124afbe09","resolution":{"observed_at":"2026-07-31T10:58:34.582870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.642651Z","title":"Visolo: Grid-based space-time aggregation for efficient online video instance segmen- tation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.642651Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:a9de2abccd4c2c5ffd38cad00c09acf6b7b5e26fe32212859cb8b90af3d340d6","observation_id":"aec835aa-2eb4-48a1-b5c0-7bc7de1e8713","resolution":{"observed_at":"2026-07-31T10:58:34.642651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.726895Z","title":"Video instance segmentation using inter-frame communication transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.726895Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:cf00cb74ee9b2f89ad528c9907328993dacb8c7462bba42ded0d95357e84e665","observation_id":"155011e5-32a2-4ef7-99fc-81067040a24b","resolution":{"observed_at":"2026-07-31T10:58:34.726895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.799758Z","title":"Vita: Video instance segmentation via object token as- sociation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.799758Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:e719395da756c09227adad85d02160a1877b0dcdfd8c79d09e553cb465014720","observation_id":"d3b9db15-e4bd-4960-bba9-83afd1863d99","resolution":{"observed_at":"2026-07-31T10:58:34.799758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.891287Z","title":"Mdqe: Mining discriminative query embeddings to segment occluded instances on challenging videos,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.891287Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:2ddff0b78dd806141b0b4ef9b05aebbc8934cc56bb5314f5bb1e75dd9171e92f","observation_id":"0354a5dc-b080-4a62-95e4-80c988c608f8","resolution":{"observed_at":"2026-07-31T10:58:34.891287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04774","last_updated":"2023-06-07T20:45:15Z","snapshot_observed_at":"2026-08-07T03:56:44.495546Z","submitted_at":"2023-06-07T20:45:15Z","title":"RefineVIS: Video Instance Segmentation with Temporal Attention Refinement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04774","snapshot_observed_at":"2026-07-31T10:58:34.951024Z","title":"Re- finevis: Video instance segmentation with temporal at- tention refinement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.951024Z"},"links":{"cited_paper":"/paper/2306.04774","citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:2db26f9f22d8512af65f3143749a2bf1776f1b5a9b1fddff8ba3acc03626e4dd","observation_id":"e5de03ed-1e0f-47e5-ae34-c6a97b1eb35d","resolution":{"observed_at":"2026-07-31T10:58:34.951024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:35.035346Z","title":"Sipmask: Spatial information preserva- tion for fast image and video instance segmentation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:35.035346Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:39264c2429906e09a11a6e118a0336842a54a86f2f01b11e7235ccbbdda48bf7","observation_id":"17a2e83c-953a-4dba-8d55-d63ea0e2a943","resolution":{"observed_at":"2026-07-31T10:58:35.035346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:35.125591Z","title":"The 3rd large-scale video object segmentation challenge – video instance segmentation track,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:35.125591Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:b941c08113d40b5ce5ce921faa0e85da91a7f66deb188ee8fc500f68fb95e564","observation_id":"f8e80bae-a73d-4ca3-95fa-7a52c568836e","resolution":{"observed_at":"2026-07-31T10:58:35.125591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:35.208422Z","title":"The 4th large-scale video object segmentation challenge – video instance segmen- tation track,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:35.208422Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:9f4c0bd5aa0932e297e7047f8615d81b75d93a9e327f9eb6b3f900d65d3c7776","observation_id":"922e9a2f-485a-45ab-beaa-8a7c8b28af4b","resolution":{"observed_at":"2026-07-31T10:58:35.208422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:35.271268Z","title":"Occluded video instance segmentation: A benchmark,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:35.271268Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:a0591c9c36635fdb9eec47ab2460e18f2e120f2d592771220d4b4aae21c7c5d1","observation_id":"7ae57f54-e54a-4939-9c06-01c6aad4d1af","resolution":{"observed_at":"2026-07-31T10:58:35.271268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:35.332254Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:35.332254Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:91940b2cc0af415ef13fcc7dc18ead14f92834922f6d805c7bbbca1fd86cb8e4","observation_id":"3728bd47-4a74-4f14-b168-7c54bacd48ab","resolution":{"observed_at":"2026-07-31T10:58:35.332254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:35.384836Z","title":"Relational knowledge distillation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:35.384836Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:f278f868c9f36745f9766cc6df2bd6963e030407b8217bdf27582e3fb616ecd1","observation_id":"ae20e517-4a34-4748-93a3-674d923c2d0e","resolution":{"observed_at":"2026-07-31T10:58:35.384836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:35.439139Z","title":"Swin Transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:35.439139Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:e1bd6ef17f3886a0b92bda810b893f7f533c36c6daf49c348587324aa12b1535","observation_id":"9232720a-19e8-49ae-ac86-dfb4d3afc8b9","resolution":{"observed_at":"2026-07-31T10:58:35.439139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T02:51:22.712335Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2607.24598."}