Pith. sign in

Paper Citation Record · LEDGER

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment

As of 7 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2607.24598.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.24598 v1

Coverage vector

measured 31 of 31 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-31T10:58:35.439139Z

measured 31 of 31 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

31 of 31 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved31
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 9c6e4cba-285d-4aca-9f4f-69d2451f5679 · outbound

This paper cites End-to-end object detection with transformers,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment End-to-end object detection with transformers,

Reference 1

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:33.307255Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:33.307255Z digest=sha256:bf45ee6c55570636fafc9d87d20329298e89953b8997380648e7a088f60cc10b

Observation 783767c4-e0a9-41eb-8d43-9dc6540b20bc · outbound

This paper cites Masked-attention mask transformer for universal image segmentation,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Masked-attention mask transformer for universal image segmentation,

Reference 2

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:33.372720Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:33.372720Z digest=sha256:a80437fab0c28d1529f9e1a816686bf4b643b7c4ea54ab643fbbca353a2eaa34

Observation c0dffed0-01e2-4cd8-991a-8f1d2156eda3 · outbound

This paper cites Seq- former: Sequential transformer for video instance seg- mentation,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Seq- former: Sequential transformer for video instance seg- mentation,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:33.442996Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:33.442996Z digest=sha256:319ec75df670e7e687d7ffab280e99a31d957c10e006f14e72481a1dc6b2c5c2

Observation edab6910-923a-4518-829d-456e7422eb8a · outbound

This paper cites In defense of online models for video instance segmen- tation,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment In defense of online models for video instance segmen- tation,

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:33.507883Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:33.507883Z digest=sha256:6b1445a81bf2dfd9235fe0f04a0b81411ca26c9b12d0f1db22d3cbf18f342b56

Observation f6140898-49e4-45a2-89e1-0776227811ac · outbound

This paper cites Visage: Video instance segmentation with appearance-guided enhancement,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Visage: Video instance segmentation with appearance-guided enhancement,

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:33.563503Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:33.563503Z digest=sha256:d5e36d98009893cf9af332990452470978cdf60ec07ef549d173fb9c1cbc36b5

Observation cad1075c-6918-4e50-b9af-4f7feefa43ae · outbound

This paper cites Minvis: A minimal video instance segmentation framework without video-based training,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Minvis: A minimal video instance segmentation framework without video-based training,

Reference 6

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:33.635832Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:33.635832Z digest=sha256:4f90aeb90fbce1c2069f44147274392082d01ae8d75e9760bd7ce4c691f711f7

Observation 0638f34a-3217-4976-9a95-1cf2a0de0319 · outbound

This paper cites A generalized framework for video instance segmentation,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment A generalized framework for video instance segmentation,

Reference 7

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:33.705270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:33.705270Z digest=sha256:684b3f78040ffc75d14f9896bf6d8ec44748adafe9b9fe203be9eedbbc4347ab

Observation 9954900b-112e-4a4f-9718-3aaf940cf07a · outbound

This paper cites Tcovis: Tempo- rally consistent online video instance segmentation,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Tcovis: Tempo- rally consistent online video instance segmentation,

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:33.789588Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:33.789588Z digest=sha256:e1875e9f88aa0d55edeb19e446195de7488a2257da427184990d2bf2e78090f3

Observation badad673-7af7-42ad-b5f5-5b0db16e7ccb · outbound

This paper cites Dvis: Decoupled video instance segmentation framework,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Dvis: Decoupled video instance segmentation framework,

Reference 9

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:33.869090Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:33.869090Z digest=sha256:5ca04160f5504eafe56e09d29625cf1d90ef3dab81e4c9e78b99baa3230e2847

Observation c0cd4b19-15fb-4dc5-89f2-9b1ab9a4ef37 · outbound

This paper cites Cavis: Context-aware video instance segmentation,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Cavis: Context-aware video instance segmentation,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:33.931745Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:33.931745Z digest=sha256:3155b6932b301c89a7c5f8d4cdcc0362d25a23b127e02a26e43e4259e4685032

Observation c2a5ba52-1077-4d4e-a978-98dde57fd80a · outbound

This paper cites Lidar-camera fusion for video panoptic segmentation without video training,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Lidar-camera fusion for video panoptic segmentation without video training,

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:34.010812Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:34.010812Z digest=sha256:cff2da02bdaefd432f89ace4e989f33209ca654db379c6138c6aa3c879df81e9

Observation 9247b755-fd73-4a75-b7a3-067759679792 · outbound

This paper cites Mind the Gap: Disentangling Performance Bottlenecks in Video Instance Segmentation.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Mind the Gap: Disentangling Performance Bottlenecks in Video Instance Segmentation

Reference 12

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:34.054265Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:34.054265Z digest=sha256:5bf7d4f94f6aef1dd46e5b420aaccf77c1761fee2a55c5d52ce821b71493b405

Observation 100d4823-7740-47bb-b767-03d1f9bd81aa · outbound

This paper cites Per-pixel classification is not all you need for semantic segmen- tation,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Per-pixel classification is not all you need for semantic segmen- tation,

Reference 13

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:34.159602Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:34.159602Z digest=sha256:238ca97f247096e3ec3971fd14fd1688c45ec3e2c97824cf1afd3a8853c99393

Observation 068634c6-7b7c-4737-8d88-a5f282de9e9b · outbound

This paper cites Video instance segmen- tation,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Video instance segmen- tation,

Reference 14

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:34.218847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:34.218847Z digest=sha256:644859344e0e107fdc09aaa4f1246da245b5df96576d5ad67198ede13521b2f4

Observation a9d0b735-d0e4-4712-ab2a-c591dbf00c07 · outbound

This paper cites Crossover learning for fast on- line video instance segmentation,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Crossover learning for fast on- line video instance segmentation,

Reference 15

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:34.280427Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:34.280427Z digest=sha256:ad339d3d1652b00729860ed0e7dbd43b7d0218e9f858107df523aedc2d34f457

Observation c17f4dd9-4c37-4692-87e0-ac930d6af10e · outbound

This paper cites VidEoMT: Your ViT is secretly also a video segmentation model,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment VidEoMT: Your ViT is secretly also a video segmentation model,

Reference 16

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:34.363325Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:34.363325Z digest=sha256:991002c7cb7c15e3eb2f27a4cb67dfd89905dce68db4e2cd2e7c002224b0dd85

Observation 22ed96f8-91dd-426a-8984-e0eb69d43288 · outbound

This paper cites NOVIS: A Case for End-to-End Near-Online Video Instance Segmentation.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment NOVIS: A Case for End-to-End Near-Online Video Instance Segmentation

Reference 17

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:34.447852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:34.447852Z digest=sha256:93175a03e4b2cb87fc319b87001259c796c0dc69e553b8d3d0173f25f5c15acd

Observation 4e50b678-002c-4c99-a734-38665b8b0936 · outbound

This paper cites Efficient video instance segmentation via tracklet query and proposal,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Efficient video instance segmentation via tracklet query and proposal,

Reference 18

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:34.511329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:34.511329Z digest=sha256:bc64c5652750f9e10ba79fe2ded1a0ed4cc04f43ef6f541575585ef70b7723e6

Observation 376b6020-655d-4a71-a00a-60b124afbe09 · outbound

This paper cites Ctvis: Con- sistent training for online video instance segmentation,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Ctvis: Con- sistent training for online video instance segmentation,

Reference 19

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:34.582870Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:34.582870Z digest=sha256:6c7f74b2c2c52f2212d04cf029acc6f204f809bfd6c7c951f8b085b40b063f90

Observation aec835aa-2eb4-48a1-b5c0-7bc7de1e8713 · outbound

This paper cites Visolo: Grid-based space-time aggregation for efficient online video instance segmen- tation,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Visolo: Grid-based space-time aggregation for efficient online video instance segmen- tation,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:34.642651Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:34.642651Z digest=sha256:a9de2abccd4c2c5ffd38cad00c09acf6b7b5e26fe32212859cb8b90af3d340d6

Observation 155011e5-32a2-4ef7-99fc-81067040a24b · outbound

This paper cites Video instance segmentation using inter-frame communication transformers,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Video instance segmentation using inter-frame communication transformers,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:34.726895Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:34.726895Z digest=sha256:cf00cb74ee9b2f89ad528c9907328993dacb8c7462bba42ded0d95357e84e665

Observation d3b9db15-e4bd-4960-bba9-83afd1863d99 · outbound

This paper cites Vita: Video instance segmentation via object token as- sociation,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Vita: Video instance segmentation via object token as- sociation,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:34.799758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:34.799758Z digest=sha256:e719395da756c09227adad85d02160a1877b0dcdfd8c79d09e553cb465014720

Observation 0354a5dc-b080-4a62-95e4-80c988c608f8 · outbound

This paper cites Mdqe: Mining discriminative query embeddings to segment occluded instances on challenging videos,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Mdqe: Mining discriminative query embeddings to segment occluded instances on challenging videos,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:34.891287Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:34.891287Z digest=sha256:2ddff0b78dd806141b0b4ef9b05aebbc8934cc56bb5314f5bb1e75dd9171e92f

Observation e5de03ed-1e0f-47e5-ae34-c6a97b1eb35d · outbound

This paper cites RefineVIS: Video Instance Segmentation with Temporal Attention Refinement.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment RefineVIS: Video Instance Segmentation with Temporal Attention Refinement

Reference 24

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:34.951024Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:34.951024Z digest=sha256:2db26f9f22d8512af65f3143749a2bf1776f1b5a9b1fddff8ba3acc03626e4dd

Observation 17a2e83c-953a-4dba-8d55-d63ea0e2a943 · outbound

This paper cites Sipmask: Spatial information preserva- tion for fast image and video instance segmentation,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Sipmask: Spatial information preserva- tion for fast image and video instance segmentation,

Reference 25

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:35.035346Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:35.035346Z digest=sha256:39264c2429906e09a11a6e118a0336842a54a86f2f01b11e7235ccbbdda48bf7

Observation f8e80bae-a73d-4ca3-95fa-7a52c568836e · outbound

This paper cites The 3rd large-scale video object segmentation challenge – video instance segmentation track,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment The 3rd large-scale video object segmentation challenge – video instance segmentation track,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:35.125591Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:35.125591Z digest=sha256:b941c08113d40b5ce5ce921faa0e85da91a7f66deb188ee8fc500f68fb95e564

Observation 922e9a2f-485a-45ab-beaa-8a7c8b28af4b · outbound

This paper cites The 4th large-scale video object segmentation challenge – video instance segmen- tation track,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment The 4th large-scale video object segmentation challenge – video instance segmen- tation track,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:35.208422Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:35.208422Z digest=sha256:9f4c0bd5aa0932e297e7047f8615d81b75d93a9e327f9eb6b3f900d65d3c7776

Observation 7ae57f54-e54a-4939-9c06-01c6aad4d1af · outbound

This paper cites Occluded video instance segmentation: A benchmark,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Occluded video instance segmentation: A benchmark,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:35.271268Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:35.271268Z digest=sha256:a0591c9c36635fdb9eec47ab2460e18f2e120f2d592771220d4b4aae21c7c5d1

Observation 3728bd47-4a74-4f14-b168-7c54bacd48ab · outbound

This paper cites Deep residual learning for image recognition,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Deep residual learning for image recognition,

Reference 29

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:35.332254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:35.332254Z digest=sha256:91940b2cc0af415ef13fcc7dc18ead14f92834922f6d805c7bbbca1fd86cb8e4

Observation ae20e517-4a34-4748-93a3-674d923c2d0e · outbound

This paper cites Relational knowledge distillation,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Relational knowledge distillation,

Reference 30

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:35.384836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:35.384836Z digest=sha256:f278f868c9f36745f9766cc6df2bd6963e030407b8217bdf27582e3fb616ecd1

Observation 9232720a-19e8-49ae-ac86-dfb4d3afc8b9 · outbound

This paper cites Swin Transformer: Hierarchical vision transformer using shifted windows,.

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Swin Transformer: Hierarchical vision transformer using shifted windows,

Reference 31

Resolution
unresolved
no resolver link, observed 2026-07-31T10:58:35.439139Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T10:58:35.439139Z digest=sha256:e1bd6ef17f3886a0b92bda810b893f7f533c36c6daf49c348587324aa12b1535

Pith citing papers

No inbound Pith citation observations are available.