Pith. sign in

Paper Citation Record · LEDGER

Referring Video Object Segmentation via Language-aligned Track Selection

As of 15 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 2 inbound Pith citation observations for arXiv:2412.01136.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.01136 v2

Coverage vector

measured 29 of 29 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-12T04:42:30.341132Z

measured 31 of 31 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T12:08:16.065856Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T05:09:31.997736Z

Reference resolution

29 of 29 outbound references displayed

  • verified exact0
  • verified fuzzy20
  • unresolved9
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 72b3f13b-d469-49cc-af3f-03b302024ed0 · outbound

This paper cites GPT-4 Technical Report.

Referring Video Object Segmentation via Language-aligned Track Selection GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-12T04:42:30.187102Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:42:30.187102Z digest=sha256:2174ffc92d4e63319f8e5edcbf6b12e927c2dbffdab03dddec1b15debf914f6f

Observation 7aedcaaa-2530-4ba2-8bfd-3eca2b38a316 · outbound

This paper cites End-to-end referring video object segmentation with mul- timodal transformers.

Referring Video Object Segmentation via Language-aligned Track Selection End-to-end referring video object segmentation with mul- timodal transformers

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:31.055324Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.192902Z digest=sha256:6bcd42ca627ea664a4f7087f1dec006907c05334e6850a0e432985a9a74528ba

Observation 2e5a6799-73e8-4236-97bb-42b1e1f4627f · outbound

This paper cites Vision-language transformer and query generation for refer- ring segmentation.

Referring Video Object Segmentation via Language-aligned Track Selection Vision-language transformer and query generation for refer- ring segmentation

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:31.039986Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.198030Z digest=sha256:140c6f07f76da99b52d8a905a10bd9cc728e6634b39f4cc73d6eca20ea7e3c8d

Observation 021f977b-b978-4745-96c1-a0bf0c45470d · outbound

This paper cites Mevis: A large-scale benchmark for video segmentation with motion expressions.

Referring Video Object Segmentation via Language-aligned Track Selection Mevis: A large-scale benchmark for video segmentation with motion expressions

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:31.023971Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.203375Z digest=sha256:25187ce41f05c937627046c8604ac6348206513d393bfc837386b56f69a50f71

Observation e8af9f4e-02b6-4310-813e-d1c9fe1ff8ca · outbound

This paper cites Language-bridged spatial-temporal interaction for referring video object segmentation.

Referring Video Object Segmentation via Language-aligned Track Selection Language-bridged spatial-temporal interaction for referring video object segmentation

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:31.003957Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.208440Z digest=sha256:5eaee32d9acc5373f9fcec8cd2d88ddd1317b47bd0db7177f8a28861e204b676

Observation ee750bb6-3a96-4573-bdf1-84b2f0fed86c · outbound

This paper cites The pascal visual object classes (voc) challenge.

Referring Video Object Segmentation via Language-aligned Track Selection The pascal visual object classes (voc) challenge

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:30.985638Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.213445Z digest=sha256:6d2625f3a2d0bbdb62c6eb876c91f81e1bfa31c095914d63b290874404911b77

Observation 2e25aaf5-ba70-495e-9386-7bcf1ceb2269 · outbound

This paper cites Actor and action video segmentation from a sen- tence.

Referring Video Object Segmentation via Language-aligned Track Selection Actor and action video segmentation from a sen- tence

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:30.969164Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.220559Z digest=sha256:3a47d237569959789e471252dd125dde68d23970c38511e5c817ca96e7a7a315

Observation ce2302a8-491a-4ef8-8d50-72b4a0c643a7 · outbound

This paper cites Html: Hybrid temporal-scale mul- timodal learning framework for referring video object seg- mentation.

Referring Video Object Segmentation via Language-aligned Track Selection Html: Hybrid temporal-scale mul- timodal learning framework for referring video object seg- mentation

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:30.951065Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.228708Z digest=sha256:98f8caf059412103668f5f9a2e929c44f97d9b64f0a46aea57aad0a84e5e694a

Observation 5ba59491-4c49-46a1-8788-8e9f46a22f65 · outbound

This paper cites Decoupling static and hier- archical motion perception for referring video segmentation.

Referring Video Object Segmentation via Language-aligned Track Selection Decoupling static and hier- archical motion perception for referring video segmentation

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:30.934513Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.233906Z digest=sha256:6cbe58557d933327cd595ca90b9238998043b891d49633d1cfdc6dc2d08e74e0

Observation 72a94c27-7bf6-4408-8487-2d83cf546cdf · outbound

This paper cites Benchmarking Neural Network Robustness to Common Corruptions and Perturbations.

Referring Video Object Segmentation via Language-aligned Track Selection Benchmarking Neural Network Robustness to Common Corruptions and Perturbations

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-12T04:42:30.238720Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:42:30.238720Z digest=sha256:49562d6b66a9ccf21eab527dce6e4d1a1e981c9b4ab55fade36aedce66489129

Observation 41c97bf8-dcb4-4d16-ac06-e2152538a441 · outbound

This paper cites Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object Segmentation.

Referring Video Object Segmentation via Language-aligned Track Selection Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object Segmentation

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-12T04:42:30.243704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:42:30.243704Z digest=sha256:8e0e3cc9e69fc0e2c7d7668a8ac32fe46bd4dffadf270fa7005ca03c4a654246

Observation 4b34fb5a-31c7-4a10-a5f1-1511cd520211 · outbound

This paper cites Scaling up visual and vision-language representa- tion learning with noisy text supervision.

Referring Video Object Segmentation via Language-aligned Track Selection Scaling up visual and vision-language representa- tion learning with noisy text supervision

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:30.915946Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.249752Z digest=sha256:33f7c192a96433502066206bff796b90486aeed3aec48d91a24b5a525177ffbb

Observation 19fee968-32f3-468c-a432-a56361293f7d · outbound

This paper cites Video object segmentation with language referring expressions.

Referring Video Object Segmentation via Language-aligned Track Selection Video object segmentation with language referring expressions

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:30.899243Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.254626Z digest=sha256:a1e9ba56e9dbc3915b980926d81a3e46f6d41ffb299b5d405ee228c67a1a699c

Observation 5c37430b-569c-4528-b8ca-035f1ecc81c4 · outbound

This paper cites Video object segmentation with language referring expressions.

Referring Video Object Segmentation via Language-aligned Track Selection Video object segmentation with language referring expressions

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:30.881871Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.259230Z digest=sha256:306f105d3d45d9b53d2894a176ad6fac69a9d8de9598b7fa7a163b66d6abd0cc

Observation a9ab9048-f549-47f7-aca3-3a4c9a07bc0a · outbound

This paper cites Segment any- thing.

Referring Video Object Segmentation via Language-aligned Track Selection Segment any- thing

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-12T04:42:30.264270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:42:30.264270Z digest=sha256:edc8ef5936c00e6a9ab368e35d1425a8b4146546e99d371bcd388b6c7b1cba7b

Observation 2102bee9-3c31-493a-a017-c3540bfab65e · outbound

This paper cites Referring image seg- mentation via recurrent refinement networks.

Referring Video Object Segmentation via Language-aligned Track Selection Referring image seg- mentation via recurrent refinement networks

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:30.855992Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.268630Z digest=sha256:91524d7e61bdefcc52ac3e7dc20484de46f76688240a983444f244b7cfa17cb8

Observation c5ebdb6e-1be1-4721-acbe-1f04f1af376b · outbound

This paper cites Robust referring video object segmentation with cyclic structural consensus.

Referring Video Object Segmentation via Language-aligned Track Selection Robust referring video object segmentation with cyclic structural consensus

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:30.838830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.273139Z digest=sha256:164a224316974a3b7e90fe32a68da557c227b8a48bef1d851802be19538371fe

Observation c5366fd6-a2d9-4667-8ec4-f8cfbac51261 · outbound

This paper cites RefSAM: Efficiently Adapting Segmenting Anything Model for Referring Video Object Segmentation.

Referring Video Object Segmentation via Language-aligned Track Selection RefSAM: Efficiently Adapting Segmenting Anything Model for Referring Video Object Segmentation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-12T04:42:30.278910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:42:30.278910Z digest=sha256:12ff1f6c05dd2b580402ebdb9d6d5b1f87f1f1e1e334abbc071e836c63e1dc2d

Observation c146b9a3-2a06-4a09-b7ce-677443afd363 · outbound

This paper cites Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection.

Referring Video Object Segmentation via Language-aligned Track Selection Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-12T04:42:30.285147Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:42:30.285147Z digest=sha256:fe1cacbd5c0a4649fed6227b8a8e9e9f7d3d5792aa6841bb019d3701821e1b75

Observation 70c4a044-c2b8-473a-85f6-7cd0364320c3 · outbound

This paper cites RoBERTa: A Robustly Optimized BERT Pretraining Approach.

Referring Video Object Segmentation via Language-aligned Track Selection RoBERTa: A Robustly Optimized BERT Pretraining Approach

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-12T04:42:30.292818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:42:30.292818Z digest=sha256:5d16e9cecf8c9b30bfc2d47b0db1da4c04ef19803770958d3089fbf1e7edf53c

Observation af574789-eae5-4493-ab62-1d0c2fe1bb50 · outbound

This paper cites Temporally consistent referring video object segmentation with hybrid memory.

Referring Video Object Segmentation via Language-aligned Track Selection Temporally consistent referring video object segmentation with hybrid memory

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:30.821262Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.298412Z digest=sha256:84601b37da0b78bb1cef80f2f65ea76f55215e66eb45f9a441075577a9a5eb7e

Observation 74a8702f-3397-492b-9705-167cb268bcbe · outbound

This paper cites Efficient non- maximum suppression.

Referring Video Object Segmentation via Language-aligned Track Selection Efficient non- maximum suppression

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:30.801716Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.304055Z digest=sha256:5fbdda32f044828def59c4875869b47d077cb04cd27ba857a50e7e61a572e5ac

Observation 6f332e0b-e8e8-422c-8616-623c1c5c75c7 · outbound

This paper cites A benchmark dataset and evaluation methodology for video object segmentation.

Referring Video Object Segmentation via Language-aligned Track Selection A benchmark dataset and evaluation methodology for video object segmentation

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:30.783350Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.309190Z digest=sha256:c7de00725762d0f2f8b37f7bb209c77c46b583b9964e90746df426a5b87db58b

Observation deaf41a7-9c1d-4c4d-90c4-d639b97bbee4 · outbound

This paper cites SAM 2: Segment Anything in Images and Videos.

Referring Video Object Segmentation via Language-aligned Track Selection SAM 2: Segment Anything in Images and Videos

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-12T04:42:30.313812Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:42:30.313812Z digest=sha256:6201482382ca20bf8bceb717cbe25b2a4dc1883fceae054070c3c1dd0783864f

Observation 4a8dcfc2-c299-46a1-9f6d-86faa7caf827 · outbound

This paper cites Urvos: Unified referring video object segmentation network with a large-scale benchmark.

Referring Video Object Segmentation via Language-aligned Track Selection Urvos: Unified referring video object segmentation network with a large-scale benchmark

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:30.763510Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.320392Z digest=sha256:dfe175e7adf66314dc55779847c40e5d13c65060235bc1bc27aa7543aebd3725

Observation 1617197a-0fdd-4668-afc2-5ef4222d579f · outbound

This paper cites Attention is all you need.

Referring Video Object Segmentation via Language-aligned Track Selection Attention is all you need

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-12T04:42:30.325968Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:42:30.325968Z digest=sha256:c7a1229fa992041bfc30329b17dea28ca8da1ffc2cee361e4131c02058198330

Observation 77670a91-7112-4f11-89a8-e3b7ef0d0497 · outbound

This paper cites Data-efficient mul- timodal fusion on a single gpu.

Referring Video Object Segmentation via Language-aligned Track Selection Data-efficient mul- timodal fusion on a single gpu

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:30.735719Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.330343Z digest=sha256:0555fe9dfe0029c05268023a5181f4be3bca5341ce2ee17a05a34fa168dab8c8

Observation 4a000abf-1e12-427a-b2a3-5943585bfade · outbound

This paper cites Language as queries for referring video object segmen- tation.

Referring Video Object Segmentation via Language-aligned Track Selection Language as queries for referring video object segmen- tation

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:30.719106Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.336155Z digest=sha256:b29e15386612ddb6673e123fd5a74a2ce0baf65c50c23a7dea393ad9ffa9a7dd

Observation c50724b1-ee13-4332-949a-76b6a6232ef8 · outbound

This paper cites Going right.

Referring Video Object Segmentation via Language-aligned Track Selection Going right

Reference 2022

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T04:42:30.695296Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T04:42:30.341132Z digest=sha256:381c7d820a151c9baa99a4b0f0492aa5ad161181cfd8302bd66d390f03796edc

Pith citing papers

Observation ec8a01c8-6981-4e8b-8e64-4b8fa22f65bb · inbound

MOVE: Motion-Guided Few-Shot Video Object Segmentation cites this paper.

MOVE: Motion-Guided Few-Shot Video Object Segmentation Referring Video Object Segmentation via Language-aligned Track Selection

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T12:08:16.065856Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T12:08:16.065856Z digest=sha256:617ce2968ad6d22bb1d0f4c8f895bc7b7f271f4fcc88b0d9c9858a817c324201

Observation cff9ce97-b9ba-401e-82fe-fa7684435c61 · inbound

Unleashing Hierarchical Reasoning: An LLM-Driven Framework for Training-Free Referring Video Object Segmentation cites this paper.

Unleashing Hierarchical Reasoning: An LLM-Driven Framework for Training-Free Referring Video Object Segmentation Referring Video Object Segmentation via Language-aligned Track Selection

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-08-05T05:09:32.003729Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-08-05T05:09:31.671155Z digest=sha256:65294a9dbae8328aac3525181edd0e258c6c408b77c2108b129bd128cee67751