{"as_of":"2026-08-08T22:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:21f7cc5a792a9e3cdfa1462554a131d795a872b26c316e209b85a4c4a1c396ce","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:06:32.584755Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24098/citation-record","integrity":"/paper/2607.24098/integrity","json":"/paper/2607.24098/citation-record.json","paper":"/paper/2607.24098"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:06:30.899494Z","title":"Actor and action video segmentation from a sentence,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:30.899494Z"},"links":{"citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:292be8422d796238f79a6e7ab3546191d71633abf441d858d9ec9d9d96f668a3","observation_id":"712d6bef-d630-457a-b7d3-7d3b8d10b7c3","resolution":{"observed_at":"2026-07-31T23:06:30.899494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:06:31.008316Z","title":"URVOS: Unified referring video object segmentation network with a large-scale bench- mark,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:31.008316Z"},"links":{"citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:321b0c6a0d224200e12af0d64b96389e6c59b32f9951d210ed1d62d658cc51d7","observation_id":"53a4ef9c-2adf-42e3-9697-5230246d1d6a","resolution":{"observed_at":"2026-07-31T23:06:31.008316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:06:31.091976Z","title":"MeViS: A large-scale benchmark for video segmentation with motion expressions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:31.091976Z"},"links":{"citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:001686f7ac1561bf4340e3f0589d68442349c9a10e42a409016c27d426d57202","observation_id":"b5ee68be-96c6-438a-ba8d-e6d725c718bb","resolution":{"observed_at":"2026-07-31T23:06:31.091976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:06:31.188817Z","title":"VISA: Reasoning video object segmen- tation via large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:31.188817Z"},"links":{"citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:857e8064b03e52e13a70bf31c8dd4b56ac6fca470310615e8182811c9ff4d1af","observation_id":"fee77d54-1b81-484c-b5a1-45e1c8a28c02","resolution":{"observed_at":"2026-07-31T23:06:31.188817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:06:31.270162Z","title":"End-to-end referring video object segmentation with multimodal trans- formers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:31.270162Z"},"links":{"citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:809f9f14a90aeb2f2832b3b97733dc6b4b0ef4360a26bc8895a33d0a8b6bb212","observation_id":"fdd379d2-4154-4376-825a-6cf560b16143","resolution":{"observed_at":"2026-07-31T23:06:31.270162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:06:31.387262Z","title":"Language as queries for referring video object segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:31.387262Z"},"links":{"citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:49cd5049b955ad11e26ed468bebce07ba37562dc09898ca1e3af312bed8e6dbb","observation_id":"d91888e9-a9e0-40f7-bf07-5f6a9b559c0c","resolution":{"observed_at":"2026-07-31T23:06:31.387262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:06:31.480230Z","title":"Referred by multi-modality: A unified temporal transformer for video object segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:31.480230Z"},"links":{"citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:ffb8b507650b381af080f886e8052b451e19f37d995c696b32208b11acaa10ad","observation_id":"1a99a642-0e1a-444d-b252-99161fbf70ce","resolution":{"observed_at":"2026-07-31T23:06:31.480230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:06:31.548617Z","title":"GLUS: Global-local reasoning unified into a single large language model for video seg- mentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:31.548617Z"},"links":{"citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:8fac1c1e5cd9fcbfc301d3a111cb538915a641cc4fd418b7587d38a1e7ce6481","observation_id":"692c4fdc-6cdd-4c59-8b2c-3986cfacc7a7","resolution":{"observed_at":"2026-07-31T23:06:31.548617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:06:31.636414Z","title":"ReferDINO: Referring video object segmentation with visual grounding foundations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:31.636414Z"},"links":{"citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:16d5ccc049c1b2eafebe2146c10a1844505c0e469f7fb16a11428a2a2f8fb193","observation_id":"9a3199a0-dd4e-4a14-ad2c-68e074329b00","resolution":{"observed_at":"2026-07-31T23:06:31.636414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15876","last_updated":"2024-12-23T08:10:30Z","snapshot_observed_at":"2026-07-06T19:07:11.892165Z","submitted_at":"2024-08-28T15:47:32Z","title":"Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15876","snapshot_observed_at":"2026-07-31T23:06:31.757236Z","title":"Unleashing the temporal- spatial reasoning capacity of GPT for training-free audio and language referenced video object segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:31.757236Z"},"links":{"cited_paper":"/paper/2408.15876","citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:5562f6654885622d1bbc47604ac5b7d74309861ffd43ec7f7a99ce3610af70db","observation_id":"66aa3088-8e89-40e1-8f36-f058adb30cf0","resolution":{"observed_at":"2026-07-31T23:06:31.757236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:06:31.848870Z","title":"CoT-RVS: Zero-shot chain-of-thought reasoning segmentation for videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:31.848870Z"},"links":{"citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:0095c7fee3ec2a8a4aa5d0b9c089e99b5e16b2e861aa189ec536961957c0fc62","observation_id":"ff61c170-53fb-45fe-aa9b-9f4468195fc7","resolution":{"observed_at":"2026-07-31T23:06:31.848870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:06:31.945419Z","title":"Refer-agent: A collaborative multi-agent system with reasoning and reflec- tion for referring video object segmentation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:31.945419Z"},"links":{"citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:178cbd85480579e7cde833c82508b1c0501ea38c9d1af51f8b778b6f63ef7a89","observation_id":"57fee6d1-cf59-4cd6-8c28-5c3ad4a66c79","resolution":{"observed_at":"2026-07-31T23:06:31.945419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:06:32.037377Z","title":"SAM 2: Segment any- thing in images and videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:32.037377Z"},"links":{"citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:58893d86658b8700ab603f56be62f3acc2185a8fefdc8c73248ddab6d07a2a53","observation_id":"4a126857-5e73-4e8a-93c3-3ccb1ccebd0a","resolution":{"observed_at":"2026-07-31T23:06:32.037377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-07-31T23:06:32.111775Z","title":"SAM 3: Segment anything with concepts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:32.111775Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:b1a82b35f60f7ecedc07027db1707552f5b01d0f50dc145224fefe137fbeefbc","observation_id":"58b52475-4771-46d1-87fa-f0a13a4f67a1","resolution":{"observed_at":"2026-07-31T23:06:32.111775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:06:32.233746Z","title":"Universal instance perception as object discovery and retrieval,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:32.233746Z"},"links":{"citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:d2686a2fc8c0bc6daea8eb571f17c4d31d3b5f746cdc30770a8884a0b5a07c7e","observation_id":"1df4d480-223f-4525-a230-1193c8c67b64","resolution":{"observed_at":"2026-07-31T23:06:32.233746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:06:32.329746Z","title":"Exploring pre-trained text-to-video diffusion models for re- ferring video object segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:32.329746Z"},"links":{"citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:cbd85c2300911d0a1ee6c63328425b79b7a8dda5b833b45752943b0d5b44fbfd","observation_id":"d9e42881-5c76-4d92-bfe4-0f6380da2815","resolution":{"observed_at":"2026-07-31T23:06:32.329746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:06:32.414398Z","title":"Refereverything: Towards segmenting everything we can speak of in videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:32.414398Z"},"links":{"citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:b7a7d655273e2cbd12857c3e70312b85903a76cfb50704620c239eeeb8cecc89","observation_id":"80aacfa3-4392-47d1-b3c1-3e745a1975df","resolution":{"observed_at":"2026-07-31T23:06:32.414398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19603","last_updated":"2024-09-29T07:47:15Z","snapshot_observed_at":"2026-07-06T19:24:03.133851Z","submitted_at":"2024-09-29T07:47:15Z","title":"One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19603","snapshot_observed_at":"2026-07-31T23:06:32.513024Z","title":"One token to seg them all: Lan- guage instructed reasoning segmentation in videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:32.513024Z"},"links":{"cited_paper":"/paper/2409.19603","citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:61b811a1c860725c1b11f4b18e23865a28f47256b0524d864b2cd3f7de552a48","observation_id":"9cae0649-f568-41ec-ab37-de31d94e0a2d","resolution":{"observed_at":"2026-07-31T23:06:32.513024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:06:32.584755Z","title":"Object-centric video question answering with visual grounding and referring,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:32.584755Z"},"links":{"citing_paper":"/paper/2607.24098"},"observation_digest":"sha256:a3020d0acd485fd62af0ed6d56f573466552557360e48b3c9506f85f8624e96e","observation_id":"b8a488c8-dff5-4791-94b4-9867ac3340af","resolution":{"observed_at":"2026-07-31T23:06:32.584755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24098","last_updated":"2026-07-27T07:39:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-31T23:06:30.484084Z","submitted_at":"2026-07-27T07:39:20Z","title":"ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2607.24098."}