{"as_of":"2026-08-09T22:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cae7bce4ca7864b2164bb1f9c4e5aa898d6e23de55962e301f18327810251902","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T07:20:54.642591Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.29357/citation-record","integrity":"/paper/2606.29357/integrity","json":"/paper/2606.29357/citation-record.json","paper":"/paper/2606.29357"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Tracking by natural language specification,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:ee41af51eb4accbad0b2bc5b05e45855667dfdce9e0456c1e4d2290107b42fc4","observation_id":"2ee7bc57-efa1-487d-a684-58c830a80bc6","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Towards more flexible and accurate object tracking with natural lan- guage: Algorithms and benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:c01dec498be2b0e44ffb20415c9215510f632e886619c667771a90f0da82f8c1","observation_id":"5cfd51e9-47b8-4d53-a36d-f3577f98d4a6","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.10014","last_updated":"2018-11-27T02:54:57Z","snapshot_observed_at":"2026-08-06T15:11:05.852095Z","submitted_at":"2018-11-25T14:00:05Z","title":"Describe and Attend to Track: Learning Natural Language guided Structural Representation and Visual Attention for Object Tracking","version":2},"cited_work":{"arxiv_id":"1811.10014","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.10014","snapshot_observed_at":"2026-07-04T08:49:42.633474Z","title":"Describe and Attend to Track: Learning Natural Language guided Structural Representation and Visual Attention for Object Tracking","venue":"cs.CV","work_id":"edd6f322-d1ee-40c5-b077-034c8ff89454","year":2018},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"cited_paper":"/paper/1811.10014","citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:1477154e97e22ddeda62ef460ebdd3be8b7931065a871c48625fc9c3ef906090","observation_id":"20d3570b-28d6-4b44-9131-ef3c86870e92","resolution":{"observed_at":"2026-06-30T07:24:21.276420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Grounding-tracking- integration,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:be2a5183f3a605a10e014da00d2b5f9264fe4fffccd2cfe39c0cd95a947e4d1c","observation_id":"90e79796-2b5a-40ea-bf3c-e2b661cd6f51","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Joint visual grounding and tracking with natural language specification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:c2dc66d6e2ebad9031483ab87960ca9204d4b8cf3882196742ae1becc7889e84","observation_id":"b4edd94e-b4b7-473d-beca-3d109995b3ac","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Large-scale multi-modal pre-trained models: A comprehensive survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:b29757e256cf131001ea96573077729af1ba757dcfe2d1ae6a3b6ee0f64ee57c","observation_id":"3dbfc87c-0bc3-49f2-9a61-a99a84a62193","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Llmformer: Large language model for open-vocabulary semantic segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:0bf7955a764bf8323692c34812ef76b4dfa479048b28bc12dddd4f73e7965760","observation_id":"c379308a-95e1-43d6-a258-416c4045dd13","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Pedestrian attribute recognition: A new benchmark dataset and a large language model augmented framework,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:382cf57b1f34e5fb0dd77a38f16888ed0583f3d20f9d960d3d843cbd0323a5c9","observation_id":"86159438-afd8-4022-b0e1-4951909d06c3","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Language decou- pling with fine-grained knowledge guidance for referring multi-object tracking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:4617b9f65fded134831187463406e2beb76c1adc7fccaf83e8a64e182864de66","observation_id":"e18e8391-d297-44a6-a553-57f0034764ef","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Chattracker: Enhancing visual tracking performance via chatting with multimodal large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:6c748c1b41b7699d8ad81beb275c178bbd798a9c960e9f4b98f07974703836c1","observation_id":"cc15022b-8ae9-4afb-8d7f-5569aab4935e","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06621","last_updated":"2025-03-09T13:47:19Z","snapshot_observed_at":"2026-08-07T17:18:59.207619Z","submitted_at":"2025-03-09T13:47:19Z","title":"Dynamic Updates for Language Adaptation in Visual-Language Tracking","version":1},"cited_work":{"arxiv_id":"2503.06621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.06621","snapshot_observed_at":"2026-06-30T07:24:21.273537Z","title":"Dynamic updates for language adaptation in visual-language tracking,","venue":null,"work_id":"5245ba92-5e26-42b0-b35f-f0497409cb4a","year":2025},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"cited_paper":"/paper/2503.06621","citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:2d80f7a9fa7c1d11662284175b4cde98e8896ff1b366a659b9a1d618977a7845","observation_id":"3a202221-71a7-47a6-b4a3-e7982016e427","resolution":{"observed_at":"2026-06-30T07:24:21.275032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:39ce7778fc7a65937ba55958a07451d0abe242ff14fae28804647a718dd25833","observation_id":"45e9876b-24c4-4eaa-a10e-5a986a801e73","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Glad: Generative language-assisted visual tracking for low-semantic templates: X. luo et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:d75a9cb4bee345b199cab892eb8afa8953a87a10fbb972b46317426fe8617dbd","observation_id":"2972d4c7-3ab8-4f8e-8718-ffef0744bfb6","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:7db6e615028174d8103c92ea913a2415b3b3166ef4372dab76b1698fee5c5e78","observation_id":"93a07e9f-7024-4795-8a9f-d6fc54334c2b","resolution":{"observed_at":"2026-06-30T07:24:21.260957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05221","last_updated":"2025-08-07T10:02:07Z","snapshot_observed_at":"2026-08-08T00:35:05.931290Z","submitted_at":"2025-08-07T10:02:07Z","title":"ReasoningTrack: Chain-of-Thought Reasoning for Long-term Vision-Language Tracking","version":1},"cited_work":{"arxiv_id":"2508.05221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05221","snapshot_observed_at":"2026-06-30T07:24:21.262066Z","title":"Reasoningtrack: Chain-of-thought reasoning for long-term vision-language tracking","venue":null,"work_id":"6e9195bc-4a62-4f9d-ade8-ac76f8468598","year":2025},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"cited_paper":"/paper/2508.05221","citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:12f4af7747fce5dac138d75158caec3b117dea0363cb71c6423859200a688dc9","observation_id":"f8c1c0df-f7f9-43ae-a570-3d6198a5ed84","resolution":{"observed_at":"2026-06-30T07:24:21.263627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Lasot: A high-quality benchmark for large-scale single object tracking,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:bca9420888b3d9081f675a85cacaf9bb13299fa121d5348b93d1a6879ce0ebde","observation_id":"b56cccd9-b699-4b4b-9245-e133709a3d03","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Towards more flexible and accurate object tracking with natural lan- guage: Algorithms and benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:e389f49c07e21292d70e1a1792817769332f585e449bb4bed2a8535ccda20e27","observation_id":"f2509db2-45c8-43a3-8baf-bd76d79567b5","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Divert more attention to vision- language tracking,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:a3f2f2129002212aaeb841ecf3bb506291ad353951c06343fd63937ab6014554","observation_id":"d8a707bb-ced9-4556-8229-a034d8ebbf33","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"All in one: Exploring unified vision-language tracking with multi-modal alignment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:2abb67fea2adc76e4a62c75302859847f7fd0cfc96282578efb9678410515665","observation_id":"2f567368-95fb-4210-bdee-5cd2a083a468","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Toward unified token learning for vision-language tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:32ddb910ba058ff56a0974bbcd8c1487e2b46792936e65d8ce0122b220c64074","observation_id":"b6c08702-e3f7-4662-aee5-e31580cd1a3f","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Context- aware integration of language and visual references for natural language tracking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:1ff6547b8617abd82b3c3434ffd781078f7ac55777386d41f597dfb755c8f9d3","observation_id":"7263e4d6-7720-4e4a-96fa-3005181881c6","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Unifying visual and vision-language tracking via contrastive learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:5e4495fe5926fa1e9711419e4a4ed31c16f3019afa81b1f9393feca729079e20","observation_id":"10568d39-cd20-43b6-b425-154368eb911d","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Mambavlt: Time- evolving multimodal state space model for vision-language tracking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:40ab7e81d52bcf87261fdfba43088f5274dbd9b3e7b8d1a60ce5df75215b351a","observation_id":"4bf12eb4-7c80-475f-a962-0a3bd0708d89","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Atctrack: Aligning target-context cues with dynamic target states for robust vision-language tracking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:2ff17946ab33ce3d1d99a03012e8a8f7006828f1c041424b6d4a9003bc7abee9","observation_id":"eb7b5ea7-443a-485d-b4e6-34414a7aa398","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Cross-modal retrieval via deep and bidirectional representation learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:17a12a724de9fe42c2cb0e59e119082d65ad728014bf19cfd0dc846b90a9c477","observation_id":"b33afb71-b608-46c7-90ed-04d5afd6b0f6","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Adversarial attribute-text embed- ding for person search with natural language query,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:07dfb35466742a84cde2c818f8374abe73ada06119e6e829b026576c616d4ccd","observation_id":"964b2abf-62d1-4428-8662-4cdffb5c0222","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Align and tell: Boosting text-video retrieval with local alignment and fine-grained supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:ac82735e01c05b1c1e2e19d8944f9a1496f274cba691c4db4ee547974845f234","observation_id":"225360c7-b354-4be5-a759-e814a5c596c4","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Multi-task cnn model for attribute prediction,","venue":null,"work_id":null,"year":1949},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:955a605361b7e59d61273c9085e11e76f68e4f9fc99d86de7a13befed21f0f1f","observation_id":"9af85916-64cf-4639-adab-5d13955eef3f","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Correlation graph convolu- tional network for pedestrian attribute recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:d0aaa55c10f9d7f72db62d32661665c9befa9cffd192569bce29e1cded8b26c2","observation_id":"a09c1093-2fbf-4257-be83-08e8c35af0a8","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:3274396a3c0fdac5d4d918f64d4c3a3e845b106c2b0c44e0171478daa6a4e208","observation_id":"e24f4b1b-5763-4821-8685-e08c1fd2e758","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:1a2db141c80c35be78c9166f1a3f86d158ae9910502a1590c48ce7ab8008e149","observation_id":"09725e22-c036-4b34-9173-c22949da9ee8","resolution":{"observed_at":"2026-06-30T07:24:21.265504Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:9dc0097cbec2e9c5d0352f0d1a79a2a7dd468eae217e17db80b73a2544c273c6","observation_id":"e73e62fd-d0d2-4abc-b5f7-860a7f5beba2","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Sam 2: Segment anything in images and videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:d312ca2d820b015150a9d4993a26e115783d26dfae672988258720159f6690ec","observation_id":"a4788d4a-1515-41e3-ba6a-2bb2ff7012fc","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:559f54813d9ef38e921a86852cdbdb435ca21ed8330af4f48058b7bdf110fef8","observation_id":"defb28a9-e50c-44b2-8729-fbb0ede1beeb","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:70290afd09b7c59509bc250cd10fa35d099537cb82cf5f702bead52865a7eb19","observation_id":"4910220f-9b5e-42c5-812f-c66cfca3b268","resolution":{"observed_at":"2026-06-30T07:24:21.273048Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:ac9d2082c046a1f47879ba00bf350ccc03d04a931132bf379f7b5c45a54e1eae","observation_id":"105a7c76-6c3a-4233-82e4-d38cc2baac3d","resolution":{"observed_at":"2026-06-30T07:24:21.258391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21980","last_updated":"2025-07-22T15:39:40Z","snapshot_observed_at":"2026-08-06T22:11:53.372622Z","submitted_at":"2025-06-27T07:41:15Z","title":"R1-Track: Direct Application of MLLMs to Visual Object Tracking via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2506.21980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21980","snapshot_observed_at":"2026-06-30T07:24:21.251853Z","title":"R1-track: Direct application of mllms to visual object tracking via reinforcement learning","venue":null,"work_id":"603a5ed6-b789-43ec-a241-77b44c0ff954","year":2025},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"cited_paper":"/paper/2506.21980","citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:ec2b6185b3dd2a3535a5d2d118504b7bd3a64e6075baf00ea5ad73e133bb05f7","observation_id":"237d682c-c674-4c7a-919d-5a3f979fd039","resolution":{"observed_at":"2026-06-30T07:24:21.253447Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.22799","last_updated":"2026-04-14T01:38:15Z","snapshot_observed_at":"2026-07-06T22:40:12.666349Z","submitted_at":"2025-12-28T06:12:28Z","title":"VPTracker: Global Vision-Language Tracking via Visual Prompt","version":2},"cited_work":{"arxiv_id":"2512.22799","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.22799","snapshot_observed_at":"2026-07-04T08:49:42.644493Z","title":"VPTracker: Global Vision-Language Tracking via Visual Prompt","venue":"cs.CV","work_id":"66949554-52cc-4043-ad27-3ec79be5c3fb","year":2025},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"cited_paper":"/paper/2512.22799","citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:f04ee74cda2900877023273752fb28708b8577f6389dff044ce3eb0234c73cc5","observation_id":"f3335b67-1f4a-44ad-b463-cbd573bd8207","resolution":{"observed_at":"2026-06-30T07:24:21.281526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06550","last_updated":"2026-07-22T15:20:13Z","snapshot_observed_at":"2026-08-06T23:57:51.136833Z","submitted_at":"2026-01-10T12:18:12Z","title":"Generative Semantic Multi-Object Tracking: A Large-Scale Benchmark and an MLLM-Driven Reasoning Framework","version":4},"cited_work":{"arxiv_id":"2601.06550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.06550","snapshot_observed_at":"2026-07-07T04:17:58.620756Z","title":"Llm- track: Semantic multi-object tracking with multi-modal large language models,","venue":null,"work_id":"5d22d3b7-071a-4188-a3ea-ca339ca69dfb","year":2026},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"cited_paper":"/paper/2601.06550","citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:b00cf12e2c94122e7392f50008a9935fb5e8934af8842dcf29782c00ddabc2be","observation_id":"e495ff10-cd13-40e0-8374-287c2c771147","resolution":{"observed_at":"2026-07-07T04:17:58.620756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Deep biaffine attention for neural dependency parsing,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:2e7ca403811fde77ed66d4cca46da96e85ba03dfcdffc69badbaca8b1f7c7d0f","observation_id":"2c82bfab-3e76-42fa-82ac-1a5fe352c572","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Universal dependencies v1: A multilingual treebank collection,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:90087ff8cd754d5bf1bb844f038e511342b32d0c30382d771ee941a9af9a764f","observation_id":"4ef82fea-9f7f-4eb8-a894-dffe7dff3f4b","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"A gold standard dependency corpus for english,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:4ffa21fad161e8c8f834fcbc49664ea0042ec4877561781124456133937a037b","observation_id":"55472819-53fe-439e-a186-7f766a543b26","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:3f418a8677ec038a4488d7933344a2ebb51ae5f2d17afd3a9d66716dec13dbb7","observation_id":"a662e581-debb-4ce3-9624-1351f51eda1f","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Generalized intersection over union: A metric and a loss for bound- ing box regression,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:2f7c7fa35c9794af52daa990e4f9499355afe2f9d71d0786b0711bfdab05fe10","observation_id":"41f27cd3-ea62-4804-9441-628ff07d78ff","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Focal loss for dense object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:547060929031dea36041f0b820e6a004c40462d8f5a36799d38fec93f4304960","observation_id":"8b4e050a-8353-49ef-bda8-d0c55cc20d28","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:e9d93320d2cae4c2e38b00daf6888be554967199d03796c711ea63cf943fb3b8","observation_id":"9d3c2d7a-db08-45c7-96da-d58f303250ee","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Joint feature learning and relation modeling for tracking: A one-stream framework,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:2d59cb41e57bc9e3106edc2976559b1473b2c9de1d0080c8bd8963f63dfb262b","observation_id":"95cf6f3a-cedc-4171-91b1-8f55ffbb1726","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Mixformer: End-to-end tracking with iterative mixed attention,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:2e07b1930e28b99e30701346e43be93aa43ca3d961e1c14e270290aa446f4088","observation_id":"31d4cb89-410e-4021-8791-aeb285d51370","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Aiatrack: Attention in attention for transformer visual tracking,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:6993b917d6090c135f330eb464a15139785f1b867882c9d7836d07db4e53314b","observation_id":"9a827872-de91-4ad1-8991-f37cc8e7f635","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Citetracker: Correlating image and text for visual tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:9d4af200bad9a55b675a467a8cf71052bb0c5198ed6f44dd7ac1f53a95c9decb","observation_id":"6d801357-ff2e-4655-9026-e9a90b77eef3","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Robust object modeling for visual tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:59657f0542801265e6b07c3482ecc4616a97da2f6fef562bbd4c19f92eeee4dd","observation_id":"06637f69-cc3d-410d-a7f6-6f82657f4edd","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Generalized relation modeling for transformer tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:0cb3e475dc6f47dacd26d28a789e6bc1cf8dbdd33b72292afdd1c10acd4414eb","observation_id":"0cdcee00-2f48-4f36-92fb-247bb8341354","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Odtrack: Online dense temporal token learning for visual tracking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:4901976d1a5a42164b8eb8b00f657e842cefa1f02da92a6b4b2bd403d5bf3c58","observation_id":"a4dc9ac8-27d2-49cc-9e38-a37099a4d087","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Explicit visual prompts for visual object tracking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:16720257778f7e87e694c7c39e9a50cad610e0ad4d1053d6ea2fa28ffdbb8ffe","observation_id":"dd2ddee0-3ba5-41a5-8258-ff61f8f4bd31","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Autoregressive queries for adaptive tracking with spatio-temporal trans- formers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:d601c44a4e6417bdcc5c77304b34a6eb4ef190e65f3a5279121c856bfd1af21c","observation_id":"81c63ac4-8dd9-4d48-8d79-60a1f14571dd","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Less is more: Token context-aware learning for object tracking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:7c5285a733ec17bca1960cbda34cacc8d235c92439f7d7cb5013b902dd6b0997","observation_id":"3f20c244-2d38-44f2-8e19-39e6576d9dea","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Enhancing vision-language tracking by effectively con- verting textual cues into visual cues,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:e589ecc480d1597229322e98fc12258f9552fbd4e1b767827d659ccf8ec17c68","observation_id":"e689a555-e109-405c-9709-c8d630f19c79","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Sutrack: Towards simple and unified single object tracking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:66388990e33938b8188af0e06fcaa0a207d173e93996ff4069883691e8a67622","observation_id":"e609eda5-4997-40e9-80bd-b9fc21ae3b14","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Dynamic updates for language adaptation in visual-language tracking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:0683337e89ce2c2431f3858ed9a6a1a0bd0ed9e5fabdd1523e03405bdfaf39d2","observation_id":"9c043613-a869-49d4-b8fc-7ba71f4c5b47","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Selective distillation of lan- guage tokens for redundancy suppression in vision-language tracking,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:7dac5fec7b971dc6cd078b26e4a4826282efec168729ee9352638fe4416b12fc","observation_id":"01c277ed-6336-463d-b457-ed55ac9f05f7","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Seqtrack: Sequence to sequence learning for visual object tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:de81cb57e461e8a1a8330a7a79ac042c56c71928c6345045254acbfe944538f6","observation_id":"49086bbf-2f9f-4d4d-b92c-2da7642af3b3","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Tdcl: Dense seman- tic contrastive learning for vision-language tracking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:832c225a0dd5a7565fd6443eee04754e90aae48bebc1c96eb94db8b22d272b03","observation_id":"45c32c9c-1097-4dbf-bd94-ee979991c940","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Consistencies are all you need for semi-supervised vision-language tracking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:b77b3b533588a177e1458a20d87f0bb68abef2a8482af15208a46b4fac636e3d","observation_id":"d726839e-8c86-4918-a325-1dbbfc551fab","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"One-stream stepwise decreasing for vision-language tracking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:d21804660391c3faf29995e8c89997dfe90b2b23a6ffe3601ad331952876fdfc","observation_id":"dc277698-4fb8-4f61-9458-93869052e045","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"cited_work":{"arxiv_id":"2507.00454","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00454","snapshot_observed_at":"2026-06-30T07:24:21.277633Z","title":"Atstrack: Enhancing visual-language tracking by aligning temporal and spatial scales,","venue":null,"work_id":"b2739ed2-39dc-4a93-bcf1-d56b5ebbd00e","year":2025},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"cited_paper":"/paper/2507.00454","citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:370f45d5166135107d22196cec5c324feef91175230eae62272acf4a9932020e","observation_id":"9bd60c18-a9cc-4ce4-9dc2-387bbc900887","resolution":{"observed_at":"2026-06-30T07:24:21.279204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Robust tracking via mamba-based context-aware token learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:7a4d7c62d477740f95c5b0f2dc2318ecf119de035dab6e5c758be1f30badced7","observation_id":"1561aa8e-dfcc-417c-ac7f-530fd6d1396f","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Aware distilla- tion for robust vision-language tracking under linguistic sparsity,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:8e2588f900b3439e83ddb7ee466c65e3383932996e276909bfbfd523b2cba97f","observation_id":"574127d4-b9a6-4f1b-a44a-29f4c89cec5b","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Vision-language tracking with attention-based optimization,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:a919993e6b08b3a8f1b0f7cc2843908d1dc4247882fdc552109ed6034cb75e63","observation_id":"700c6093-854e-48b2-978e-6d287d1a6282","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Sematrack: semantic-driven unified vision-language tracking: J. zhang et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:2072f83d7b085fee351e75318ad6c54fd7835b8418003c693963c1f4d5787d31","observation_id":"4ac4e4fc-dd39-4b29-87f0-c3a5b1f0ff49","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Rwkv-inspired multi-modal relation modeling for vision-language tracking,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:d68dfaca7daaea67c0d6701a2f3592a7159f6c324114ac444f3c4da620418ef5","observation_id":"1e31ead8-8ef1-45f6-99ed-a3d8523d396a","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.03806","last_updated":"2022-05-08T07:46:34Z","snapshot_observed_at":"2026-07-06T13:07:44.802145Z","submitted_at":"2022-05-08T07:46:34Z","title":"Transformer Tracking with Cyclic Shifting Window Attention","version":1},"cited_work":{"arxiv_id":"2205.03806","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.03806","snapshot_observed_at":"2026-06-30T07:24:21.277172Z","title":"Transformer tracking with cyclic shifting window attention,","venue":null,"work_id":"d6cdbaad-9f9e-439c-a554-fc553d1a4745","year":2022},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"cited_paper":"/paper/2205.03806","citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:4b66b377a78a090711a3e15b507442447411b718a02bc9777e6a648af7e2b07b","observation_id":"5fddf6f9-67cf-4110-a1c9-2343129c729e","resolution":{"observed_at":"2026-06-30T07:24:21.278948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Transformer vision- language tracking via proxy token guided cross-modal fusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:7d494010337ee1d9493da6887e4a5442afff58e43f56b1161497116178d79b1c","observation_id":"35379813-be47-46b8-92aa-ace61b7ef44c","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Real-time visual object tracking with natural language description,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:9b44a867d4729ff892b60f9e91a9fe5319caa309fde77c28fcb8f8feac32786c","observation_id":"401366df-9a03-4a21-9929-74d04c67c735","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:20:54.642591Z","title":"Siamese natural language tracker: Tracking by natural language descriptions with siamese track- ers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:b58f1d04e3908e13760e61d2b9b83527a789d6c76ba653ecc5ab96993c5fb7b2","observation_id":"da0e173f-74e4-4cc2-a2b8-57960ae710f8","resolution":{"observed_at":"2026-06-30T07:20:54.642591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":12,"verified_fuzzy":0},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 0 inbound Pith citation observations for arXiv:2606.29357."}