{"as_of":"2026-08-14T01:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c44d6aa5d1c7c25c9bb5e5c8a2f158da8b73f44f551114764a4b58572526af8","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:09:18.356984Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:09:21.137235Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T00:47:30.785940Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15600","snapshot_observed_at":"2026-08-11T00:09:21.137235Z","title":"How texts help? a fine-grained evaluation to reveal the role of language in vision-language tracking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19648","last_updated":"2024-12-27T13:54:32Z","snapshot_observed_at":"2026-08-12T23:43:38.482736Z","submitted_at":"2024-12-27T13:54:32Z","title":"Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T00:09:21.137235Z"},"links":{"cited_paper":"/paper/2411.15600","citing_paper":"/paper/2412.19648"},"observation_digest":"sha256:d652f150a914207602213ba9da10695164a2b063f70f7d7851123d53fd535f1f","observation_id":"f9b351c5-372e-4071-9993-8bc2101de048","resolution":{"observed_at":"2026-08-11T00:09:21.137235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"cited_work":{"arxiv_id":"2411.15600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15600","snapshot_observed_at":"2026-07-03T00:47:30.785940Z","title":"How texts help? a fine- grained evaluation to reveal the role of language in vision-language tracking,","venue":null,"work_id":"704d304c-775d-4a8b-9dba-e58bd772acc2","year":2024},"citing_paper":{"arxiv_id":"2606.09167","last_updated":"2026-06-08T08:05:40Z","snapshot_observed_at":"2026-08-12T23:43:39.120516Z","submitted_at":"2026-06-08T08:05:40Z","title":"Vision-Language Guided Hyperspectral Object Tracking via Semantics Fusion and Contextual Template Updating","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T17:00:06.124148Z"},"links":{"cited_paper":"/paper/2411.15600","citing_paper":"/paper/2606.09167"},"observation_digest":"sha256:fbbd7b2bbdec8a5a586b61cd37d79af90d3d42ab230ac45b5c5dc1f440f0df15","observation_id":"411cef07-8af4-4362-95f6-05eddc97d6ed","resolution":{"observed_at":"2026-07-03T00:47:30.788092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.15600/citation-record","integrity":"/paper/2411.15600/integrity","json":"/paper/2411.15600/citation-record.json","paper":"/paper/2411.15600"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.103564Z","title":"Human mem- ory: A proposed system and its control processes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.103564Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:653b41e4362294790685fd46b06da0ae118aea024b26b5749494671d54ed10eb","observation_id":"c691b2e0-3aa4-4517-b7a8-de1014d9f763","resolution":{"observed_at":"2026-08-12T14:09:18.103564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:19.133692Z","title":"Hiptrack: Visual tracking with historical prompts","venue":null,"work_id":"83a54648-e993-4004-b289-e944ce61ab6b","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.108712Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:dc49cd4c211882bc8b56541c7fa72bb5f022687b73da9bd52be31544441981e8","observation_id":"881e888d-1078-449b-9ad5-994789e07879","resolution":{"observed_at":"2026-08-12T14:09:19.138491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.114816Z","title":"Lasot: A high-quality benchmark for large-scale single ob- ject tracking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.114816Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:49e1d837be86b35db2903ccfec40d226b208ea2f020606296be55ade4e87d43e","observation_id":"8a57c619-3fd1-4110-a336-57db4580f668","resolution":{"observed_at":"2026-08-12T14:09:18.114816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:19.110154Z","title":"Lasot: A high-quality large-scale single object tracking benchmark","venue":null,"work_id":"59d3be10-1a4d-4052-9fe3-b9dd9c406617","year":2021},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.119871Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:99c8ad9ac4ba7321814016053d450b47a7e54e3630e721927ed49b5ab64d6059","observation_id":"96076bb1-e19d-486c-a9a0-8fc314c3fd77","resolution":{"observed_at":"2026-08-12T14:09:19.114942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:19.094934Z","title":"The ther- mal infrared visual object tracking vot-tir2015 challenge re- sults","venue":null,"work_id":"bcba2852-8cd9-4010-8591-e507e5ed086f","year":2015},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.125035Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:e3481caf197b54cb0ac147f95e0a3831152fbbab7da11b8bad6ed474fcb698e4","observation_id":"f2e1bfc6-d475-4fee-8d92-ffb21e0fc335","resolution":{"observed_at":"2026-08-12T14:09:19.099954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02048","last_updated":"2021-04-05T18:03:24Z","snapshot_observed_at":"2026-08-13T20:16:29.094509Z","submitted_at":"2019-12-04T15:16:32Z","title":"Siamese Natural Language Tracker: Tracking by Natural Language Descriptions with Siamese Trackers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02048","snapshot_observed_at":"2026-08-12T14:09:18.130217Z","title":"Robust visual object tracking with natural language region proposal network","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.130217Z"},"links":{"cited_paper":"/paper/1912.02048","citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:3ba4e20f2f466abf7d95fc49b9e1c8351d703242feca453545a4123f7327ee23","observation_id":"3c47da88-d533-4e27-904e-94fd2c4cdf3f","resolution":{"observed_at":"2026-08-12T14:09:18.130217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:19.079507Z","title":"Real-time visual object tracking with natural lan- guage description","venue":null,"work_id":"2834430e-4cb2-43e1-81c8-82258cb85dbd","year":2020},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.136265Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:e3ecdf2d909c5041d6ce6610f73e0c2e012fb72d1557159e63efcfbfbb98d7a4","observation_id":"7ee7f2b0-718e-4e4a-9776-e6151e02ab5b","resolution":{"observed_at":"2026-08-12T14:09:19.084546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:19.064814Z","title":"Siamese natural language tracker: Tracking by natural lan- guage descriptions with siamese trackers","venue":null,"work_id":"0dec4124-aa20-40e4-a310-d23b231dcc2e","year":2021},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.141139Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:32dcf51c9d226a4866962ad50551c2cfa3d64b48f3de7635861a4bea5f00ae9f","observation_id":"44c9f2af-045c-42fa-8a7a-70f844a7e963","resolution":{"observed_at":"2026-08-12T14:09:19.070116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:19.050737Z","title":"MemVLT: Vision-language tracking with adaptive memory- based prompts","venue":null,"work_id":"4939c7cc-52f9-49fb-8e37-c9431e1cb970","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.146373Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:3602adf17b07640a025ba11901878bf0172fa52e882c918b32ebae3126ec06b1","observation_id":"b761f02c-1fd9-4117-bd35-8f0467b15c93","resolution":{"observed_at":"2026-08-12T14:09:19.055495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:19.035326Z","title":"Consistencies are all you need for semi-supervised vision-language tracking","venue":null,"work_id":"5de581bf-63b0-46cd-a5ef-4bd0a6f8764b","year":1904},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.151226Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:6c51981c23f415ad179f8e2fe31fbecb1fb9e535888cbcc3f962a46976664e22","observation_id":"a56339be-e9c9-4f14-b7fe-fbf118c2f054","resolution":{"observed_at":"2026-08-12T14:09:19.040434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:19.021542Z","title":"Divert more attention to vision-language tracking","venue":null,"work_id":"04ce7c2e-7bd3-4d5f-972a-f347f87136d7","year":2022},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.156126Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:4bc25d148d755f31f0c3d69ba1d0739285878a647632d5eb9b160937a6c3624f","observation_id":"782e3fdb-7f13-423c-98a4-8e531c289e26","resolution":{"observed_at":"2026-08-12T14:09:19.026128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:19.007122Z","title":"Divert more attention to vision-language object tracking","venue":null,"work_id":"66ead24a-c245-4138-a2ff-82c1062f94ce","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.160917Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:e15b10c07718b2cd56f027a3d66fcba6b59ad175a2a511d0f8c675cfdf209f3c","observation_id":"a18ba0f9-cb3e-4228-ab3f-d09fe06e99c9","resolution":{"observed_at":"2026-08-12T14:09:19.011993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.992020Z","title":"Global instance tracking: Locating target more like humans","venue":null,"work_id":"cce22695-4f6a-4028-b256-06b8a4a24d65","year":2022},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.165505Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:2a32357fe3a0493a775cb4543b4aec6994e63dda917f58df6174f0d0b156e6e0","observation_id":"d4ad2f17-3e36-4606-80ac-d8429d77aba6","resolution":{"observed_at":"2026-08-12T14:09:18.996937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.977103Z","title":"A multi-modal global instance tracking benchmark (mgit): Better locating target in complex spatio-temporal and causal relationship","venue":null,"work_id":"2148c507-da91-4918-9e23-a40d476953e9","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.170815Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:dd21b60804c589b89714d09099ef2ae19745fe207e0ea44db064024fc1dd65c2","observation_id":"2d5bd364-cf7e-4c6d-b4c7-e54bbbe5e165","resolution":{"observed_at":"2026-08-12T14:09:18.982423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.963072Z","title":"Sotverse: A user- defined task space of single object tracking","venue":null,"work_id":"97bad116-4068-431e-97e4-342556fd83f6","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.175845Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:6ca64cc845c61a0684902d409116d27f15361fae967f559e234e8b904a0b301a","observation_id":"e0ff01a6-a8e9-44e1-b151-b84c0f8c54c9","resolution":{"observed_at":"2026-08-12T14:09:18.967890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.948754Z","title":"Rtracker: Recoverable track- ing via pn tree structured memory","venue":null,"work_id":"ead9dd98-597c-411a-81db-8a2afd2bf1e1","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.181623Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:6259716e66332c7fe97b0070fac31aa129a48f54a87cab1674889ed31a084c32","observation_id":"c4eaebec-61c2-4c42-8e2e-a301cc81fb6e","resolution":{"observed_at":"2026-08-12T14:09:18.953505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.934180Z","title":"The sixth visual object tracking vot2018 challenge results","venue":null,"work_id":"d7735584-70d8-4f5f-9f42-7df14dc74358","year":2018},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.186969Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:45030e8dd907502497df0920530e7183434fef1faf0ce15520295979c574506a","observation_id":"0774f916-c945-4e4c-b88a-91f50ef30465","resolution":{"observed_at":"2026-08-12T14:09:18.939065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.919353Z","title":"The seventh visual object tracking vot2019 chal- lenge results","venue":null,"work_id":"9152896d-a010-4c3a-9894-a42fbe7db5fa","year":2019},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.191693Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:d2b916c7030929fa6f76754961c90a202bc36ba8a5bb79ed93fe3b18ca7c35b3","observation_id":"88220d66-de46-4b7d-9aad-ee7477ba4a0a","resolution":{"observed_at":"2026-08-12T14:09:18.924264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.905026Z","title":"The eighth visual object tracking vot2020 chal- lenge results","venue":null,"work_id":"624b2ed1-f219-4ab7-b2ea-13ba38b1f77a","year":2020},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.196789Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:d48c7f9a41b4552a871c2957ada60a5b125277527e51818725493ef5e277521b","observation_id":"84d66b3c-cf7b-4fa4-98ab-c437e0f9aa11","resolution":{"observed_at":"2026-08-12T14:09:18.909595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.889400Z","title":"The ninth visual object tracking vot2021 challenge results","venue":null,"work_id":"5db8b205-b7da-4825-8d5a-59c9b5fe7add","year":2021},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.202337Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:eb0dd14a409857c4755044e064910f842f3b6242433348b2ee1fff82e0b9dca8","observation_id":"3a1abc17-5ecc-43e2-aa9f-75e330ec33e5","resolution":{"observed_at":"2026-08-12T14:09:18.894884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.874931Z","title":"The tenth visual object tracking vot2022 challenge re- sults","venue":null,"work_id":"20f69163-68d2-4b55-8710-82d412194522","year":2022},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.206910Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:23c97e7a7655a1dd0e58837305708f6134ef99fdf8fbd28ebb45761947e73434","observation_id":"ef392102-65b6-4b4d-a993-46fd01ac911b","resolution":{"observed_at":"2026-08-12T14:09:18.879567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.859624Z","title":"Dtllm-vlt: Diverse text generation for visual language tracking based on llm","venue":null,"work_id":"2e03d1c6-3f42-4ebe-8fdb-efe563465a56","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.211677Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:3ae4683a3e49500704f44042e40e81b46b2d5c7c957667e29db119af4ef67918","observation_id":"65bd778c-f33d-452d-8017-040820f4a3a6","resolution":{"observed_at":"2026-08-12T14:09:18.865064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02492","last_updated":"2024-10-09T14:07:15Z","snapshot_observed_at":"2026-08-12T22:31:39.005867Z","submitted_at":"2024-10-03T13:57:07Z","title":"DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02492","snapshot_observed_at":"2026-08-12T14:09:18.216985Z","title":"Dtvlt: A multi-modal 9 diverse text benchmark for visual language tracking based on llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.216985Z"},"links":{"cited_paper":"/paper/2410.02492","citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:be92e69bb9af77679149aab8d27d28d5552669312b1e783e4480d080475df99e","observation_id":"4ad675ef-d0f0-4044-92b5-2b720b9f1a7d","resolution":{"observed_at":"2026-08-12T14:09:18.216985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08887","last_updated":"2024-09-13T14:54:37Z","snapshot_observed_at":"2026-08-12T22:45:26.185600Z","submitted_at":"2024-09-13T14:54:37Z","title":"Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark","version":1},"cited_work":{"arxiv_id":"2409.08887","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.08887","snapshot_observed_at":"2026-08-12T14:09:18.459031Z","title":"Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark","venue":"cs.CV","work_id":"b5140620-846e-4121-869e-8308bd442292","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.222921Z"},"links":{"cited_paper":"/paper/2409.08887","citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:5d5f01bcc520f61f886ab59e69d5194f3696e18bce9537176ab6f0ad2a3b287c","observation_id":"e2a7c7a5-3c78-46fd-a66b-35eae532892d","resolution":{"observed_at":"2026-08-12T14:09:18.465992Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.844736Z","title":"Cross- modal target retrieval for tracking by natural language","venue":null,"work_id":"01a0a740-66d5-4ca2-99aa-a2506cec262c","year":2022},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.227573Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:fac8b2793c468b7fa1f28c87e43faf3e647afed45ceae2646ce6e75360d2ad07","observation_id":"eab50161-26c0-48e1-9d5e-8b3e2f4140b1","resolution":{"observed_at":"2026-08-12T14:09:18.850078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.830535Z","title":"Tracking by natural language specification","venue":null,"work_id":"53353d09-6965-4d10-a0bb-33873c5c6b03","year":null},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.232583Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:024f5a630ae8f86e63b6cc3efda7bb41a426e85ddfefbb72ff30a09f188e51de","observation_id":"ede48084-bcb6-4c20-8c4b-64a06640b73b","resolution":{"observed_at":"2026-08-12T14:09:18.835221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.816181Z","title":"Unifying visual and vision-language tracking via contrastive learning","venue":null,"work_id":"af86076f-5852-40bc-89f9-5f66a048b219","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.237944Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:254d5af2cd761ec45378fd75d5a344698fb0256b8ebcacec1d268d4dcef0eca0","observation_id":"78a3cc78-8dba-4446-b3ca-29f268e31bd9","resolution":{"observed_at":"2026-08-12T14:09:18.820905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.799898Z","title":"Human memory","venue":null,"work_id":"a9a8ac62-d4b4-4b86-947e-8e47dc7615c0","year":2021},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.242844Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:a9e134f8fc728725a44abe1632a36803b4d3f546f5a1123957415491ff811f57","observation_id":"d04315e0-37e9-4afe-8d2f-43569950c657","resolution":{"observed_at":"2026-08-12T14:09:18.804407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.785007Z","title":"The visual object track- ing vot2016 challenge results","venue":null,"work_id":"844fd71b-05fd-44a5-8d19-c91be9a17883","year":2016},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.248344Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:d734f526a1a197e2c8e45f7d444cfe7410c000a8a220666e6792afd39a915e53","observation_id":"b4dba66c-1329-47fb-837d-e88ee4fecaa8","resolution":{"observed_at":"2026-08-12T14:09:18.790519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.769638Z","title":"Context-aware integration of lan- guage and visual references for natural language tracking","venue":null,"work_id":"08e46081-7acf-4129-af72-daa8f08301f3","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.252952Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:ae04e95d2720a2418c7d9fc19247e7a9b9bd8bbac79829ec49d90053439aa654","observation_id":"3ead83b6-0b82-4cca-8684-2b92c2bcecbb","resolution":{"observed_at":"2026-08-12T14:09:18.774118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.755182Z","title":"Explicit visual prompts for visual object tracking","venue":null,"work_id":"11df406b-26ea-429b-acff-660591b949a5","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.257481Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:5fb0f73cf577436bdf7028b41e173e19d67ec697a45b03f02dc1ec7a19597b68","observation_id":"1fe940d1-a924-4644-b23f-b21af2d2134f","resolution":{"observed_at":"2026-08-12T14:09:18.759747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.740627Z","title":"Auditory sensory (”echoic”) memory dysfunction in schizophrenia","venue":null,"work_id":"5e1c67f5-2523-4956-9c89-e88b779ff57c","year":1995},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.261997Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:135116f9d86fd382b0a53645efe9a1ddf35e292a1fdf9e0f4824922d7ddbe5c3","observation_id":"8c0b6c44-f2b2-4804-b90b-51dc991611d1","resolution":{"observed_at":"2026-08-12T14:09:18.745258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01756","last_updated":"2024-12-16T12:53:25Z","snapshot_observed_at":"2026-08-12T22:08:40.056053Z","submitted_at":"2024-11-04T02:43:55Z","title":"ChatTracker: Enhancing Visual Tracking Performance via Chatting with Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01756","snapshot_observed_at":"2026-08-12T14:09:18.267141Z","title":"Chat- tracker: Enhancing visual tracking performance via chat- ting with multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.267141Z"},"links":{"cited_paper":"/paper/2411.01756","citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:3b5f04cfad8f654edf7fb01fb3b3ce428934b3b998439933d29390c6d8f53882","observation_id":"5ad3aaec-2001-450f-905c-ef1547a5e252","resolution":{"observed_at":"2026-08-12T14:09:18.267141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.725106Z","title":"Elysium: Exploring object-level perception in videos via mllm","venue":null,"work_id":"a66f33ec-8d9f-4b3f-b37f-d15157887094","year":2025},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.272795Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:a3df11b173f301385a89a8d275e3d5d4e1f3ef6d7b6de1c4243e08f2b2f89065","observation_id":"917f536b-3295-4830-80a2-8f134fefd9b7","resolution":{"observed_at":"2026-08-12T14:09:18.730119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.710367Z","title":"Semtrack: A large-scale dataset for semantic tracking in the wild","venue":null,"work_id":"a75e7b9f-c8c1-45cd-9866-a74bf74bace5","year":2025},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.277700Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:59794f61d2abc3d25427c798733f9a7d34201c2d17381e2bd0dbf0406c06cd0b","observation_id":"db3ba621-7ef0-48be-880f-55a6fcd7fb8f","resolution":{"observed_at":"2026-08-12T14:09:18.715262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.694172Z","title":"Unified transformer with isomorphic branches for natural language tracking","venue":null,"work_id":"cffc7790-af2c-427c-bbcc-189073666b64","year":2023},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.283013Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:c087c26f14b1724502b3761457d5e5c9631871fe32555819bb809c8ee2db16b7","observation_id":"f9e12642-b43f-41b8-bc4f-da8173b7627e","resolution":{"observed_at":"2026-08-12T14:09:18.699411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.10014","last_updated":"2018-11-27T02:54:57Z","snapshot_observed_at":"2026-08-06T15:11:05.852095Z","submitted_at":"2018-11-25T14:00:05Z","title":"Describe and Attend to Track: Learning Natural Language guided Structural Representation and Visual Attention for Object Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.10014","snapshot_observed_at":"2026-08-12T14:09:18.288190Z","title":"Describe and attend to track: Learning natural language guided structural representation and visual attention for object tracking","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.288190Z"},"links":{"cited_paper":"/paper/1811.10014","citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:636f7b98073671ba88acdcab592a2f509c2da376815534dec474da515841c604","observation_id":"4c3a89d1-ed08-496e-be7b-26df92b80bdf","resolution":{"observed_at":"2026-08-12T14:09:18.288190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.679294Z","title":"Towards more flexible and accurate object tracking with natural language: Algo- rithms and benchmark","venue":null,"work_id":"ea39feac-6d4d-4ccc-a6c4-3cbfc055267c","year":2021},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.293346Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:6caa2ba3a3e87def72549bfe11f505b223d4a9f3223a9191b21db7d20fd80623","observation_id":"95ea0b52-9fde-4404-a1b7-7259aa545944","resolution":{"observed_at":"2026-08-12T14:09:18.684054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.664679Z","title":"Online object tracking: A benchmark","venue":null,"work_id":"c1f44620-206c-48fc-a520-14bf1edbe238","year":2013},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.298731Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:4f97cd7c0fb8e25cd9abc507610c752a52de2205a04a629711175e646990f110","observation_id":"5f28e509-88c0-4f24-b367-0eb9700b0621","resolution":{"observed_at":"2026-08-12T14:09:18.669373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.649775Z","title":"Object track- ing benchmark","venue":null,"work_id":"eb93970f-0761-4a19-b190-d2f3d9995d92","year":2015},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.303585Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:fa7ee0f3e146cea85627dc02e77e74ac8eb6ca035d41edcaed76a52c31203f74","observation_id":"dd0a1bfa-3699-45c7-b46c-3a67baf380de","resolution":{"observed_at":"2026-08-12T14:09:18.654849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.634988Z","title":"Autore- gressive queries for adaptive tracking with spatio-temporal transformers","venue":null,"work_id":"aad3f8e0-7783-4c89-8a5e-1748b61ba1db","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.308091Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:a1820dbca1c42658fa4b3f29648e578add6eb5f816c29699e8c0f150846492f4","observation_id":"932c0727-fa98-42a7-8928-56e91a12cc20","resolution":{"observed_at":"2026-08-12T14:09:18.639677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.620603Z","title":"Grounding-tracking-integration","venue":null,"work_id":"abcd617d-1c79-4e57-97fd-f1bc2d9071b9","year":2021},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.313353Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:ef38fbde80a2ede4c2b2178a6650781246294d64c81c7a0626c5da254609cb30","observation_id":"203c9a77-e2b8-470d-be58-cf95dadd2df7","resolution":{"observed_at":"2026-08-12T14:09:18.625256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.603166Z","title":"Webuav- 3m: A benchmark for unveiling the power of million-scale deep uav tracking","venue":null,"work_id":"de02f97e-681e-4ac5-b482-be21456719bf","year":2022},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.318218Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:1ec689e0f52e87fdb05b811dde73c2605da9471f5d9406117331e54d052a8944","observation_id":"0e63a94b-20e4-4cb8-be81-4617b937366e","resolution":{"observed_at":"2026-08-12T14:09:18.609682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16902","last_updated":"2025-05-19T03:40:10Z","snapshot_observed_at":"2026-08-12T23:42:52.632511Z","submitted_at":"2024-09-25T13:10:03Z","title":"Underwater Camouflaged Object Tracking Meets Vision-Language SAM2","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16902","snapshot_observed_at":"2026-08-12T14:09:18.323238Z","title":"Towards underwater camouflaged ob- ject tracking: An experimental evaluation of sam and sam 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.323238Z"},"links":{"cited_paper":"/paper/2409.16902","citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:c3ec8fe65f60f2df14c1c8ebb81fbd99840af6a4542cefc8f1d2992a7fd535b6","observation_id":"fadae9dd-0be5-411a-94d4-406e88d3823a","resolution":{"observed_at":"2026-08-12T14:09:18.323238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19818","last_updated":"2024-05-30T08:25:21Z","snapshot_observed_at":"2026-08-12T23:54:26.498123Z","submitted_at":"2024-05-30T08:25:21Z","title":"WebUOT-1M: Advancing Deep Underwater Object Tracking with A Million-Scale Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19818","snapshot_observed_at":"2026-08-12T14:09:18.328043Z","title":"Webuot-1m: Advancing deep underwa- ter object tracking with a million-scale benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.328043Z"},"links":{"cited_paper":"/paper/2405.19818","citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:1118e52f6c41e3cb3052946c1b14ef162ffd9f047b9a8c2296167d1a926322f2","observation_id":"321d7609-2b05-4dc8-910f-3087262260bf","resolution":{"observed_at":"2026-08-12T14:09:18.328043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.587702Z","title":"One-stream stepwise decreas- ing for vision-language tracking","venue":null,"work_id":"38ea65dc-7bfc-4761-b586-c144d7117ea2","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.332954Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:53dfad5b6bef6e6eb884860b5c13decf79eedbcdf4d7d1d17d870f97f85aa833","observation_id":"f272e89d-847a-428a-aaf2-23a903f1fd8c","resolution":{"observed_at":"2026-08-12T14:09:18.592456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.569705Z","title":"One-stream vision-language memory network for object tracking","venue":null,"work_id":"396dc43a-a03f-4275-b6ae-843dab962369","year":2023},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.337812Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:10ce49df7a719090538a5c1973446cb5679d17c19ed0f9376ef9ac384aa4220f","observation_id":"0bd97540-232a-47df-a677-5d2e0d843ae6","resolution":{"observed_at":"2026-08-12T14:09:18.575460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.553267Z","title":"Transformer vision-language tracking via proxy token guided cross-modal fusion","venue":null,"work_id":"c8c52337-0e8a-4e97-a2bb-8852933f8b40","year":2023},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.342232Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:c081e5b4c74d1d0671a0f561932bd70a5c59e8695106531b233a9ea66f2966fb","observation_id":"0b10906b-48cd-4c07-9e97-30d1c1fd858d","resolution":{"observed_at":"2026-08-12T14:09:18.558743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.537746Z","title":"Towards unified token learn- ing for vision-language tracking","venue":null,"work_id":"8c25d593-0403-490a-a26d-dffc0a802324","year":2023},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.347565Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:6f5d3e654438e17859e759197b4b36e7290cd24e3b60c4050d316cb3b787a9ee","observation_id":"7a4a8d23-6730-4448-af42-86aa5cfd59a4","resolution":{"observed_at":"2026-08-12T14:09:18.542702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.521756Z","title":"Odtrack: Online dense temporal token learning for visual tracking","venue":null,"work_id":"c785075a-b6fa-4d2b-9e96-cb25ad07c855","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.352182Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:66696604fbf0a9a6866b868836052de5c57ecfe8160ba85d34b6cf6244f4c906","observation_id":"f05b2deb-bb77-45d7-b166-5feaa4c7c507","resolution":{"observed_at":"2026-08-12T14:09:18.526689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.506688Z","title":"Joint vi- sual grounding and tracking with natural language specifica- tion","venue":null,"work_id":"7fcb415f-d88e-4cb2-9967-6643247b4d8f","year":null},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.356984Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:a8fd282d19551c5d1f7a3958dfa297a8235db0dcde3712d9c306681dabc89e73","observation_id":"047e5346-a73f-4ae6-b1fe-3a345f869610","resolution":{"observed_at":"2026-08-12T14:09:18.511244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T10:06:53.330792Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":42},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 2 inbound Pith citation observations for arXiv:2411.15600."}