{"as_of":"2026-08-09T11:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:193b9586af6c1dceb09560669fecfb05ff09256b6c7fec1e35b7e749de842ee0","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:17:06.045580Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.00847/citation-record","integrity":"/paper/2608.00847/integrity","json":"/paper/2608.00847/citation-record.json","paper":"/paper/2608.00847"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.867049Z","title":"In: European Conference on Computer Vision, pp","venue":null,"work_id":"c06eea8a-3742-4842-9100-146835377d83","year":2022},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.842972Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:39d0b4d81c690db8d461a0e1d8adb7ca8cb7f2851870ae1db6fc1bc68d6b8413","observation_id":"f3b63ce5-ceff-4e4b-a552-af1cfdbf811a","resolution":{"observed_at":"2026-08-05T00:17:06.871190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.858259Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision 21 and Pattern Recognition (CVPR), pp","venue":null,"work_id":"111d6905-34e4-4070-8a5b-dba3d9e45589","year":2022},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.846254Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:dec11e37a8d9a2058a7767cadfec60b11df93847492155db3b67b9dde9eeefa0","observation_id":"395f5f39-d103-482c-b38c-5bba8599429e","resolution":{"observed_at":"2026-08-05T00:17:06.861510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.848288Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"6edd7238-9440-42b7-9778-d82b979ee26a","year":2023},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.849345Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:36b5f00b83c18deb9cbc8071167862df2be55447be11c7f4a42dc114d08dbbf6","observation_id":"06cf98fb-071b-4a61-ac4b-bdcd3749a175","resolution":{"observed_at":"2026-08-05T00:17:06.852089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.838438Z","title":"In: Pro- ceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"43cccd08-7ca8-4d7c-a115-38bb4fca29ce","year":2023},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.852614Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:1a5fd96d969d331d99fa7ccd0708fc4adcd12ca6e8ba41d36588c48a8241c939","observation_id":"90063397-9bf9-4d76-b410-302436185ddd","resolution":{"observed_at":"2026-08-05T00:17:06.841811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:05.855807Z","title":"Proceedings of the AAAI Conference on Arti- ficial Intelligence38(7), 7588–7596 (2024) ht tps://doi.org/10.1609/aaai.v38i7.28591","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.855807Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:01cc76f4a7f2116d3f0e81b6276c58880ea2a861553e248bcf66d906f703d902","observation_id":"fb79cd20-ef16-41b8-8c84-06c499cfae33","resolution":{"observed_at":"2026-08-05T00:17:05.855807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.829704Z","title":"In: Pro- ceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"7c8a38af-6e1b-48a9-8194-3279780e2232","year":2024},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.859903Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:409550507e964ef2976359c93a4eb5cb0780ae4bcd4acdbdcdbe72fc09de7f10","observation_id":"1c0f71e4-c89c-4b4f-a51a-9abb3039e7f7","resolution":{"observed_at":"2026-08-05T00:17:06.833003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.820687Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pat- tern Recognition (CVPR), pp","venue":null,"work_id":"51325ce2-51b9-41b9-94e2-11346f15030b","year":2024},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.863467Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:63a0a9a0397c1a44f3b0f54bd98bdf0ce9c55ae055e90368278da909f5f8ca99","observation_id":"398c02bc-08ad-4dc6-a8cd-c8341c26ac5f","resolution":{"observed_at":"2026-08-05T00:17:06.823881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.810611Z","title":"In: Pro- ceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"1c377ee2-4bfd-4954-8a28-39b0c990db31","year":2024},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.866410Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:4ecb8058b95c8d9e5f83711248b0863f965d5c1309b8e08fc8b402eea6c64997","observation_id":"c4aa8ae6-fb9c-4d8a-a9f3-812a90a4a343","resolution":{"observed_at":"2026-08-05T00:17:06.814563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.802021Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence, vol","venue":null,"work_id":"3db0e66c-59c8-4db3-bb58-52b4a56c141c","year":2025},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.869992Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:979be7ea5a60584084ff91b7402796a3905d4308c8450bae3e826616755d2e7c","observation_id":"b0c6a539-04f1-424a-9d3c-3de5ac2feb1a","resolution":{"observed_at":"2026-08-05T00:17:06.805241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.793560Z","title":"In: Pro- ceedings of the AAAI Conference on Artificial Intelligence, vol","venue":null,"work_id":"eaebd6ee-c725-48f8-b304-7a4e183c5463","year":2025},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.873002Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:3b3b04b3802acf87f808e712fdb6bfa8a2420f49d100f0fb277c16950140ebcb","observation_id":"8668e48d-6882-4a9b-b2a0-2e6ade9051d6","resolution":{"observed_at":"2026-08-05T00:17:06.796548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.783821Z","title":"In: Pro- ceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"21384d9f-fed2-4390-aa9b-dec4e4ecfc2c","year":2026},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.875673Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:f727f1aad7468c32e8fe0f68ec94c12b88d539c839ac5aba519b62375c1acacf","observation_id":"517bb03c-423a-4786-b18c-31a763485347","resolution":{"observed_at":"2026-08-05T00:17:06.787093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.774004Z","title":"Transactions on Machine Learning Research Journal, 1–31 (2024)","venue":null,"work_id":"f820fed1-6e66-40e0-9caf-06707a84b10e","year":2024},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.879167Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:60167d77c80aa96713f811a86512e161bdeb5ade2ca46e8fd161444352036032","observation_id":"66b42d24-52c0-4043-9dff-e904e4662294","resolution":{"observed_at":"2026-08-05T00:17:06.777451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.764728Z","title":"In: Leonardis, A., Ricci, E., Roth, S., Rus- sakovsky, O., Sattler, T., Varol, G","venue":null,"work_id":"d8a08233-1134-4b4c-bd80-fcf6ada31e4b","year":2024},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.882099Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:011e12af740317b79cff3d18e670b65d19da7ba44c0a85f8af15b78832900391","observation_id":"99d805dc-3676-4fb9-9375-0d782517eef9","resolution":{"observed_at":"2026-08-05T00:17:06.768163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.753809Z","title":"In: Advances in Neural Information Processing Systems (NeurIPS) (2025)","venue":null,"work_id":"cdb12648-0367-4198-84d4-f811340f98b8","year":2025},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.885189Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:1a08595e9560731e1a3ec445d6631fd50ae47aaf1873eda0a9d58c99db458a54","observation_id":"33b65092-105f-4621-96c2-1b21ab15e4b3","resolution":{"observed_at":"2026-08-05T00:17:06.758530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.744217Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"5823d949-6085-46f6-a8b8-b765d389ac5d","year":2025},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.888071Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:6a08584ad14c557298df5e1c3d1f9e5b9715cbb4df4aa46a3756989d85fa44e5","observation_id":"139c11ab-af90-42c2-b882-95d4c7825128","resolution":{"observed_at":"2026-08-05T00:17:06.747874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.735137Z","title":"In: The Thirteenth International Confer- ence on Learning Representations (2025)","venue":null,"work_id":"93065c65-f616-470c-b943-3229d765d473","year":2025},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.890940Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:2e6a70040f2c7208dd0b3165e8165c9a4f0eb44cb0a34663f9b65fbe474b12d2","observation_id":"1bae30d5-8f34-4509-8618-a195a709513b","resolution":{"observed_at":"2026-08-05T00:17:06.738437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-05T00:17:05.893724Z","title":"https: //arxiv.org/abs/2511.16719","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.893724Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:da1a3a7c9dadf8b73089b8e02c93ce759d420c4892e3dc193d472de615c5ea27","observation_id":"5ffd07f4-91d3-4323-bba9-9444c8a2fdea","resolution":{"observed_at":"2026-08-05T00:17:05.893724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.726390Z","title":"IEEE Transactions on Image Processing (2026)","venue":null,"work_id":"ff8da9ef-1eaa-44b8-8c07-b63d62b248f6","year":2026},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.896837Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:26a151015fbe2f291fedf86a5dca77ccd0000d203e165cff792ed690e939e2c7","observation_id":"1dd38d70-9b1f-422b-8c16-d0dd68d8a174","resolution":{"observed_at":"2026-08-05T00:17:06.729505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.717029Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"ff4d3fe1-88c4-49a9-88f4-1a62626584fa","year":2025},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.899581Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:8b65fbaf69bf02d823ddf8dedbaeec30761dc6ee32ab0e7741e1e1fc2ea944dd","observation_id":"9d3b7feb-a921-4b46-8579-76159281dea3","resolution":{"observed_at":"2026-08-05T00:17:06.720548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T00:17:05.902373Z","title":"http s://arxiv.org/abs/2511.21631","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.902373Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:fa6db58d0adaa61b3e784c1dff2c41048abd84725b0df6bb0013331c8997a0cb","observation_id":"419f75f5-a9c7-4e16-8488-d9ffd5c93daf","resolution":{"observed_at":"2026-08-05T00:17:05.902373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.707931Z","title":"In: Advances in Neural Information Processing Systems (2024)","venue":null,"work_id":"73936402-3d46-452b-944e-1bca89ca60d8","year":2024},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.905539Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:3250698f387776186e45d556215dc74bed833f2bd8f4f538af39f44b6046718f","observation_id":"e9977b25-13c5-4d96-a878-de4cd1b13c46","resolution":{"observed_at":"2026-08-05T00:17:06.711439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.698612Z","title":"In: European Con- ference on Computer Vision, pp","venue":null,"work_id":"d6c684a9-f538-438e-8d1f-f4e106646d08","year":2024},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.908059Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:a201950fc09bfecd828fdf6bd8b8058b0f41b9772ffc980539fc26ca8dae795c","observation_id":"662a84ed-d8c6-4a83-a7ce-84b08316e0bf","resolution":{"observed_at":"2026-08-05T00:17:06.702565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.22799","last_updated":"2026-04-14T01:38:15Z","snapshot_observed_at":"2026-07-06T22:40:12.666349Z","submitted_at":"2025-12-28T06:12:28Z","title":"VPTracker: Global Vision-Language Tracking via Visual Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.22799","snapshot_observed_at":"2026-08-05T00:17:05.910955Z","title":"https://arxiv.org/abs/2512.22799","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.910955Z"},"links":{"cited_paper":"/paper/2512.22799","citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:9711b19dfeb3c0d4c1ae1bbd37dcd30392cab045391be11e8730809cffb6abf8","observation_id":"20a3ba24-e28a-4a82-b347-37a8c9d9ae7a","resolution":{"observed_at":"2026-08-05T00:17:05.910955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.690043Z","title":"https://arxiv.org/abs/2506.172 52","venue":null,"work_id":"5b3a1556-0ab5-4acf-91fa-1d6f2d40b0ae","year":2026},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.913907Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:64cb57a86d4a68e38152d32c6fc639e264104a9b22156ea7bade541b55bf8dcb","observation_id":"23cebfa5-e60f-4be5-9c1b-b93fb8da919f","resolution":{"observed_at":"2026-08-05T00:17:06.693111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08354","last_updated":"2026-05-12T08:51:24Z","snapshot_observed_at":"2026-08-02T06:13:05.770451Z","submitted_at":"2026-02-09T07:38:22Z","title":"Does Your Reasoning Model Implicitly Know When to Stop Thinking?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.08354","snapshot_observed_at":"2026-08-05T00:17:05.916654Z","title":"https: //arxiv.org/abs/2602.08354","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.916654Z"},"links":{"cited_paper":"/paper/2602.08354","citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:4258506b289bdb8fb8d330e3975362969e2d684c4f8a468836ab24bfb139b157","observation_id":"3cb815cf-342a-4ee1-971c-61fcde08251d","resolution":{"observed_at":"2026-08-05T00:17:05.916654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.680656Z","title":"https://arxiv.org/abs/2601.226 64","venue":null,"work_id":"4c661146-b3fd-44f8-86d2-a7e19a6141a2","year":2026},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.919753Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:38a17763dc01f59921d6d2a0a28bd26d5385bb1aed79ebebadb599c8ca205601","observation_id":"ea20ff44-fd4e-4ea2-b4a2-a169ed1bfe32","resolution":{"observed_at":"2026-08-05T00:17:06.683972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14394","last_updated":"2024-03-27T03:23:12Z","snapshot_observed_at":"2026-08-03T15:15:24.715402Z","submitted_at":"2023-04-27T17:56:29Z","title":"Unified Sequence-to-Sequence Learning for Single- and Multi-Modal Visual Object Tracking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14394","snapshot_observed_at":"2026-08-05T00:17:05.922548Z","title":"arXiv preprint arXiv:2304.14394 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.922548Z"},"links":{"cited_paper":"/paper/2304.14394","citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:a767ac9e73909f1881fe07423322d4ad19d951bd1398c6a64ae0f9942fbf2fa8","observation_id":"76ba6e98-7be7-411c-8f9e-58f44eaa0b10","resolution":{"observed_at":"2026-08-05T00:17:05.922548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.670397Z","title":"In: AAAI (2025)","venue":null,"work_id":"5aa96bf0-e325-447a-b796-61130e1b3dad","year":2025},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.925903Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:a3b6ccf02fd9bd727534c984f009eb6ba6b65f60635e72e5d517e62df184e1cd","observation_id":"91c7868d-b674-4931-bff8-2e7ff44680d6","resolution":{"observed_at":"2026-08-05T00:17:06.673742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.660468Z","title":"https://arxiv.org/abs/2603 .14452","venue":null,"work_id":"4d59d41d-14cc-423c-a122-f6f108ff9818","year":2026},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.928700Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:1747d825bdc2bd0a0ac692558b04e1143bcc5b32e2534ab0bfb50a93f1c3b72e","observation_id":"c5bd5637-6974-445c-ac06-d00a2af05fe5","resolution":{"observed_at":"2026-08-05T00:17:06.664456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.650924Z","title":"In: ECCV, pp","venue":null,"work_id":"2c2f4219-355b-439a-965f-3d6abc263119","year":2016},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.931335Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:eebcca1a3725f2a6ea322a69665eb32216b308a189b745c28d17b8a87fd831ea","observation_id":"c2e76d25-5e66-49f5-b3f1-17ffc2493e49","resolution":{"observed_at":"2026-08-05T00:17:06.654494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.640748Z","title":"In: CVPR, pp","venue":null,"work_id":"2fd26464-a031-473b-8db6-65d31d30f07d","year":2018},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.933915Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:dfaa493d92f5507beabbb46fa0880a732f7f28f991d983849da51082873503ca","observation_id":"f4d74651-63b9-480c-a546-91bfb3914981","resolution":{"observed_at":"2026-08-05T00:17:06.644865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.631348Z","title":"In: CVPR, pp","venue":null,"work_id":"248c3f3b-00ae-42aa-bc42-c210e4d08a5a","year":2021},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.936523Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:4f2cd489de05917e76241a7c63496de4bf474c48aebe4673213dee87d085d26c","observation_id":"a897d2c3-5f7b-469b-9c55-b50ec7f92036","resolution":{"observed_at":"2026-08-05T00:17:06.634594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.621809Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":"1ed476da-8b1a-4345-83f1-c1febd6d3601","year":2021},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.939235Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:844c63d895687e140ff7c243e33242a669f2f9036e7f8ecae54e3c3e2acfd04c","observation_id":"fa6f970d-4f0d-4d19-a1a3-be2d39c1c82f","resolution":{"observed_at":"2026-08-05T00:17:06.625315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/tip.20","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.081180Z","title":"IEEE Transactions on Image Processing31, 392– 404 (2022) https://doi.org/10.1109/TIP.20 21.3130533","venue":null,"work_id":"79aef01b-046f-4efe-804f-7529f5fa4490","year":2022},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.941799Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:be408d81ddd1d6b742f2d99d67ea482accfb08dc796ac756d0b312bf804da3e2","observation_id":"33376245-da3c-4b28-97ff-4309f56d3651","resolution":{"observed_at":"2026-08-05T00:17:06.085476Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-07T00:08:08.901167+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T00:08:08.901167+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.611966Z","title":"In: Proceedings of the IEEE/CVF Inter- national Conference on Computer Vision (ICCV), pp","venue":null,"work_id":"72099ea9-8283-4f23-bf0a-7ac74182e57e","year":2021},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.944494Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:14279b25bb833d6f35761a3a481fa9d7cf19d51ac4681baac3e5bca503d043ac","observation_id":"11775d84-fc41-4a60-90b3-0ce5025cc866","resolution":{"observed_at":"2026-08-05T00:17:06.615316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.33186","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.289220Z","title":"IEEE Transactions on Cybernetics54(3), 1997–2010 (2024) https: //doi.org/10.1109/TCYB.2023.3318601","venue":null,"work_id":"fb0c50b3-707d-41c8-b2cb-8129f267e93c","year":1997},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.947451Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:1656e5e9e065d945eb1c69cf9b2de4a721ec5096e7b4def523830ad9a67021b1","observation_id":"3490bf83-0b0a-4e5d-ae51-0414d22b0509","resolution":{"observed_at":"2026-08-05T00:17:06.294097Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.602793Z","title":"In: Proceedings of the 30th ACM International Conference on Multimedia, pp","venue":null,"work_id":"3490d4a1-1d25-4187-b036-08e682c39f90","year":2022},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.950165Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:d53bb1661a0af749a32f774ec837df49b9c9424fb0fbb503cc8bca133f84bfef","observation_id":"f32c4d71-7762-4185-9a54-94a69be025ca","resolution":{"observed_at":"2026-08-05T00:17:06.606017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.594006Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"17381dee-c5d8-477f-8003-33697e253425","year":2023},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.952709Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:324d61d369fd5d3e64899ca4fcc5708658c55bfc74b7a6fd9b9a36c0aaa86701","observation_id":"d9ae951a-1021-4785-9a8d-05157ffdd5a7","resolution":{"observed_at":"2026-08-05T00:17:06.597124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20024","last_updated":"2024-11-04T06:08:30Z","snapshot_observed_at":"2026-07-06T18:38:33.882786Z","submitted_at":"2024-06-28T16:13:55Z","title":"eMoE-Tracker: Environmental MoE-based Transformer for Robust Event-guided Object Tracking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20024","snapshot_observed_at":"2026-08-05T00:17:05.955538Z","title":"arXiv preprint arXiv:2406.20024 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.955538Z"},"links":{"cited_paper":"/paper/2406.20024","citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:e56d13038bff57cce244a07350215d535a87648dd6466b07bf23d954f6737268","observation_id":"2887188c-7ad8-4caa-b162-32c3b7d544d5","resolution":{"observed_at":"2026-08-05T00:17:05.955538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.585072Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"c1a113dd-bedb-4f52-b70b-3988532603da","year":2024},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.958622Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:8ac79855de59f535d6d4b7b06b760193ac96cb09f8ff0e7933313e6d26cc9dd7","observation_id":"7519f72e-4385-4961-a1ba-0a33cc862737","resolution":{"observed_at":"2026-08-05T00:17:06.588467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.576302Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"5f23c6bb-8488-45fc-a702-672abd06ff6d","year":2024},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.961601Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:ee2ea592395ec5dce134b92fbee99d367f59220afb94e1d4206f91cf154be0a5","observation_id":"aa61ddf9-2246-4899-ba94-3c7723ac2c29","resolution":{"observed_at":"2026-08-05T00:17:06.579668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.566899Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"805f0cd9-fd3c-4985-9eb8-046e41a5d4a9","year":2024},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.964156Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:6bfbfc23a26996f82129d3a8b19ebdf7fdd264f32b8dd7acdbba32efad41c3a2","observation_id":"2b858334-43f9-4967-965b-d4fff1bf4458","resolution":{"observed_at":"2026-08-05T00:17:06.570186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16558","last_updated":"2024-03-29T05:12:45Z","snapshot_observed_at":"2026-07-06T17:50:01.477081Z","submitted_at":"2024-03-25T09:17:15Z","title":"Elysium: Exploring Object-level Perception in Videos via MLLM","version":2},"cited_work":{"arxiv_id":"2403.16558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.16558","snapshot_observed_at":"2026-08-05T00:17:06.206018Z","title":"Elysium: Exploring Object-level Perception in Videos via MLLM","venue":"cs.CV","work_id":"cd644264-296e-4eba-ac53-9b517144a1c8","year":2024},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.966824Z"},"links":{"cited_paper":"/paper/2403.16558","citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:b9ba94d5618fd8819785dfe316069964e3bf25d0f97fa7cd3663d0a1cdd28956","observation_id":"a74e1e41-6ea6-452c-821d-0c2409d6548d","resolution":{"observed_at":"2026-08-05T00:17:06.209920Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.557817Z","title":"In: CVPR, pp","venue":null,"work_id":"715acfe4-1fa0-4ac2-8312-afed39c3417a","year":2019},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.969863Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:746004d4b6e94d60566b05cf276d20c3b9e02d4663c723b180497b6806a59fcf","observation_id":"67c7bd64-6bd3-4be7-b0b2-296bcefbc44c","resolution":{"observed_at":"2026-08-05T00:17:06.561085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.548271Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pat- tern Recognition (CVPR), pp","venue":null,"work_id":"b93d0bae-7919-49d1-b07d-4c5cb8e89e9f","year":2021},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.972579Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:8e18a8041a993264190ffa5e89b6a32782848d5f479d3602ca78010cc15ca152","observation_id":"3de90279-6d59-4bd6-8c3f-62c5d9603611","resolution":{"observed_at":"2026-08-05T00:17:06.552464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.538893Z","title":"In: CVPR, pp","venue":null,"work_id":"5addd8d6-6246-4612-9c62-a40034d4016f","year":2019},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.975385Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:e92f1052ec698d00af327cf8eabc273b8fa04324c4782673a79d2e21838ec53f","observation_id":"f1af0638-ec54-4218-bc69-7251bb6e12da","resolution":{"observed_at":"2026-08-05T00:17:06.541836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.530970Z","title":"In: IEEE International Conference on Image Processing (ICIP), pp","venue":null,"work_id":"99a9dd73-d5c6-4552-9009-17b557d4e8d8","year":2017},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.978275Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:2fb626e1f15bef1b9bb963ab521e46423f1580815d8adac63776c7d074222ff8","observation_id":"289c2abb-03a7-447e-b9b5-a8fe3ddf3eb0","resolution":{"observed_at":"2026-08-05T00:17:06.533888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.521751Z","title":"0 model card: Towards intelligence frontier for real-world complexity","venue":null,"work_id":"d455b3d0-a4df-4168-afc2-df170b91e61e","year":2026},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.980717Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:1c46ece6b11ccd9324b110cee5721ddf9c411ab5097ab824147e899d2e637e92","observation_id":"c48af7fc-f8b4-43d1-814f-eccc730a8058","resolution":{"observed_at":"2026-08-05T00:17:06.525150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21732","last_updated":"2025-07-29T12:11:56Z","snapshot_observed_at":"2026-08-08T21:53:02.621426Z","submitted_at":"2025-07-29T12:11:56Z","title":"SAMITE: Position Prompted SAM2 with Calibrated Memory for Visual Object Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21732","snapshot_observed_at":"2026-08-05T00:17:05.983542Z","title":"https://doi.org/10.4 8550/arXiv.2507.21732","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.983542Z"},"links":{"cited_paper":"/paper/2507.21732","citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:9b6fa42d2c2a3fecce39b620da56ada2320a3b126b96f56a8430979dd819a83e","observation_id":"fcb121d8-47d4-4669-b3b6-c00eb96ec8e7","resolution":{"observed_at":"2026-08-05T00:17:05.983542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.512736Z","title":"https://arxiv.org/abs/2605.073 79","venue":null,"work_id":"08082145-fe47-4c07-80dc-a8413b8d6b20","year":2026},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.986847Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:cca3e6e1981fca12d2030f9f80ae2687579af40c0ac761e241ea88e2275b31c9","observation_id":"1fb2abdb-bcec-4061-9514-65345560e495","resolution":{"observed_at":"2026-08-05T00:17:06.515908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.503726Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"a712a44e-0e58-4ce4-9334-4a76e279211d","year":2025},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.989284Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:bd20314a5219625b8051c6a0be250a1e3f84826f622eb14bbee79fd026bdc6e4","observation_id":"f3f61a83-f515-4aac-a974-92d27ec00598","resolution":{"observed_at":"2026-08-05T00:17:06.506948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.495118Z","title":"TPAMI (2019)","venue":null,"work_id":"613d35b8-7ab0-4ed0-af0f-6bb7f56a9c9f","year":2019},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.992182Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:9f3403520929bc0d8b3aa8472114ab0e1983d56c2b3249b6cce2e2e0486e1d02","observation_id":"cb77077f-cdd0-462e-a9af-2b08ed7357c6","resolution":{"observed_at":"2026-08-05T00:17:06.498095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.486444Z","title":"In: ECCV, pp","venue":null,"work_id":"809ac764-f4a1-48ea-b761-e212a92449dd","year":2014},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.994788Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:21beea75f8990dae0b893d6c2538ca3a2c7be3ba3b80e1783101c76d41163bf3","observation_id":"6c1b1bff-121e-4db8-a9ba-852be712aa24","resolution":{"observed_at":"2026-08-05T00:17:06.489285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.477631Z","title":"In: ECCV, pp","venue":null,"work_id":"f668b5ef-63af-473c-b25a-3445ef1692a0","year":2018},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.997194Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:44313406c93d9539cc1041cea7df9a6a8ff6156fd1e0271b6fb1f7205d240250","observation_id":"710f80f7-b6d2-4236-9ee8-ff5c3d72d510","resolution":{"observed_at":"2026-08-05T00:17:06.480611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.469305Z","title":"In: Glober- son, A., Mackey, L., Belgrave, D., Fan, A., Paquet, U., Tomczak, J., Zhang, C","venue":null,"work_id":"288e9aeb-fa8e-4cfb-907e-213e9ff37198","year":2024},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:05.999805Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:9b9f4a8b377954dfd548768b7c01b23bc70c8fe00e856fb2c1f3f4e30a3185f0","observation_id":"329af951-99ae-4bc8-8a6f-d1fde848cece","resolution":{"observed_at":"2026-08-05T00:17:06.472281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.461519Z","title":"In: 7th International Conference on Learning Representations, ICLR (2019)","venue":null,"work_id":"bbeb3ca2-cd83-4051-90d4-cb9d7c1ca368","year":2019},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:06.002421Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:11753903a99e6110690f434ad70073a194b621296b45ff0c39c0c4e344338672","observation_id":"3e06ef8b-f7b0-4e06-8294-e64ea6239ef6","resolution":{"observed_at":"2026-08-05T00:17:06.464211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.452363Z","title":"In: CVPR, pp","venue":null,"work_id":"024d61e8-cd7e-4e32-ad08-55b4e876d9cc","year":2019},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:06.005086Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:dcc7d2d8cedfc49b289ed189c9386fc9f666a86b13fbb8b5c6ecdfe74a29f1c1","observation_id":"55b71186-2dae-4121-aea1-d6f782dc55d2","resolution":{"observed_at":"2026-08-05T00:17:06.455755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.443468Z","title":null,"venue":null,"work_id":"e564a8cd-c5c4-4f0b-ada2-8218105213db","year":2024},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:06.007608Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:8b6f547e9e8b600663005837de1e99f8c142b4a0748219c36b2945a5d4fc7d16","observation_id":"0293fef9-4f56-4273-a442-940cf9a78f6d","resolution":{"observed_at":"2026-08-05T00:17:06.446696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.434847Z","title":"In: Pro- ceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"e06b0937-7758-493f-8ca4-589c52386454","year":2024},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:06.014684Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:7b6ada2e1c842a6e3ae92f44bfa531c2b6e05eec29d7a531c8b8fae9fe671f02","observation_id":"63369556-3c54-42f9-ba1b-e3944bc955bd","resolution":{"observed_at":"2026-08-05T00:17:06.437772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.425805Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"168045f8-9721-4794-a69d-7fdbcf7f70e2","year":2023},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:06.017699Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:81e268a756fdb6fc1c60ed707364b0147742096ca46b7fb92dda5814e93052c9","observation_id":"54a48651-002e-48df-9e24-df2f0af4150f","resolution":{"observed_at":"2026-08-05T00:17:06.428731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2014.23882","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.190319Z","title":"TPAMI37(9), 1834–1848 (2015) https://doi.org/10.1109/TPAMI.2014.23882 26","venue":null,"work_id":"b5a719d7-af8c-470a-ad2f-5162742fe15b","year":2015},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:06.020361Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:b45684045914785261f0a626fd067c0e072ec48c7915934a73b400902e535a38","observation_id":"3b430388-0bb2-4a52-be25-8cad2be801a0","resolution":{"observed_at":"2026-08-05T00:17:06.196567Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.416969Z","title":"In: ECCV, pp","venue":null,"work_id":"7b33f87e-05ff-4b35-8092-e45487a83cde","year":2016},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:06.023099Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:21b2e49f76565174d6c9e895977e0d69e553f55672fab28edc6e4ff8eb422713","observation_id":"80b1f1f4-2501-46a3-9bd9-f8b7276614ad","resolution":{"observed_at":"2026-08-05T00:17:06.419692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.407543Z","title":"In: Proceedings of the IEEE Inter- national Conference on Computer Vision (ICCV) (2017)","venue":null,"work_id":"062d9958-af4d-4380-93e3-219ebee36c99","year":2017},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:06.025724Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:91e99eda2ed0c6845efd30362a57266c2027b308e2b366a6fc8cca37b8858567","observation_id":"3854c537-d92f-481d-b7db-1c1ea9d050ad","resolution":{"observed_at":"2026-08-05T00:17:06.411489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.397612Z","title":"In: Computer 25 Vision–ECCV 2022: 17th European Confer- ence, Tel Aviv, Israel, October 23–27, 2022, Proceedings, Part XXII, pp","venue":null,"work_id":"fe120fda-38a4-426d-8d30-407bd53f6002","year":2022},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:06.028187Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:b9d792f9bf8f363776d94545307bb90817e24dd7617ac9354dab9ec2ff191cf3","observation_id":"8a45ed7e-bf39-4fec-9b8f-2f5893fc778d","resolution":{"observed_at":"2026-08-05T00:17:06.400965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.387220Z","title":"In: Proceedings of the IEEE/CVF Interna- tional Conference on Computer Vision, pp","venue":null,"work_id":"f4055d07-da6d-40fa-b582-8aa07dba52fc","year":2021},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:06.030834Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:483b45d3bc69f946e247a77c716568ce6fae46c411a979fb1ea26e9232280a6b","observation_id":"21a3d632-ec91-4b14-b67a-af7a2fdf3eca","resolution":{"observed_at":"2026-08-05T00:17:06.390840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.377978Z","title":"In: Pro- ceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), pp","venue":null,"work_id":"796a17a2-6022-454a-92d5-99a1670756f6","year":2023},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:06.033411Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:da9a0cbe6eb1a264ce72cc425b9679d1f3cf83c78ad3c6671521c91c0ee1c3bd","observation_id":"130cbac0-722d-442d-b9ab-f079550d8548","resolution":{"observed_at":"2026-08-05T00:17:06.381468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.368231Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pat- tern Recognition (CVPR), pp","venue":null,"work_id":"50c897a6-0166-41b8-a102-74919e9b553a","year":2023},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:06.036464Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:1eed77d453e194d62fb60f98ee94669895a026fd828f5d716d50e0881a4f0f53","observation_id":"0b3e84e5-1dea-48b6-87af-5b332a593709","resolution":{"observed_at":"2026-08-05T00:17:06.371889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.357434Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"2dafabfc-1354-43f3-a8a9-8a277f84ec25","year":2023},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:06.039290Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:af34f5c5c33d3637b26a444cdd6ef5e96e7b4cea45983474c61abbaace172f6d","observation_id":"7d40fd39-4235-45b9-9c7f-613ff4ed8bda","resolution":{"observed_at":"2026-08-05T00:17:06.361185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05899","last_updated":"2025-07-08T11:40:21Z","snapshot_observed_at":"2026-08-06T19:13:11.550970Z","submitted_at":"2025-07-08T11:40:21Z","title":"What You Have is What You Track: Adaptive and Robust Multimodal Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05899","snapshot_observed_at":"2026-08-05T00:17:06.041987Z","title":"arXiv preprint arXiv:2507.05899 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:06.041987Z"},"links":{"cited_paper":"/paper/2507.05899","citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:b725da4bb1674a9f3a1189451bbce2478004608458942e2283d00505bc4c3826","observation_id":"b3874d96-4e13-4ba0-bc7d-70b516cbd3af","resolution":{"observed_at":"2026-08-05T00:17:06.041987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:17:06.347312Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence, vol","venue":null,"work_id":"f61b8534-8a8b-4502-bf0c-4fdb055214ef","year":2025},"citing_paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:06.045580Z"},"links":{"citing_paper":"/paper/2608.00847"},"observation_digest":"sha256:d74660034709f7f15a1e4806bb22da920e68e1bb7c1bda0ae4ca10244f299de6","observation_id":"f8a90a3a-19fb-420f-9084-e2f5db970ef9","resolution":{"observed_at":"2026-08-05T00:17:06.350557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.00847","last_updated":"2026-08-01T19:58:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T09:17:36.530488Z","submitted_at":"2026-08-01T19:58:09Z","title":"Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":56},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2608.00847."}