{"as_of":"2026-08-11T16:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e5eb0e3a77617839744ec8e75f13f069505043710ab4f3d3f8d115ffed2c08b","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T18:32:38.644948Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.02638/citation-record","integrity":"/paper/2605.02638/integrity","json":"/paper/2605.02638/citation-record.json","paper":"/paper/2605.02638"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-view referring multi-object tracking","venue":null,"work_id":"c729899a-a12f-476a-8b27-afeca2396853","year":2025},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:406da29dc7a31f25b907660c0b4a505c0f2f545601a6264ce931810b935dc5a1","observation_id":"2a4cd945-208c-44a2-9cdd-2045feef5fff","resolution":{"observed_at":"2026-05-26T04:46:43.391189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Referring multi-object tracking","venue":null,"work_id":"9a862c25-a78b-477b-9466-37dfbb2138c9","year":2023},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:50056fe48eb0a25901170c5fc784cb12a0c4afd61b81b3a3ef2004d86dbe271e","observation_id":"dcc8dbfb-9ba0-4df4-ab9c-423d0e6e2625","resolution":{"observed_at":"2026-05-26T04:46:43.361789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.01247","last_updated":"2022-12-02T15:43:55Z","snapshot_observed_at":"2026-08-11T15:05:40.516298Z","submitted_at":"2022-12-02T15:43:55Z","title":"CC-3DT: Panoramic 3D Object Tracking via Cross-Camera Fusion","version":1},"cited_work":{"arxiv_id":"2212.01247","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.01247","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CC-3dt: Panoramic 3d object tracking via cross-camera fusion","venue":null,"work_id":"7dbf74d4-1cf6-4704-8605-f3fa519e738d","year":2022},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"cited_paper":"/paper/2212.01247","citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:d3cb768b141416261b9751739d80dc528431ed862b90de831cf5898b4d0f18c0","observation_id":"b9f3c2a9-c7b3-4e14-88ac-e00fb53e5496","resolution":{"observed_at":"2026-05-09T06:20:42.583740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tango: training- free embodied ai agents for open-world tasks","venue":null,"work_id":"d1cffd8c-30da-4d3c-b0d2-a9c9fd031271","year":2025},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:56694978586cdbd5efffb37690c7710be8c02d01d654467d6724fad1bf948a7d","observation_id":"afa863a4-5ba1-4570-9d5c-fd92b1dcffc5","resolution":{"observed_at":"2026-05-26T04:46:43.374965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Divotrack: A novel dataset and baseline method for cross-view multi- object tracking in diverse open scenes.International Journal of Computer Vision, 132(4):1075– 1090","venue":null,"work_id":"a026fc62-21ce-4e6d-a54c-d41844abd7cb","year":2024},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:3f454680dab10d754ec742563c7cc3b6115c64efe274558cdba12acdbf9a8362","observation_id":"f57d16c3-2047-4c11-83c3-37c600aad160","resolution":{"observed_at":"2026-05-26T04:46:43.380116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-target multi-camera tracking with spatial-temporal network","venue":null,"work_id":"9d4d170c-40ee-49c3-92bb-a13aceddbc23","year":2023},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:b22c043004a7c1c19c82bccd43ce7baebdbbdcd002a894d71020302a536554e2","observation_id":"b0df05a0-2ae8-4cdc-9a42-405be7eb3d42","resolution":{"observed_at":"2026-05-26T04:46:43.388665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dual-head feature enhancement for graph-based cross-view multi-object tracking","venue":null,"work_id":"c62cab11-b402-4091-8d4b-8d788fef2dbc","year":2025},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:ec2c7a97a94e00088d904ec7212761e07856a0db5c2de4dcd9391ee9a90c0bad","observation_id":"8514f0bf-3897-4418-a126-c27cf917233c","resolution":{"observed_at":"2026-05-26T04:46:43.377590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gmt: Effective global framework for multi-camera multi-target tracking.arXiv e-prints, pages arXiv–2407","venue":null,"work_id":"6f60378a-13d2-41c7-a468-ec577888805c","year":2024},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:34eb0a09216dfff6f766edaddb12b49f5cebbe1c532df39157a7570084217aa6","observation_id":"ff839168-b3ad-4a4f-a14f-3afbccb43d9d","resolution":{"observed_at":"2026-05-26T04:46:43.368475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All-day multi- camera multi-target tracking","venue":null,"work_id":"2ff5d350-dc97-483f-831c-4165d7d7e954","year":2025},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:863b4042d68c26ee0c81c20f3f8c8da0a5729393ce599e7e080d0b0dfca9e63f","observation_id":"22c59ac3-7189-458e-8179-f798064ae16d","resolution":{"observed_at":"2026-05-26T04:46:43.385873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Consis- tencies are all you need for semi-supervised vision-language tracking","venue":null,"work_id":"3b073ef5-8b36-4a03-a493-ffc60cd8e602","year":1904},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:88844cd72f950bb849c18a2cac95d1e511de8496d3240c3551a251f063d5cbf4","observation_id":"f32527cf-8940-45e7-832f-a6e56dbc4d8a","resolution":{"observed_at":"2026-05-26T04:46:43.382923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large-margin weakly supervised dimen- sionality reduction","venue":null,"work_id":"4b9026d8-0471-4c55-ae74-af4cc2da8f49","year":2014},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:1bbc9c38e2cecac4bfb271bc324f6e236b6f18d7d51c699251dbaddfc32a5467","observation_id":"bd8eba3f-82f4-4550-9bcc-73db70a063ab","resolution":{"observed_at":"2026-05-26T04:46:43.365165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weaksam: Segment anything meets weakly-supervised instance-level recognition","venue":null,"work_id":"73b73a23-f78d-460a-87d9-f99b6392315a","year":2024},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:86761e4c54e4fa8b06db667e7f23ccb4fbed4fe98bf3c385e856dc77135edb79","observation_id":"be6285cf-6a30-417f-9f72-9c89ee55cd4d","resolution":{"observed_at":"2026-05-26T04:46:43.347611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A brief introduction to weakly supervised learning.National science review, 5(1):44–53","venue":null,"work_id":"a62f5b02-71e6-4c2f-974e-b0875221d7ab","year":2018},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:bbdab853962a8a4fb9fdf64fa45358191cdbcd5c6750523a8d0c5109176e370d","observation_id":"674215f9-e3c8-45d4-a927-0cd24b6dc173","resolution":{"observed_at":"2026-05-26T04:46:43.269114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:57:25.332055Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901","venue":null,"work_id":"bd7ec542-9242-446e-955e-bb75e729be5d","year":1901},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:13bc0065e7e57d7c935a7f0423bacb03cd0036e4f8a91b3aa234617889bf3aeb","observation_id":"a9cdf71e-cad7-427d-b9b2-5b5d5596869b","resolution":{"observed_at":"2026-05-26T04:46:43.335368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:16:04.687562Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"ad3e05b3-af3a-4fa2-ab30-c45f9f403277","year":2021},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:94f45af7624c8b7445a77dda241df7b7e730e8bdbeac2760201d1d2c25d35c1e","observation_id":"d97dc494-cc7b-4b51-8422-f8b87bad574b","resolution":{"observed_at":"2026-05-26T04:46:43.340941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:53.204657Z","title":"Segment anything","venue":null,"work_id":"ccc0c322-2f90-4398-aaac-1d329cfcf543","year":2023},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:395c83bcab8c4e61dd1079cadb253c9f61b49b0762578a9c76df5af6d9adbe0e","observation_id":"d6d07fa7-b19c-416d-9bbf-7e7fcea47958","resolution":{"observed_at":"2026-05-26T04:46:43.350961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":"59f0e57f-6aec-4d9c-95a8-7d1ae3adb538","year":null},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:efd07ed187c5c140d0a6e06c1ff791c063fbbdbaabadb6dd36214be844545706","observation_id":"a0b8c718-cafd-4259-b031-2fe85377f9d4","resolution":{"observed_at":"2026-05-26T04:46:43.359191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":"2511.16719","doi":"10.48550/arxiv.2511.16719","metadata_source":"pith","pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 3: Segment Anything with Concepts","venue":"cs.CV","work_id":"4a72a006-2592-4554-aad0-a9c41a9f952d","year":2025},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:d8691a407e90dab691a047ebed0d95158c9dc420b74a87e4156cba96f8e41a8a","observation_id":"e2dd3cc0-404b-45b0-9791-f8cdf8bdd732","resolution":{"observed_at":"2026-05-09T06:20:42.591222Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From sam to cams: Exploring segment anything model for weakly supervised semantic segmentation","venue":null,"work_id":"cd3bbd8e-b688-4ec0-98a1-fdc8f3389399","year":2024},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:8ee9b3030ca5f14d499cbbb8447e8ff4e6e0624d7858f5474412fb68609de863","observation_id":"c750f0b1-d7b7-4cdb-aebc-652a71247249","resolution":{"observed_at":"2026-05-26T04:46:43.304958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ffee41e5-40e1-4845-a7ee-a6103fdf7a9d","year":2023},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:b873dd2f31dee3d86e982cf2d2a503ea5db379557d647b72c690210df2ffb4af","observation_id":"79c744d7-6cd8-4dd4-a9d9-ba5923c8afff","resolution":{"observed_at":"2026-05-26T04:46:43.301794Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tracking by natural language specification","venue":null,"work_id":"5f3ae3fa-c5d6-454f-b961-7d16b7017929","year":2017},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:0be039253fbe09ea88b7f105635a0e816fff5f3ddf1d93ec7c78b4039a54c401","observation_id":"565555e0-e1b4-4ed3-aebb-1bdc599d33bb","resolution":{"observed_at":"2026-05-26T04:46:43.322335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards more flexible and accurate object tracking with natural language: Algorithms and benchmark","venue":null,"work_id":"509b8148-42aa-44cd-87c5-43b166c12bc6","year":2021},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:e455e6104a6f177136bbfafe4238d51c2796f61735e3d783a07100df90cdfd09","observation_id":"49f2c68a-0f3b-4e5b-89ed-d8cde46001d6","resolution":{"observed_at":"2026-05-26T04:46:43.319233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Joint visual grounding and tracking with natural language specification","venue":null,"work_id":"0fe9ce04-6435-433c-9d9b-d227dc9e3e2f","year":2023},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:971dd0c5062d7feb0928338d5021de817aa8a70c45ea7946c37ccd4e5e809131","observation_id":"5fb763be-19e5-48fa-8533-e0e90074d693","resolution":{"observed_at":"2026-05-26T04:46:43.288487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Divert more attention to vision- language tracking","venue":null,"work_id":"cf9124e2-7582-4c6a-96ad-8cc430dc738c","year":null},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:319ee77a2cfff4a6fbca67f58de66533617b7d06661123af31f469de7dddb88a","observation_id":"6652e5b5-dcae-479f-bf95-523fe5478ba9","resolution":{"observed_at":"2026-05-26T04:46:43.331613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R1-track: Direct application of mllms to visual object tracking via reinforcement learning","venue":null,"work_id":"fd6e5c64-cacf-4142-a3ef-bbffbd734274","year":2025},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:63a6020505a5d9ffa39b8daad55b73b67fe6fb69b422ff97b5f2123f941583a4","observation_id":"f6a1db19-275c-4d48-b0ce-7a8c05ea5522","resolution":{"observed_at":"2026-05-26T04:46:43.325166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9756ed23-d707-4c03-bcfc-50a9a42a17d0","year":2025},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:792a3b2148fbc1ed02a1ceacff97601be47491fb6cb810574f3626a9c4cccc23","observation_id":"488ef27e-1fb6-4e72-b3ea-a2ed0df724df","resolution":{"observed_at":"2026-05-26T04:46:43.328150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ikun: Speak to trackers without retraining","venue":null,"work_id":"d1041630-9fe9-4762-a3b2-c5aa05e28a1b","year":2024},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:ac52f01deddf99ae8ccc1e83737a55779b7ed801cc5149c7df5af108777f365c","observation_id":"66f6b1fc-82f4-48b0-9b66-0b3450713deb","resolution":{"observed_at":"2026-05-26T04:46:43.298729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lamot: Language-guided multi-object tracking","venue":null,"work_id":"f20e0848-ce79-407a-8ce6-3cba0181865f","year":2025},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:bf51cdba622da1adc48d653827625838bfd53e9cd55ad6805e67056568ad3988","observation_id":"76f9e535-b6d7-49d5-b7e8-d4c0d134c1fc","resolution":{"observed_at":"2026-05-26T04:46:43.295802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language decoupling with fine-grained knowledge guidance for referring multi-object tracking","venue":null,"work_id":"7f8e293d-4ff1-482d-9e13-f1b6546192cc","year":2025},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:f7450493e59c3b8698855a8f66c3ed6564b73ba8b63b74281aab2d7cb2da2b9a","observation_id":"62253a5a-40fc-48f8-894c-a3f5f3a07bab","resolution":{"observed_at":"2026-05-26T04:46:43.308572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporal-enhanced multimodal transformer for referring multi-object tracking and segmentation.IEEE Transactions on Circuits and Systems for Video Technology","venue":null,"work_id":"66532ed9-eafb-4b3c-85bf-163c7998dad5","year":2025},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:897afeb3e66762d682413cb7627d4255026acf4884aecaa623920406dc7daeab","observation_id":"c205ed74-41db-4ea2-9ce3-982e227f1090","resolution":{"observed_at":"2026-05-26T04:46:43.292306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cgatracker: Correlation-aware graph alignment for referring multi-object tracking.IEEE Transactions on Circuits and Systems for Video Technology","venue":null,"work_id":"45dccf43-aad7-4a7f-a179-ab5318706f73","year":2025},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:19879f533d252d723dbe14d1420e5146b6fd5b3c254b38e0410dd6317cce532b","observation_id":"759eae0c-2d5a-4f99-870e-1b4fab43fcad","resolution":{"observed_at":"2026-05-26T04:46:43.355915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cognitive disentanglement for referring multi-object tracking.Information Fusion, page 103349","venue":null,"work_id":"b97f2548-b1c4-4ac8-bdbc-eaebe8dcad10","year":2025},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:7e90e5ee894f04038617c937fc5f2852052e2fad5207b63d7b76d53365d4147a","observation_id":"109fce50-3088-4b38-8043-385246de2f06","resolution":{"observed_at":"2026-05-26T04:46:43.285371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual-linguistic feature alignment with semantic and kinematic guidance for referring multi-object tracking.IEEE Transactions on Multimedia","venue":null,"work_id":"3863d2df-a857-405f-b568-17460ed42902","year":2025},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:44b4bd223acf59fb5fe7dddfd94b24f77aa6e9210443a094e2ed88f6a5113456","observation_id":"1c423cb9-723b-4e9e-8b3a-fe712fbab442","resolution":{"observed_at":"2026-05-26T04:46:43.312439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11922","last_updated":"2024-11-30T22:32:34Z","snapshot_observed_at":"2026-08-08T21:51:38.855361Z","submitted_at":"2024-11-18T05:59:03Z","title":"SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory","version":2},"cited_work":{"arxiv_id":"2411.11922","doi":"10.48550/arxiv.2411.11922","metadata_source":"pith","pith_arxiv_id":"2411.11922","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Samu- rai: Adapting segment anything model for zero-shot visual tracking with motion-aware memory","venue":"cs.CV","work_id":"674b0e1d-b2cd-4f05-be76-259084dae1ec","year":2024},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"cited_paper":"/paper/2411.11922","citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:5fbab9e607c0f77943f1f7ddcea8bb41a1370de8b757d6b2e6ba133ba84b36de","observation_id":"6fc81412-d66f-4b21-b63d-41c75667cc03","resolution":{"observed_at":"2026-05-09T06:20:42.565832Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sam2long: Enhancing sam 2 for long video segmentation with a training-free memory tree","venue":null,"work_id":"e158fb39-d4e6-40a9-94b7-5b2d7e6b858a","year":2025},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:52de89a80f31a52150622dbd5084e4d2fb146f5b110a1a21c16dc6fe38c57d7a","observation_id":"36e3c076-a61f-407b-92ae-7463d76d1444","resolution":{"observed_at":"2026-05-26T04:46:43.278261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.04519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T03:06:30.030991Z","title":"Sam2mot: A novel paradigm of multi-object tracking by segmentation","venue":null,"work_id":"6628c27b-4f5b-4b4b-897b-c69907f56e08","year":2025},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:170e9e8385d39ffd0cdee39e4fd3a0e2269caf977e43f50c43067d99b8b01369","observation_id":"0de1625c-8f40-4e15-9de5-fb88c4561d65","resolution":{"observed_at":"2026-05-09T06:20:42.572008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omni-scale feature learning for person re-identification","venue":null,"work_id":"c681e16c-357b-4189-9d6b-838b059e2772","year":2019},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:57d7015f4cdd2da96a4a76586e6411a30a88b5aee5747eb844b73689ab439864","observation_id":"c2007e6d-bafb-459d-b75a-dffafe916708","resolution":{"observed_at":"2026-05-26T04:46:43.282046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:12c4f519e099970136fa5058fe71267bb8f7a5977871a6a5e049f3dbe6627915","observation_id":"c720873b-72a4-49ae-99bc-5d2bac1a6c08","resolution":{"observed_at":"2026-05-09T06:20:42.579877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:23:41.735459Z","title":"Parameter-efficient transfer learning for nlp","venue":null,"work_id":"a0985c32-1c1a-47e6-a1b2-cc058f360ca0","year":2019},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:653035f0377b3aa28d4d7d52f363abfa129eb6ad10ac94f5c9de300c9748bedf","observation_id":"6f10f714-f616-4b82-811a-8f6d90681e30","resolution":{"observed_at":"2026-05-26T04:46:43.273744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.811605Z","title":"Film: Visual reasoning with a general conditioning layer","venue":null,"work_id":"c1e83d30-ff32-4e18-8493-a614841147ed","year":2018},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:66793f18944eb5b12e9a6aaae25308dfff63b94a31c82ac67677454b0b590f7c","observation_id":"f1ee9e6d-eb1a-4285-93e3-22526fb66d10","resolution":{"observed_at":"2026-05-26T04:46:43.372379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":"1907.11692","doi":"10.1007/s10489-02203627-9","metadata_source":"pith","pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","venue":"cs.CL","work_id":"41fe12c4-e538-4890-a244-480650ed3078","year":2019},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:6aa9e4e71f4fc2553ef3ad39e0409572ab8f250533dfef5970eae57f2222aac5","observation_id":"fbb328d1-55bd-4825-9c1b-e7d8b7c3686b","resolution":{"observed_at":"2026-05-09T06:20:42.587014Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards unified text-based person retrieval: A large-scale multi-attribute and language search benchmark","venue":null,"work_id":"1352a670-3fee-434a-b085-e2f03e26b796","year":2023},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:997f369d8e0e3ce524656a118a7ffa1842d2466da3a7265e819b312e1f61bb7a","observation_id":"c1b830b6-0a6c-4094-b473-4d89c8814ee0","resolution":{"observed_at":"2026-05-26T04:46:43.315993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Urvos: Unified referring video object segmentation network with a large-scale benchmark","venue":null,"work_id":"45493bb1-5407-48f8-a633-6bcfdd890a30","year":2020},"citing_paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:38.644948Z"},"links":{"citing_paper":"/paper/2605.02638"},"observation_digest":"sha256:2aa91882d403c9412ef16d7c65d83285936481fd4325a61ab81f4c36c845c128","observation_id":"9100381e-44ff-48a4-b838-b79da8e5ebec","resolution":{"observed_at":"2026-05-26T04:46:43.344424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.02638","last_updated":"2026-05-04T14:23:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T08:17:39.182991Z","submitted_at":"2026-05-04T14:23:38Z","title":"ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":6,"verified_fuzzy":35},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2605.02638."}