{"as_of":"2026-08-08T03:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3743854e1f6c78c4847e3a3f2a2c4fee1f0f32bd4eb86f4ab8635c76660ac7f2","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:51:46.426406Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20718/citation-record","integrity":"/paper/2505.20718/integrity","json":"/paper/2505.20718/citation-record.json","paper":"/paper/2505.20718"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T13:51:43.474536Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond.Arxiv Preprint Arxiv:2308.12966, 1(2):3, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:43.474536Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:e885da5c3df047c2b7f332167dff810e6e7d16a0c4cb6539ec0b92f8a85ecc11","observation_id":"54c4669a-2f11-403f-baaa-d4c2a298f02a","resolution":{"observed_at":"2026-08-07T13:51:43.474536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:43.540009Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:43.540009Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:9484a3ea24aed78a4e7152d7cb228a000258f19cf7595784f8dd7db4e2b3da14","observation_id":"6ef6bfa1-9b6e-4479-8d86-5dd33924f34b","resolution":{"observed_at":"2026-08-07T13:51:43.540009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:50.925651Z","title":"Tracking anything with decoupled video segmenta- tion","venue":null,"work_id":"7b5a044c-ce19-4f4b-b5b5-74070707f3c1","year":2023},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:43.644671Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:1a3703a4ec3aeda4370cefb0f1e8f0135d6560722b80639a9e2bdcec2da3b6d7","observation_id":"31cb6773-2e01-4d29-8031-b6364f4d8287","resolution":{"observed_at":"2026-08-07T13:51:50.969592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:50.789565Z","title":null,"venue":null,"work_id":"e8b2340e-b228-4214-ab6b-d257314a9ad0","year":2012},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:43.761418Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:e76cd5a502c34f2587da572339cfaefb03c2a267249d7ec7d4cad7a1aff9989c","observation_id":"5b26f5f9-35cb-44d4-9ce4-4137ccf72add","resolution":{"observed_at":"2026-08-07T13:51:50.855505Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:50.647830Z","title":"Proactive multi-camera collaboration for 3d human pose estimation","venue":null,"work_id":"9beab43e-fb91-4cae-8768-7151d7594be3","year":2023},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:43.901893Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:7d455536d066edb8bcb8df50839b44d4b3272d099ccb5d1823c6579aaba328e4","observation_id":"704b213d-417b-4f9a-bad5-8c4c6730ff8b","resolution":{"observed_at":"2026-08-07T13:51:50.692694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:50.529958Z","title":"Enhancing continuous control of mobile robots for end-to-end visual active tracking.Robotics and Autonomous Systems, 142:103799, 2021","venue":null,"work_id":"50452c9d-03e7-44c2-954d-73d34d9f1e17","year":2021},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.059949Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:5215cac6748fa745f8748149ca0abdc02a19829d670bf06c209ab1ed46a7482f","observation_id":"b18b71a2-8040-4c01-aef6-96f5211b6d6d","resolution":{"observed_at":"2026-08-07T13:51:50.605703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:50.367633Z","title":"E-vat: An asymmetric end-to-end approach to visual active exploration and tracking.IEEE Robotics and Automation Letters, 7(2):4259–4266, 2022","venue":null,"work_id":"0228ce6b-093d-4dfb-a5ce-428a6f101915","year":2022},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.177272Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:eefb1f03b48827585504b36a3b4a4c63e1b37d585a14124183258f40020242be","observation_id":"f6d464b0-ed64-428e-939c-1a569fac0b7d","resolution":{"observed_at":"2026-08-07T13:51:50.455798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:50.273203Z","title":"D-vat: End-to-end visual active tracking for micro aerial vehicles.IEEE Robotics and Automation Letters, 2024","venue":null,"work_id":"e42a76b1-41aa-4e1f-a894-28959c23d4c7","year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.299789Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:cd1210a9f1e29e07b5e748ef8dd8f6e801b523b4340994fd5ca4986b2deb0101","observation_id":"cbf17c7f-be72-4e1e-949f-5826f5d84ac8","resolution":{"observed_at":"2026-08-07T13:51:50.324369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:44.418085Z","title":"Memory sharing for large language model based agents.Arxiv Preprint Arxiv:2404.09982, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.418085Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:b8789d27054759b5410c533d21bf43e49f3f413113a85ef93ab6bb077bc8e50c","observation_id":"16a841a7-1f69-462c-b24b-69874cc65de2","resolution":{"observed_at":"2026-08-07T13:51:44.418085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:50.070604Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":"ffb376f7-6b34-483f-a8b3-2f7a30cdc8d2","year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.500183Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:4a32757f4192014bac772ab1d01035f57613f6a326305354145bca63b99f96ae","observation_id":"93964576-1afd-41f8-b39a-fd8b7be5de22","resolution":{"observed_at":"2026-08-07T13:51:50.182089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09952","last_updated":"2025-07-01T05:21:49Z","snapshot_observed_at":"2026-07-06T12:49:33.217014Z","submitted_at":"2022-03-14T14:11:12Z","title":"Conquering Ghosts: Relation Learning for Information Reliability Representation and End-to-End Robust Navigation","version":4},"cited_work":{"arxiv_id":"2203.09952","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.09952","snapshot_observed_at":"2026-08-07T13:51:46.571152Z","title":"Conquering Ghosts: Relation Learning for Information Reliability Representation and End-to-End Robust Navigation","venue":"cs.AI","work_id":"4e7609c3-9c29-476b-a6d0-54a21a20cf4e","year":2022},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.571948Z"},"links":{"cited_paper":"/paper/2203.09952","citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:75882d52d288d20745ba0f5a7ec174b63a81b134cf01a5302d1dbfa4f5bdaef8","observation_id":"6abaf5df-2d3c-4371-b70e-d389b36ce974","resolution":{"observed_at":"2026-08-07T13:51:46.630634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:49.919074Z","title":"OpenVLA: An open-source vision-language-action model","venue":null,"work_id":"ab2501df-1821-482c-ad69-90145604a4bb","year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.643669Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:9490231980c8318e2ec98a5421d8892c7e3182b17e8e5ad5e96e3244ca6976e2","observation_id":"55664fc4-dc56-47dd-83c1-d2bd62cba002","resolution":{"observed_at":"2026-08-07T13:51:50.001978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:49.773405Z","title":"A novel performance evaluation methodology for single-target trackers.IEEE Transactions on Pattern Analysis and Machine Intelligence, 38(11):2137–2155, Nov 2016","venue":null,"work_id":"5757c727-a0b9-4a84-85d4-7e7523fbe673","year":2016},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.737506Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:c0d3a1756cc28b0f9b6b64a5f6353399a050b55851f9836e6432462fd1538039","observation_id":"7f395053-766f-41b7-ad25-7da0c9e89a57","resolution":{"observed_at":"2026-08-07T13:51:49.824518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:49.647492Z","title":"Person following robot based on real time single object tracking and rgb-d image","venue":null,"work_id":"84c336f2-f56e-41fd-8d26-1800e20db105","year":2022},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.829613Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:d93be268eb8c035eedc3bc95d5ab1b2cc9a54e391f1485b090d2861865e4bea1","observation_id":"97273674-23de-4b91-ae61-801372c2e4ee","resolution":{"observed_at":"2026-08-07T13:51:49.727647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:49.449695Z","title":"Blip-2: Boot- strapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"14fb4acd-3b3e-4d87-afe4-1bc36f7bfbd0","year":2023},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.927307Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:080c09d726c3ed420f769fe300ceb70345d626146f47905253fb6a1e9740ff2c","observation_id":"225dd818-5576-43b6-8d35-e74c33fcbff8","resolution":{"observed_at":"2026-08-07T13:51:49.536692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:49.266437Z","title":"Vi- sual instruction tuning.Advances in Neural Information Processing Systems, 36:34892–34916, 2023","venue":null,"work_id":"4ce8593a-0454-44c6-a1aa-3a7591ef06ec","year":2023},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.026284Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:c5279490a9bb65c2a9893a2c356f56582442eaa2b0295ef594d0d9c5caa87af1","observation_id":"4417db72-92aa-45cc-8bf4-bc54c8dfe350","resolution":{"observed_at":"2026-08-07T13:51:49.380606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:49.042223Z","title":"End-to-end active object tracking via reinforcement learning","venue":null,"work_id":"cc7e42aa-2338-41c0-b851-8c0fe8bc4e8f","year":2018},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.123410Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:a6a0551a4ef0950133d45d5034d520a476da52069d244a11fb49acf8236d9e16","observation_id":"6f02cfff-2347-4e62-8510-e8c41d2acedc","resolution":{"observed_at":"2026-08-07T13:51:49.120498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:48.872720Z","title":"Curious george: An attentive semantic robot.Robotics and Autonomous Systems, 56(6):503–511, 2008","venue":null,"work_id":"37d4f842-0ed5-440f-bdae-9815c0f1f3d7","year":2008},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.249150Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:45ea64d89863e5c4bd6b3dec06b96d11c98629f2bb662cc38003728b93f48f55","observation_id":"093d7d60-5442-4e70-97ac-08a00379108d","resolution":{"observed_at":"2026-08-07T13:51:48.945402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:48.634967Z","title":"The hands-free push-cart: Autonomous following in front by predicting user trajectory around obstacles","venue":null,"work_id":"9aaf2663-a9ff-45a6-8ec7-bbe45fd14325","year":2018},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.348257Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:6bc3e353f03f725f18ad372e30d4e0b3563d103ea8926938aea255329b58a995","observation_id":"2ccb200f-9763-4a12-b6f4-52931b22ea36","resolution":{"observed_at":"2026-08-07T13:51:48.787461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:48.512525Z","title":"Unrealcv: Virtual worlds for computer vision","venue":null,"work_id":"a3e413a2-5d4f-441a-881c-02dced3b6b61","year":2017},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.423214Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:0da68c49c99d15565c86536c513cee42b95e8a37ff68b1ae74c5475fba861a63","observation_id":"fa7968d5-f715-4a43-bfc7-33a0b93f4ed8","resolution":{"observed_at":"2026-08-07T13:51:48.557921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:48.305311Z","title":"Tracking multiple moving targets with a mobile robot using particle filters and statistical data association","venue":null,"work_id":"1545b81c-e573-46c6-b8ae-d65469927f3b","year":2001},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.501658Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:ad8535c51cde6ea00605fa275df747832d07da64586c0e457480f720afb695dd","observation_id":"a0c6ebb1-b3d7-45f0-a4e9-0f8eadb2f2ef","resolution":{"observed_at":"2026-08-07T13:51:48.406896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:48.070117Z","title":"Accurate and real-time 3-d tracking for the following robots by fusing vision and ultrasonar information","venue":null,"work_id":"2b93a0c3-be9e-44ad-8f25-a68f42037e84","year":2018},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.573732Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:a6b883ea2445ef21f7369805d9230df0f332d8cca5c2efcc108de909bf22ad28","observation_id":"f929f2e8-5a5c-43f3-b8ed-543c40b5b99e","resolution":{"observed_at":"2026-08-07T13:51:48.185872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:47.888454Z","title":"Vlfm: Vision-language frontier maps for zero-shot semantic navigation","venue":null,"work_id":"a426e0c2-919b-4ad2-a371-0efca9b0e3f4","year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.633871Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:359a52f38a04832313c34947d8973f52eda765af98ca88c5c8a744842af92700","observation_id":"f698e522-b59a-4366-81c7-c3897d833e31","resolution":{"observed_at":"2026-08-07T13:51:47.971967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-07-06T17:34:57.509162Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15852","snapshot_observed_at":"2026-08-07T13:51:45.712882Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation.Arxiv Preprint Arxiv:2402.15852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.712882Z"},"links":{"cited_paper":"/paper/2402.15852","citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:73ec54133eb1b142ae33ee0f609a5799f46b6c4d6c2cab4d0769dc023ad4f40e","observation_id":"bf9ea878-827c-4e9a-801d-5334361f5f9f","resolution":{"observed_at":"2026-08-07T13:51:45.712882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:45.745565Z","title":"Vision- language models for vision tasks: A survey.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.745565Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:997958f5e3861304e0583b790829af6c63e2dca97491b685910fc97001c52bd6","observation_id":"ae97a3f0-c3f1-4b96-9694-406729479488","resolution":{"observed_at":"2026-08-07T13:51:45.745565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:47.675072Z","title":"Ad-vat+: An asymmetric dueling mechanism for learning and understanding visual active tracking.IEEE Transactions on Pattern Analysis and Machine Intelligence, 43(5):1467–1482, 2019","venue":null,"work_id":"8963b249-2745-48e5-a708-27600b18183f","year":2019},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.848692Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:14b6f334590e8a3199c423560c71ee19c9c78101084de19ff371a442b4971b57","observation_id":"b8c1f7a8-18fb-4977-97da-77328d528d46","resolution":{"observed_at":"2026-08-07T13:51:47.772963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:47.491370Z","title":"AD-V AT: An asymmetric dueling mechanism for learning visual active tracking","venue":null,"work_id":"297247ec-314c-4d59-b5a8-9f57a2bdb715","year":2019},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.913847Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:c45864ab39f2799f7759f252d26301c5d1e6ed96319eeeb0abb9e527cc474d19","observation_id":"03053d95-a475-4b71-9abf-f544c9f0f1a0","resolution":{"observed_at":"2026-08-07T13:51:47.591371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:47.296222Z","title":"Towards distraction-robust active visual tracking","venue":null,"work_id":"9fcd2fe7-1549-4ba0-b694-2b588d779976","year":2021},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.993230Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:80adafdab8525d8eb59d89a7b0bcf08ceb4b3cb693c2109f60ba7439f5b6f37c","observation_id":"e7dcbe83-8bb0-40c4-ad19-73d0dcef778a","resolution":{"observed_at":"2026-08-07T13:51:47.403448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:47.129911Z","title":"Empowering embodied visual tracking with visual foundation models and offline rl","venue":null,"work_id":"685b60ac-a08f-47ac-8bbd-6bee1e29d049","year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:46.111382Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:ac72b6e3262d4211e190d58598fc7883b426dede6d5552dc3cbe544063511c11","observation_id":"4ecb89fa-7d86-472b-9434-d00fa02bbbab","resolution":{"observed_at":"2026-08-07T13:51:47.194940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20977","last_updated":"2025-08-12T11:56:32Z","snapshot_observed_at":"2026-07-06T20:14:40.579474Z","submitted_at":"2024-12-30T14:31:01Z","title":"UnrealZoo: Enriching Photo-realistic Virtual Worlds for Embodied AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20977","snapshot_observed_at":"2026-08-07T13:51:46.216740Z","title":"Unrealzoo: Enriching photo-realistic virtual worlds for embodied ai.ArXiv Preprint ArXiv:2412.20977, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:46.216740Z"},"links":{"cited_paper":"/paper/2412.20977","citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:50aba12e7c63a76827c9bee473f88a02748646f72a6a6b5124f7cf87c7d51472","observation_id":"c0649b78-027a-409b-add2-5304a117d34a","resolution":{"observed_at":"2026-08-07T13:51:46.216740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:46.996834Z","title":"On deep recurrent reinforcement learning for active visual tracking of space noncooperative objects.IEEE Robotics and Automation Letters, 8(8):4418–4425, 2023","venue":null,"work_id":"96629366-872f-4061-92cb-a84ad5454599","year":2023},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:46.295861Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:e4079cb078d9a5f907eaec367d747b2defc2e3d9312957e9d2a6e7fa4968553a","observation_id":"7286d023-c9cd-4e30-b802-7eceb1b93786","resolution":{"observed_at":"2026-08-07T13:51:47.054337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:46.811427Z","title":"Navgpt-2: Unleashing navigational reasoning capability for large vision-language models","venue":null,"work_id":"96446551-3afe-474b-bdc0-ab6e8a5f28bd","year":2025},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:46.426406Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:69bf42b0d513e92a0c7c8280168b87ff3afec7594cf82d353c2ade521f5be181","observation_id":"571ac838-6b22-4f3d-9760-004a84501875","resolution":{"observed_at":"2026-08-07T13:51:46.915857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2505.20718."}