{"as_of":"2026-08-07T12:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f8868001b1f6c6004a6d92e22c52013c6951ace046556f3c09782d4f3053b697","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T17:23:57.404158Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17669/citation-record","integrity":"/paper/2607.17669/integrity","json":"/paper/2607.17669/citation-record.json","paper":"/paper/2607.17669"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:53.207966Z","title":"To achieve this goal, extensive experiments were conducted using the VisDrone dataset, which consists of drone- captured images collected under diverse environmental conditions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:53.207966Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:75b99bf0bbcdaffe004f19ef2766cc8e68e295b63830c02e95139cd58130d3a6","observation_id":"1bef4fee-9e63-4fdf-8a7f-e180f49007cd","resolution":{"observed_at":"2026-08-01T17:23:53.207966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:53.317228Z","title":"car” and “truck","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:53.317228Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:7b23497085f2775db554d55cecb6178ac6805a89c86000fe3052e3cf508cfc63","observation_id":"a561de8c-449e-4a39-98d4-a433f5833b27","resolution":{"observed_at":"2026-08-01T17:23:53.317228Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.bushor.2017.08.001","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From toys to tools: The co-evolution of technological and entrepreneurial developments in the drone industry,","venue":"Business Horizons","work_id":"96ba74aa-d74c-4b97-bce6-aeb46210eb86","year":2017},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:53.393449Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:8a01c17b96020f6f4b90f02bd4305536964e56d360018c531069b6a27c794494","observation_id":"91e437f5-0d08-4921-b9f9-f2d67b8f8a84","resolution":{"observed_at":"2026-08-01T17:28:37.126410Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4018/979-8-3693-8497-8.ch004","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Edge Computing, Emerging Trends, and Drone Technology for the Business Industry,","venue":"Advances in computational intelligence and robotics book series","work_id":"809486f4-a9b1-407f-9ac4-50ef70bbf830","year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:53.514533Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:83f005eda09726cb38b4e407d24ab9edbfc214f6bf63b3b1d6fd777f06c332ca","observation_id":"2d9985fb-6f1b-48df-a148-1a2001dcde3d","resolution":{"observed_at":"2026-08-01T17:28:36.887832Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4018/979-8-3693-0774-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:28:36.634998Z","title":"Use of AI applications for the drone industry,","venue":null,"work_id":"e1dbda34-acbd-46af-bb68-35b13c1413c9","year":2024},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:53.630495Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:808eb22d5fc9e905f220d597a57e1c22e073a5985a77adb003b3425217ffea04","observation_id":"5ea99d68-08d9-48d7-8b96-cc7597ea9923","resolution":{"observed_at":"2026-08-01T17:28:36.695040Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v36i1.19986","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UFPMP-Det:Toward Accurate and Efficient Object Detection on Drone Imagery,","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"2880d949-5630-4549-8b1e-6cd50695b722","year":2022},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:53.723953Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:b02ceb1a4e56f4c8ef34ddc5576c8d545b2f8014aa205f1b75a9191c62c54c57","observation_id":"ffe00af6-5be1-4ea2-8e46-b3f4f115e446","resolution":{"observed_at":"2026-08-01T17:28:36.499900Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:54.106165Z","title":"DR-YOLO: An improved multi-scale small object detection model for drone aerial photography scenes based on YOLOv7,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.106165Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:002d06a35136d3a8371bbc658f41f0df3a33cc23d2f7ea1a6a4f6ba183566f8e","observation_id":"8f6c5cc4-1dac-4142-be85-9343f04d42aa","resolution":{"observed_at":"2026-08-01T17:23:54.106165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:54.209072Z","title":"DHANet: Dual-Stream Hierarchical Interaction Networks for Multimodal Drone Object Detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.209072Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:c6b4419d1d4ddfdc43e9193c20c59de1baecec3fb757b85a555bfe3e7625744d","observation_id":"7786534a-98a8-4136-9fe7-90803ff21054","resolution":{"observed_at":"2026-08-01T17:23:54.209072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:54.340464Z","title":"HiCAL: Hierarchical Consistency-Based Active Learning for Drone-View Object Detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.340464Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:4cf781c3825b7c4cf7a3e336ada25b3f5ced82f4b393bd7ebbe15fd001fe5f00","observation_id":"6c761c0f-a839-461f-aa63-5f075220547f","resolution":{"observed_at":"2026-08-01T17:23:54.340464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/ece3.72856","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automated Detection and Monitoring of Ground-Nesting Bee Nests Using Drone Imagery and Deep Learning,","venue":"Ecology and Evolution","work_id":"e7715a71-5262-4133-abfd-7dc95255aa83","year":2026},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.499096Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:b738b175b92453306e081a91802ae8758bb09dacc7b975e14100fc44ad8689e4","observation_id":"7780b813-e22d-437a-9a6d-86239e415759","resolution":{"observed_at":"2026-08-01T17:28:36.096574Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:54.579253Z","title":"SPVD-DETR: A novel real-time end-to-end object detector of sweetpotato virus disease from unmanned aerial vehicle ortho imagery,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.579253Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:6e0a0356f725226165d1e4b48330d9d57329508389f31f6da4e6a17c369ea6e4","observation_id":"cf949cc6-cfc5-42b1-a9c2-b0728cc31c7e","resolution":{"observed_at":"2026-08-01T17:23:54.579253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s41064-025-00373-8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Single-tree Delineation by Instance Segmentation Using Drone-based Lidar and Multispectral Imagery: a Comparative Study in Various Forest Structures,","venue":"PFG – Journal of Photogrammetry Remote Sensing and Geoinformation Science","work_id":"65b1d8ff-81ee-480d-8012-ee6637a17047","year":2026},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.660649Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:68e155e6984e3b69adbf063c00e3b70254c8aec9dfd9e5f181ce06bb736a034b","observation_id":"65b55fb4-2438-4fd0-bfe8-a91832c9fd07","resolution":{"observed_at":"2026-08-01T17:28:35.732373Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:54.721644Z","title":"Advancing traffic object detection in complex environments: a deep learning object detection approach with vehicle-mounted UAV data for traffic scene perception,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.721644Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:5e6046f684702356f040a6b2482d034019e06cff3f14b59a4b3bbc6f2d7d2508","observation_id":"2472ed9d-4eb8-4b45-b26d-96e121b4702b","resolution":{"observed_at":"2026-08-01T17:23:54.721644Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/cpe.70528","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Enhancing Wildfire Preparedness and Response: A Drone Network- Based Early Warning System for Bushfires,","venue":"Concurrency and Computation Practice and Experience","work_id":"9726e7f2-0e54-4578-8fb5-53f2ed39f153","year":2026},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.773477Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:8b7bf415d85ada1108839b6c6cd7e56ffe7d4fe5e43057b9008008034332a043","observation_id":"9c4bef65-df51-434f-ad6b-c79b34cae56f","resolution":{"observed_at":"2026-08-01T17:28:35.448196Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:54.816604Z","title":"Rich feature hierarchies for accurate object detection and semantic segmentation,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.816604Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:aee9a4a1f494e7b8eac9c0f154e230e8ffdf0dc83f11c37d7a1af925609c79ef","observation_id":"29689278-d1f3-4d33-9fd2-93a85acf7d06","resolution":{"observed_at":"2026-08-01T17:23:54.816604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:54.864472Z","title":"Fast r-cnn,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.864472Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:65ceea76db3f673c4704e30a82f2709ce68ac6cf09a97807f541fe999055a8a8","observation_id":"a5a3bb49-a97d-4d4a-83a1-3e3a54515206","resolution":{"observed_at":"2026-08-01T17:23:54.864472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:54.989106Z","title":"Faster R-CNN: Towards real-time object detection with region proposal networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.989106Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:d55bf375ebe0e579c837c244b6f175c061d2d793371add40ad6efec3351c654d","observation_id":"9fa90ed1-9a0e-4886-8ac7-bb4dc822255d","resolution":{"observed_at":"2026-08-01T17:23:54.989106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:55.129813Z","title":"Mask r-cnn,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:55.129813Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:1dede3ad9ee7b1b4b5596b28f45c993fc59f7d162ef62955a1f8ba5b1f8b72f1","observation_id":"b4eb8cc3-e27b-4979-bbbe-3202be1a270d","resolution":{"observed_at":"2026-08-01T17:23:55.129813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:55.299770Z","title":"You only look once: Unified real-time object detection,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:55.299770Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:3f5b6612f8d3b6be28f842dbd7fc4922abbff516b2f4f00eb6846923967d36a0","observation_id":"a3de1e62-763e-48f7-adee-090aaf353268","resolution":{"observed_at":"2026-08-01T17:23:55.299770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:55.477382Z","title":"YOLO9000: better, faster, stronger,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:55.477382Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:41de6eb90d71d1d26603f032e09ba733a1b94019894dc2dd4c84abc6c3d2f858","observation_id":"973f211f-f83c-4dbf-af2d-fe795383d0d8","resolution":{"observed_at":"2026-08-01T17:23:55.477382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.02767","last_updated":"2018-04-08T22:27:57Z","snapshot_observed_at":"2026-08-06T11:09:16.409556Z","submitted_at":"2018-04-08T22:27:57Z","title":"YOLOv3: An Incremental Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.02767","snapshot_observed_at":"2026-08-01T17:23:55.652761Z","title":"Yolov3: An incremental improvement,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:55.652761Z"},"links":{"cited_paper":"/paper/1804.02767","citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:e3ac89f2cdde47250f81ab75c150246f0da0124baadaa410289c01597e338471","observation_id":"5357f8dc-7047-4fc5-bc27-704ff6326514","resolution":{"observed_at":"2026-08-01T17:23:55.652761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10934","last_updated":"2020-04-23T02:10:02Z","snapshot_observed_at":"2026-07-06T09:14:32.318388Z","submitted_at":"2020-04-23T02:10:02Z","title":"YOLOv4: Optimal Speed and Accuracy of Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10934","snapshot_observed_at":"2026-08-01T17:23:55.764230Z","title":"Yolov4: Optimal speed and accuracy of object detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:55.764230Z"},"links":{"cited_paper":"/paper/2004.10934","citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:de089567247b1ca4023cc420aa207d41088c6e9377b1d1248dd58fd428a12bd2","observation_id":"23821e80-e1ce-4259-9d3c-0f7f474461d1","resolution":{"observed_at":"2026-08-01T17:23:55.764230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:55.944808Z","title":"Available online: https://github.com/ultralytics/yolov5, (accessed on: 23 November 2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:55.944808Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:beb50ebd57eb86db5ea46d3ee9f5760520b3ec733ab39fbda0716432d951cfb8","observation_id":"dbe1a9b8-2f9b-44ba-b33c-5ed0e1099b04","resolution":{"observed_at":"2026-08-01T17:23:55.944808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.02976","last_updated":"2022-09-07T07:47:58Z","snapshot_observed_at":"2026-07-06T13:49:37.223049Z","submitted_at":"2022-09-07T07:47:58Z","title":"YOLOv6: A Single-Stage Object Detection Framework for Industrial Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.02976","snapshot_observed_at":"2026-08-01T17:23:56.004512Z","title":"YOLOv6: A single-state object detection framework for industrial applications,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.004512Z"},"links":{"cited_paper":"/paper/2209.02976","citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:d3984b19140349019fc222c7413e37d95dd53871b10b1f1584d42e33c0a67243","observation_id":"7d0d31c5-5f2c-4d96-8ceb-01140b2c4a26","resolution":{"observed_at":"2026-08-01T17:23:56.004512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.073594Z","title":"YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.073594Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:49f9ab2464c0aa387915109ebf2e34c8147fcf2cb89484b33706cbd6a12f32d8","observation_id":"26f2fa26-e336-4647-8d50-ccb17e873f2d","resolution":{"observed_at":"2026-08-01T17:23:56.073594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.139812Z","title":"Available online: https://docs.ultralytics.com/models/yolov8 (accessed on: 11 November 2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.139812Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:6a521e7d1639f76d2b231607ba305817c875a4045183d81873ec65d4c12c1eb7","observation_id":"b4771bab-be7c-4155-b5ed-d0afc477c915","resolution":{"observed_at":"2026-08-01T17:23:56.139812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.180031Z","title":"YOLOv9: Learning what you want to learn using programmable gradient information. European Conference on Computer Vision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.180031Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:6c1e75bb7e282cc6929cb736f3c040a374f512942f9782fa47d0af17771bc841","observation_id":"af854cfb-0d65-4bdb-a2af-a0d718e5f420","resolution":{"observed_at":"2026-08-01T17:23:56.180031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.233855Z","title":"YOLOv10: Real-Time End-to-End Object Detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.233855Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:6743000c7ad9b21d477019b0db8befa206d4f9b254b161050734c8a8e7ddb91f","observation_id":"15fb4cce-0936-424c-99cb-d196f5f53514","resolution":{"observed_at":"2026-08-01T17:23:56.233855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.285332Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.285332Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:a64e9b912f2582e20e16f40ac8fd3c3e33034bbe4352ae4fccdfb5778c09219c","observation_id":"4e601489-88d3-4816-b315-018c761de33c","resolution":{"observed_at":"2026-08-01T17:23:56.285332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.592520Z","title":"Ssd: Single shot multibox detector,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.592520Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:a587795f1ea9fa02922cc9c47926b7220224a3954358846f978db2ca60162ca8","observation_id":"9e8fe89e-42c4-4984-ac15-445d47cbcd43","resolution":{"observed_at":"2026-08-01T17:23:56.592520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12524","last_updated":"2025-02-18T04:20:14Z","snapshot_observed_at":"2026-07-06T20:38:20.545914Z","submitted_at":"2025-02-18T04:20:14Z","title":"YOLOv12: Attention-Centric Real-Time Object Detectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12524","snapshot_observed_at":"2026-08-01T17:23:56.453859Z","title":"YOLOv12: Attention-Centric Real-Time Object Detectors,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.453859Z"},"links":{"cited_paper":"/paper/2502.12524","citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:087f4938229e996816ff561f494e3f3814529ba2bb0511402fca7f1012256271","observation_id":"236e03c3-f614-4183-bfa5-5ac4db9d31af","resolution":{"observed_at":"2026-08-01T17:23:56.453859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.529197Z","title":"Available online: https://github.com/ultralytics/ultralytics, (accessed on: 14 January 2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.529197Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:f0c43ae4a8254eaea1a23cfc4247a6fe3e37012d5bd731ec5944cff0501e00d5","observation_id":"cdc16677-0d7a-4c62-a637-fba3676c3fd6","resolution":{"observed_at":"2026-08-01T17:23:56.529197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i4.32433","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LogicAD: Explainable Anomaly Detection via VLM-based Text Feature Extraction,","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"25f710f0-2e5a-4109-aacd-217fa1791683","year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.787092Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:33cd8aa84430c2e3a24186620601dba828d47f6b38fef02aed819046cfe36468","observation_id":"c9db5f4a-4918-4b80-b4d7-a056a1dbd40f","resolution":{"observed_at":"2026-08-01T17:28:35.060257Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.659843Z","title":"Focal loss for dense object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.659843Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:f02b07ec38495a47a663d1d93a8c671703122936e81133543404bc224dd749a4","observation_id":"00eb6df5-d678-4810-9610-2cd2cb655595","resolution":{"observed_at":"2026-08-01T17:23:56.659843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.723448Z","title":"Single-shot refinement neural network for object detection,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.723448Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:d6ec6fdea8b5a309997650393bec8cd2ff14ac65464e2d0e5c61e0b32b7dfb77","observation_id":"9cbf7331-363f-49e8-8783-208d3c961756","resolution":{"observed_at":"2026-08-01T17:23:56.723448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.979126Z","title":"Strong and Weak Prompt Engineering for Remote Sensing Image-Text Cross- Modal Retrieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.979126Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:c33be7f565a8bb44a6852f9de51847c08ad9fd5579369778ed2d136eb34fc0b9","observation_id":"f289f90c-614a-42d5-94c4-ad1b7882dcf2","resolution":{"observed_at":"2026-08-01T17:23:56.979126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.859865Z","title":"GADNet: Improving image–text matching via graph-based aggregation and disentanglement,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.859865Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:7c30b8159f3e365d7366d4187db457c43310584c66bd2ee3c391ee22ef2a012d","observation_id":"f1ca4c81-3974-4047-8027-aadede2e1f62","resolution":{"observed_at":"2026-08-01T17:23:56.859865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/cpe.8345","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A System of Multimodal Image-Text Retrieval Based on Pre-Trained Models Fusion,","venue":"Concurrency and Computation Practice and Experience","work_id":"18be75ba-3714-496f-bb67-72f70dfe73aa","year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.929475Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:95fd7d018e902e9457e4c5488bc305e6069ce3c71302c4feecf059849d9f721c","observation_id":"c6628848-d655-4f8f-86d3-7d88aaf3cfc2","resolution":{"observed_at":"2026-08-01T17:28:34.854372Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:57.135380Z","title":"Make It Count: Text-to-Image Generation with an Accurate Number of Objects,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:57.135380Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:8fe49ad1e159cec0cef74afd0ca0b2c132f4777829e85ec1b827aad4f08ccc4f","observation_id":"430f971a-7a95-459d-beb4-e9672928593d","resolution":{"observed_at":"2026-08-01T17:23:57.135380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:57.021176Z","title":"Local-enhanced representation for text-based person search,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:57.021176Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:9ee35eb358e0c4c595d1fc966b5575a0a6af2da3ae60a51f8c0b90bf90b0c080","observation_id":"3dd9d87d-5f50-4b14-9640-fee2d161228d","resolution":{"observed_at":"2026-08-01T17:23:57.021176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41598-025-31803-7","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An efficient YOLOv12-based framework for detecting extremely small-scale objects,","venue":"Scientific Reports","work_id":"ba072487-bd8f-4edd-9130-8623281608bc","year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:57.320522Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:0ead46ebb5e47bf8b016a80c6effc6bdc7c83622408c6f13273d779272534238","observation_id":"007992c8-c938-4784-8bd6-d749e67fb5c1","resolution":{"observed_at":"2026-08-01T17:28:34.568750Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:57.178288Z","title":"Perception-Guided Jailbreak Against Text-to-Image Models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:57.178288Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:9b97251900235de79fe7dc2ec343fc03a5d9cdf6e5bcca5033fa1b1444bbc912","observation_id":"4b51e30a-843d-48bb-874b-615a899ae47f","resolution":{"observed_at":"2026-08-01T17:23:57.178288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.35784/acs_7850","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A text-guided vision model for enhanced recognition of small instances,","venue":"Applied Computer Science","work_id":"0b0541f8-3162-46d4-bbd5-6efa32a15b60","year":2026},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:57.404158Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:5a245b11e62ff92a6f1542a0fb431beb6df46aa7b5373d4705e3a6c41a8aa3b4","observation_id":"652c627b-c5d6-4e04-a238-d3b93bfe4cb5","resolution":{"observed_at":"2026-08-01T17:28:34.357222Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:57.269204Z","title":"YOLO-World: Real-Time Open-Vocabulary Object Detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:57.269204Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:e92dab5186e15fae057fd9abdd7b8ab47e8df418dba2d2ec8bf28c2d4e919a0e","observation_id":"e0bbfa59-d679-45f3-8b82-42f17126eac7","resolution":{"observed_at":"2026-08-01T17:23:57.269204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:57.354010Z","title":"CSPNet: A new backbone that can enhance learning capability of CNN,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:57.354010Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:378fa470b943c4afacc8e30ac64eb6ce8fc3a42886e0c04aba16043adf980c49","observation_id":"8b6f9ad4-2dbf-4374-81ab-cd0b863bb924","resolution":{"observed_at":"2026-08-01T17:23:57.354010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17725","last_updated":"2024-10-23T09:55:22Z","snapshot_observed_at":"2026-07-06T19:38:22.461739Z","submitted_at":"2024-10-23T09:55:22Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17725","snapshot_observed_at":"2026-08-01T17:23:56.368162Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.368162Z"},"links":{"cited_paper":"/paper/2410.17725","citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:31495270e13e367bafe7962a8343e59796b9c03c8db3dd76df519d45dc6aaca1","observation_id":"4ae386db-caf3-40e9-abdd-a6908ac7d767","resolution":{"observed_at":"2026-08-01T17:23:56.368162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i25.34821","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"1c69ccac-8bde-47df-8a4c-10473451ee7c","year":null},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:57.221809Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:dedad61d14e7a3d27a11ddd52ea7efc917ad241548e386231c6561f23aa128ef","observation_id":"6b6c01c8-a10a-4cd7-b64e-4f48188c240d","resolution":{"observed_at":"2026-08-01T17:28:34.717629Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T17:23:51.811513Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":11,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2607.17669."}