{"as_of":"2026-08-09T14:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec8f0684cb0d942ac590b381ee83c1f61dc5fc9af5321bbdf0c1a6c03d7b8d27","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:44:12.467300Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.00385/citation-record","integrity":"/paper/2509.00385/integrity","json":"/paper/2509.00385/citation-record.json","paper":"/paper/2509.00385"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:21.449131Z","title":"The reverse hierarchy theory of visual perceptual learning","venue":null,"work_id":"288d50f6-7a58-4b48-9b9f-c647aa97c1b9","year":2004},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:06.734568Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:aa5d73c6de7b200f83fd7316bdea916fe03a969d57776c81a1cab3c2425033e4","observation_id":"343da560-cc26-48ff-b134-c373326dcdf1","resolution":{"observed_at":"2026-08-05T13:44:21.594179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:21.307394Z","title":"Unsupervised learning of visual features by contrasting cluster assign- ments","venue":null,"work_id":"0bb39637-44a3-47f7-9a42-32d497fd03bc","year":2020},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:06.792454Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:d93616d68f015b710f3eb559598ca24da68d005dd07bb506d315f9a1ac528fd6","observation_id":"624581e3-a65d-494d-95e5-06b19ff90b7e","resolution":{"observed_at":"2026-08-05T13:44:21.364489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:06.889279Z","title":"Generative pretraining from pixels","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:06.889279Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:ca89d6bb58629ce54f438531c85f837d4ece7d820bec3494e4a0a66bdf1522ef","observation_id":"30b9d34e-4101-43e7-81dd-afa08cfb0788","resolution":{"observed_at":"2026-08-05T13:44:06.889279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:06.936956Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:06.936956Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:229e0f7d8188aa2f8a55d478bef3fdc36f7cf218750270978d201556535e61ac","observation_id":"efb65a25-6af5-4bca-b995-7eb6f9556b66","resolution":{"observed_at":"2026-08-05T13:44:06.936956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:07.015401Z","title":"Detect what you can: Detecting and representing objects using holistic models and body parts","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:07.015401Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:8be60852aa5f5667a9ff3a8d71518bcd1ff779a3e486cd45ac2f73b3a27e5a73","observation_id":"0b1a6c6c-a244-49f0-8bbe-b440157a6347","resolution":{"observed_at":"2026-08-05T13:44:07.015401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:21.112504Z","title":"Seq- track: Unified sequence-to-sequence learning for single- and multi-modal visual object tracking","venue":null,"work_id":"9420fa70-6a55-45de-9a1e-2b6e9798fb3a","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:07.089046Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:1965022d48fe8f6531a2e13e8988cedc4f8bf305131e3064671874b965d7de2f","observation_id":"5d28a930-f42c-416a-a09a-3b2eb87aa996","resolution":{"observed_at":"2026-08-05T13:44:21.214840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:20.924229Z","title":"Category-aware allocation transformer for weakly supervised object localization","venue":null,"work_id":"81ff0909-579c-46d2-a89a-9212ddb07d44","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:07.237436Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:405d78431f807eee69e2b86e5b5eafae56a6ef76797da04ffacc35f6e75e9b58","observation_id":"81a5e480-f3a5-40cf-bca3-b094530c63af","resolution":{"observed_at":"2026-08-05T13:44:20.969466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:20.784628Z","title":"Unsupervised object dis- covery and localization in the wild: Part-based matching with bottom-up region pro- posals","venue":null,"work_id":"ce8fee27-d3dd-4719-bd98-e3a9401f6b48","year":2015},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:07.393746Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:aa2f7ef4576a9bc164846fb071b5a7853c7c62a3fcf5d7d4dd4591b83a156b9d","observation_id":"951dcd1f-9f65-4e4e-a048-d11e8c425476","resolution":{"observed_at":"2026-08-05T13:44:20.844592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:20.636520Z","title":"Mixformer: End-to-end tracking with iterative mixed attention","venue":null,"work_id":"72d9dbdd-33de-4fc5-abec-61b52f7178c7","year":2022},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:07.538345Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:7c819ab675d17cb0ebfacfe932e781ff0e0a58355f28530804818e8399a321dc","observation_id":"36dff553-d615-4d5e-90a7-f2a4f94c41dd","resolution":{"observed_at":"2026-08-05T13:44:20.694813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:20.455969Z","title":"Scaling egocentric vision: The epic-kitchens dataset","venue":null,"work_id":"386cff51-d04f-4780-9ac1-42124a1e2896","year":2018},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:07.668157Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:ff665dbdda0f2e3742524145ccd9b794e1ef9b532c2c45982cce6ae32bd8e8ab","observation_id":"71982cae-6936-426c-8b99-49802d5674ea","resolution":{"observed_at":"2026-08-05T13:44:20.551822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:20.260064Z","title":"Augmented reality smart glasses in industrial assembly: Current status and future challenges","venue":null,"work_id":"ea167c10-0c12-47c0-8257-9bcf43c5fc75","year":2020},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:07.800976Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:01bb72141fc587e3bcc3a7c2d7a6f12cae89139f9b8cb9faf93b81e268c1cd4a","observation_id":"e2d28dda-257b-4ef4-8e91-1fed8f372f12","resolution":{"observed_at":"2026-08-05T13:44:20.347230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:20.098356Z","title":"Is first person vision challenging for object tracking? In ICCVW, 2021","venue":null,"work_id":"b7213bed-fd70-40da-a8ac-cb0999a7e3d2","year":2021},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:07.911097Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:647fd61948a849904b9386d72ff1e6ef36f1eaf19f02e9d836f9f43bd14343a6","observation_id":"9dba88ef-93a7-4950-b8c3-4dcfea20158e","resolution":{"observed_at":"2026-08-05T13:44:20.177501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:19.914754Z","title":"Pairwise body-part attention for recognizing human-object interactions","venue":null,"work_id":"57386756-f7c8-4fd3-ad67-cb14b4f0dc8d","year":2018},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:07.974127Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:9966e6ef9de1b4bc77c6941523a9efbc71c48b3fc6cc70fee3667ad2c5a1facf","observation_id":"19a2433d-cb1f-42a6-92ff-3b2a2a0d71c7","resolution":{"observed_at":"2026-08-05T13:44:19.988181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:19.739375Z","title":"Amego: Ac- tive memory from long egocentric videos","venue":null,"work_id":"7b1fbf5f-499c-4b7f-8d53-fa19ed25568d","year":2024},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:08.099016Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:616fadb7fe87d2a93ad1a26157e68d84379384d76ad2d9d00e76090d15789622","observation_id":"40c63a19-4fa9-4d93-a53b-4095f4758950","resolution":{"observed_at":"2026-08-05T13:44:19.846902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:19.616632Z","title":"Robotic home assistant care-o-bot® 3 - product vision and innovation platform","venue":null,"work_id":"cdb86024-26e5-4183-8899-681aa5a4c191","year":2009},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:08.196820Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:efd39b2382217cf05536445fd32cce1920589ae6ab64147c1aee64e74b6a2bf1","observation_id":"ee8e6332-f54c-4e09-8db3-c441e8d0eedd","resolution":{"observed_at":"2026-08-05T13:44:19.659164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:08.284879Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:08.284879Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:1525a24191fa8ae97a791e93d092d0a2b32081142f102b759a3458ad940df1ab","observation_id":"d7ce5496-0a70-49b4-840d-0ef1396f4106","resolution":{"observed_at":"2026-08-05T13:44:08.284879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:19.487821Z","title":null,"venue":null,"work_id":"dd42f962-d318-4dc6-b4df-4ea4a559e95c","year":2024},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:08.426028Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:33836ac97a6ffcf22b9d7705a619f997f62e4bf8128c05c786d09003266bb3b8","observation_id":"56d297b6-a05b-42f6-b426-dff0de459dc2","resolution":{"observed_at":"2026-08-05T13:44:19.543480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:19.328822Z","title":"Bootstrap your own latent-a new approach to self- supervised learning","venue":null,"work_id":"df128da5-ca05-4d13-9b03-0a6e5ea0343b","year":2020},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:08.576387Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:7f8f018013c8e2ab561e85b387e5c07903fed22407fc6b2d51f886d22ce8f2db","observation_id":"437d4cd3-1171-4ee1-97f7-4f70ec66a548","resolution":{"observed_at":"2026-08-05T13:44:19.402423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:19.183637Z","title":"Momentum con- trast for unsupervised visual representation learning","venue":null,"work_id":"b05f091c-f88f-407e-954d-6b6ddbf84f42","year":2020},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:08.673786Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:681b4fbde17df8d93b8557383a8d4ccb3d437ceb72e2d0478884bad11cb8ab93","observation_id":"2bc5a3a4-96bc-4e39-a232-a4989467bad7","resolution":{"observed_at":"2026-08-05T13:44:19.247637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:19.035333Z","title":"View from the top: Hierarchies and reverse hier- archies in the visual system","venue":null,"work_id":"efef95d9-76c4-41ac-960a-33155909ce31","year":2002},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:08.769670Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:d83912148ef4423363f12a4fc4158ea07d2af2b976e0c6d59697256a19ea1b7a","observation_id":"b9daf06e-6b97-41d8-8b5c-75fa0d92b639","resolution":{"observed_at":"2026-08-05T13:44:19.124177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:18.881596Z","title":"Egocentric audio-visual object localization","venue":null,"work_id":"ee90c123-cd33-499e-bff4-dd7e5e70231e","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:08.863920Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:d3ddc46a6bbd0df38ccb80b8acb01949457351174d69540cebb9c57b046c7e08","observation_id":"851b8dfb-79ae-4486-a853-0d8b809253c3","resolution":{"observed_at":"2026-08-05T13:44:18.964756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:18.730464Z","title":"Video recap: Recursive captioning of hour-long videos","venue":null,"work_id":"fb55a016-8360-4d35-9bbe-4f66f23a9779","year":2024},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:08.970275Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:3b10c5fdd1651624100006aff791b8b509c2bd3d577a2cb811bef4eccd85a4ca","observation_id":"297bef9c-b1f1-45c6-ac0a-02b38b0ac74f","resolution":{"observed_at":"2026-08-05T13:44:18.795345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:18.605182Z","title":"Detrs with hybrid matching","venue":null,"work_id":"50b96e54-1803-4fa8-8dee-cef04bc44c76","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:09.111805Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:e5e293f673950adaa9934c53cbf5ae3e89fb74c09610b50b390799e87ef5ad97","observation_id":"38a075b8-734c-411b-be49-362547e70648","resolution":{"observed_at":"2026-08-05T13:44:18.659210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:18.508261Z","title":"Single-stage visual query localization in egocentric videos","venue":null,"work_id":"e2a6a357-9147-4dc8-9c2a-8a0e8a8f5c42","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:09.256521Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:19f900ca2a61f97ee6457987f1904852baaab4eec11baf05ea0817e7c43a8183","observation_id":"4b48aa6c-ba8a-42ca-8b8a-081a402c000b","resolution":{"observed_at":"2026-08-05T13:44:18.548988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:09.367167Z","title":"Sam2mot: A novel paradigm of multi-object tracking by segmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:09.367167Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:40d00c788638ceaeb3af1e88eefcdd0d8019d888eaaa8c5136cc2e3798b3fff9","observation_id":"1399fc09-ceb5-4072-b1bf-17a5bdd684df","resolution":{"observed_at":"2026-08-05T13:44:09.367167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:18.377008Z","title":"Refego: Referring expression compre- hension dataset from first-person perception of ego4d","venue":null,"work_id":"de97be51-60a8-4ba2-b3ac-d6a03595d212","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:09.463880Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:e847167c8b0fbcfc730abb08f31f5dff0d21b220d62e47b99e8b13016f5b6a7e","observation_id":"1769a7c3-a6ff-4e3f-81e8-020793cfea0e","resolution":{"observed_at":"2026-08-05T13:44:18.452493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:18.234822Z","title":"Locate: Localize and transfer object parts for weakly supervised affordance grounding","venue":null,"work_id":"0315ca0c-ad89-447c-bd73-f6fe445164e4","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:09.584010Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:71919fd57d2caa0ab4e8d9b1f7e25b165d074fb0af7380ff1499f654ba437e18","observation_id":"03420ebd-cf17-4354-b52c-5367e2d3ef11","resolution":{"observed_at":"2026-08-05T13:44:18.313653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:18.059408Z","title":"Tsm: Temporal shift module for efficient video understanding","venue":null,"work_id":"3b4892ce-19dc-4108-930a-9a06e562fcda","year":2019},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:09.719343Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:51a5eea6fcc3c5f2010aa9c7eed28339a63f29f3475770824b9b607fc2a21325","observation_id":"e139906a-7062-4fbf-a8db-ba4a5453ccc0","resolution":{"observed_at":"2026-08-05T13:44:18.121464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02002","last_updated":"2018-02-07T18:44:44Z","snapshot_observed_at":"2026-07-06T05:54:18.908943Z","submitted_at":"2017-08-07T06:32:42Z","title":"Focal Loss for Dense Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.02002","snapshot_observed_at":"2026-08-05T13:44:09.854460Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:09.854460Z"},"links":{"cited_paper":"/paper/1708.02002","citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:175b185a41882f7e3606bfb7885bd3d6b11f1e16a348c673cf62b64c1cd59686","observation_id":"d98ab12c-15de-42b4-af99-8e4fd2b492e3","resolution":{"observed_at":"2026-08-05T13:44:09.854460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:09.925615Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:09.925615Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:e367cd0a5c06a5c709c80a083aee277cdff3fab5ca3ab1d8beb0204cde49b495","observation_id":"3127d551-e6a9-4621-a396-6f5d12ad81a0","resolution":{"observed_at":"2026-08-05T13:44:09.925615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:17.865935Z","title":"Egoloc: Revisiting 3d object localization from egocentric videos with visual queries","venue":null,"work_id":"b134ea09-84df-4ab3-b9ce-893ae707f0fc","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.007376Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:1f7870c5041550332634e04a10ed28e1c386908d3a824bb5c307cc8984dfa69b","observation_id":"42491b24-cee6-4f2d-bfea-efced078276f","resolution":{"observed_at":"2026-08-05T13:44:17.959933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:17.632071Z","title":null,"venue":null,"work_id":"5ed2ab14-71b4-4faf-9715-e64f8682b8f5","year":2024},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.127017Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:36d6624af38c0aac1eea0f53289761b7b872a0d96442cb07889014a301b8e532","observation_id":"f40b9bea-30c4-48a1-bc1e-795bf7afb049","resolution":{"observed_at":"2026-08-05T13:44:17.769270Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:17.361664Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":"cc415f07-928c-40e5-8d23-80a62b523cb5","year":2017},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.233579Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:5b7bef2db449b081e82991c3d90407226e9c4a7da7a58c622042210c74fd6cce","observation_id":"4879726a-6586-4091-9f6a-00fb1b74ba2b","resolution":{"observed_at":"2026-08-05T13:44:17.504074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:17.125525Z","title":"Learning transferable visual models from natural lan- guage supervision","venue":null,"work_id":"72647235-1bd3-4a1c-918e-2ca95b00950f","year":2021},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.339632Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:ff96bb77a9ff2122aa40f4313a6ec40a1ce34b3b6c2d0afb9609ec7a8565644d","observation_id":"85a9426d-3582-4209-bbc1-ec20eab8d36e","resolution":{"observed_at":"2026-08-05T13:44:17.255306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:16.861892Z","title":"Generalized intersection over union: A metric and a loss for bounding box regression","venue":null,"work_id":"d162b783-1a3e-4ac0-ac01-6c9908855b1e","year":2019},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.464720Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:3fc53ab90e0ac319c3335a3697037d502ce459919677c2effd0b232b2438faab","observation_id":"d4826698-af89-4e3e-9487-c778104a23b4","resolution":{"observed_at":"2026-08-05T13:44:16.974537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:16.559221Z","title":"Ego4d goal-step: Toward hierarchical understanding of procedural activities","venue":null,"work_id":"3f0efc8e-8222-4ff3-ad66-a63e3720f522","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.553235Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:053c11821b731256a0d2f57d28333b22b62e6337fdd2eeef988eda62ff8947de","observation_id":"64db5430-329e-428c-af1c-03fbb1b5f17a","resolution":{"observed_at":"2026-08-05T13:44:16.713470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:16.287325Z","title":"Transformer tracking with cyclic shifting window attention","venue":null,"work_id":"6c386c9b-86ea-492e-9839-147fc7b30014","year":2022},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.689444Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:fb381ed98ae6bb374031db69f61284af251f246d7f9a7c35e174862036aef1b9","observation_id":"470e1544-6890-4837-aa64-bec31f640e2e","resolution":{"observed_at":"2026-08-05T13:44:16.398256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:15.983462Z","title":"Egotracks: A long-term ego- centric visual object tracking dataset","venue":null,"work_id":"52ede72d-4710-46b0-b12c-c4c7b2596c1f","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.804582Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:21010e7568ac5f8df82da2f4c5d2286f9db0910da4fe8ef2dbf8f81250241e00","observation_id":"5a3b8773-967c-44e0-bc4d-9361f4df6ba2","resolution":{"observed_at":"2026-08-05T13:44:16.158694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:15.676399Z","title":"Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N","venue":null,"work_id":"23c21206-df47-4da4-ab24-c1fab4e0cb9e","year":2017},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.913351Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:0a6689e45560206efedee9bda2aa3599039eb5b97a5c8439fdcb9f6a2172090e","observation_id":"7e0419b4-3965-47af-a959-244040339b93","resolution":{"observed_at":"2026-08-05T13:44:15.823631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01949","last_updated":"2022-08-03T09:54:51Z","snapshot_observed_at":"2026-08-05T23:02:25.468381Z","submitted_at":"2022-08-03T09:54:51Z","title":"Negative Frames Matter in Egocentric Visual Query 2D Localization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01949","snapshot_observed_at":"2026-08-05T13:44:10.998462Z","title":"Negative frames matter in egocentric visual query 2d localization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.998462Z"},"links":{"cited_paper":"/paper/2208.01949","citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:dabed2b6d539f50e51268e6fae683710824cdf2fe360f53eec6c529efdfbf336","observation_id":"dd0b0736-cdbc-4311-b480-7b67f4216ead","resolution":{"observed_at":"2026-08-05T13:44:10.998462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:15.392993Z","title":"Where is my wallet? modeling object proposal sets for egocentric visual query localization","venue":null,"work_id":"dd6566ba-5076-40d1-85da-b3c26b1866b8","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:11.100684Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:259811d173952ed45d46b0450aabc68b56db3cc37376e93befca6a39545b9f85","observation_id":"1c20528b-4039-4574-99cf-8dc14772d849","resolution":{"observed_at":"2026-08-05T13:44:15.520003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:15.033973Z","title":"Learning spatio- temporal transformer for visual tracking","venue":null,"work_id":"7f8a5a00-d63c-4507-9657-f41d0e52d3be","year":2021},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:11.202670Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:8199c0fe4c852c79f17600f20b97567eba00881bfa865e4cf8c9d44f749fb8b1","observation_id":"9d5731d0-85bc-4b8f-98b6-1cdebb4800da","resolution":{"observed_at":"2026-08-05T13:44:15.214035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11922","last_updated":"2024-11-30T22:32:34Z","snapshot_observed_at":"2026-08-08T21:51:38.855361Z","submitted_at":"2024-11-18T05:59:03Z","title":"SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11922","snapshot_observed_at":"2026-08-05T13:44:11.339769Z","title":"Samurai: Adapting segment anything model for zero-shot visual tracking with motion-aware memory","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:11.339769Z"},"links":{"cited_paper":"/paper/2411.11922","citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:f0fb00c0c600430f41ab81039ff6db67c15136b2f3fd6364ae45980ba0c6654f","observation_id":"a3f02956-f0d1-4161-862a-3e1a2bff626e","resolution":{"observed_at":"2026-08-05T13:44:11.339769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:14.674775Z","title":"Self- produced guidance for weakly-supervised object localization","venue":null,"work_id":"a513aaed-fa59-4cb2-b95f-27ff35f2d767","year":2018},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:11.451191Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:76a080de3c474c0f063ef7738505a9ca6a858e434d84872b077d1982cf157ddc","observation_id":"da666d6d-bb6c-491f-a3ca-8ae12c6e387d","resolution":{"observed_at":"2026-08-05T13:44:14.842946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:14.355229Z","title":"Visual prompt multi-modal tracking","venue":null,"work_id":"821d2b72-3697-487c-89a3-d5a7a1bb11e2","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:11.558759Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:1976672c2f3327f9f1006fbd55acff5786dec243d81d1e518ea0ae912b54f8b0","observation_id":"13bc24c7-c175-46f4-81c8-73c7afcb2268","resolution":{"observed_at":"2026-08-05T13:44:14.487317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:14.115606Z","title":null,"venue":null,"work_id":"c5d5d66b-a466-4211-9e93-fc6e6d2d64e7","year":null},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:11.659970Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:f0d049c4ec84e5c7406e17bac888bda8d2497bd93eb6860e87608edaf8e10992","observation_id":"90026469-bfad-4f15-973f-80d3446a6271","resolution":{"observed_at":"2026-08-05T13:44:14.239291Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:13.856085Z","title":null,"venue":null,"work_id":"35d14fff-61db-4aef-aaec-e326122101d5","year":null},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:11.756374Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:9e8b44cf37fb96a60540c397209cd042da09b15d089a8b004d205067c5472ee9","observation_id":"12ca8d7c-cdc2-4076-9c5b-f98bf761c449","resolution":{"observed_at":"2026-08-05T13:44:13.991415Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:13.637893Z","title":"Details VQ2D dataset is a large-scale egocentric video dataset for localization that con- tains about 6K clips","venue":null,"work_id":"5d6a946d-e340-410d-b7b7-368fc8d34c5b","year":null},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:11.927514Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:c21c4123bbd7478c147d480b54e48bcb08e25e722c845728a5a50d81f2f76f55","observation_id":"c6670d0c-21fd-48ae-ae32-62616bf549d6","resolution":{"observed_at":"2026-08-05T13:44:13.773988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:13.441342Z","title":"Specifically, we evaluate tAP25 at a tIoU threshold of 0.25, indicating how well the predicted temporal boundaries align with the ground truth","venue":null,"work_id":"73b82422-8c08-41ca-914b-1e66f7a32fc8","year":null},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:12.068369Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:b45b9a36c3e512890b88852ded8a470702c2324bec9eebbee77cbe29d5a0055a","observation_id":"4a25a988-2c15-4309-b67d-eb402c8b1314","resolution":{"observed_at":"2026-08-05T13:44:13.579042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:13.139379Z","title":"This metric measures the overlap between the predicted and ground-truth spatio-temporal volumes, capturing both spatial accu- racy and temporal alignment","venue":null,"work_id":"3695b6f7-7c75-4b96-a240-fd1ac305018e","year":null},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:12.219216Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:f694a3e5042ea268231fa595c2345ebf64f0082421ff788954a08587bcd59e20","observation_id":"97438272-4156-4725-b16b-9459b82bf02b","resolution":{"observed_at":"2026-08-05T13:44:13.305418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:12.925194Z","title":"For a frame to be considered correctly recovered, the spatial IoU between the prediction and ground truth must exceed 0.5","venue":null,"work_id":"e654f615-3a9b-4b09-9aa8-18332a399b09","year":null},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:12.347036Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:25c3781b7eded369610a2b520fc406ecf859467437b002cb0586e54233aac5a1","observation_id":"067c9ae1-33ef-4ec2-b5e6-996547153096","resolution":{"observed_at":"2026-08-05T13:44:13.053744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:12.704076Z","title":"This metric empha- sizes identifying whether the prediction captures even a minimal level of overlap with the ground truth","venue":null,"work_id":"fb932b2a-514f-4da9-b565-421ccf145d96","year":null},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:12.467300Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:7a503193e09c802bf12f435831cdc065e8a755c6c487e886a92902ddb652cfdd","observation_id":"dc7c431a-2ac4-4e66-a2eb-72a7f08140ec","resolution":{"observed_at":"2026-08-05T13:44:12.787893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:29:44.251808Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":12,"verified_exact":0,"verified_fuzzy":39},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2509.00385."}