{"as_of":"2026-08-16T15:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:46fb0e96eacbde0d59f9f5827129137c3bd3b6a87f09054fbb7e35c53f1ccbec","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T12:55:11.572179Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.06354/citation-record","integrity":"/paper/1908.06354/integrity","json":"/paper/1908.06354/citation-record.json","paper":"/paper/1908.06354"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.435159Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":"6008dd61-08cf-469c-bc7b-716a0ad67e31","year":2018},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.335642Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:4f4b59cfe5701d40ab854db539934eb56748c0e8b83cef513d0b40217cee2c19","observation_id":"1f26aae9-ba06-4f3c-9546-f6b31eecd4ba","resolution":{"observed_at":"2026-08-14T12:55:12.440663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.421104Z","title":"Msrc: Multimodal spatial regression with semantic context for phrase grounding","venue":null,"work_id":"a94a6384-c7a5-4351-9a0d-0aa2fff060a5","year":2017},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.340299Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:335a33dfde6a38495ae5e490365f556d7f0bdb6e95eae8103154b0870a6e61b6","observation_id":"e313c44d-687f-46c9-87e2-5681344257cb","resolution":{"observed_at":"2026-08-14T12:55:12.426027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.392205Z","title":"Query-guided regression network with context policy for phrase ground- ing","venue":null,"work_id":"242dd60e-67d2-4d55-8fbc-8991ba16e597","year":2017},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.348979Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:1704b25cc8f05d7f0d784705f32a0799194cad3d7f688b776402e364c43a0841","observation_id":"7f5ec710-b2f9-4891-997d-88a34ffdd60c","resolution":{"observed_at":"2026-08-14T12:55:12.396695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-14T12:55:11.353344Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.353344Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:5b75344099d33acb050be1572ecaf499082cfbd89aad1b8e1abbd861d9eb9478","observation_id":"29c11b80-f0a4-4ab8-8d5d-ec15b3a29c07","resolution":{"observed_at":"2026-08-14T12:55:11.353344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.376113Z","title":"Neural sequential phrase grounding (seqground)","venue":null,"work_id":"d948774e-0624-47d9-8e24-b3e590b0f92c","year":2019},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.357435Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:8cab33f0d369429926997971b9e1b078a85edea7fdd10ddbc62368866b15b640","observation_id":"f9e55d75-ee69-4952-954c-2ad4c4a57dd7","resolution":{"observed_at":"2026-08-14T12:55:12.381932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.361562Z","title":"The segmented and annotated iapr tc-12 benchmark","venue":null,"work_id":"55afcb19-3b71-4c40-88b8-95463b45dca2","year":null},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.361607Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:a85b2bb46369ae7a7572e8571e2369ebfee381a8ffe764924b0e2d613234fc87","observation_id":"8ad291f8-fb2f-4613-aab5-f888f5314bd2","resolution":{"observed_at":"2026-08-14T12:55:12.366049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.346659Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":"e4e34942-1c7b-412b-bde1-29b3293a4e9b","year":2010},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.365667Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:ed6b67f26e0e6ed03d045bf2609dc446ac3b8d3edb03cf7afefd05b33889e5ee","observation_id":"f6417af6-6172-4b19-a970-61fbe3ae60c8","resolution":{"observed_at":"2026-08-14T12:55:12.352034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.329811Z","title":"Unsupervised image captioning","venue":null,"work_id":"d92ad0e7-a0ff-4e2f-ab5a-857f68806718","year":2019},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.369425Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:a74add250b2e2385129783b57838a61976c8da51e25e556e2ab901c73eb6c687","observation_id":"187aed7b-f426-4b90-bd66-208d7662b5df","resolution":{"observed_at":"2026-08-14T12:55:12.336192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.311542Z","title":"Vqs: Linking segmentations to questions and answers for supervised attention in vqa and question-focused semantic segmentation","venue":null,"work_id":"63b9041e-c7c1-44c1-a1fb-656391cc92ae","year":null},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.373289Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:c6cf553cb5cfe84a8f263e90ec9a4731a61c454ae552cd5b5a6dcf9bcae7d7be","observation_id":"cb9af571-ebff-461d-9807-b6d3577a408d","resolution":{"observed_at":"2026-08-14T12:55:12.319128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.377370Z","title":"Fast r-cnn","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.377370Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:4b18ed96e225aa4a0728f53083d27733113e0faea34a7bdd36990614bbc93cae","observation_id":"9ecd650c-6ffa-4d03-826e-fe17c81a5ff3","resolution":{"observed_at":"2026-08-14T12:55:11.377370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.381665Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.381665Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:111ab9afcb4a24a16d6b13782d2e34496e3b41662b2280ba145062e10b144d56","observation_id":"fd625d7d-c626-4e1d-b36e-316cf87e4f57","resolution":{"observed_at":"2026-08-14T12:55:11.381665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.385359Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.385359Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:631c0029b650be0dee22c065f92c75c664c7cad96b9e9b4bf8811376421362a7","observation_id":"28fcd494-d121-4e93-9b04-ee4349de6536","resolution":{"observed_at":"2026-08-14T12:55:11.385359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.254459Z","title":"Seg- mentation from natural language expressions","venue":null,"work_id":"3f76deaa-d5ae-4e50-89d2-76d9319051eb","year":null},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.388957Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:270263106713392066782a56cc61e6679de67bfda8cbd4b50267ce09fda9fe51","observation_id":"8fc88fee-3d8b-4eb8-ac10-3c0ab2f1a0dc","resolution":{"observed_at":"2026-08-14T12:55:12.260855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.234912Z","title":"Natural language object re- trieval","venue":null,"work_id":"119769ed-bd3f-4d81-a09a-afa04bdabc84","year":2016},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.392648Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:cf1bb1d263059d5c29fab21b9a8add371100c930d64d4880ee89eb55c4993bf8","observation_id":"222ae0c5-03b3-49f2-8d1c-2f78c3652b4d","resolution":{"observed_at":"2026-08-14T12:55:12.239661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.221294Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":"3ac2c636-b755-46ed-8b45-a17a2f9469e9","year":2014},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.396644Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:beef788b823eacb4137945043d23d9f3500493fc1c7b9caa9af68e03ef43061c","observation_id":"84446249-5966-449f-809f-0f19c6a9ab14","resolution":{"observed_at":"2026-08-14T12:55:12.226138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.200996Z","title":"Deep attribute-preserving metric learning for natural language object retrieval","venue":null,"work_id":"7c935d5d-50d8-4253-a73e-1a93da92dc19","year":2017},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.401304Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:a8536458d699d6fafc7790e9577e2520f803d927fcc5c972a1a0db251c120e0f","observation_id":"0b43fd43-e575-4cd5-bf66-4f24bb53abfe","resolution":{"observed_at":"2026-08-14T12:55:12.206003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.186665Z","title":"Tell-and-answer: Towards explainable visual question an- swering using attributes and captions","venue":null,"work_id":"09e81565-a18a-4d3d-9b91-90653581acd4","year":2018},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.405066Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:779e5e021d5fcd1354b8d06be0abf2c0c827f82935d43cb0bb6b11c0bca5412b","observation_id":"4c223974-84cf-482f-98ec-037c79ddb607","resolution":{"observed_at":"2026-08-14T12:55:12.191684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.171017Z","title":"Feature pyramid networks for object detection","venue":null,"work_id":"7029d8ad-ddb0-4fb7-a614-43275d08c5f9","year":2017},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.409428Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:c08f3e45a59866c8dd1e3c47ae6fb52fad9797f669a907ca4b373188f68e985a","observation_id":"d18cad78-f01e-4560-a100-11f0c9032862","resolution":{"observed_at":"2026-08-14T12:55:12.175903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.156071Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"468b02ef-d585-4ddb-b464-dfdbceef3379","year":2014},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.413337Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:8e7e59b6c2f779db5fd5eb6165dadc30888f590ad9506f5f723623db11f98288","observation_id":"6fac5db6-cba0-4b1e-a57a-dd20d40dcd04","resolution":{"observed_at":"2026-08-14T12:55:12.160594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.142335Z","title":"Recurrent multimodal interaction for refer- ring image segmentation","venue":null,"work_id":"aa6bd4ec-f0b2-42a9-8ef2-dd91c47f331a","year":null},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.417176Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:7b68baab9019c146b3cad9753f2810a7e1c4b08385ea89c7c5abfa3c41af5fec","observation_id":"4c25bc21-62a8-4614-b7b5-2201777f2f44","resolution":{"observed_at":"2026-08-14T12:55:12.147129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.127754Z","title":"Ssd: Single shot multibox detector","venue":null,"work_id":"a0ba5c8f-0cac-4f6d-9301-975bf3a0141f","year":2016},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.422367Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:1b29916ee70396967b2ceb71460af63a80d14131c355520f9388ef4679247da2","observation_id":"19c774fe-cff0-429a-8e74-44bc1e117a10","resolution":{"observed_at":"2026-08-14T12:55:12.132601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.114090Z","title":"Improving referring expression grounding with cross-modal attention-guided erasing","venue":null,"work_id":"5930f7fe-bd43-462e-8245-b61d8fc750cb","year":1950},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.426931Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:113c69888051a2153d6a4468f3df1a65c099dab5c1959a455006e2216b6fb533","observation_id":"64f5e608-c7fc-4b1d-913a-78539321dca1","resolution":{"observed_at":"2026-08-14T12:55:12.119086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.100702Z","title":"Comprehension- guided referring expressions","venue":null,"work_id":"42a350ba-1879-44d5-a4e1-7d638f673a07","year":2017},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.430923Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:4548fd12acc9200558f36cc2481b319ca982cfb23cf041a417208db971ad79ad","observation_id":"a4fe9a4b-7cb3-4612-adee-495f3f231ec7","resolution":{"observed_at":"2026-08-14T12:55:12.105696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.085666Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"21d2865b-fa1b-4d32-bf6d-cbc2ec84e659","year":2016},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.435330Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:7176e61025f2cbb22832b1ed60a8dc6f6e75f7dcbe273e74f1f97b62e0e9fd84","observation_id":"1941cfb0-e714-4f8f-91d3-048573786179","resolution":{"observed_at":"2026-08-14T12:55:12.090608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.068231Z","title":"Dynamic multimodal instance segmentation guided by natural language queries","venue":null,"work_id":"93cc9080-a54b-4acf-a7c7-c61832b5d6f4","year":2018},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.439580Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:d59ec19fdb105d3a521d479fd8a3aade4cc508d150cbd89abd1624606505a298","observation_id":"9f9cffbb-732e-48c1-ad5c-7ae37f593cf3","resolution":{"observed_at":"2026-08-14T12:55:12.074576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.052010Z","title":"Distributed representations of words and phrases and their compositionality","venue":null,"work_id":"c2ef0f98-e018-4503-9fa1-3009eeeb191d","year":2013},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.443547Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:f688655b4ceb444788ee48055d058d0e0db9f31d1aca591dd3de66232adff28d","observation_id":"16ac2ed0-d065-45a1-8545-846d0f8d0415","resolution":{"observed_at":"2026-08-14T12:55:12.056958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.003456Z","title":"Mod- eling context between objects for referring expression un- derstanding","venue":null,"work_id":"675aa1ed-ea5d-40e9-9a86-75126c956d0a","year":2016},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.447317Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:007f3aded7306f70497f7672c6aebd1a7a32b09fbd071beb0a984b326173fdc4","observation_id":"0a3d39b6-e267-4653-ba94-7f2ff6b1c7c3","resolution":{"observed_at":"2026-08-14T12:55:12.009148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.988434Z","title":"Im- proving the ﬁsher kernel for large-scale image classiﬁcation","venue":null,"work_id":"6ef77d8a-0aba-49f1-9d89-d517db0cec7d","year":2010},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.452326Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:1ea6716ebdae57095355181ecbd08f294c3a3a35134924e54e528fb0cb17680c","observation_id":"18a9c807-fa59-4e85-ac6f-192335e743ac","resolution":{"observed_at":"2026-08-14T12:55:11.992848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.970910Z","title":"Plummer, Paige Kordas, M","venue":null,"work_id":"fed357a3-7fcd-427e-afb7-6715ee9d73bc","year":2018},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.455860Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:7d631d9df77b90b8d03d9a6a7f2db7afab86d63fddc39b7ce99d5bd277a30d37","observation_id":"96cb83fe-95ff-4af1-9aff-9515bfc4be25","resolution":{"observed_at":"2026-08-14T12:55:11.978275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.954446Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":"f0ed94d6-83f8-4ba7-b9de-6ea3d73696fa","year":2017},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.459668Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:e69f3c154f102f9169430a8f0ed36fd7a696758dc5e3caa9d24cf7dac5a996c1","observation_id":"66963325-f148-41e7-b2b3-8e02c5019c84","resolution":{"observed_at":"2026-08-14T12:55:11.959536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:12.405596Z","title":"2, 3, 4, 5, 6","venue":null,"work_id":"b83e954b-ef19-4d89-9c96-94cf6fd671c0","year":2017},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.344484Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:484d7d94af53165b92fc4cc28f94fbc2c2efe5c68159ef94590579002e0375a3","observation_id":"d3ffc6f8-1ef1-432a-bf14-8a900638afb2","resolution":{"observed_at":"2026-08-14T12:55:12.411425Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.940602Z","title":"You only look once: Uniﬁed, real-time object de- tection","venue":null,"work_id":"1523e5ca-0f63-47d8-a326-00b39d5b7c6b","year":2016},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.464015Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:2a377e02f2a1900acf1e67d9acdad649bdbe2606eb0878baa4d9231033c16c65","observation_id":"9e487ade-84fb-47af-b04a-dee03f7e1bb5","resolution":{"observed_at":"2026-08-14T12:55:11.944856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.468168Z","title":"Yolo9000: better, faster, stronger","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.468168Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:2726de7a2ff0dba45400b17a6135057495e377d2797fc731f3327172f329e14d","observation_id":"9c23c48a-8026-4f80-a544-7eed6fe897f4","resolution":{"observed_at":"2026-08-14T12:55:11.468168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.02767","last_updated":"2018-04-08T22:27:57Z","snapshot_observed_at":"2026-08-15T16:54:48.034047Z","submitted_at":"2018-04-08T22:27:57Z","title":"YOLOv3: An Incremental Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.02767","snapshot_observed_at":"2026-08-14T12:55:11.472786Z","title":"Yolov3: An incremental improvement","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.472786Z"},"links":{"cited_paper":"/paper/1804.02767","citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:b3744568723900c9e3ce94bc09e2d6b6a27ebaf50f8898f0e5874a1d2c9f1074","observation_id":"bfcea0a0-7568-47da-a7a9-f3d425d8c0fd","resolution":{"observed_at":"2026-08-14T12:55:11.472786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.917598Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":"63a5d1ee-46e5-4609-9d37-51f42bd3d85c","year":2015},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.477553Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:70d95fc2018f438315b41925873460cb4bd9c3a3e0ac3e932e58a68889d36c17","observation_id":"80296cc4-afb9-4024-92b0-585812587c2f","resolution":{"observed_at":"2026-08-14T12:55:11.922562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.901247Z","title":"Grounding of textual phrases in images by reconstruction","venue":null,"work_id":"fe92bc18-fd9e-470e-a9d9-8eca4f81c95a","year":2016},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.482659Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:e3d487ae4544c7a8a015f18eb853bbe280796516b096d69fdc42fd0df58ab230","observation_id":"8e3070fc-ac99-4c2b-90cf-5141e0268048","resolution":{"observed_at":"2026-08-14T12:55:11.906492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.486610Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.486610Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:d215da361d5619b6fc24423a5eb36a71fbfe788678d176b658cd74f7852aaf57","observation_id":"67655938-7e62-4cb3-a054-765068d4ff21","resolution":{"observed_at":"2026-08-14T12:55:11.486610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.876186Z","title":"Faster r-cnn features for instance search","venue":null,"work_id":"066a8c3a-55c1-41a2-90c0-c9e834c350d5","year":2016},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.491009Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:c8d511ea1687627b35ee350267f67f34c89e1f80d3c805d54f4a42dee169f09a","observation_id":"c0adf11b-18ea-4ee6-9647-9d95e1a1673f","resolution":{"observed_at":"2026-08-14T12:55:11.880617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T23:20:42.336514Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-14T12:55:11.495992Z","title":"Very deep convo- lutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.495992Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:2786f6f21b0fa3c2adbd8a8dfbc4753b9f4e9b9af4dbbad5b14b9bbe33b30563","observation_id":"44ba2670-6622-49e1-9e43-d2a69daaab53","resolution":{"observed_at":"2026-08-14T12:55:11.495992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.858325Z","title":"Parsing with compositional vector grammars","venue":null,"work_id":"c3ad40f2-2206-44e1-a59a-77185aa75136","year":2013},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.500807Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:c98c0844921108846b62d672cfcce44c274d71467831440d238bf3ea2c26a238","observation_id":"40ea66b0-507d-4b0a-8047-4fb1352390eb","resolution":{"observed_at":"2026-08-14T12:55:11.867146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.840147Z","title":"Lecture 6.5-rmsprop: Divide the gradient by a running average of its recent mag- nitude","venue":null,"work_id":"5af0dcad-1a85-460e-80d0-aacc2bf16795","year":2012},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.505236Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:0e70e49547e3927478e245fa6503ee9f19dfb5501e91000609a5cddb62632151","observation_id":"0dfce907-d635-4953-a44a-9217be5e4aeb","resolution":{"observed_at":"2026-08-14T12:55:11.847627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.827356Z","title":"Selective search for ob- ject recognition","venue":null,"work_id":"011d61fd-dee9-4466-b071-636ab1232597","year":2013},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.510325Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:14581b789843ac44a516c86365e3d8ac167d9d8e49f1759254acdf08859cec1f","observation_id":"31881fdf-a29e-4f6d-b080-ece6dc0f7da6","resolution":{"observed_at":"2026-08-14T12:55:11.831025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.812346Z","title":"Learning two-branch neural networks for image-text match- ing tasks","venue":null,"work_id":"aa2ef84e-c833-4b71-948b-60a49d3436d0","year":2018},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.514598Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:fecbba5a13a09e0009599ee26242d22e3f8926a78051114ba1f70956b38084a9","observation_id":"0e7ca21b-75fb-4315-8bc4-dd85f4d95cc7","resolution":{"observed_at":"2026-08-14T12:55:11.817024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.799655Z","title":"Learning deep structure-preserving image-text embeddings","venue":null,"work_id":"395c8cd7-55cc-4798-8dc5-6491aba4291c","year":2016},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.519533Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:8ee8ae9a3d4171b3e44852889d797ffc38a8f6ac5285261c1a304e90f524df3e","observation_id":"c037a184-0240-48ed-a8de-68f1429fe6bb","resolution":{"observed_at":"2026-08-14T12:55:11.804316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.787224Z","title":"Interpretable and globally optimal pre- diction for textual grounding using image concepts","venue":null,"work_id":"cf525d39-f632-4ea7-8168-109f034954c5","year":1912},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.524365Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:c02cd9dbc18239f1c797406f1e6b63419a657404337f9fdb7253b1521a3cf0ea","observation_id":"c8ab59d5-af30-4df5-a47a-acb6405928f1","resolution":{"observed_at":"2026-08-14T12:55:11.791462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.773190Z","title":"Image captioning with semantic attention","venue":null,"work_id":"5d5cd6ac-a830-4288-9a5d-002f7b07c1d7","year":2016},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.529345Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:52f0e6e4383977df35417e645320faf3d9aab839e84a987c0619413698e1679f","observation_id":"695bafff-5894-4ec9-9066-06c88695cfda","resolution":{"observed_at":"2026-08-14T12:55:11.777497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.759189Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descrip- tions","venue":null,"work_id":"882a4aa1-6d6f-4c35-a64c-f6202796838b","year":2014},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.533648Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:c7a4964f6c876afaa6123d71489cb0b3507366fb5b823ea8c10664986fbf09f7","observation_id":"3431b645-d117-4ca9-85ab-5a477d600006","resolution":{"observed_at":"2026-08-14T12:55:11.763882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.745533Z","title":"Mattnet: Modular atten- tion network for referring expression comprehension","venue":null,"work_id":"82024a76-be32-4f20-b88e-69c97202f149","year":2018},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.539085Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:b48cda3040345fc230e0545fd61626437a6dd9fa5a9c79e377645604bf6ed0ea","observation_id":"73927b3c-a610-4203-b97c-486d57ce6b54","resolution":{"observed_at":"2026-08-14T12:55:11.750577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.732921Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"2d8d4aa9-2886-4ade-8fca-336ad70ddd14","year":2016},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.543205Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:dd7f5da9fc549846af7497c392b27c881234e1aa9d516d37b390a4e4c8c884d0","observation_id":"db96d21b-8c94-4b6d-9a64-8392ebff8f11","resolution":{"observed_at":"2026-08-14T12:55:11.737131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.718978Z","title":"A joint speaker-listener-reinforcer model for referring expres- sions","venue":null,"work_id":"b60290c2-db5e-4991-af19-1b1432a16628","year":2017},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.550258Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:bc1aca765cbcb949fc486084d4bb66a99251572cbb88ca998b36036093570eea","observation_id":"e6ca58b2-1d9f-4ede-93bc-5e407200082d","resolution":{"observed_at":"2026-08-14T12:55:11.723865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.703167Z","title":"Ground- ing referring expressions in images by variational context","venue":null,"work_id":"066d6dd9-585e-4324-8b0d-eda89cd77e3f","year":2018},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.554323Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:f70143d914af923452d2de3f7c69171c1d0d32ac04a7bb2ecc824ad349bab2bb","observation_id":"03ca5762-0428-479b-bc44-6e35477e2fa6","resolution":{"observed_at":"2026-08-14T12:55:11.708463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.687171Z","title":"Discriminative bimodal networks for visual localization and detection with natural language queries","venue":null,"work_id":"14adef6a-1a67-4681-a2ae-82743c76f5a3","year":2017},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.559020Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:8da2695e4c5fd7eab2f313713cd9396aee5ae58452562dece7777fa7aede45e7","observation_id":"f3832973-384d-4eb1-af96-7f5c0923950d","resolution":{"observed_at":"2026-08-14T12:55:11.692025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.672050Z","title":"Weakly supervised phrase localization with multi-scale anchored transformer network","venue":null,"work_id":"5919c3af-81d6-466b-8544-f7e964c3dc22","year":2018},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.563125Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:f58c18dc9d8891b45c3d82b95c6e7ebcbd12f5916fde5b1a1921de4893a344eb","observation_id":"079f9950-04a7-4442-a54c-4f7731c5c365","resolution":{"observed_at":"2026-08-14T12:55:11.677645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.658366Z","title":"Visual7w: Grounded question answering in images","venue":null,"work_id":"63fc7766-f3ec-43e0-8ef3-78a54cd50765","year":2016},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.567371Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:139e569d8b4e1abfc0a446bee3cb9088f06ade9d4ae250f7bd54f846008e4099","observation_id":"4f2fbce2-108d-4305-a01b-b37e19756b22","resolution":{"observed_at":"2026-08-14T12:55:11.663054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:11.641468Z","title":"testA” contains images with multiple people and “testB","venue":null,"work_id":"2a6b475a-e7d3-4101-9e43-dcc6c7f35bfd","year":2014},"citing_paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:11.572179Z"},"links":{"citing_paper":"/paper/1908.06354"},"observation_digest":"sha256:72139ae3284e3683a33dd3b0499515362644c0532181e2f52bd4835d309db380","observation_id":"5b78738a-f77f-4c7d-913d-ab60b6af7688","resolution":{"observed_at":"2026-08-14T12:55:11.648830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.06354","last_updated":"2019-08-18T00:25:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T04:43:09.052391Z","submitted_at":"2019-08-18T00:25:02Z","title":"A Fast and Accurate One-Stage Approach to Visual Grounding"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":8,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:1908.06354."}