{"as_of":"2026-08-17T05:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6addc8fee818ab7e70820af1c190c5d6e2a5b08479c58ba0eca59fdd3ba32fe1","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T12:31:49.466514Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.07129/citation-record","integrity":"/paper/1908.07129/integrity","json":"/paper/1908.07129/citation-record.json","paper":"/paper/1908.07129"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:50.288641Z","title":"Vqa: Visual question answering","venue":null,"work_id":"2e4c0566-8a6f-4a21-bec6-bcbf5bb4a021","year":2015},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.231081Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:123adb33a841643d6762ca494b29137c76a5536ea8081b064f97ec82e0e3f65f","observation_id":"afd06a1a-ce1b-464b-9b15-65da536eb6e4","resolution":{"observed_at":"2026-08-14T12:31:50.293539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:50.269967Z","title":"Zero-shot object detection","venue":null,"work_id":"4854a2ab-4b1e-4614-a7de-3f84ce348c79","year":2018},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.236575Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:84a4ab05bbde821b0dce4ab40252c275e0efd1dfa66edb9ca2540a1b9f090941","observation_id":"5c8f0bf8-c7c0-478e-b893-4a1455ca2223","resolution":{"observed_at":"2026-08-14T12:31:50.276234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:50.252113Z","title":"Mutan: Multimodal tucker fusion for visual question answering","venue":null,"work_id":"7ab9e0d8-6e36-460a-ad66-3173b251a223","year":2017},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.241322Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:5258ea8975715262e2588d5c872f176f7f3cdced5874fc2c9adf935f062a8eb6","observation_id":"53346dde-3245-4b8d-8533-9b161339f13e","resolution":{"observed_at":"2026-08-14T12:31:50.257474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:50.231173Z","title":"Block: Bilinear superdiagonal fusion for visual question answering and visual relationship detection","venue":null,"work_id":"437f5a83-219a-4bdf-be4e-9a27abe8c011","year":2019},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.247386Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:c9e90bedf91a1646d283885d3ce5edb2c3844b6fe881d743e76508cfa3016463","observation_id":"a9b5d66a-3f1c-460a-9355-af022f69b544","resolution":{"observed_at":"2026-08-14T12:31:50.238746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:50.206976Z","title":"AMC: Attention guided multi-modal correlation learning for image search","venue":null,"work_id":"81d21c91-1b3d-4c43-a8a9-29d87136457f","year":2017},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.252435Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:92f80a7967b04f4352d723abccfa6d10c6a80a94e3145f265af44dc9e2939d9b","observation_id":"dc9b3b58-82ae-4072-968f-05382d262bd5","resolution":{"observed_at":"2026-08-14T12:31:50.213379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:50.186395Z","title":"Knowledge aided consistency for weakly supervised phrase grounding","venue":null,"work_id":"cde6b1d1-4fd8-472f-90aa-50b6a2b08a65","year":2018},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.257506Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:cdf9f314f792530c993d28a186a6956330a50bc14797fcbcdbf1393debb950b2","observation_id":"7f5b03c9-e38a-4aa3-b583-b3918d6e8ed3","resolution":{"observed_at":"2026-08-14T12:31:50.192838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:50.168175Z","title":"Query-guided regression network with context policy for phrase grounding","venue":null,"work_id":"dd38c45f-cb58-426b-b86a-a18320f56c8e","year":2017},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.262971Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:3470326632173c0a91529b79aa9567dbc310e12b293b8ad83bc15f2293af7853","observation_id":"e2451f71-a8d5-4e4e-9010-6aa2fc46e2f7","resolution":{"observed_at":"2026-08-14T12:31:50.173585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:50.152372Z","title":"Guess- what?! visual object discovery through multi-modal dia- logue","venue":null,"work_id":"dc3d572b-638a-4bef-b1a5-f3e2b1a0bf6b","year":2017},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.268119Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:5d186865ff36eca269328edc01bb4430d1975c7d5dd6ffff24543ed81d264fd8","observation_id":"e1133799-ecdd-4c3e-8b1a-924b92e0888b","resolution":{"observed_at":"2026-08-14T12:31:50.157578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:50.134190Z","title":"Visual grounding via accumulated atten- tion","venue":null,"work_id":"116b7fac-aba6-4a7d-927b-cc55699b931d","year":2018},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.272636Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:6720d63dac3a4653f47e9c2bf446df2c3ceab2fd5dd0d64f7f0c813769d8bdd1","observation_id":"6fcf474f-5c15-4b63-837f-4d4c629bbff6","resolution":{"observed_at":"2026-08-14T12:31:50.139136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.277245Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.277245Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:4308aba64eb49f7669913e2c175bfd6eca7cd11d4fc9a1f755a88977ec1700d0","observation_id":"a08e85dd-1f75-4bfe-9916-1e3da253a8dd","resolution":{"observed_at":"2026-08-14T12:31:49.277245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:50.107597Z","title":"The segmented and annotated iapr tc-12 benchmark","venue":null,"work_id":"a6ece056-645f-46a0-8b82-b00cfdf2e3e2","year":null},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.281944Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:efcfbc8b687426330e587f04c65e5b2f13b29f5c167912edcf5f7e7efebde023","observation_id":"69b383f6-6805-471e-9671-76fb6e5504a2","resolution":{"observed_at":"2026-08-14T12:31:50.112502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:50.092118Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":"4ac482c6-6970-4e3a-8aa3-fb6d3784760d","year":2010},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.286988Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:91da716391cf7ef8461b75a64c1202bdf906dd0d6e71f1b6139d05c45027fa7d","observation_id":"7fe8b207-836b-41a8-a06b-f7dcd8978b53","resolution":{"observed_at":"2026-08-14T12:31:50.097186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:50.075623Z","title":"Multimodal com- pact bilinear pooling for visual question answering and vi- sual grounding","venue":null,"work_id":"02f5c8a6-feda-4b2c-a81c-6479acdfc98d","year":2016},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.291604Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:b7d3e1c882b5fd4e619a5f89421ca7bcf2419f334f5bc00fef3eec66c9f84110","observation_id":"77fcc18c-2706-4574-a5c7-522c42ce9cb1","resolution":{"observed_at":"2026-08-14T12:31:50.081038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:50.059317Z","title":"Open- vocabulary object retrieval","venue":null,"work_id":"fbf76d3e-05f2-41b0-8be6-95b10392c15e","year":2014},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.295997Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:155c8fe4a255751e14803cad46952dfd5d25f98ec3739e5073a6e6a05c529080","observation_id":"bf7dcfce-324e-487a-9590-fdad95911c63","resolution":{"observed_at":"2026-08-14T12:31:50.064219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:50.043814Z","title":"Mask R-CNN","venue":null,"work_id":"ba1c2af7-742b-476b-9c27-581e980e1852","year":2017},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.300289Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:83c99d9af945d48ba9def07bfc9d5c75cb9c9c4c05f6d5dd5f62a89f4346061d","observation_id":"308bb3e8-578d-40c2-9a81-7c2f268868d4","resolution":{"observed_at":"2026-08-14T12:31:50.049173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.304673Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.304673Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:fbc015361cc21a06e812316c0d7fcd5c0eaddec5d48b170fdefb6c427ffb2cba","observation_id":"275528d3-6e75-4108-a536-6fb4d73fda6d","resolution":{"observed_at":"2026-08-14T12:31:49.304673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:50.017085Z","title":"Long short-term memory","venue":null,"work_id":"8fb40190-eaaf-41cd-8a61-65753c202ce9","year":1997},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.309213Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:3a7235edb46d24e41b408485bb3591d69a4499bd1d1816f6a0262c0ac000415f","observation_id":"681c2e5a-1d06-48c6-a627-219b201cb6a7","resolution":{"observed_at":"2026-08-14T12:31:50.021859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:50.001804Z","title":"spacy 2: Natural lan- guage understanding with bloom embeddings, convolutional neural networks and incremental parsing","venue":null,"work_id":"4285bb76-af11-4d7e-bd74-5791ac9aa6eb","year":2017},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.313680Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:432535e90d34d25867e4c2f362d6fac99990881813bbee098af350f2ea957846","observation_id":"4b07b69f-9517-4769-9cf5-77a93be125cd","resolution":{"observed_at":"2026-08-14T12:31:50.007167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.986554Z","title":"Natural language object retrieval","venue":null,"work_id":"5a92c59c-3759-42fb-9d29-08fc473f51a2","year":2016},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.318288Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:3e0d6fb486d6d8cd00787970612cba093a9aff701f49d02a46ac8af99e328c35","observation_id":"07d300a1-c568-4fda-934d-46e3d6a31b77","resolution":{"observed_at":"2026-08-14T12:31:49.991744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.970531Z","title":null,"venue":null,"work_id":"9c3af9d5-8ae8-4751-87b1-c71c72dd7134","year":2014},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.322742Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:31f82a874182949bd4e65ad62083e3b750447a155765fbe13230b3912e170a9e","observation_id":"ea538cdc-6858-47e4-b291-e0ff82e4d502","resolution":{"observed_at":"2026-08-14T12:31:49.976225Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.955075Z","title":"Hadamard product for low-rank bilinear pooling","venue":null,"work_id":"3728987f-dfbb-4275-9ceb-254cf432c8ad","year":2017},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.327001Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:b42464aad273962085d576ebd7667b44528734c02f23bd72e048a037f2aa2639","observation_id":"6a1f09f2-03ce-4e00-af89-05a6fde3f1dd","resolution":{"observed_at":"2026-08-14T12:31:49.960034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.331309Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.331309Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:0a07abb306572b69f3c92a984d369d674ade5f1b8b29f555899e078679f4955c","observation_id":"a9ff9dfa-2787-4a8c-83c0-7142237927d3","resolution":{"observed_at":"2026-08-14T12:31:49.331309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.929314Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":"1152a000-d462-48b4-9a8c-540d3a859bc0","year":2017},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.335706Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:926622ad784152ad37f86b889ad4cc5404c2fe5509cf9d6434c51010a131374e","observation_id":"2c65dd90-d03f-4b11-8c93-04901462e3a5","resolution":{"observed_at":"2026-08-14T12:31:49.934380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.914220Z","title":"Deep attribute-preserving metric learning for natural language object retrieval","venue":null,"work_id":"feb8ff66-8325-4d9f-af69-cf611be76ee8","year":2017},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.339830Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:3d91923b387ee680f056461276ecf8f5e98cdbe2a94248d0212bd2d99ee2b5c8","observation_id":"3cfadab4-8dc0-48f2-91fa-eebe2a68fe1d","resolution":{"observed_at":"2026-08-14T12:31:49.919307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.900280Z","title":"Scene graph generation from objects, phrases and region captions","venue":null,"work_id":"3c976c5d-c9f2-42ee-b21a-33bb2312dab7","year":2017},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.344454Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:69497890e5676765b5a03e199c83a0b0e0769a87d568eb0752b3c57d79f8a17f","observation_id":"5fc4288d-3abd-40ed-b1e3-08dd1e68929c","resolution":{"observed_at":"2026-08-14T12:31:49.904862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.885183Z","title":"Feature pyramid networks for object detection","venue":null,"work_id":"c7dd25ec-9d9d-4dac-9939-a00e9e9a51a0","year":2017},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.348992Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:f72de60f914f13a2026de08afc4c73ca4194110c24140fd046b8f90ce68247ee","observation_id":"f7e97634-eb98-4862-8c03-37584b6f74da","resolution":{"observed_at":"2026-08-14T12:31:49.890725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.870585Z","title":"Focal loss for dense object detection","venue":null,"work_id":"284b9b4b-9dbd-4689-87c4-12f04c022db8","year":null},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.353416Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:bb2ad3fcd0639fdf6bb40d666e5684026265e02af600320abcc7a60b6b5bf586","observation_id":"16d62828-93e3-4d72-8034-4f95bc7335c4","resolution":{"observed_at":"2026-08-14T12:31:49.875448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.856001Z","title":"Bilinear cnn models for ﬁne-grained visual recognition","venue":null,"work_id":"b32df3de-3367-4a4d-83fc-891dd07ae3a1","year":2015},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.358729Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:d3f3e0268fb5d255fb1a8b964ccedd2d310a44b8b6c039782cbf528055a5bba3","observation_id":"00839f7b-9e9c-4c9e-bf06-9c651cee3088","resolution":{"observed_at":"2026-08-14T12:31:49.860588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.839846Z","title":"SSD: Single shot multibox detector","venue":null,"work_id":"36c1e213-fca6-4a97-abba-1213a29a7371","year":2016},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.363514Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:050799322dc5aa3f535e26af40c5fdad583b262f6101ee6ba140422fe4b8cb86","observation_id":"f30da546-55ad-404c-9a12-bb053f0daa12","resolution":{"observed_at":"2026-08-14T12:31:49.845268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.824720Z","title":"Neural baby talk","venue":null,"work_id":"3b9444fc-d285-438a-a109-fce8e3f250d8","year":2018},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.368092Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:b11f0e916929f7afa8ce3758eaccba591d0e50e91a68dcee172e0131266b7374","observation_id":"6dca9097-d02d-48b8-998d-6c4b0c5f0f95","resolution":{"observed_at":"2026-08-14T12:31:49.829385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.810678Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"d03e4664-aa9d-495f-a833-6f5008e079e7","year":2016},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.372686Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:9259faaebad3182b2ddf51dc542fbe53e029e15867d3629e1b26f5ad0742f507","observation_id":"22f7f556-f72c-4a77-bcfe-baea360de9de","resolution":{"observed_at":"2026-08-14T12:31:49.815320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.795984Z","title":"Wordnet: a lexical database for english","venue":null,"work_id":"a0abbf95-4f4c-4581-ba9e-219e3f8065e3","year":1995},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.376972Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:0c031a16874e583b824737353d3f2054f44f4aedc571dd1c77ca3e9c3852f5c0","observation_id":"4caaf742-216c-4f2f-99a1-f5bbb2311839","resolution":{"observed_at":"2026-08-14T12:31:49.800603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.781648Z","title":"Glove: Global vectors for word representation","venue":null,"work_id":"9aa572b2-1561-4758-b737-5e6be4d68dcc","year":2014},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.381443Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:095c88ff61f62c0ea781d47a477e573f39d0bf969040723cfc351f649687ea74","observation_id":"52c008ad-43de-436f-9882-53fec99fc5ff","resolution":{"observed_at":"2026-08-14T12:31:49.786452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.765952Z","title":"Condi- tional image-text embedding networks","venue":null,"work_id":"bff20098-53e8-43de-a28c-5133a2a83556","year":2018},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.385666Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:d6479fc19eb344239d6b25e2c915be3143726bd842dcd5eb3caf79afb5a7a96b","observation_id":"90d3daab-f4d2-4cb1-bac5-62cc6c8d1fb7","resolution":{"observed_at":"2026-08-14T12:31:49.772443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.390382Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.390382Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:6f1f9296783cd5f358f91a0f6ebb0ca27ca833185007bd20ddc48369e0195fb6","observation_id":"978aef90-dfe6-414c-b649-8ef97bef99b1","resolution":{"observed_at":"2026-08-14T12:31:49.390382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.742051Z","title":"You only look once: Uniﬁed, real-time object de- tection","venue":null,"work_id":"0e1c4c48-cda8-49a3-bbdb-1cc82ce413c1","year":2016},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.395208Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:f17b4a5900742d8cfc6fedbd4d96868f13edbd3dd25762ead0ea0102934630e2","observation_id":"6a1259bd-002e-4772-afb6-b899869ebc2a","resolution":{"observed_at":"2026-08-14T12:31:49.746884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.726545Z","title":"Yolo9000: better, faster, stronger","venue":null,"work_id":"11e40e49-5bc2-459b-83dd-4938856dabba","year":2017},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.399578Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:0924fb479765bb28bfeb80f27253de4559fb58b5583ee7774d7e8a79883de17d","observation_id":"f1e74265-e75a-4efb-8aaf-ca34a76334cc","resolution":{"observed_at":"2026-08-14T12:31:49.731502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.02767","last_updated":"2018-04-08T22:27:57Z","snapshot_observed_at":"2026-08-15T16:54:48.034047Z","submitted_at":"2018-04-08T22:27:57Z","title":"YOLOv3: An Incremental Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.02767","snapshot_observed_at":"2026-08-14T12:31:49.404038Z","title":"Yolov3: An incremental improvement","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.404038Z"},"links":{"cited_paper":"/paper/1804.02767","citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:de6ebaa75afddf95ac934bcbceae7e081f3dab7e17f51f68e53b502b3344508d","observation_id":"441e3acb-0e2b-41f4-b310-7ac57156bb5b","resolution":{"observed_at":"2026-08-14T12:31:49.404038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.711707Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":"e316151f-32a2-4229-aa9f-a1d98ccf42e8","year":2015},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.408858Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:c9b6c74007f6dea5431a9c733d5b18dd2cd7f8166d81192718d29ba6fbcdc0c5","observation_id":"1fc6974c-834b-4145-a4f4-366faad648d0","resolution":{"observed_at":"2026-08-14T12:31:49.716505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.696758Z","title":"Grounding of textual phrases in images by reconstruction","venue":null,"work_id":"a6cca9cb-e723-4058-9c69-bd3298376be3","year":2016},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.413092Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:3eef22aa50e8de3c985f2725b81a96f95642f165b8ba001f95494e92b920b594","observation_id":"907a7adf-2335-4c21-9590-edcfb0147d0c","resolution":{"observed_at":"2026-08-14T12:31:49.701877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.417662Z","title":"Imagenet large scale visual recognition challenge","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.417662Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:dc665562f7b29c5638c79f633fe86c561a1397f867aac9deb51853655db214a5","observation_id":"cd858970-fef2-446e-bd8c-a46bd18d5ac6","resolution":{"observed_at":"2026-08-14T12:31:49.417662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.672503Z","title":"Bidirectional recurrent neural networks","venue":null,"work_id":"96493a71-eae7-428d-9d59-75e25e70b04e","year":1997},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.422036Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:3206e78567fde77126e4d99666dd36a6880c1a476b6ecd5e91c117b5c119b3a1","observation_id":"84c83c91-53d6-43bc-b370-cc97066abff8","resolution":{"observed_at":"2026-08-14T12:31:49.677120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.658210Z","title":"Graph r-cnn for scene graph generation","venue":null,"work_id":"5cef6e55-5cd8-4cf3-b42d-f771c973e5e1","year":null},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.426688Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:abd82c0794f90b3bd447ccc75bc1bb1b5f79554a85e91faf2d802cd9304a39a0","observation_id":"2150ba32-7b35-4577-924e-c86f9524d32a","resolution":{"observed_at":"2026-08-14T12:31:49.662790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.643611Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descrip- tions","venue":null,"work_id":"fc57dcef-2092-4dfa-a296-08d5c2e7d7e4","year":2014},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.431664Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:f0767c5f7ce39732e8d991500383d75cf1fec43bb1b5daabbaf33aae54c62eb0","observation_id":"b5470467-0998-40ef-97f2-8e3b429c0bde","resolution":{"observed_at":"2026-08-14T12:31:49.648402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.628860Z","title":"Mattnet: Modular at- tention network for referring expression comprehension","venue":null,"work_id":"75f1c032-cb7a-4753-8819-ce1e87e6bb82","year":2018},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.436012Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:c1d24586afd020790dbf27d922e2b552984130c065433ddadb92b9dc2f6b7213","observation_id":"0960c835-83b0-4bf8-8bb3-229e244d8065","resolution":{"observed_at":"2026-08-14T12:31:49.633657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.613103Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"9093a50b-a294-4dfc-b232-76bb9ebc7de9","year":2016},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.440341Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:c6193171a51dbb80e907043fc6766635c457a54d98a8264269dfb3c1ad998fce","observation_id":"a50e3143-6f53-440a-b4c7-7fd81996a391","resolution":{"observed_at":"2026-08-14T12:31:49.618447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.597224Z","title":"Multi- modal factorized bilinear pooling with co-attention learning for visual question answering","venue":null,"work_id":"5839a0e7-87b0-4a83-a404-910d35c5e6f9","year":2017},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.444533Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:3734fdc5afa0978d02d6630be2eab8335b33caed425ee2284e4990d1f9a35575","observation_id":"0cf8054e-b273-4b8c-a203-a800c59c9c53","resolution":{"observed_at":"2026-08-14T12:31:49.602455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.581314Z","title":"Beyond bilinear: generalized multimodal factorized high-order pooling for visual question answering","venue":null,"work_id":"e45cbfad-33e3-471e-9508-f1a6bd9c91e9","year":2018},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.448928Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:0ee5d43090324a43eeb794a5896b1cda7f59a4e75f5a87f7aa787facc12d1adb","observation_id":"2baa27b7-d9da-4ed4-bbc9-a8f949fb3345","resolution":{"observed_at":"2026-08-14T12:31:49.586556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.565555Z","title":"Rethinking diversiﬁed and discriminative proposal generation for visual grounding","venue":null,"work_id":"f8db99b1-323d-467d-9342-28e90b4bca06","year":2018},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.453159Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:7a7bd83268ac44625a842058aed404ed88a3d22cf8e266051b6d51b8788ec793","observation_id":"696c8180-4b00-4959-a57d-737ca0e8bb50","resolution":{"observed_at":"2026-08-14T12:31:49.570562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.550741Z","title":"Grounding referring expressions in images by variational context","venue":null,"work_id":"363e7580-0c8c-40a0-9d44-640f2e5d7cca","year":2018},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.457344Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:3576eff87ec0ccea6ff661557256319f101847405ce52238ec605bc78f8c647e","observation_id":"cbf73751-cc21-4390-98a9-6d539c738215","resolution":{"observed_at":"2026-08-14T12:31:49.555654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.531698Z","title":"In- terpretable visual question answering by visual grounding from attention supervision mining","venue":null,"work_id":"24d0092c-eb4c-47cf-a05c-88f4ccd82257","year":2019},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.461898Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:1b615f04170f626e4a25215dd1bd534c0fa3bdb73df5969f7c0ed1c02be26682","observation_id":"16e923e5-fcd2-466b-97c2-c27540b4237f","resolution":{"observed_at":"2026-08-14T12:31:49.537440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:31:49.515634Z","title":"car” and “cars","venue":null,"work_id":"f6cfdefb-fd04-40f9-9c31-8a751c233884","year":2018},"citing_paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T12:31:49.466514Z"},"links":{"citing_paper":"/paper/1908.07129"},"observation_digest":"sha256:52fc86c9fb4a76bfc1a8587f18a7e53dc7a285976c2a825052b3fcba3837daad","observation_id":"4ca5deaf-fa4c-4cd8-893e-3e508e8bd19f","resolution":{"observed_at":"2026-08-14T12:31:49.521322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.07129","last_updated":"2019-08-20T02:07:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T09:27:49.070158Z","submitted_at":"2019-08-20T02:07:14Z","title":"Zero-Shot Grounding of Objects from Natural Language Queries"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":45},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:1908.07129."}