{"as_of":"2026-08-17T01:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1740e281cbed918a1c5771a1e3e6e491bc6c849c48c83f2ca38d710e26c8472","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T12:51:50.130298Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.06336/citation-record","integrity":"/paper/1908.06336/integrity","json":"/paper/1908.06336/citation-record.json","paper":"/paper/1908.06336"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:51:50.269575Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"c597ee14-ac03-44f7-8250-42e269e254a7","year":2015},"citing_paper":{"arxiv_id":"1908.06336","last_updated":"2019-10-22T19:03:21Z","snapshot_observed_at":"2026-08-16T15:35:50.704744Z","submitted_at":"2019-08-17T20:12:39Z","title":"What is needed for simple spatial language capabilities in VQA?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T12:51:50.088573Z"},"links":{"citing_paper":"/paper/1908.06336"},"observation_digest":"sha256:b7c198a3e267ecb64f062e0250be2ca2a3b4edd84ad2bb58adffd4b97ee58a48","observation_id":"1270a9a5-ce52-44d0-8fd8-c72545c7c2b5","resolution":{"observed_at":"2026-08-14T12:51:50.272851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:51:50.260306Z","title":"Learning to reason: End-to-end module networks for visual question answering","venue":null,"work_id":"c401548a-f75d-416b-b2e9-f0f3e07bf763","year":2017},"citing_paper":{"arxiv_id":"1908.06336","last_updated":"2019-10-22T19:03:21Z","snapshot_observed_at":"2026-08-16T15:35:50.704744Z","submitted_at":"2019-08-17T20:12:39Z","title":"What is needed for simple spatial language capabilities in VQA?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T12:51:50.092487Z"},"links":{"citing_paper":"/paper/1908.06336"},"observation_digest":"sha256:68e1355ae579b11f63623478538ecc5f67719eae2edff445b0d752d208b3f26a","observation_id":"a3c5d07f-69ba-449c-9cd3-81d42d2e5db2","resolution":{"observed_at":"2026-08-14T12:51:50.263901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:51:50.251364Z","title":"Hudson and Christopher D","venue":null,"work_id":"c31caed4-c758-43aa-a7ba-def7317a618b","year":2018},"citing_paper":{"arxiv_id":"1908.06336","last_updated":"2019-10-22T19:03:21Z","snapshot_observed_at":"2026-08-16T15:35:50.704744Z","submitted_at":"2019-08-17T20:12:39Z","title":"What is needed for simple spatial language capabilities in VQA?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T12:51:50.096183Z"},"links":{"citing_paper":"/paper/1908.06336"},"observation_digest":"sha256:d7a78279a0678fa60c22a0e35ce27140dc2df80de20f07d5def66a25e8dbc5d5","observation_id":"debc4da1-3e7d-4eea-b2d2-a60942b68be2","resolution":{"observed_at":"2026-08-14T12:51:50.254433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:51:50.242603Z","title":"Lawrence Zitnick, and Ross Girshick","venue":null,"work_id":"ffacd75b-1a1d-4c26-8794-f6b01cea40da","year":2017},"citing_paper":{"arxiv_id":"1908.06336","last_updated":"2019-10-22T19:03:21Z","snapshot_observed_at":"2026-08-16T15:35:50.704744Z","submitted_at":"2019-08-17T20:12:39Z","title":"What is needed for simple spatial language capabilities in VQA?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T12:51:50.099683Z"},"links":{"citing_paper":"/paper/1908.06336"},"observation_digest":"sha256:71a8e93ce39125e831b27263ee1382b80020148820a73d10deb19026840e25d3","observation_id":"034be91e-4d21-4ee4-8866-68b66cf0a199","resolution":{"observed_at":"2026-08-14T12:51:50.246041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:51:50.233130Z","title":"Inferring and executing programs for visual rea- soning","venue":null,"work_id":"6806934c-eeca-4138-b7d0-3efbad96cea9","year":2017},"citing_paper":{"arxiv_id":"1908.06336","last_updated":"2019-10-22T19:03:21Z","snapshot_observed_at":"2026-08-16T15:35:50.704744Z","submitted_at":"2019-08-17T20:12:39Z","title":"What is needed for simple spatial language capabilities in VQA?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T12:51:50.103235Z"},"links":{"citing_paper":"/paper/1908.06336"},"observation_digest":"sha256:41711d3eac9ada8f9928dfe88b132770ebee8931bf7044d9e1ec335b55689cf5","observation_id":"bdb221b6-0c17-43c2-ac4e-7ad356f183be","resolution":{"observed_at":"2026-08-14T12:51:50.236688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04517","last_updated":"2017-04-14T19:01:51Z","snapshot_observed_at":"2026-08-14T21:06:41.235721Z","submitted_at":"2017-04-14T19:01:51Z","title":"ShapeWorld - A new test methodology for multimodal language understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04517","snapshot_observed_at":"2026-08-14T12:51:50.106637Z","title":"ShapeWorld - a new test methodology for multimodal language understanding","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.06336","last_updated":"2019-10-22T19:03:21Z","snapshot_observed_at":"2026-08-16T15:35:50.704744Z","submitted_at":"2019-08-17T20:12:39Z","title":"What is needed for simple spatial language capabilities in VQA?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T12:51:50.106637Z"},"links":{"cited_paper":"/paper/1704.04517","citing_paper":"/paper/1908.06336"},"observation_digest":"sha256:168c820dbb9b30dc81842f34bc6327bda8e5adde41f5e4be8e6869e34a1e6eb9","observation_id":"b5f8e9fd-5729-4509-9b38-a0b31798e70a","resolution":{"observed_at":"2026-08-14T12:51:50.106637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:51:50.222973Z","title":"An intriguing failing of convolutional neural networks and the CoordConv solution","venue":null,"work_id":"579ccf8f-44bf-4013-b7cd-74f8bfb31be9","year":2018},"citing_paper":{"arxiv_id":"1908.06336","last_updated":"2019-10-22T19:03:21Z","snapshot_observed_at":"2026-08-16T15:35:50.704744Z","submitted_at":"2019-08-17T20:12:39Z","title":"What is needed for simple spatial language capabilities in VQA?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T12:51:50.110709Z"},"links":{"citing_paper":"/paper/1908.06336"},"observation_digest":"sha256:5dd0e1d2a9abf44eef6c0e3b5358823c0555ee337bc9a0020aa4f909962214a2","observation_id":"34d41f2c-1ef3-4c03-965a-9f685886a2c1","resolution":{"observed_at":"2026-08-14T12:51:50.227187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:51:50.212909Z","title":"The visual QA devil in the details: The impact of early fusion and batch norm on CLEVR","venue":null,"work_id":"871a537c-ebc9-431f-b42f-0eb0cf2779ba","year":2018},"citing_paper":{"arxiv_id":"1908.06336","last_updated":"2019-10-22T19:03:21Z","snapshot_observed_at":"2026-08-16T15:35:50.704744Z","submitted_at":"2019-08-17T20:12:39Z","title":"What is needed for simple spatial language capabilities in VQA?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T12:51:50.113934Z"},"links":{"citing_paper":"/paper/1908.06336"},"observation_digest":"sha256:2ab96b723d8c6d900f3317cef7797a167941dccc23fa8857d0ddb56c7d36eaf8","observation_id":"2ff7f002-23bf-495c-8b9f-7ca4293b3dad","resolution":{"observed_at":"2026-08-14T12:51:50.216514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:51:50.202667Z","title":"Transparency by design: Closing the gap between performance and interpretability in visual reasoning","venue":null,"work_id":"e380de0b-2200-4d55-aa34-981f248e1359","year":2018},"citing_paper":{"arxiv_id":"1908.06336","last_updated":"2019-10-22T19:03:21Z","snapshot_observed_at":"2026-08-16T15:35:50.704744Z","submitted_at":"2019-08-17T20:12:39Z","title":"What is needed for simple spatial language capabilities in VQA?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T12:51:50.117280Z"},"links":{"citing_paper":"/paper/1908.06336"},"observation_digest":"sha256:bc0911ce9cab9f6ba4e67aac21a4eb99b4387abeed93b614bcd15e232253f2df","observation_id":"cced3cac-9939-4f2a-bb84-29d3de31aa0a","resolution":{"observed_at":"2026-08-14T12:51:50.206412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:51:50.193224Z","title":"Courville","venue":null,"work_id":"2241f7a9-88e5-4ffe-bef8-07352f75fd71","year":2018},"citing_paper":{"arxiv_id":"1908.06336","last_updated":"2019-10-22T19:03:21Z","snapshot_observed_at":"2026-08-16T15:35:50.704744Z","submitted_at":"2019-08-17T20:12:39Z","title":"What is needed for simple spatial language capabilities in VQA?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T12:51:50.120707Z"},"links":{"citing_paper":"/paper/1908.06336"},"observation_digest":"sha256:941b77ae2fc5d19b8ce9982179c1bb4221e5a842d36364588b1e1e295e40908c","observation_id":"537d91c6-afb8-477c-b3df-dadc5de4c03c","resolution":{"observed_at":"2026-08-14T12:51:50.196498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:51:50.183395Z","title":null,"venue":null,"work_id":"168cd3d1-781e-498e-b108-23e13396d8cb","year":2017},"citing_paper":{"arxiv_id":"1908.06336","last_updated":"2019-10-22T19:03:21Z","snapshot_observed_at":"2026-08-16T15:35:50.704744Z","submitted_at":"2019-08-17T20:12:39Z","title":"What is needed for simple spatial language capabilities in VQA?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T12:51:50.123903Z"},"links":{"citing_paper":"/paper/1908.06336"},"observation_digest":"sha256:1ff6527fc600d11d624c4c2795a79d7effa15136263c835ff19143772863d4e5","observation_id":"9f6edb19-3c55-42d4-ba50-9fb83c13623e","resolution":{"observed_at":"2026-08-14T12:51:50.186887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:51:50.173081Z","title":"A dataset and architecture for visual reasoning with a working memory","venue":null,"work_id":"b13c3b89-f184-4f85-9592-6a290a46c802","year":2018},"citing_paper":{"arxiv_id":"1908.06336","last_updated":"2019-10-22T19:03:21Z","snapshot_observed_at":"2026-08-16T15:35:50.704744Z","submitted_at":"2019-08-17T20:12:39Z","title":"What is needed for simple spatial language capabilities in VQA?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T12:51:50.126987Z"},"links":{"citing_paper":"/paper/1908.06336"},"observation_digest":"sha256:883e8f191384b8111a92aecb90aa0f47d6ee81348d53f32c428f5d2765d9c6ed","observation_id":"c549683c-4f8f-4904-8b57-9ac304deffd7","resolution":{"observed_at":"2026-08-14T12:51:50.177406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:51:50.162188Z","title":null,"venue":null,"work_id":"20b7822e-c4ab-410b-bf68-9f338498d632","year":2016},"citing_paper":{"arxiv_id":"1908.06336","last_updated":"2019-10-22T19:03:21Z","snapshot_observed_at":"2026-08-16T15:35:50.704744Z","submitted_at":"2019-08-17T20:12:39Z","title":"What is needed for simple spatial language capabilities in VQA?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T12:51:50.130298Z"},"links":{"citing_paper":"/paper/1908.06336"},"observation_digest":"sha256:24c6dbf86804f32a24b7ce875f9eebc516bc402e5d407306552dddc7a7ef5e7b","observation_id":"c2cc1188-cf79-4913-8f0a-02345e2d1038","resolution":{"observed_at":"2026-08-14T12:51:50.166533Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.06336","last_updated":"2019-10-22T19:03:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T15:35:50.704744Z","submitted_at":"2019-08-17T20:12:39Z","title":"What is needed for simple spatial language capabilities in VQA?"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:1908.06336."}