{"as_of":"2026-08-15T11:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:52611dbfb201fe36aad97f8b9f8d1f5d27e78b868db446eafde4dddf4082ec75","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T14:19:11.407540Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.03409/citation-record","integrity":"/paper/1908.03409/integrity","json":"/paper/1908.03409/citation-record.json","paper":"/paper/1908.03409"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1807.06757","last_updated":"2018-07-18T03:28:02Z","snapshot_observed_at":"2026-08-14T11:12:04.949259Z","submitted_at":"2018-07-18T03:28:02Z","title":"On Evaluation of Embodied Navigation Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.06757","snapshot_observed_at":"2026-08-14T14:19:11.119168Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.119168Z"},"links":{"cited_paper":"/paper/1807.06757","citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:6c7220b46b694ed929e405ad6023d5962ee3869c0d384669f250f05919ab7080","observation_id":"4ca3a9ef-a873-45fe-87d3-6477a2f6686a","resolution":{"observed_at":"2026-08-14T14:19:11.119168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.465840Z","title":"Vision-and- Language Navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":"9cd3c2d5-75ca-4138-a276-ff1a7b3c080b","year":2018},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.126454Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:21d9756b33dfe8c975498ddf2bcde0a7b1406adb9a79ef54b6ee27517ee1bc89","observation_id":"d66bc0d8-8957-4a79-9cab-3931c2707c47","resolution":{"observed_at":"2026-08-14T14:19:12.471471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.445657Z","title":"Antol, A","venue":null,"work_id":"7694bc12-c102-4c3c-9918-060419d23a83","year":2015},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.133722Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:3e082c2e12b51b3aedf106b83d33f937d61994068b28cb6b1726e77ab0cd6fe2","observation_id":"faa70d35-0050-45e0-b60c-b64025140b7c","resolution":{"observed_at":"2026-08-14T14:19:12.450905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.428467Z","title":"A framework for behavioural cloning","venue":null,"work_id":"8ca7949d-97e7-430e-8856-409c05dd6278","year":1995},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.139657Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:feca86fc73bd171a33141bbee73faf7e39ef77ed69c4a31432dabf6e6f3b55bb","observation_id":"341838b6-d8bf-4161-9697-baeacd275943","resolution":{"observed_at":"2026-08-14T14:19:12.433784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.409697Z","title":"Pre- diction, cognition and the brain","venue":null,"work_id":"9e2c6c4a-c8fb-4b54-95c0-4dc14daad110","year":2010},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.146609Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:d932b701d54c2135ae62798fcce08375575b205c65fad009a06fd89d9afb7b16","observation_id":"3c21a7ec-8f2a-4a78-ae6a-c970bd309726","resolution":{"observed_at":"2026-08-14T14:19:12.416315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.391073Z","title":"Matterport3D: Learning from RGB-D data in indoor environments","venue":null,"work_id":"1b531a37-acb4-4a7c-8f5a-918d0c499128","year":2017},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.153427Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:9598890a61391b5a6fbe906165833196c4a3ce631f9431f588087f4a7267cb15","observation_id":"4a9b3ebd-e9bb-4e38-b8b7-169898bcaa54","resolution":{"observed_at":"2026-08-14T14:19:12.397683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.368529Z","title":"Fol- lowing formulaic map instructions in a street simu- lation environment","venue":null,"work_id":"d8ad7aca-12d4-4254-b0e7-969472a2625f","year":2018},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.160600Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:874cfa3110146ed6e48cf0495c8d77db7980f6111b4fe901507297c97a098e50","observation_id":"8685371d-43af-43de-9e4c-86891f969140","resolution":{"observed_at":"2026-08-14T14:19:12.375342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.00627","last_updated":"2016-08-01T21:53:04Z","snapshot_observed_at":"2026-08-14T21:45:52.158397Z","submitted_at":"2016-08-01T21:53:04Z","title":"Learning Transferable Policies for Monocular Reactive MAV Control","version":1},"cited_work":{"arxiv_id":"1608.00627","doi":null,"metadata_source":"pith","pith_arxiv_id":"1608.00627","snapshot_observed_at":"2026-08-14T14:19:11.600329Z","title":"Learning Transferable Policies for Monocular Reactive MAV Control","venue":"cs.RO","work_id":"3a0b4d98-7058-403f-80d6-22b4d3492a20","year":2016},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.166962Z"},"links":{"cited_paper":"/paper/1608.00627","citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:b1001be1f318310ea0a056fa1af10a051c1a17fabc39b07d7b68d9f113d78198","observation_id":"670e568d-83dc-4ca6-8c15-1beffc4d5c88","resolution":{"observed_at":"2026-08-14T14:19:11.606364Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.344281Z","title":"Moura, Devi Parikh, and Dhruv Batra","venue":null,"work_id":"c6669329-07cb-4a70-80cf-14bcd0282aaa","year":2017},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.174068Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:1b9d1da6c8ee097ea092f9fd65cb3969e17f41c679881a4ff70df59b38f49691","observation_id":"3e21dc95-b895-426c-bbab-56cd59ecfb7b","resolution":{"observed_at":"2026-08-14T14:19:12.351647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03367","last_updated":"2018-12-23T22:42:59Z","snapshot_observed_at":"2026-08-14T18:54:03.911041Z","submitted_at":"2018-07-09T20:05:24Z","title":"Talk the Walk: Navigating New York City through Grounded Dialogue","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03367","snapshot_observed_at":"2026-08-14T14:19:11.179655Z","title":"Talk the Walk: Nav- igating New York City through Grounded Dialogue","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.179655Z"},"links":{"cited_paper":"/paper/1807.03367","citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:a310d0ee9ef7340639a6835df9e9514fbe72d9777faf311e60c3db3ecfab88a9","observation_id":"35e0a59a-86dd-4076-b338-1b3feefee9df","resolution":{"observed_at":"2026-08-14T14:19:11.179655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.322018Z","title":"Optimal perceived timing: Integrating sensory information with dynamically updated expectations","venue":null,"work_id":"6b8c49c8-4287-4a65-92cd-10c41d027485","year":2016},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.186018Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:06bb37fb2a35cbad71cb1225a6b2e6cda7b31f90d43edda64ac608c9df02e32f","observation_id":"ed7fa6fa-8428-446b-9280-2dffbf9a8f4e","resolution":{"observed_at":"2026-08-14T14:19:12.331171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.300444Z","title":"Donahue, L","venue":null,"work_id":"65175406-de4a-43b1-8645-897214907889","year":2017},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.193586Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:8a66dba0260c6e90a9cdda66e7dd571b3fa7e23131da73734a0d2e44e976de41","observation_id":"3f152cc0-e59c-46cd-9336-b9ab3210b861","resolution":{"observed_at":"2026-08-14T14:19:12.307427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.275408Z","title":null,"venue":null,"work_id":"2624c514-e081-416a-ac7d-cdf7d12f0e55","year":2015},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.200210Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:62972e3e48f94daef2bf0220fffa1f97b06fc333d79c6562bbe29f18c6ef272b","observation_id":"1614c3ca-37e9-4d97-ba8a-d8a4eeb9f32a","resolution":{"observed_at":"2026-08-14T14:19:12.282670Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.256622Z","title":"Speaker-follower models for vision- and-language navigation","venue":null,"work_id":"f3a32ee3-50ff-4bc6-82e1-95690dc2fab2","year":2018},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.208250Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:b783737b4997382ff05346e1ad61e795143f3b8797bba9e86d9486b5c9c0ef3f","observation_id":"60a95a36-8e3e-4354-86ec-2c58d5c5b8c4","resolution":{"observed_at":"2026-08-14T14:19:12.262343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.08008","last_updated":"2018-11-19T22:23:59Z","snapshot_observed_at":"2026-08-14T17:56:30.174932Z","submitted_at":"2018-11-19T22:23:59Z","title":"End-to-End Retrieval in Continuous Space","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.08008","snapshot_observed_at":"2026-08-14T14:19:11.214599Z","title":"End-to-end retrieval in continuous space","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.214599Z"},"links":{"cited_paper":"/paper/1811.08008","citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:2a3517da265881ba896b9a289244fc58db43c2d14ddf2b1a68dd3d845ea7632e","observation_id":"28331094-57a3-47da-81f5-a17999152111","resolution":{"observed_at":"2026-08-14T14:19:11.214599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.236225Z","title":"Girshick, Jeff Donahue, Trevor Darrell, and Jitendra Malik","venue":null,"work_id":"87f75ea9-5d0f-45a7-80b9-e66cb1ec348b","year":2014},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.221766Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:74c7f91153ff053eed852dbbef25e68ab3ae01282e8603de119ee31c7f0907c5","observation_id":"1b861484-879b-464d-8fa7-29174e7b1386","resolution":{"observed_at":"2026-08-14T14:19:12.242161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.217465Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"af472bcf-7574-4a93-9915-f4fa06dddd11","year":2016},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.227571Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:21d7e8e1e3dd9e10ecfa187dd2cd20ebfc19cddb9e84dddc9764197d91be6e52","observation_id":"9cf15d99-9a0a-4597-8a6b-72b8acf382ec","resolution":{"observed_at":"2026-08-14T14:19:12.224239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.194217Z","title":"Howard, Nicholas Roy, Anthony Stentz, and Matthew R","venue":null,"work_id":"25334102-c422-41f4-b329-88ece6894a24","year":2015},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.233120Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:7a3a773d947b2a3813998fdb2f5683107e79598e13e897c7bc66100188e0ae65","observation_id":"8a58c6b0-cd30-4cd2-9ffd-f7268985f628","resolution":{"observed_at":"2026-08-14T14:19:12.200570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00401","last_updated":"2019-11-21T22:38:35Z","snapshot_observed_at":"2026-08-14T17:08:54.730216Z","submitted_at":"2019-03-01T16:50:02Z","title":"Learning To Follow Directions in Street View","version":2},"cited_work":{"arxiv_id":"1903.00401","doi":null,"metadata_source":"pith","pith_arxiv_id":"1903.00401","snapshot_observed_at":"2026-08-14T14:19:11.528002Z","title":"Learning To Follow Directions in Street View","venue":"cs.AI","work_id":"badbd262-0a45-4a0b-b1e2-1a8cd6642d5e","year":2019},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.239882Z"},"links":{"cited_paper":"/paper/1903.00401","citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:13519c8ff3f9bc84666b43360c93be8f16c535f591d0ebbfc18114f419eabd4f","observation_id":"e96c25a2-f218-439a-955e-b3c3e3896ebf","resolution":{"observed_at":"2026-08-14T14:19:11.536817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.173920Z","title":"Long short- term memory","venue":null,"work_id":"c30f3298-b007-4d03-9022-4d1416d9caf9","year":null},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.245632Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:033911d759b6426673fe03361b8f7de533ceb6fe344101343a5be7ad1190cd45","observation_id":"805b5679-27db-4032-8fef-eaa01907d0d5","resolution":{"observed_at":"2026-08-14T14:19:12.179454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.153301Z","title":"Segmentation from natural language expressions","venue":null,"work_id":"a60b04cf-43fe-4a3a-b1cd-f75a74602c77","year":2016},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.253116Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:7bf9dfba41a0b19946e85263be0ba809a76f7f5fcd88ab5e87df66a795aea364","observation_id":"58d8c99a-14a4-4376-856c-866ac19d34fe","resolution":{"observed_at":"2026-08-14T14:19:12.162181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.135162Z","title":"Multi-modal discriminative model for vision-and-language navigation","venue":null,"work_id":"a9f31a1c-4951-406b-be3d-c67c7f58687f","year":2019},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.258985Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:5e130c1607d056988d3581a33bb79ca663b983267182b87cb5c1f7f38d043059","observation_id":"3b75a289-9de2-48e8-9e21-68f81480624c","resolution":{"observed_at":"2026-08-14T14:19:12.141081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.118386Z","title":"Deep visual-semantic alignments for generating image descriptions","venue":null,"work_id":"cbb2308b-dedd-4b2f-a648-246fe2d6d1dd","year":2015},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.265041Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:733b9a6ec8d275613fba2970d028ecd4fb876d04dd8953a9dc76a1ce85a53716","observation_id":"4d6f2199-80b8-43b3-a450-5c62fd86f94a","resolution":{"observed_at":"2026-08-14T14:19:12.123816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.098468Z","title":"Self-monitoring navigation agent via auxiliary progress estimation","venue":null,"work_id":"5260db90-6bd7-48f3-873c-3faa84409d0f","year":2019},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.271858Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:09c36b79a8192658e22567af5349461134bd20c201310b375403b126dd7bb9da","observation_id":"1452f6ec-fa82-474d-aff0-775007d17ada","resolution":{"observed_at":"2026-08-14T14:19:12.104517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.074188Z","title":"The regretful agent: Heuristic- aided navigation through progress estimation","venue":null,"work_id":"e02d8692-b839-4f59-af1c-28cc6275ad70","year":2019},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.276925Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:716caac3e7557879187f64eabd8b21296a752f5e4fc73ead0982f86ab65a3655","observation_id":"e358715e-22f6-433a-b221-d529ec1aa216","resolution":{"observed_at":"2026-08-14T14:19:12.082224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.054722Z","title":"Walk the talk: Connecting language, knowl- edge, action in route instructions","venue":null,"work_id":"e71cfd4b-df48-4003-97d8-5def20815849","year":2006},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.283362Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:096ed5dd7eebabc2393cec78d79d56ec729aa1a3e713a06d3839b40718d661f8","observation_id":"9760fe42-5c10-47d3-971f-0f5899d66a71","resolution":{"observed_at":"2026-08-14T14:19:12.060487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.035530Z","title":"Yuille, and Kevin Murphy","venue":null,"work_id":"37214d94-94fc-4610-a1df-4f787e6f5839","year":2016},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.288760Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:a3555f869387e2b02fb43c643cf1d821802ca0187401a9c1350f6207dd56d381","observation_id":"50e99ed7-a15f-4679-bd94-1ff291b03a35","resolution":{"observed_at":"2026-08-14T14:19:12.040851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:12.018023Z","title":"Grounded language learning: Where robotics and NLP meet","venue":null,"work_id":"0a252f5c-c6fe-429e-b9f3-2f12eabdbdce","year":2018},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.293814Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:bacd18108c538b3a26d15265e4f49d0c89042427ca5cacf215d96a73159f6342","observation_id":"8e186d58-e3d8-4e78-a584-92ddcc3345c3","resolution":{"observed_at":"2026-08-14T14:19:12.023588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:11.993598Z","title":"Learning to nav- igate in cities without a map","venue":null,"work_id":"f21ae542-7b6d-46e9-aa18-e6d6507580a3","year":2018},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.299826Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:33a2bdd2896e9224ca9cf41f2f7330b9d0133736b05a92fd2060ce2c58cf91e5","observation_id":"475ffa7a-c893-4ff8-b491-190bbf236cdb","resolution":{"observed_at":"2026-08-14T14:19:12.001906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:11.959290Z","title":"GloVe: Global vectors for word represen- tation","venue":null,"work_id":"f5bf783c-6a7f-46e6-b3e8-a457997112b5","year":2014},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.304689Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:183ea6f241b537ec14bb7f151945c1cfd185da01bc5cc4245bdd115025e4d1c5","observation_id":"a0e41960-6f16-42a4-97df-dbf7d3ba4bf1","resolution":{"observed_at":"2026-08-14T14:19:11.967093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:11.937009Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":"718b18ac-665f-444a-9c77-b3baef4f37c1","year":2015},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.309896Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:a1805b89c25ec12affcca03eceed80facf80025a28746fa24b57c62858cdaf96","observation_id":"90192a8a-397b-49c3-8809-c9283596ee65","resolution":{"observed_at":"2026-08-14T14:19:11.943264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:11.911852Z","title":null,"venue":null,"work_id":"05c1bde3-a5a6-4dd0-88e8-b57ec2315d77","year":1997},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.315769Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:db54f60654ab142d0f5bdb367730932a52de599ee6b404c5e58ac5f5ae07c328","observation_id":"bf93a4c8-8411-4a43-8f6a-bc0844882ee8","resolution":{"observed_at":"2026-08-14T14:19:11.919833Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:11.884588Z","title":"A survey of available corpora for building data-driven dialogue systems: The journal version","venue":null,"work_id":"2757f6ad-f276-4a88-b4b5-c03a27d73e9b","year":2018},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.320991Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:bfd666da35cba8e408811b0c0af5c7c2aa57722824d623802dbb5d3cd59e45c9","observation_id":"1e0c0de9-8e88-4c90-8513-39941aa2cbeb","resolution":{"observed_at":"2026-08-14T14:19:11.891699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:11.860522Z","title":"Learning to navigate unseen environments: Back translation with environmental dropout","venue":null,"work_id":"a74f7834-f955-4212-b90a-7a95762ae284","year":2019},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.326538Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:d4cd26d314908476ca1f345aee1c50c65b8856c097ba12d929a3c05c16f37af8","observation_id":"2bb91e95-dcfe-413c-bb98-0b9a6267fe2d","resolution":{"observed_at":"2026-08-14T14:19:11.869767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:11.839800Z","title":"Visual represen- tations for semantic target driven navigation","venue":null,"work_id":"00099cfe-de85-4855-b272-88740afa93ff","year":2018},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.331732Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:caee3d98e634a6551b82e187e2409b22c96e0141598a7bb0dcfd3f44723ae28c","observation_id":"339a8912-e055-4e5a-90e4-4168db9edcae","resolution":{"observed_at":"2026-08-14T14:19:11.845846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-14T14:19:11.337497Z","title":"Rep- resentation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.337497Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:3fd38ad2523c0ec4ad93477e9f7690781daeb1be44b89f2b13b9e8bd8226d1b6","observation_id":"544fac11-47d1-473e-acbd-dbbf55c5285f","resolution":{"observed_at":"2026-08-14T14:19:11.337497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:11.820080Z","title":"Show and tell: A neural image caption generator","venue":null,"work_id":"71952000-eb11-4ca4-ae68-b4bbefa3ad9c","year":2015},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.344785Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:d718e9b04b2f6b5557ae810f49951704f3d10a0f5b56fa1153bc5ec51dc8c002","observation_id":"033f22e3-9ceb-4a3a-96f6-e8a5b7685841","resolution":{"observed_at":"2026-08-14T14:19:11.826135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:11.795266Z","title":"Video captioning via hierar- chical reinforcement learning","venue":null,"work_id":"e75705a1-8b25-4c12-b250-9ada0c5f39ef","year":2018},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.351938Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:9e0cdd8f96cdacec7f3d82c5968a1a0929d014dbc0b76f254d8507a27c20b3b5","observation_id":"f643b55d-115a-4579-9068-7af0d9fc9592","resolution":{"observed_at":"2026-08-14T14:19:11.805430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.10092","last_updated":"2019-04-06T05:43:50Z","snapshot_observed_at":"2026-08-14T17:54:03.495333Z","submitted_at":"2018-11-25T20:49:58Z","title":"Reinforced Cross-Modal Matching and Self-Supervised Imitation Learning for Vision-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.10092","snapshot_observed_at":"2026-08-14T14:19:11.359505Z","title":"Reinforced cross-modal match- ing and self-supervised imitation learning for vision- language navigation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.359505Z"},"links":{"cited_paper":"/paper/1811.10092","citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:7bd7d9bae7160d52a0fd5ea062040b4ab85df236562da37290e407e8145625ec","observation_id":"80eefb52-59c7-4a15-8bac-d8dfbb4092ae","resolution":{"observed_at":"2026-08-14T14:19:11.359505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:11.771482Z","title":"Look before you leap: Bridg- ing model-free and model-based reinforcement learn- ing for planned-ahead vision-and-language navigation","venue":null,"work_id":"7b7d9d7b-5205-4b0b-b21b-829fdee2a555","year":2018},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.366180Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:4a446033c11d4049425c1169af26b34588e75234029a6aa7d4d494615d0e6449","observation_id":"c9486b45-6581-403c-b3dc-9d2cda7a1abb","resolution":{"observed_at":"2026-08-14T14:19:11.779931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:11.747666Z","title":"Williams","venue":null,"work_id":"d2539b25-2fa8-497b-b47d-6186703ab4fd","year":1992},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.372679Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:3e956bf067569fdf92709495b2acf057b20bf832bd72123fbe938e780dc111c6","observation_id":"3c844af7-b456-47ab-93b7-48fec306f542","resolution":{"observed_at":"2026-08-14T14:19:11.755950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:11.720606Z","title":"Courville, Ruslan Salakhutdinov, Richard S","venue":null,"work_id":"4b4867dd-fb0d-4041-8018-c71004e25201","year":2015},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.379857Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:e71fe11e23610ece0a4c7d5f26c2d062a92b4cd3d79e3ef555e3b39093c5a8d3","observation_id":"49345936-bec0-49c5-853b-f808c47ba4b6","resolution":{"observed_at":"2026-08-14T14:19:11.726654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:11.702558Z","title":null,"venue":null,"work_id":"3091506a-9804-4ee7-ba27-ed1fdbe32d8f","year":2016},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.385627Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:3059160f8f2b09963586a5f74159ec23353ba0bb0ce53b6154449efb3bb87984","observation_id":"9553e5d2-ba09-4a6c-9bbf-6a047de59cdf","resolution":{"observed_at":"2026-08-14T14:19:11.708296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:11.684815Z","title":"Video paragraph captioning using hierarchical recurrent neural networks","venue":null,"work_id":"b0312ed2-1bad-4c66-88bb-8a5c1a54abf3","year":2016},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.393470Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:3c2b33f2492a10ee9628c67abd56729fe82527b992b7f4d845ce9620f8c04811","observation_id":"27ab8297-92be-493d-82eb-b4ab2aa7f09e","resolution":{"observed_at":"2026-08-14T14:19:11.690262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:11.661494Z","title":"Zeiler and Rob Fergus","venue":null,"work_id":"bece43ae-7807-40bd-a45d-a29380dd29da","year":2014},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.399683Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:8677220c88bbec9fcd0a656ad3bf7bd9eaf21b3c60d25499155414af60238fbb","observation_id":"3d2baa88-dbf4-46a3-b6ab-5aa573943c44","resolution":{"observed_at":"2026-08-14T14:19:11.668772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:19:11.641117Z","title":"Lim, Abhinav Gupta, Li Fei-Fei, and Ali Farhadi","venue":null,"work_id":"bb7fa70d-a500-422a-ae55-c4030ad01f28","year":2017},"citing_paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T14:19:11.407540Z"},"links":{"citing_paper":"/paper/1908.03409"},"observation_digest":"sha256:71eadfc95daefe389dec278acd3cf505c6594c89e4db3878ca7c1203f0682513","observation_id":"5223a639-628c-4df9-adea-5a34e3bb547f","resolution":{"observed_at":"2026-08-14T14:19:11.646883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.03409","last_updated":"2019-08-12T22:00:55Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T04:59:23.244242Z","submitted_at":"2019-08-09T10:58:01Z","title":"Transferable Representation Learning in Vision-and-Language Navigation"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":36},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:1908.03409."}