{"as_of":"2026-08-14T02:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:24f2f9bd7350d570582038b203860f2f35c88cd0cec73fe74a9ea542ec9a16ce","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T15:39:13.803571Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.01621/citation-record","integrity":"/paper/2606.01621/integrity","json":"/paper/2606.01621/citation-record.json","paper":"/paper/2606.01621"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":"Krantz, E","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:b7be800bfacc2f14984d4b5b6d1a407e4736ea6dca425b34796662032a282354","observation_id":"ed47e10c-4019-476b-8751-a18b3ba9bea0","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:509c591bef93a7359489dcbca815fc292edb3742d12aa60e946bfe9df9aa1e78","observation_id":"cfcb8d93-631f-47cb-9a8a-1e5ee07652e6","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:4ef30226d2780776d28de870e282392c62307a11d914df864afac25c4af54a51","observation_id":"da2181ec-3527-4b9a-b7ec-34d93dc88a36","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":"Chen, P.-L","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:b8ee88adeae1935db33200048ecda352abc91897d652036fb16837fb775d7726","observation_id":"2ba27dc8-4238-4477-82fd-f4db09a6e846","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:109bdbe92e4271ede28d3f71898a0ba3e076957a9c9851392a90a3e49768595d","observation_id":"a2a08eaf-6a4f-4698-af45-71a0c5bd71b5","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:97115ca78d78b6d3119c4b0323bcf5bfe3cd59bf086b53812626315bad5f4753","observation_id":"1ca1d131-1816-4016-b5f0-bde35ac7d86b","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:ad4c453fde7806bb202bb6366f43ee1c4077da5f27b933d0f85f57be70f69d6b","observation_id":"1b4d2021-d0b5-410e-8a46-da3395ebf5b0","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:9c57933927ea81a45d5d9a02fcf20bffd3d6d5e876f460ef1c482aaeaca712a7","observation_id":"4083be7d-303f-4c68-8617-346922122555","resolution":{"observed_at":"2026-07-01T22:16:15.776992Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:45675519d6fc031ac8b49354d9cc0db298e8c3f660a51e139044f13cd1c2ce11","observation_id":"ba468080-dd09-4a86-863d-a06394ca1d4a","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:1d6f307b795b4649f1238f870c2c08fee59cdd647111a180d6d01010199cf04e","observation_id":"f194b4a6-8f25-449e-ba7f-fd7e9d66a71e","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.10310","last_updated":"2026-06-29T06:58:00Z","snapshot_observed_at":"2026-08-14T00:56:31.163795Z","submitted_at":"2025-12-11T05:57:48Z","title":"Efficient-VLN: A Simple yet Strong Baseline for Efficient Vision-Language Navigation","version":2},"cited_work":{"arxiv_id":"2512.10310","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.10310","snapshot_observed_at":"2026-07-11T02:27:49.250637Z","title":"arXiv preprint arXiv:2512.10310 , year=","venue":"cs.CV","work_id":"b0629fcb-619e-4afe-b911-843cb720c910","year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/2512.10310","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:261e191f49bce2a31e090b6aa3f54e4e879656ab44907465b31c014d947f2128","observation_id":"4c633403-81c4-4d5d-9964-83703d2c29a5","resolution":{"observed_at":"2026-07-01T22:16:15.784820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:48.931160Z","title":"Janusvln: Decoupling semantics and spatiality with dual implicit memory for vision-language navigation","venue":null,"work_id":"5c872c6e-2d14-466d-8bf5-dcae48cf1d63","year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:8e0ae5287a4ef94b75bb1c498437d81e4f54cf7a7268585ea6ff6f3fcf2d16e1","observation_id":"105bdba0-1d4a-40d4-b7fd-0e75a0b3d0e6","resolution":{"observed_at":"2026-07-01T22:16:15.782327Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-08-06T17:32:08.916929Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"cited_work":{"arxiv_id":"2412.06224","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06224","snapshot_observed_at":"2026-07-11T02:27:49.380331Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","venue":"cs.RO","work_id":"13512be0-3aa0-406d-8602-a0edc0286028","year":2024},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/2412.06224","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:176fbf272d008891d483e6779b4d59e4e86dc7f91a6bc92d0c9054166486fcc1","observation_id":"d3e3e868-d9ce-46f4-9a86-2ea1138627f6","resolution":{"observed_at":"2026-07-01T22:16:15.785830Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:362cc06e0c118f82f02198ddfd00c892857c65b3f2db48ae0f26dbe0758982af","observation_id":"6140041d-f96a-4d2d-9946-5494867a5812","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-08-12T04:00:31.932219Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"cited_work":{"arxiv_id":"2402.15852","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.15852","snapshot_observed_at":"2026-07-10T08:47:01.956969Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","venue":"cs.CV","work_id":"a18e1283-0ce1-4c27-bf05-99efa4f917c4","year":2024},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/2402.15852","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:0549a0d422fb9b12c19a7f38db2365897c03a59b294a28a7a7b5a31b8460c078","observation_id":"39ef6771-1c38-4a75-b96c-7eb8ef563bdc","resolution":{"observed_at":"2026-07-01T22:16:15.780723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":"Zheng, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:6fc75012414b8e8ada99d07eb6923eb4ce5f14496b5effc083c49590b0f19a16","observation_id":"646697d6-d03b-411c-9bc8-3e2b6762ecd8","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-10T03:00:31.416194Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"cited_work":{"arxiv_id":"2509.10884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.10884","snapshot_observed_at":"2026-07-04T10:39:45.302935Z","title":"Nav-r1: Reasoning and navigation in embodied scenes","venue":null,"work_id":"bad70f4d-e39b-4222-93b8-ddeb973b2e9b","year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/2509.10884","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:22f93e1f769cc22ed25fae18ab168d54739b26d5320f67691cc3b5e5fb3614df","observation_id":"0554d21b-c375-44db-93b8-3ff12891f63a","resolution":{"observed_at":"2026-07-01T22:16:15.792458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-06T23:28:19.444744Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:bdb562107342ff0edc7d02ae44a7234b5e6e144661560297d2b79522e0619413","observation_id":"59072d98-3d15-47d9-b66f-d43b0980ef2a","resolution":{"observed_at":"2026-07-01T22:16:15.779796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:c48b67dd6c11baf233686f2e20e2f4fb60ce95835796c3c6135099e3b22935cb","observation_id":"b79fac24-9072-4f62-8a59-08199f454518","resolution":{"observed_at":"2026-07-01T22:16:15.795177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":"Zhang, X","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:0486d0d511bdeb90176b3f5fb335ea07948944fb1e05d2ffb8c7c353879a0c8b","observation_id":"5c571556-5ebb-449c-b0dd-62e03654da57","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:074ce55433b11d40917c45c3a767e5782ca9fa06e271f3048f261c68c571d8b7","observation_id":"72e8bbfd-b004-4845-bc57-09b029e17c02","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:48eab22d8994e4e16bd1ede7740830933a9671ccac6774c7e2656e984873b5fe","observation_id":"a9b05f50-df2f-4afc-9e3b-8c0b03ae5305","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":"Krantz, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:67675b52340b7d52e1aea7a8899dc0424b15c17aa5e21b4ff3f28219f66a3a8f","observation_id":"6116b56e-2c37-4042-8967-ff5e73b579a4","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":"Zhang and P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:bcb590fab2ec03f4ccccb550e2c00b31ad7d19ce57bd58dbb8e9ed10ceae2bde","observation_id":"9b89bd9e-37fe-4c3f-8d1b-0ec3d9d57c4a","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:8d1aa158df611a346b436d7af0f96ca77177d1c8698beaaf8a10fc1fab52490b","observation_id":"116fb1b3-902f-48a1-9c56-778e009d468b","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.08186","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:49.061789Z","title":"Available: https://arxiv.org/abs/2512.08186","venue":null,"work_id":"bb9f5bf8-8d63-4d67-9cc2-7f0fe65b4ade","year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:7fc6ee9271859e1334edff8beb99686d6a18d7a46169f4d2796ec5d3a2154256","observation_id":"d606d28a-193c-475c-90aa-19623f2d8fcc","resolution":{"observed_at":"2026-07-01T22:16:15.760263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:07:24.202581Z","title":"Omninav: A unified framework for prospective exploration and visual-language navigation","venue":null,"work_id":"3dab4811-a369-4aed-9612-71d164d55fb2","year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:312ac47eec4c6ca7b6deb3f506ae3d72a413bf5d594852ffda17db9664442c11","observation_id":"2f3a9db8-6490-40d6-9d3a-a088ab1164ef","resolution":{"observed_at":"2026-07-01T22:16:15.772160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:03916059e1d4ed943efae271f3a83bed3aaa63750a66274b34a0725cc74e6866","observation_id":"6a345a58-0e70-4d95-a39c-fdeb0f65fd65","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":"Anderson, Q","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:2bd55d1ad0366be7842036a88c94fc033d136fadcc4532f4bcf6ac35e5140b6a","observation_id":"7ddbd146-5d46-487c-b63d-2b2f01b9a5c5","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.20499","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T22:16:15.796201Z","title":null,"venue":null,"work_id":"662a2462-89b3-4132-b937-75c1dc3a0dab","year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:4c7969e90b43cf7a92d4b8f8ff220342b9af0cb83f4eb8bd2f9805ec95ef41e6","observation_id":"27f2de71-59ba-4d9a-9bda-19d617de9140","resolution":{"observed_at":"2026-07-01T22:16:15.797589Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04882","last_updated":"2024-06-07T12:26:34Z","snapshot_observed_at":"2026-08-12T23:47:55.777672Z","submitted_at":"2024-06-07T12:26:34Z","title":"InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment","version":1},"cited_work":{"arxiv_id":"2406.04882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04882","snapshot_observed_at":"2026-07-04T16:59:58.820576Z","title":"Instructnav: Zero-shot system for generic instruction navigation in unexplored environment","venue":null,"work_id":"163a5740-30e3-4ba4-a130-8dd5e26c10e7","year":2024},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/2406.04882","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:10def5f0f85a050069e734921c0b3bcd0d66c3f602438ecb9fa2413f568c465b","observation_id":"29b6bb46-a986-4301-9faa-3a26b00825ae","resolution":{"observed_at":"2026-07-01T22:16:15.775030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:d7b1d25665a5d6824dfdaf71de1f8b6a4c84f815db95c0b27a07a2ac124ee4b2","observation_id":"4ca7576d-9ab7-4086-9985-2499f2c502c3","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:79892c6665d0cf88d626d137e89ec58b536fd035976304705673e4e79afc117e","observation_id":"29549c67-446a-44db-8092-f6e34e2df5a2","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.19655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:29:56.725392Z","title":"Lavira: Language-vision-robot actions translation for zero-shot vision language navigation in continuous environments.arXiv preprint arXiv:2510.19655, 2025","venue":null,"work_id":"a159123d-a911-42cc-8d69-a5b14ed391b2","year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:48435670e8328ddc869a4d038c14756c766d711ca445c98da547a495260f89f9","observation_id":"c456f4c4-1de1-410d-9e4d-d8257080fc45","resolution":{"observed_at":"2026-07-01T22:16:15.766380Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:b62e7db011b9b8b583f3909321b71623431827a69a4e3336fdcd6c62cd171711","observation_id":"60cc2261-df9c-4b6d-b20d-93ca598fd1cb","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:e50d4b11291d35fd7a25170602355d1c316b3d80f7af459fb61dfd687b96d054","observation_id":"50f0a94c-1198-45b3-9253-195febb90e4a","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:215b2e912cb72f74846781c9ec26b51a3faa74d6ced92a3330ad189c01fcd454","observation_id":"a53e3467-2ebf-4883-bd59-f31437e91cf3","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:990cbe9ad611c081a1b1fc424fb4679344f32cb942cf8f2d72e49cd5ef3246fc","observation_id":"8bd0ef9b-11ce-447b-8058-32b9b1e5b9c1","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:5198f2ba2d2b7c84ac03ec4748c0f1b51aaae91a58423563a207e24dc915651f","observation_id":"fdfa657d-52a2-4241-a6b5-276416985707","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":"Wang and G","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:2582c5858ffe6ae1fb5ade4dc0fa8e695203d7d09bff6cde51377cddd73c8213","observation_id":"fa0d9b3e-528e-41f7-a1b8-e41cb379a7e7","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:eb84a88fdce94cdedd82d469ea89377c5d2c7ec475d152cbf58ec8d84be03977","observation_id":"2437a369-d933-4fb7-bc50-8d59455669c1","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09798","last_updated":"2024-10-14T04:48:18Z","snapshot_observed_at":"2026-08-12T23:42:57.144749Z","submitted_at":"2024-06-14T07:50:09Z","title":"Sim-to-Real Transfer via 3D Feature Fields for Vision-and-Language Navigation","version":3},"cited_work":{"arxiv_id":"2406.09798","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09798","snapshot_observed_at":"2026-07-01T22:16:15.770472Z","title":"Sim-to-real transfer via 3d feature fields for vision-and-language navigation","venue":null,"work_id":"d1a53bf2-6bce-425d-84c0-51f068f3870f","year":2024},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/2406.09798","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:6881fb4a5ccada1fa1f790c4a38a66c6675e79deebc9cfedd6456056d1e8cf96","observation_id":"09ea12b4-f5f7-4198-a492-f49e253a9cd7","resolution":{"observed_at":"2026-07-01T22:16:15.772018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":"Krantz and S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:a02ee0dc598e312a9bdd6d90dd99c914735167eff2e6d20fbed6ced0d2a918aa","observation_id":"a8b2540d-9d02-44a7-b8a5-f60781dfed23","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-14T00:58:55.999499Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:fef5f826cdf54170ddde77cd675a7e29137d6eba3f7b32cb6b00bfbf5f2bdc8f","observation_id":"b9f10a16-8489-4590-a084-9ff074af788f","resolution":{"observed_at":"2026-07-01T22:16:15.766063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:c4aa50adbdf507e42cd241e94ba5f85172854b9db3deae958aca317d9974360d","observation_id":"8f3ee617-d37b-4bea-8aa3-d1334d25792e","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":"Taioli, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:9a75f2d404646fbcbd3013da50d1b146033137d2c5563938cbc89165f4af91a9","observation_id":"ef7b1f38-c5a8-4a17-b757-1b99be3f53c1","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.12129","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:49.210222Z","title":"Embodied navigation foundation model","venue":null,"work_id":"12f41b76-9aed-4727-a532-07029f19a43c","year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:c762ce61b7f092f06ced2282bb0a426a245c36a8d4d7a69e3c34119563cbceec","observation_id":"2d860a80-5c48-4a35-8af5-c3d034e5ca47","resolution":{"observed_at":"2026-07-01T22:16:15.783511Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06158","last_updated":"2017-09-18T20:34:48Z","snapshot_observed_at":"2026-08-02T16:47:23.623541Z","submitted_at":"2017-09-18T20:34:48Z","title":"Matterport3D: Learning from RGB-D Data in Indoor Environments","version":1},"cited_work":{"arxiv_id":"1709.06158","doi":"10.48550/arxiv.1709.06158","metadata_source":"pith","pith_arxiv_id":"1709.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Matterport3D: Learning from RGB-D Data in Indoor Environments","venue":"cs.CV","work_id":"a6675134-1bd7-4d3f-9344-d7072e7449e9","year":2017},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/1709.06158","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:2b01b3c9cc3eaddee1b4515fb462505aef44065d1cee013d35e29d4270fd8c87","observation_id":"af4642a5-475d-4bc6-9e22-7c575a1583f2","resolution":{"observed_at":"2026-07-01T22:16:15.787173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:dbc16be0050824397449853a3f2a7b969b4cb3352f36187851d9fe312c06cdd8","observation_id":"57f56cac-78d8-4624-a174-67f40bfd4baa","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:77091991708fc6cfff70b533d41ee206e94b8034ef586e7314bd7af724f8c7ac","observation_id":"5109d1e3-b605-491b-86db-9dcbf0305c2d","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:7e255b58d23cb711020dec0322755634fdadeaf27336a4926e91f8361164d5f9","observation_id":"e31fb023-432c-4e81-9e89-b95f52cc936a","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:b06d9dccd071424e966a6a3ed90ee5e7dfb018978c7bcdd9582d8e6323f889da","observation_id":"9fdef271-621d-4350-a675-71c78912d932","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:c50e6b8b19217ae4b0937e6ae9ccd59e7fab7946be31713452e383d80225e61b","observation_id":"920fb44f-0f01-4007-b99a-02c5f7b0e1d1","resolution":{"observed_at":"2026-07-01T22:16:15.799842Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":"1608.03983","doi":"10.21203/rs.3.rs-7055642/v1","metadata_source":"pith","pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","venue":"cs.LG","work_id":"ad476478-c5ea-495b-a454-168c504bbfcc","year":2016},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:249849b582aacf304f9848eca9666885cefa36dc2a84cf05f55f935d901b422d","observation_id":"1ecbb519-fd59-4e6d-8f30-6c324cec795e","resolution":{"observed_at":"2026-07-01T22:16:15.789916Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:26fffe7a29043163a10ff5acb5d195012af06955bcd289c51f030284326fb8fe","observation_id":"0f15e94d-60c4-4c35-ba95-b0392d991ca0","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":"Rasley, S","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:8fa78dce3a8d9e98825d3f2db2dd4dca174d84570b58ae9d54eed1f1bb74926a","observation_id":"1de712ef-5482-4a92-9f07-f668a6956062","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:13.803571Z","title":"XXX, YYY","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:a0a908574d07235e1423bc44486ea16ae7813ace4f310e4d246eacdbf4685ad8","observation_id":"a089b734-913b-4f3d-afb7-a81813997f83","resolution":{"observed_at":"2026-06-28T15:39:13.803571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":20,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2606.01621."}