{"as_of":"2026-08-21T11:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:39c37c52b18b07db49a25dd03f64217563f73c4b5fca3fa7ead9cc6ad1f204e6","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:31:43.099505Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:37:56.867359Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:39:45.302935Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"cited_work":{"arxiv_id":"2509.10884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.10884","snapshot_observed_at":"2026-07-04T10:39:45.302935Z","title":"Nav-r1: Reasoning and navigation in embodied scenes","venue":null,"work_id":"bad70f4d-e39b-4222-93b8-ddeb973b2e9b","year":2025},"citing_paper":{"arxiv_id":"2511.17097","last_updated":"2026-04-14T15:21:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-21T09:52:07Z","title":"Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T21:02:38.013115Z"},"links":{"cited_paper":"/paper/2509.10884","citing_paper":"/paper/2511.17097"},"observation_digest":"sha256:04c661c84fc7ce84ce78689574c0098f2a0a3778a5965437e219816d22d3131f","observation_id":"97f9a599-f2df-4782-be89-9de0fe60b0d1","resolution":{"observed_at":"2026-05-17T21:05:15.957964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"cited_work":{"arxiv_id":"2509.10884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.10884","snapshot_observed_at":"2026-07-04T10:39:45.302935Z","title":"Nav-r1: Reasoning and navigation in embodied scenes","venue":null,"work_id":"bad70f4d-e39b-4222-93b8-ddeb973b2e9b","year":2025},"citing_paper":{"arxiv_id":"2602.23058","last_updated":"2026-05-17T06:55:06Z","snapshot_observed_at":"2026-08-16T11:20:25.251810Z","submitted_at":"2026-02-26T14:42:53Z","title":"GeoWorld: Geometric World Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T11:39:15.308355Z"},"links":{"cited_paper":"/paper/2509.10884","citing_paper":"/paper/2602.23058"},"observation_digest":"sha256:211cbaf49f37a5b4b8321b7dc6dea1286d9741714ba68a574a85126fcda0350e","observation_id":"88d9edd0-b521-4645-a5e2-a78cab1f5504","resolution":{"observed_at":"2026-05-21T11:40:03.318232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.10884","snapshot_observed_at":"2026-07-15T13:51:30.008232Z","title":"arXiv preprint arXiv:2509.10884 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06445","last_updated":"2026-07-08T07:22:50Z","snapshot_observed_at":"2026-08-15T10:30:17.445130Z","submitted_at":"2026-03-06T16:37:15Z","title":"What if? Emulative Simulation with World Models for Situated Reasoning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-15T13:51:30.008232Z"},"links":{"cited_paper":"/paper/2509.10884","citing_paper":"/paper/2603.06445"},"observation_digest":"sha256:0e5929a9905e374c63ad0a10b4242a13963711192ca168a135878d1538c2cb6b","observation_id":"49ed771a-63d4-44aa-869a-bf3199c9295d","resolution":{"observed_at":"2026-07-15T13:51:30.008232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"cited_work":{"arxiv_id":"2509.10884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.10884","snapshot_observed_at":"2026-07-04T10:39:45.302935Z","title":"Nav-r1: Reasoning and navigation in embodied scenes","venue":null,"work_id":"bad70f4d-e39b-4222-93b8-ddeb973b2e9b","year":2025},"citing_paper":{"arxiv_id":"2604.17472","last_updated":"2026-04-19T14:53:38Z","snapshot_observed_at":"2026-08-16T05:00:13.858774Z","submitted_at":"2026-04-19T14:53:38Z","title":"UniMesh: Unifying 3D Mesh Understanding and Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T06:55:42.679323Z"},"links":{"cited_paper":"/paper/2509.10884","citing_paper":"/paper/2604.17472"},"observation_digest":"sha256:b0046ecb2fb81947a9af24b615e203ee276b325bb46bef8177c9a1eb6c348a17","observation_id":"2e017691-05b0-4605-b195-6456ffd25768","resolution":{"observed_at":"2026-05-10T06:56:47.345040Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"cited_work":{"arxiv_id":"2509.10884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.10884","snapshot_observed_at":"2026-07-04T10:39:45.302935Z","title":"Nav-r1: Reasoning and navigation in embodied scenes","venue":null,"work_id":"bad70f4d-e39b-4222-93b8-ddeb973b2e9b","year":2025},"citing_paper":{"arxiv_id":"2604.27620","last_updated":"2026-04-30T09:09:40Z","snapshot_observed_at":"2026-08-11T04:56:25.116086Z","submitted_at":"2026-04-30T09:09:40Z","title":"SpaAct: Spatially-Activated Transition Learning with Curriculum Adaptation for Vision-Language Navigation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-07T05:05:33.606975Z"},"links":{"cited_paper":"/paper/2509.10884","citing_paper":"/paper/2604.27620"},"observation_digest":"sha256:96ce3657ef7f021b75d4adfd4107a127e9e1df8672718d0ca187f69a2f08012e","observation_id":"62431785-4ba0-4496-82ef-121c8f058ed2","resolution":{"observed_at":"2026-05-12T10:36:31.239026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"cited_work":{"arxiv_id":"2509.10884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.10884","snapshot_observed_at":"2026-07-04T10:39:45.302935Z","title":"Nav-r1: Reasoning and navigation in embodied scenes","venue":null,"work_id":"bad70f4d-e39b-4222-93b8-ddeb973b2e9b","year":2025},"citing_paper":{"arxiv_id":"2605.22816","last_updated":"2026-05-21T17:58:26Z","snapshot_observed_at":"2026-08-15T08:15:33.417798Z","submitted_at":"2026-05-21T17:58:26Z","title":"AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T04:46:03.020800Z"},"links":{"cited_paper":"/paper/2509.10884","citing_paper":"/paper/2605.22816"},"observation_digest":"sha256:ba43e3ca52165feacacdf6d775137ec0c12f5f312adda8312be03c5ca2c8f980","observation_id":"fda16bb8-09bf-4837-98ef-0e06788b4967","resolution":{"observed_at":"2026-05-22T04:46:04.556035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"cited_work":{"arxiv_id":"2509.10884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.10884","snapshot_observed_at":"2026-07-04T10:39:45.302935Z","title":"Nav-r1: Reasoning and navigation in embodied scenes","venue":null,"work_id":"bad70f4d-e39b-4222-93b8-ddeb973b2e9b","year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/2509.10884","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:6d441a0fcc7291836d053cf4f9181c475585f7fc0a83d735c4d149056fa9a3e6","observation_id":"0554d21b-c375-44db-93b8-3ff12891f63a","resolution":{"observed_at":"2026-07-01T22:16:15.792458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"cited_work":{"arxiv_id":"2509.10884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.10884","snapshot_observed_at":"2026-07-04T10:39:45.302935Z","title":"Nav-r1: Reasoning and navigation in embodied scenes","venue":null,"work_id":"bad70f4d-e39b-4222-93b8-ddeb973b2e9b","year":2025},"citing_paper":{"arxiv_id":"2606.01788","last_updated":"2026-06-01T07:08:50Z","snapshot_observed_at":"2026-08-16T10:02:57.875119Z","submitted_at":"2026-06-01T07:08:50Z","title":"PlatonicNav: Unveiling Semantic Correspondence in Navigation with Platonic Topological Maps","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T15:35:47.290488Z"},"links":{"cited_paper":"/paper/2509.10884","citing_paper":"/paper/2606.01788"},"observation_digest":"sha256:40734e0539b7f8598ab8f94ef4565fbd5a775cdb87161111dd54de4cda3d661e","observation_id":"27e5eb30-faad-40e2-a406-af8102b2f0b9","resolution":{"observed_at":"2026-07-01T22:16:16.292609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"cited_work":{"arxiv_id":"2509.10884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.10884","snapshot_observed_at":"2026-07-04T10:39:45.302935Z","title":"Nav-r1: Reasoning and navigation in embodied scenes","venue":null,"work_id":"bad70f4d-e39b-4222-93b8-ddeb973b2e9b","year":2025},"citing_paper":{"arxiv_id":"2606.23557","last_updated":"2026-06-22T16:28:11Z","snapshot_observed_at":"2026-08-13T21:10:59.170997Z","submitted_at":"2026-06-22T16:28:11Z","title":"Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T08:38:46.044079Z"},"links":{"cited_paper":"/paper/2509.10884","citing_paper":"/paper/2606.23557"},"observation_digest":"sha256:5077852838e5e44ace7ff032c74794c2deb307f31e64df58a325064d6a708ff8","observation_id":"a20c37a9-863d-4104-b03c-1452e0c439c2","resolution":{"observed_at":"2026-07-04T10:39:45.305524Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.10884","snapshot_observed_at":"2026-08-01T17:36:38.963388Z","title":"arXiv preprint arXiv:2509.10884 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17599","last_updated":"2026-07-20T06:40:45Z","snapshot_observed_at":"2026-08-18T06:32:15.572226Z","submitted_at":"2026-07-20T06:40:45Z","title":"ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T17:36:38.963388Z"},"links":{"cited_paper":"/paper/2509.10884","citing_paper":"/paper/2607.17599"},"observation_digest":"sha256:3b976b4796a16d1846f15d80d2fc143f095ac1d119c42aa12647fa09df174ade","observation_id":"9a79b739-c8c8-4553-bd3a-b22fa893aa3d","resolution":{"observed_at":"2026-08-01T17:36:38.963388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.10884","snapshot_observed_at":"2026-08-05T00:37:56.867359Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00613","last_updated":"2026-08-17T03:56:53Z","snapshot_observed_at":"2026-08-20T23:12:42.842243Z","submitted_at":"2026-08-01T12:09:47Z","title":"From Failures to Supervision: DynamicEnvPlan for Robust Long-Horizon Embodied Planning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T00:37:56.867359Z"},"links":{"cited_paper":"/paper/2509.10884","citing_paper":"/paper/2608.00613"},"observation_digest":"sha256:5546909e723de661d69fddf8f1221537ff8e581a4b815e41b1809aad46573e2b","observation_id":"44927f04-6f27-4de1-a4f8-115fa830b0d7","resolution":{"observed_at":"2026-08-05T00:37:56.867359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.10884/citation-record","integrity":"/paper/2509.10884/integrity","json":"/paper/2509.10884/citation-record.json","paper":"/paper/2509.10884"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:38.015699Z","title":"Etpnav: Evolving topological planning for vision-language navigation in continuous environments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:38.015699Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:305858fb7789fc50f6d9ddff41c6a759480f70efc3c419e998de6a9463d504d4","observation_id":"9172adfc-2d8a-43c3-a5f0-634b92cc8ef4","resolution":{"observed_at":"2026-08-04T17:31:38.015699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:38.097078Z","title":"1st place solutions for rxr-habitat vision-and-language navigation competition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:38.097078Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:c3595cf9631a79ef13990e7130c816d6d49800dd8fd33b9027de5383379a8d01","observation_id":"2e9c351c-31e2-4a95-9f93-d2f390673c06","resolution":{"observed_at":"2026-08-04T17:31:38.097078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.06757","last_updated":"2018-07-18T03:28:02Z","snapshot_observed_at":"2026-08-14T11:12:04.949259Z","submitted_at":"2018-07-18T03:28:02Z","title":"On Evaluation of Embodied Navigation Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.06757","snapshot_observed_at":"2026-08-04T17:31:38.233100Z","title":"On evaluation of embodied navigation agents,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:38.233100Z"},"links":{"cited_paper":"/paper/1807.06757","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:1b91881deef08a32877f79cb058511085894b8d1ffa6f3eef17a9476da95c0bf","observation_id":"e5f9e844-943e-4711-8b47-28ccad9e35e8","resolution":{"observed_at":"2026-08-04T17:31:38.233100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:38.288992Z","title":"Vision-and-language nav- igation: Interpreting visually-grounded navigation instructions in real environments,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:38.288992Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:32f3d52c4a72da9c1f5fd48c5c0ea32113fd8864f4bd504842b57cf21bd69124","observation_id":"cc91307f-a7e1-4428-8e9c-da18fe07061b","resolution":{"observed_at":"2026-08-04T17:31:38.288992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:38.361054Z","title":"METEOR: An automatic metric for MT evaluation with improved correlation with human judgments,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:38.361054Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:2a7aaa5aacd6e8552fec232a4132f9153400b21e53fab791eb0ae930f1326df0","observation_id":"23ff8f06-21f2-4cd1-8235-fafc0c84e08a","resolution":{"observed_at":"2026-08-04T17:31:38.361054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:38.436966Z","title":"Touchdown: Natural language navigation and spatial reasoning in visual street environments,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:38.436966Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:81a6609dc9f7eb5d0599c1755cd6106b380688e993924e76c7eeee54be69727a","observation_id":"6e782dc0-a233-4efa-8b64-a8f9a6ff0242","resolution":{"observed_at":"2026-08-04T17:31:38.436966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05890","last_updated":"2024-08-20T14:51:04Z","snapshot_observed_at":"2026-08-16T13:36:11.028983Z","submitted_at":"2024-07-08T12:52:46Z","title":"Affordances-Oriented Planning using Foundation Models for Continuous Vision-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05890","snapshot_observed_at":"2026-08-04T17:31:38.519836Z","title":"Affordances- oriented planning using foundation models for continuous vision- language navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:38.519836Z"},"links":{"cited_paper":"/paper/2407.05890","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:be4999b1335678006ec6139475a2c1a26cd070ac3d4ad98f258da79b3dfce7fa","observation_id":"3316db8f-2fdf-471a-84bb-97e85e6cf18e","resolution":{"observed_at":"2026-08-04T17:31:38.519836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:38.581685Z","title":"Topological planning with transformers for vision-and-language nav- igation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:38.581685Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:f7d4011573fd5c887e05bf0acdefd57d2253c3ca3519fcf9f6423c7521ec5a76","observation_id":"2075cca1-eccc-4eb4-add4-fdf0a55ccfef","resolution":{"observed_at":"2026-08-04T17:31:38.581685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:38.637577Z","title":"Weakly- supervised multi-granularity map learning for vision-and-language navigation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:38.637577Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:c462d704bad15cd66bb3133db13955a6753bf71a37a039b1f9b6eebbc4445bdd","observation_id":"f0c570ea-291a-45ab-bc56-91c86b6ebf15","resolution":{"observed_at":"2026-08-04T17:31:38.637577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:38.725346Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding, reasoning, and planning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:38.725346Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:00ca17acc10d5d4ced4b549b149b20ff21baa89dd5ea7ffee48a2f7edfe0b0f8","observation_id":"43b2aefd-a524-479f-9283-2a0833a6ea5d","resolution":{"observed_at":"2026-08-04T17:31:38.725346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-17T17:58:31.496050Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-04T17:31:38.800522Z","title":"Navila: Legged robot vision-language- action model for navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:38.800522Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:a027ca6b421a81f63f08dcf4812fe7f499f970ef733c6ddcfaf2e5f0834af407","observation_id":"6eb69b24-e8c1-4332-bb3e-2b5f293abe54","resolution":{"observed_at":"2026-08-04T17:31:38.800522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T17:31:38.888941Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:38.888941Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:b10db25cabd84115bb9f0c16d4f84d40ff8c40933794681a2a1100ae47f0eb49","observation_id":"42acfbc0-67f8-47c0-bd2e-d0fe3db4194e","resolution":{"observed_at":"2026-08-04T17:31:38.888941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-18T11:39:58.156949Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09839","snapshot_observed_at":"2026-08-04T17:31:38.957862Z","title":"Octonav: Towards generalist embodied navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:38.957862Z"},"links":{"cited_paper":"/paper/2506.09839","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:bf1c34292c725d49be4294f1d176a5bfcee46b4931fc1fc9503a72bde4670a4e","observation_id":"b78c5329-05cb-4dbb-a73c-462fdf91d666","resolution":{"observed_at":"2026-08-04T17:31:38.957862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:39.022759Z","title":"Cross-modal map learning for vision and language navigation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:39.022759Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:a2697d5bfc2691e7f3c8178f84a3443479ad23837e4af561387a8812dea9420d","observation_id":"67359b30-e546-4933-ab67-470db9617423","resolution":{"observed_at":"2026-08-04T17:31:39.022759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00886","snapshot_observed_at":"2026-08-04T17:31:39.119379Z","title":"Gaussianvlm: Scene-centric 3d vision-language models using language-aligned gaussian splats for embodied reasoning and beyond,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:39.119379Z"},"links":{"cited_paper":"/paper/2507.00886","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:60402b6478c66a3aed122eb5f606022608590804c5abdcb7ee817c62452d0745","observation_id":"941fcaf6-8663-445f-965e-9853f84b77fd","resolution":{"observed_at":"2026-08-04T17:31:39.119379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:39.319240Z","title":"Bridging the gap between learning in discrete and continuous environments for vision-and- language navigation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:39.319240Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:8f50fdcb4a6848790e80d492aeecc534e472bacf17a69464b971b8024f5ce7f3","observation_id":"0dc4115e-6e5c-4817-a8cd-0453ef5cc48b","resolution":{"observed_at":"2026-08-04T17:31:39.319240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:39.454192Z","title":"Learning navigational visual representations with semantic map supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:39.454192Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:08359002aa9f130247af23234c024bd76881dedba6c181af5a7d456e36bfc196","observation_id":"65142323-e9d2-4686-9f15-1d8002bb251b","resolution":{"observed_at":"2026-08-04T17:31:39.454192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:39.578629Z","title":"3d- LLM: Injecting the 3d world into large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:39.578629Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:f4feab6f5341685ebf64a812b8ea17537a898388b4a5966cba61e897e3ea11d5","observation_id":"3b8f2fd8-4ada-4a09-90a3-1ec9417531ed","resolution":{"observed_at":"2026-08-04T17:31:39.578629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:39.760547Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:39.760547Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:5f3e688ce5d54a87b238e3397e7dd0bddf6f67223281881240e1276b688123bc","observation_id":"8684212a-62de-4537-aaba-81cb7432693d","resolution":{"observed_at":"2026-08-04T17:31:39.760547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:39.972130Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:39.972130Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:dd9b5361d95020a09429e668c4619fbbd62319696092754b4cbdc47f02558665","observation_id":"063c6902-dd40-43bc-97f8-58b43b96ae69","resolution":{"observed_at":"2026-08-04T17:31:39.972130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:40.120107Z","title":"An embodied generalist agent in 3d world,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:40.120107Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:df45da039645363e86165b15eaf3925a6ead7b9c696bc770261030cf79f01e2d","observation_id":"8a76b0c3-461a-4806-a01c-60d58674bb28","resolution":{"observed_at":"2026-08-04T17:31:40.120107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:40.255563Z","title":"An embodied generalist agent in 3d world,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:40.255563Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:3863d175865139fb7e73609ae85193d938f2065952622430a7a7ec6e75e92995","observation_id":"07d64188-5cf4-46a2-8aee-3c300e39b994","resolution":{"observed_at":"2026-08-04T17:31:40.255563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23478","last_updated":"2025-07-31T11:59:06Z","snapshot_observed_at":"2026-08-21T10:38:58.404819Z","submitted_at":"2025-07-31T11:59:06Z","title":"3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23478","snapshot_observed_at":"2026-08-04T17:31:40.400707Z","title":"3d-r1: Enhancing reason- ing in 3d vlms for unified scene understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:40.400707Z"},"links":{"cited_paper":"/paper/2507.23478","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:3ae4c6ce5b9c6e66dfac7c4d2fa48a40d3f2a5c17729e44127d26668c9ec97e0","observation_id":"3956be89-547f-4c8a-b341-c7ac0b8d38ce","resolution":{"observed_at":"2026-08-04T17:31:40.400707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09518","last_updated":"2025-04-13T11:10:47Z","snapshot_observed_at":"2026-08-16T12:41:39.195072Z","submitted_at":"2025-04-13T11:10:47Z","title":"3D CoCa: Contrastive Learners are 3D Captioners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09518","snapshot_observed_at":"2026-08-04T17:31:40.570298Z","title":"3d coca: Contrastive learners are 3d captioners,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:40.570298Z"},"links":{"cited_paper":"/paper/2504.09518","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:e2562e4cdcab3feb2a21209e2fd9979a4a7add60501a9963a2e6ee772bcabf44","observation_id":"23ae5b24-bd45-432a-82b0-285805b76064","resolution":{"observed_at":"2026-08-04T17:31:40.570298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-16T15:11:05.647544Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15232","snapshot_observed_at":"2026-08-04T17:31:40.726038Z","title":"Dc-scene: Data- centric learning for 3d scene understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:40.726038Z"},"links":{"cited_paper":"/paper/2505.15232","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:3c49b4c6312749f8fe21dc703763aa64aacd2b8ff50560c8eeb8e0236b70ff0c","observation_id":"1b58e7ea-5237-4524-a269-f9889b875a63","resolution":{"observed_at":"2026-08-04T17:31:40.726038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05446","last_updated":"2019-11-28T16:59:52Z","snapshot_observed_at":"2026-08-21T11:38:42.494787Z","submitted_at":"2019-07-11T18:42:03Z","title":"General Evaluation for Instruction Conditioned Navigation using Dynamic Time Warping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05446","snapshot_observed_at":"2026-08-04T17:31:40.857383Z","title":"General evaluation for instruction conditioned navigation using dynamic time warping,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:40.857383Z"},"links":{"cited_paper":"/paper/1907.05446","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:60e7620383cf5cfb7c938d18446f827e2220de258a250f6b365752d42dadd381","observation_id":"15de6308-2fec-4108-913a-09e0e13603e9","resolution":{"observed_at":"2026-08-04T17:31:40.857383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:41.009140Z","title":"Kahneman,Thinking, Fast and Slow","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:41.009140Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:6822393303438ab7ad6750c36a737e01b817383c5602db92cadc61d286078df5","observation_id":"9de62c38-ad49-43ae-aed4-6b9f364d512f","resolution":{"observed_at":"2026-08-04T17:31:41.009140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:41.151069Z","title":"Sim-2-sim transfer for vision-and-language navigation in continuous environments,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:41.151069Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:07404381225a228ecff96c29f0b4644960e5ec6e699f8e6dd003ff39fba43134","observation_id":"dcecca26-3e50-460a-9031-3c61370cb6f4","resolution":{"observed_at":"2026-08-04T17:31:41.151069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:41.289147Z","title":"Beyond the nav-graph: Vision-and-language navigation in continuous environ- ments,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:41.289147Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:b0203be15f21b7012c8fd92aaa68bc16b72f170facd4eda2ce3bcdf52cbbaff2","observation_id":"5facd0a3-2c14-45a7-b728-c1a7a37da7ad","resolution":{"observed_at":"2026-08-04T17:31:41.289147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:41.413264Z","title":"Room- across-room: Multilingual vision-and-language navigation with dense spatiotemporal grounding,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:41.413264Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:1baf0a28ec6f90f9f12637b8ead942d62352fd3baa3a477b3783f28e2c6bc345","observation_id":"5c492863-6ad6-4676-937f-c868caf15d54","resolution":{"observed_at":"2026-08-04T17:31:41.413264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:41.509811Z","title":"ROUGE: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:41.509811Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:75e04c916e5fcd16bc8de6b4a3244f564033533f3900baedf339ba6bb2428663","observation_id":"f07aa857-fecb-4ac9-9359-0008ce98d4da","resolution":{"observed_at":"2026-08-04T17:31:41.509811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04882","last_updated":"2024-06-07T12:26:34Z","snapshot_observed_at":"2026-08-16T13:45:10.310910Z","submitted_at":"2024-06-07T12:26:34Z","title":"InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04882","snapshot_observed_at":"2026-08-04T17:31:41.645023Z","title":"Instructnav: Zero-shot system for generic instruction navigation in unexplored environment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:41.645023Z"},"links":{"cited_paper":"/paper/2406.04882","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:ef07157f6ef3c7b9e1fb9ba394f63df5a77b016cc90820ae742a608c5184005b","observation_id":"82cb448a-2296-4dc1-9c56-378ad85f4af8","resolution":{"observed_at":"2026-08-04T17:31:41.645023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:41.767705Z","title":"Sqa3d: Situated question answering in 3d scenes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:41.767705Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:65e767c998bf83ffb1e40a90e9af5425f5cfdbf00f80aec09ed9c9cfb7c102c6","observation_id":"2d2375a5-f519-44b8-af75-1ba13ac3de8b","resolution":{"observed_at":"2026-08-04T17:31:41.767705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:41.897746Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:41.897746Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:752fdbb9580e9f046aedeba9848eae11cd6c81d7afe9de8399df04d01d9d203b","observation_id":"84864beb-e484-4b38-8b6b-743eb43bbe32","resolution":{"observed_at":"2026-08-04T17:31:41.897746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:42.059993Z","title":"Alvinn: an autonomous land vehicle in a neural network,","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:42.059993Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:63cc7af3e5cd64febc2a9c064c7a2104356a46de31765182b178937596a87e0b","observation_id":"5a43ff08-9bbf-436f-9b16-31ef267dc817","resolution":{"observed_at":"2026-08-04T17:31:42.059993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-20T10:30:07.225436Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-08-04T17:31:42.089676Z","title":"Vln-r1: Vision- language navigation via reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:42.089676Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:b615b4c9dfe781ab56e808793f1161b91e753b0ee8841a1ab0700433df8e0fa7","observation_id":"b85f0e97-f99f-4328-b6a6-3b51bc81b640","resolution":{"observed_at":"2026-08-04T17:31:42.089676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:42.223630Z","title":"Language- aligned waypoint (law) supervision for vision-and-language navigation in continuous environments,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:42.223630Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:829aefcb30daad52350265a8e50bc1d466388539ad07dd87176b4e6c75bbab12","observation_id":"caf002e9-44d8-4df7-9433-efcd2ef8560e","resolution":{"observed_at":"2026-08-04T17:31:42.223630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:42.316143Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:42.316143Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:31b6807076b2de3a7fc48115958e1e676ba1eb8354e7d4477be43ec9737c568e","observation_id":"a550668a-3a25-4dce-9394-98ccc23181a2","resolution":{"observed_at":"2026-08-04T17:31:42.316143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T17:31:42.321667Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:42.321667Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:db6f62ba7d0979e73302fd6a84db8806692691dc89e6ca72062005f04b3e20bf","observation_id":"207ca791-c1dc-4615-ad0f-89b40581fd5d","resolution":{"observed_at":"2026-08-04T17:31:42.321667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:42.415632Z","title":"Hazards in daily life? enabling robots to proactively detect and resolve anomalies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:42.415632Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:5e0f26288fc127338ad48bc7565c62547c6327bad6756436e982a013f938dcde","observation_id":"5ac44db6-3983-4df0-abac-761969d547e0","resolution":{"observed_at":"2026-08-04T17:31:42.415632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16517","last_updated":"2025-05-24T10:44:27Z","snapshot_observed_at":"2026-08-13T20:18:37.619057Z","submitted_at":"2025-05-22T10:57:07Z","title":"ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16517","snapshot_observed_at":"2026-08-04T17:31:42.500658Z","title":"Maniplvm-r1: Reinforcement learning for reasoning in embodied manipulation with large vision- language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:42.500658Z"},"links":{"cited_paper":"/paper/2505.16517","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:b58ddded8eb400469436be8b9087dbf33a5eac00708e927d60eb652815372bd2","observation_id":"fdb7487d-55ca-4d5f-8c8d-b70dd774a0d9","resolution":{"observed_at":"2026-08-04T17:31:42.500658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24477","last_updated":"2025-05-30T11:26:32Z","snapshot_observed_at":"2026-08-17T11:14:23.993370Z","submitted_at":"2025-05-30T11:26:32Z","title":"Evaluating Gemini in an arena for learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24477","snapshot_observed_at":"2026-08-04T17:31:42.588126Z","title":"Evaluating gemini in an arena for learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:42.588126Z"},"links":{"cited_paper":"/paper/2505.24477","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:209a259e85023d031ca0b4362eb3a0e2d5012a667d5d840f6e198c832057f519","observation_id":"f4842735-bac2-4fc9-a72d-259c01aeecf8","resolution":{"observed_at":"2026-08-04T17:31:42.588126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:42.648263Z","title":"Cider: Consensus-based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:42.648263Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:3021491190ddfdcc1a3b6d82ac014d635ab21d5caf135a62b9426c321755de86","observation_id":"ab7e0219-8c7e-4991-aa4a-d2d180a7e1e4","resolution":{"observed_at":"2026-08-04T17:31:42.648263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:42.686756Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:42.686756Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:a1f7a77c6190b0366de4b5fdc54970e29883a70cb2a764dde573e76f2b6e23bf","observation_id":"51c4d7bf-a5af-40ac-b5ad-eac161090364","resolution":{"observed_at":"2026-08-04T17:31:42.686756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16524","last_updated":"2025-07-22T12:32:35Z","snapshot_observed_at":"2026-08-18T10:31:05.809825Z","submitted_at":"2025-07-22T12:32:35Z","title":"Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16524","snapshot_observed_at":"2026-08-04T17:31:42.766632Z","title":"Spatial 3d-llm: Exploring spatial awareness in 3d vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:42.766632Z"},"links":{"cited_paper":"/paper/2507.16524","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:526866c5764693f46267adc30f89f821eed3d513cbf15f4be253e9c066e9ce52","observation_id":"80d294b2-9c95-457c-b096-5ae05da9346e","resolution":{"observed_at":"2026-08-04T17:31:42.766632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:42.821024Z","title":"Reinforced cross-modal matching and self-supervised imitation learning for vision-language navigation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:42.821024Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:0e93b1d3aeaf2e329f9b4ef9820fcc715de7aaef1cc38af3a64eadc8976c9042","observation_id":"af75a56a-cc84-4fa9-8f6e-7e740b2b5be8","resolution":{"observed_at":"2026-08-04T17:31:42.821024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:42.875262Z","title":"Looka- head exploration with neural radiance representation for continuous vision-language navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:42.875262Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:6416c69dae04441e3ff174a4326dc8d6668c077a8da9494669ba02e225980dd5","observation_id":"de4913cd-8648-42dd-9cb2-4802705fe941","resolution":{"observed_at":"2026-08-04T17:31:42.875262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:42.931648Z","title":"Gridmm: Grid memory map for vision-and-language navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:42.931648Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:9a15fdb8e9c8e19b41341a83e7d819506c9ef7ce07880c37ac71ec2694984fe9","observation_id":"4f41e7c9-efb9-49fa-8194-50ee39ceb4c5","resolution":{"observed_at":"2026-08-04T17:31:42.931648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-18T02:14:46.902275Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-08-04T17:31:43.003448Z","title":"Streamvln: Streaming vision-and-language navigation via slowfast context modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:43.003448Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:a6b047f208a1aceb4cd5a82d48e1dff4d5cd25390202a7adeeae24a604ec2389","observation_id":"4587285b-ab9f-4591-ad7c-fed4f4c6fc10","resolution":{"observed_at":"2026-08-04T17:31:43.003448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:43.051782Z","title":"Vlfm: Vision- language frontier maps for zero-shot semantic navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:43.051782Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:bde65893b1e8c9d674ee1727a955b6f76692872531c3d764ea61a8fb9844ebe7","observation_id":"d0766025-4193-4401-a796-2aeb7d174bd0","resolution":{"observed_at":"2026-08-04T17:31:43.051782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:43.068835Z","title":"Hm3d- ovon: A dataset and benchmark for open-vocabulary object goal navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:43.068835Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:c7876128aa979ad94bca68c1bd98fcdb71a632e3fe5d7d74e5a7fa40bfa7a778","observation_id":"86b88114-8f1c-4211-96a2-adee934fc2b5","resolution":{"observed_at":"2026-08-04T17:31:43.068835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10416","last_updated":"2025-08-14T07:39:26Z","snapshot_observed_at":"2026-08-17T08:30:16.378226Z","submitted_at":"2025-08-14T07:39:26Z","title":"CorrectNav: Self-Correction Flywheel Empowers Vision-Language-Action Navigation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10416","snapshot_observed_at":"2026-08-04T17:31:43.075074Z","title":"Correctnav: Self-correction flywheel empowers vision- language-action navigation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:43.075074Z"},"links":{"cited_paper":"/paper/2508.10416","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:3115394b02f86c110a651b8142dc1cff28753d67b3e9403e7bf3c4675ddb83ca","observation_id":"18c9cfa3-eaa7-4c14-a779-f7bfc39d3d36","resolution":{"observed_at":"2026-08-04T17:31:43.075074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:43.080070Z","title":"Uni-navid: A video-based vision-language- action model for unifying embodied navigation tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:43.080070Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:05d20841780573f8f7a8f66e1986c5d4a463f8ef592677c79a0c82d0b96aba4a","observation_id":"483c3ef8-5c46-46b4-9cdf-94715998569f","resolution":{"observed_at":"2026-08-04T17:31:43.080070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:43.085265Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:43.085265Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:d4ac7def526a475e1c9b8319067aa8686f39ba851978c8b98e87dbad5e8024ce","observation_id":"e4c176e0-1d5a-481b-93e5-fcec5e864b20","resolution":{"observed_at":"2026-08-04T17:31:43.085265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-19T10:09:56.914941Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01292","snapshot_observed_at":"2026-08-04T17:31:43.089996Z","title":"Lscenellm: Enhancing large 3d scene understanding using adaptive visual preferences,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:43.089996Z"},"links":{"cited_paper":"/paper/2412.01292","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:f0610ab25fda1cd6d3fc365ae0f8a1c81539605b32fa0cabfeadc871ee058042","observation_id":"c02b4ead-fde1-4b93-92b0-417ce4d8e435","resolution":{"observed_at":"2026-08-04T17:31:43.089996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:43.094703Z","title":"Soon: Scenario oriented object navigation with graph-based exploration,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:43.094703Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:e1762658871df107ce2221622bfa3c5daa3be58fec030dbb987b701a9a506581","observation_id":"b83fb881-773f-4c53-9d4f-2c5147686616","resolution":{"observed_at":"2026-08-04T17:31:43.094703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:31:43.099505Z","title":"Move to understand a 3d scene: Bridging visual grounding and exploration for efficient and versatile embodied navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:43.099505Z"},"links":{"citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:4c907ef09067806cd335834541b602a09626723ae43ea2e3e4a9951616997a32","observation_id":"bb929dca-8eb3-48cf-9b8c-ae16f8004149","resolution":{"observed_at":"2026-08-04T17:31:43.099505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T17:31:42.385017Z","title":"Available: https://arxiv.org/abs/2402.03300","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:42.385017Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:5f5ac49db75f0bc8a999511c45106051247563bd61865fc79b7bdac0938a782e","observation_id":"2136eca0-145a-4c23-91ed-2fd2d091fc05","resolution":{"observed_at":"2026-08-04T17:31:42.385017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 11 inbound Pith citation observations for arXiv:2509.10884."}