{"as_of":"2026-08-09T01:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e0265630ee4392c36162999ec4a6a189a00ab57685e3fe606fd4ff3a5c36a684","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:41:42.393210Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:03:51.194382Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:38:59.525642Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"cited_work":{"arxiv_id":"2508.01539","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.01539","snapshot_observed_at":"2026-07-03T21:38:59.525642Z","title":"arXiv preprint arXiv:2508.01539 (2025) Title Suppressed Due to Excessive Length 19","venue":null,"work_id":"3936844e-7f3e-44fa-a743-d93534385d16","year":2025},"citing_paper":{"arxiv_id":"2603.17510","last_updated":"2026-05-12T12:59:22Z","snapshot_observed_at":"2026-07-06T22:49:33.482934Z","submitted_at":"2026-03-18T09:14:05Z","title":"Interpreting Context-Aware Human Preferences for Multi-Objective Robot Navigation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T09:20:24.694980Z"},"links":{"cited_paper":"/paper/2508.01539","citing_paper":"/paper/2603.17510"},"observation_digest":"sha256:9ad22790f81c4a7270f46f4932675e8a1504d6f71d263272c63d8b5a22438aed","observation_id":"eee1caca-fdb9-4b91-92f1-fe5dd3906958","resolution":{"observed_at":"2026-05-15T09:25:22.284010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"cited_work":{"arxiv_id":"2508.01539","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.01539","snapshot_observed_at":"2026-07-03T21:38:59.525642Z","title":"arXiv preprint arXiv:2508.01539 (2025) Title Suppressed Due to Excessive Length 19","venue":null,"work_id":"3936844e-7f3e-44fa-a743-d93534385d16","year":2025},"citing_paper":{"arxiv_id":"2606.12603","last_updated":"2026-06-10T19:01:31Z","snapshot_observed_at":"2026-08-07T13:05:45.178504Z","submitted_at":"2026-06-10T19:01:31Z","title":"From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T09:29:43.030058Z"},"links":{"cited_paper":"/paper/2508.01539","citing_paper":"/paper/2606.12603"},"observation_digest":"sha256:42b482fc73714da04573570c174ebe18ee90224066f61901b30b50dcbc48a9d3","observation_id":"c3309775-2f63-4448-8057-d8ba1c33babe","resolution":{"observed_at":"2026-07-03T11:38:04.680186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"cited_work":{"arxiv_id":"2508.01539","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.01539","snapshot_observed_at":"2026-07-03T21:38:59.525642Z","title":"arXiv preprint arXiv:2508.01539 (2025) Title Suppressed Due to Excessive Length 19","venue":null,"work_id":"3936844e-7f3e-44fa-a743-d93534385d16","year":2025},"citing_paper":{"arxiv_id":"2606.18426","last_updated":"2026-07-29T15:48:23Z","snapshot_observed_at":"2026-08-02T11:03:48.878962Z","submitted_at":"2026-06-16T19:21:14Z","title":"VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T00:15:26.619238Z"},"links":{"cited_paper":"/paper/2508.01539","citing_paper":"/paper/2606.18426"},"observation_digest":"sha256:2c47e6b34111e4d69c9d94be7dc1042a941301307f144f01095ea08fec8bf6de","observation_id":"573bdfba-b5b0-44f2-ac81-57da7299b166","resolution":{"observed_at":"2026-07-03T21:38:59.528002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.01539","snapshot_observed_at":"2026-08-02T11:03:51.194382Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.18426","last_updated":"2026-07-29T15:48:23Z","snapshot_observed_at":"2026-08-02T11:03:48.878962Z","submitted_at":"2026-06-16T19:21:14Z","title":"VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T11:03:51.194382Z"},"links":{"cited_paper":"/paper/2508.01539","citing_paper":"/paper/2606.18426"},"observation_digest":"sha256:1b0dbe3d234d2628f4b81d285fc4465de07ba6353943d44d0e3781a47573591b","observation_id":"a1802dc2-07e2-429d-8bc2-5355b01cac3f","resolution":{"observed_at":"2026-08-02T11:03:51.194382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.01539/citation-record","integrity":"/paper/2508.01539/integrity","json":"/paper/2508.01539/citation-record.json","paper":"/paper/2508.01539"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-658-31563-4_21","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:33.414567Z","title":"Paluch, J","venue":null,"work_id":"d693ca38-d7a8-4140-abc3-9e23ee1cda20","year":2020},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:41.898677Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:b1ec8e924883bd5259ef02b75f49e81815b5c5c735b3f68bbcede2836486e47f","observation_id":"447b2ff4-7e7c-49d7-a291-9b33bddd2fdd","resolution":{"observed_at":"2026-08-06T05:41:42.445999Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:44.260852Z","title":null,"venue":null,"work_id":"c1a336d9-0953-46c7-91a1-a830383ea368","year":2024},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:41.910258Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:63dc575442c3f1ce7cc93dcdc8199ac3fd4b3728e95a3de5e92b3c8b0979f968","observation_id":"2ec8c764-df64-4d11-9d56-359dd62ce709","resolution":{"observed_at":"2026-08-06T05:41:44.268560Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16484","last_updated":"2024-10-02T19:50:54Z","snapshot_observed_at":"2026-08-08T15:24:55.736277Z","submitted_at":"2024-09-24T22:15:24Z","title":"BehAV: Behavioral Rule Guided Autonomy Using VLMs for Robot Navigation in Outdoor Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16484","snapshot_observed_at":"2026-08-06T05:41:41.922261Z","title":"Weerakoon, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:41.922261Z"},"links":{"cited_paper":"/paper/2409.16484","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:749f8cda18c860789553438535bdcc642ae46803c8acf159dbf3be1c4e0779e8","observation_id":"a11ebb28-33ba-4a3c-93d7-9451a6be7ba2","resolution":{"observed_at":"2026-08-06T05:41:41.922261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-06T05:41:41.942248Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:41.942248Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:5e1bb47b3a2da9e5865829982203ad0d0a376be3cd61820c5f4e799939dc7808","observation_id":"c4176d68-2e40-4bfe-a753-303db470432b","resolution":{"observed_at":"2026-08-06T05:41:41.942248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17262","last_updated":"2025-07-20T22:44:23Z","snapshot_observed_at":"2026-08-08T15:24:56.663395Z","submitted_at":"2024-09-25T18:20:05Z","title":"CROSS-GAiT: Cross-Attention-Based Multimodal Representation Fusion for Parametric Gait Adaptation in Complex Terrains","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17262","snapshot_observed_at":"2026-08-06T05:41:41.952172Z","title":"Seneviratne, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:41.952172Z"},"links":{"cited_paper":"/paper/2409.17262","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:36d40625fb6ece857272f9251f6473a7c5318b83433a1ef8e58658e21dba9535","observation_id":"2c164fd9-6367-4b9d-b349-76e0ce34874b","resolution":{"observed_at":"2026-08-06T05:41:41.952172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09024","last_updated":"2024-12-30T23:59:30Z","snapshot_observed_at":"2026-07-06T20:21:37.540432Z","submitted_at":"2024-12-30T23:59:30Z","title":"Social-LLaVA: Enhancing Robot Navigation through Human-Language Reasoning in Social Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09024","snapshot_observed_at":"2026-08-06T05:41:41.959671Z","title":"Payandeh, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:41.959671Z"},"links":{"cited_paper":"/paper/2501.09024","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:de9ceb294f4ce73e74820092ceb8cfd491e7f158ff011976b52e11c74f2fb5d2","observation_id":"008c4d89-bd89-41cb-aa6b-87abc623945c","resolution":{"observed_at":"2026-08-06T05:41:41.959671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08244","last_updated":"2022-12-16T02:23:50Z","snapshot_observed_at":"2026-07-06T14:31:30.360581Z","submitted_at":"2022-12-16T02:23:50Z","title":"Offline Reinforcement Learning for Visual Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08244","snapshot_observed_at":"2026-08-06T05:41:41.966399Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:41.966399Z"},"links":{"cited_paper":"/paper/2212.08244","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:3280f4a88626788b79611a4b40d35e5be1d7e0cc40a19eb05e4bcaf86aadcdd2","observation_id":"26bce7b1-d0f1-4233-9dc8-683c84c58121","resolution":{"observed_at":"2026-08-06T05:41:41.966399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:44.233381Z","title":null,"venue":null,"work_id":"6f1efe87-6253-4349-988b-578485ee904b","year":2018},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:41.975969Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:4934b6246cb7304828fbd1474b65009289f516e7519c06c1bc40f7b479e81195","observation_id":"211d81ce-997e-4b8c-81cd-243c1b8c3166","resolution":{"observed_at":"2026-08-06T05:41:44.241719Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14947","last_updated":"2024-02-28T21:59:22Z","snapshot_observed_at":"2026-07-06T16:11:31.948429Z","submitted_at":"2023-08-29T00:00:18Z","title":"Improving Generalization in Reinforcement Learning Training Regimes for Social Robot Navigation","version":2},"cited_work":{"arxiv_id":"2308.14947","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.14947","snapshot_observed_at":"2026-08-06T05:41:43.127836Z","title":"Improving Generalization in Reinforcement Learning Training Regimes for Social Robot Navigation","venue":"cs.RO","work_id":"de8856fb-d0a6-49fa-85c2-f00ddc343dd8","year":2023},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:41.985013Z"},"links":{"cited_paper":"/paper/2308.14947","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:49109641117d5f64469e98ccb9f85f3a0a663e1300b81aedcb144e4830ad405a","observation_id":"84047cca-00d1-41af-b27e-2ba892b5c6f4","resolution":{"observed_at":"2026-08-06T05:41:43.138614Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17460","last_updated":"2025-02-06T18:55:45Z","snapshot_observed_at":"2026-08-07T21:36:26.818630Z","submitted_at":"2024-07-24T17:57:21Z","title":"SoNIC: Safe Social Navigation with Adaptive Conformal Inference and Constrained Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17460","snapshot_observed_at":"2026-08-06T05:41:41.991540Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:41.991540Z"},"links":{"cited_paper":"/paper/2407.17460","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:52d91379189ef65ad4f8b7f6cc7a52ac2399cc2b537dc21b023fe0f2eedd408b","observation_id":"5cd5aadd-c4bd-4ac0-988b-5d5c93c4c7e1","resolution":{"observed_at":"2026-08-06T05:41:41.991540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:44.208758Z","title":"Jiang, P","venue":null,"work_id":"a78fbf46-4a50-4c69-8576-d5ef595b41d3","year":2021},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:41.998346Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:e358adc7a450e2f3007fe67c92c89e9c4fd13a09501d5d22f6dac81aa5c6d85e","observation_id":"ce30310a-c7da-46ee-824a-a33cf9d33c36","resolution":{"observed_at":"2026-08-06T05:41:44.216441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:44.176738Z","title":"Karnan, A","venue":null,"work_id":"779426e3-414e-41cc-bc3e-7335826e8102","year":2022},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.004766Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:a55baeae239d887b0a4d59c4ba433803d21117c1e5eabb74794dedf35196a8bb","observation_id":"d580991e-99c6-491a-a5a2-e269b95bd9f0","resolution":{"observed_at":"2026-08-06T05:41:44.187969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07832","last_updated":"2023-09-19T21:22:19Z","snapshot_observed_at":"2026-08-08T15:24:54.034561Z","submitted_at":"2023-09-14T16:21:27Z","title":"VAPOR: Legged Robot Navigation in Outdoor Vegetation Using Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07832","snapshot_observed_at":"2026-08-06T05:41:42.012865Z","title":"Weerakoon, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.012865Z"},"links":{"cited_paper":"/paper/2309.07832","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:e6e02d7030950f52763574f4738a84ac1239b2e68541054a7a213827d48a5d52","observation_id":"7d6cab99-410d-44ea-bd41-66f6294efe59","resolution":{"observed_at":"2026-08-06T05:41:42.012865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:42.023020Z","title":"Caesar, V","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.023020Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:9d00d6e8a1abe6d0396ff1e222d2dc2c5fa65675981da4bb7fab268e9b8e20cf","observation_id":"769af3b3-c51b-4e79-9bf4-39931cc1d620","resolution":{"observed_at":"2026-08-06T05:41:42.023020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.06320","last_updated":"2026-07-27T21:25:47Z","snapshot_observed_at":"2026-08-06T08:31:25.329426Z","submitted_at":"2020-04-14T06:45:07Z","title":"A2D2: Audi Autonomous Driving Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.06320","snapshot_observed_at":"2026-08-06T05:41:42.035762Z","title":"Geyer, Y","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.035762Z"},"links":{"cited_paper":"/paper/2004.06320","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:20510e66324b2d8a5743be652e86d29588d5c2db8053c4cca938b0c181efc558","observation_id":"6dcbe0c9-1d50-4df9-ac46-93983f6cb10e","resolution":{"observed_at":"2026-08-06T05:41:42.035762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:42.066004Z","title":"Kumar, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.066004Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:caa2a53c669a5b108f6d14b183180ad39696607f92a205b2c500fc3b13596c04","observation_id":"f62aec65-6ef1-4b97-a5af-745d3c83d26e","resolution":{"observed_at":"2026-08-06T05:41:42.066004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:44.093091Z","title":"Kapoor, S","venue":null,"work_id":"eba8c5b7-fd18-4d43-a1dd-1738ba71ee47","year":2023},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.072754Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:ae645666463f57c2b8be1e54648f6c4fcf67385f00c31e610fd309e64488d5b0","observation_id":"514ea7c8-6cc3-4cf4-a0ea-3e4959d22580","resolution":{"observed_at":"2026-08-06T05:41:44.102127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:44.056285Z","title":"Liang, U","venue":null,"work_id":"fe3892fe-30d5-4c6b-9a57-a8f0781bfcd4","year":2021},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.082464Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:33589d69df11454464791cf4cb4b6c7a13917b41efd4c8496d2fdcb1d0c44214","observation_id":"1f417724-f7b0-4cad-82a6-103914ca6f3d","resolution":{"observed_at":"2026-08-06T05:41:44.065291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:44.009656Z","title":"Patel, N","venue":null,"work_id":"e5ce2633-af40-4a73-9750-af419719c9d5","year":2021},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.088954Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:ba8bcec29646f9af0acc31bd3abf93936518b2ea2727c14e1d54650d2a3fa8d8","observation_id":"8aa917d6-18e0-4a3d-a73e-dfc105c476ac","resolution":{"observed_at":"2026-08-06T05:41:44.018566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-08-06T05:41:42.094226Z","title":"Mondorf and B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.094226Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:58d851e8b98dc2b3da96c38c0c58f858ebc0e59b1d3207fad62e7cfc4159b48b","observation_id":"a9029285-c2f9-4d4c-82fa-3c3c26941291","resolution":{"observed_at":"2026-08-06T05:41:42.094226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10403","last_updated":"2023-05-26T17:59:33Z","snapshot_observed_at":"2026-08-06T19:23:30.079167Z","submitted_at":"2022-12-20T16:29:03Z","title":"Towards Reasoning in Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10403","snapshot_observed_at":"2026-08-06T05:41:42.108363Z","title":"Huang and K","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.108363Z"},"links":{"cited_paper":"/paper/2212.10403","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:7dcc0a8a1c016f7fc2a4d0323a2e99455aac1cde7c48ef098a8c2eac19080962","observation_id":"db93ab8e-02c2-44f8-960c-e07eed811093","resolution":{"observed_at":"2026-08-06T05:41:42.108363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15522","last_updated":"2024-06-06T08:15:54Z","snapshot_observed_at":"2026-07-06T18:04:42.102581Z","submitted_at":"2024-04-23T21:08:49Z","title":"LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15522","snapshot_observed_at":"2026-08-06T05:41:42.117693Z","title":"Parmar, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.117693Z"},"links":{"cited_paper":"/paper/2404.15522","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:30760a8f3906201341ec6c697b6d52cbcdaf2cb96dff04d9e622b2f989e8cf1c","observation_id":"a5dbacfa-40e5-4177-9235-3f517a90ed75","resolution":{"observed_at":"2026-08-06T05:41:42.117693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:43.976211Z","title":null,"venue":null,"work_id":"72d69d51-748d-497f-8749-1688924ff049","year":2024},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.128414Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:1924230043438a4463d81afc1d12639e1884a56fca4c88498b7a1ed7d805df41","observation_id":"5d3615b1-23d6-47be-8485-1f2fc8897293","resolution":{"observed_at":"2026-08-06T05:41:43.986811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:43.951537Z","title":"Huang, O","venue":null,"work_id":"c2c88531-cbed-45a6-b756-c44eef38ed85","year":2023},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.137295Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:216834b91aad48729340ee80005da75c4b156df036a7b8af27f45a3583edd07c","observation_id":"73adf8aa-a8c5-42b2-8ad9-bc7b26c7ca4f","resolution":{"observed_at":"2026-08-06T05:41:43.960410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:43.892453Z","title":null,"venue":null,"work_id":"60b5134a-641b-4021-ad16-9d61321b2566","year":2024},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.152092Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:52877b46edf4c29f49f8409c4bcc46b34e5f466b0f53d9f4ea87647a1c3d9249","observation_id":"972c6a70-f895-47ea-9862-77cb281e1147","resolution":{"observed_at":"2026-08-06T05:41:43.904495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20445","last_updated":"2024-09-30T16:03:44Z","snapshot_observed_at":"2026-08-06T01:59:37.806119Z","submitted_at":"2024-09-30T16:03:44Z","title":"Robot Navigation Using Physically Grounded Vision-Language Models in Outdoor Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20445","snapshot_observed_at":"2026-08-06T05:41:42.161527Z","title":"Elnoor, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.161527Z"},"links":{"cited_paper":"/paper/2409.20445","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:59d0ca07884d49ed381b5c11a263dcefe991dc4fb048c335ad51375f4ff5dca5","observation_id":"11d7e473-5c36-4862-937d-a2013cca1700","resolution":{"observed_at":"2026-08-06T05:41:42.161527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:43.868039Z","title":null,"venue":null,"work_id":"76159494-8d33-4a9e-afb5-fd13b8709979","year":1997},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.169468Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:a993202d4c977d7a8a412e82eb428fa0d6b4c7cee8ebf2134404f20c4e1ac98a","observation_id":"2895e9fc-018e-4b83-9b35-57610a6036af","resolution":{"observed_at":"2026-08-06T05:41:43.876693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03174","last_updated":"2024-12-04T09:54:48Z","snapshot_observed_at":"2026-08-08T10:19:28.931563Z","submitted_at":"2024-12-04T09:54:48Z","title":"Resilient Timed Elastic Band Planner for Collision-Free Navigation in Unknown Environments","version":1},"cited_work":{"arxiv_id":"2412.03174","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03174","snapshot_observed_at":"2026-08-06T05:41:42.808254Z","title":"Resilient Timed Elastic Band Planner for Collision-Free Navigation in Unknown Environments","venue":"cs.RO","work_id":"e331a2e0-3dcf-4112-800b-cda857b31164","year":2024},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.180688Z"},"links":{"cited_paper":"/paper/2412.03174","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:46f6cb133e4dd8ababe23619e6121afe30019d309c6220267daa70b8fd821a86","observation_id":"cf4ee867-a2ce-44d8-81f7-cb2626279152","resolution":{"observed_at":"2026-08-06T05:41:42.818139Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:42.191176Z","title":"Dosovitskiy, G","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.191176Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:5b2dd6f9bb5908a528666a18c3206876cc8f079c1d75aedd1becd6d0b03f3baf","observation_id":"2e6bb728-0397-46b0-842a-74c74711489b","resolution":{"observed_at":"2026-08-06T05:41:42.191176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:43.812595Z","title":null,"venue":null,"work_id":"66096bfd-d0cf-4f71-b9c2-ebb9e8ee7c8d","year":2024},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.197893Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:4c90940320ceaa249f26eaff0e04de6dd3a0a1a71bf8fc8ebaa02ecf1946d1fe","observation_id":"7bd0c8b2-bb76-49eb-9889-9f587c83d6ab","resolution":{"observed_at":"2026-08-06T05:41:43.819754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:42.203683Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.203683Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:f07a1ea95a4c7168115c32036a207833720f0af698149a365f3ffe64189b5b72","observation_id":"c991c3d9-3363-4ab2-af98-b60d1ebf6e51","resolution":{"observed_at":"2026-08-06T05:41:42.203683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-03T18:30:16.023253Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-08-06T05:41:42.210585Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.210585Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:ddfd1bc4ea8e75522cbece8f318b0abf4f5b5323720e462f28b6fb680eb17fd7","observation_id":"bf990ad4-6fe6-4e04-848f-c4f42f575879","resolution":{"observed_at":"2026-08-06T05:41:42.210585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-02T19:29:16.535750Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-06T05:41:42.219536Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.219536Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:58b91e26ada219b55cfe5e03c4858341eca1fa27d62995180a34836e5b748a16","observation_id":"1debe993-d244-4a08-84cc-9bc6ccd864dc","resolution":{"observed_at":"2026-08-06T05:41:42.219536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:43.724514Z","title":null,"venue":null,"work_id":"5f9fd49f-26f8-4c81-9733-e59e4f5003aa","year":1952},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.244546Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:75df58b47a948b8638cb30536dd22ec5227959276559c12d26167bb90fbdae81","observation_id":"f8be3d71-d44e-4dd6-a8b7-807fd669d6ff","resolution":{"observed_at":"2026-08-06T05:41:43.733022Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10292","last_updated":"2024-10-07T19:13:47Z","snapshot_observed_at":"2026-07-06T18:15:24.541427Z","submitted_at":"2024-05-16T17:50:19Z","title":"Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10292","snapshot_observed_at":"2026-08-06T05:41:42.254081Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.254081Z"},"links":{"cited_paper":"/paper/2405.10292","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:7e60408b9e8a74c9939b08cc5ce89dd9621d6fb8ecf6040feb9ca1868910be1c","observation_id":"a4ff4c6b-9d2e-4e44-9182-ff5299d37b8d","resolution":{"observed_at":"2026-08-06T05:41:42.254081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-07-06T17:34:57.509162Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15852","snapshot_observed_at":"2026-08-06T05:41:42.263684Z","title":"Zhang, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.263684Z"},"links":{"cited_paper":"/paper/2402.15852","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:540ad7ef90f62dc241870e7b8f4f792f74e9ae736e95e7979504207f27a31d54","observation_id":"9187e42d-90ed-4e90-87c8-1db10a76ff20","resolution":{"observed_at":"2026-08-06T05:41:42.263684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02454","last_updated":"2025-05-15T23:53:04Z","snapshot_observed_at":"2026-08-08T22:57:20.681226Z","submitted_at":"2024-08-05T13:25:27Z","title":"VL-TGS: Trajectory Generation and Selection using Vision Language Models in Mapless Outdoor Environments","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02454","snapshot_observed_at":"2026-08-06T05:41:42.275732Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.275732Z"},"links":{"cited_paper":"/paper/2408.02454","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:6fafaa3cdf388e23ba10315ee540b5c8595a6b3f56c71e0d41a641be426f0dba","observation_id":"5b0c29b2-a42e-48d3-a0f6-0bab735b5f1c","resolution":{"observed_at":"2026-08-06T05:41:42.275732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-06T05:41:42.284447Z","title":"Levine, A","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.284447Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:b3dfd13bca40c11ed3fe95ef2e21111c7956c0d6162d622601197e323b25b657","observation_id":"889620ba-285b-4180-a4bd-b176174195c5","resolution":{"observed_at":"2026-08-06T05:41:42.284447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:43.677847Z","title":null,"venue":null,"work_id":"af420a69-7418-4ffd-a628-e8e68167ae04","year":1975},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.292391Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:9e4838ba2f16299f203a9790b62452dafc9e8d865d4d0457c0ffb5ba78087271","observation_id":"7bc873a4-4dbe-4ee1-8c79-250333343146","resolution":{"observed_at":"2026-08-06T05:41:43.689975Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:42.299094Z","title":"Oquab, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.299094Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:8d07acfdcd4b68214f2e35da44182bc47306998933630c6c039865ba2fa5f706","observation_id":"4639882f-adba-4a59-be20-18e10c678589","resolution":{"observed_at":"2026-08-06T05:41:42.299094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-06T05:41:42.308957Z","title":"Kostrikov, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.308957Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:92cac15fc3dba6010a8005d6fc9e6dd92696b3157bc0c5ed2e096e9e99786e2d","observation_id":"188869df-076a-41a1-97c4-638f36f7f3db","resolution":{"observed_at":"2026-08-06T05:41:42.308957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:42.315578Z","title":"Fujimoto, H","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.315578Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:06e7b9032b56b46f63f486526a4a6a9e295752454d014ea0f0f71cb7bc929965","observation_id":"49c3d291-48b3-475d-a818-76b8f1702a53","resolution":{"observed_at":"2026-08-06T05:41:42.315578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:43.597438Z","title":null,"venue":null,"work_id":"007ad9c1-ad77-4d3c-afea-105f23fa159f","year":1997},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.326150Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:4fccbfa7f118d44725f348cab790b46ca574da0fb1d3643fb3d88ac3cdebfcc5","observation_id":"3d25c821-87d7-4992-9060-40219e793cba","resolution":{"observed_at":"2026-08-06T05:41:43.605492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.10802","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:42.579890Z","title":"Nazeri, J","venue":null,"work_id":"3f73d381-7610-4603-b7d0-9e8fd39840f7","year":2024},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.334510Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:5bddd182cdc9450b41068c7a81841c5111f44b36ecbc0fa1375fe369d456bcd9","observation_id":"bb7ede81-6f6f-4105-900d-e51358250c5b","resolution":{"observed_at":"2026-08-06T05:41:42.589513Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:43.568368Z","title":"Alt and M","venue":null,"work_id":"d56b1b4b-c2af-4409-a411-00953bb904c8","year":1995},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.341285Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:dd3a58bcd402c486fdd7f36427852e62068d8de892054f44cbb79b02029dc35e","observation_id":"379f94f0-fa1b-4266-96ec-9aba6588e650","resolution":{"observed_at":"2026-08-06T05:41:43.576104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:43.539045Z","title":"Fujimoto and S","venue":null,"work_id":"a0187a98-adac-4516-9ae1-d2e18cc2cfa5","year":2021},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.349958Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:854c8c189a4e224d1cec77bf87e215e1b9d8a71d978dc98a209313468282fde6","observation_id":"84f69c58-bd53-4431-889f-5e35c3b68a4b","resolution":{"observed_at":"2026-08-06T05:41:43.550165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:43.496628Z","title":"Tarasov, A","venue":null,"work_id":"2925f16a-266b-490d-8692-1888a6391038","year":2022},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.387708Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:21a4b838b23ec73294f549fed3f3121b508889b9161e05c93521a7481d7258c8","observation_id":"b3622393-bca0-4325-b54e-97a502504c47","resolution":{"observed_at":"2026-08-06T05:41:43.514991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:43.466175Z","title":null,"venue":null,"work_id":"6f98b7e9-03b5-4c00-aade-8bae8285980d","year":null},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.393210Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:b863f878d1c76a99c0ce5bc375aa20de87815e975da72c7d54f827ba849ca535","observation_id":"7deac5a7-971a-4e7e-9fcb-c0f8a8508c9e","resolution":{"observed_at":"2026-08-06T05:41:43.472786Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:43.921878Z","title":null,"venue":null,"work_id":"208731ff-b010-4c17-b236-67c8ed30c73a","year":null},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.144265Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:3b7b37cfe0978a0b3b351e18fdbd7f2dc3d3ec7f1a4f738e4953acc56d31787d","observation_id":"82fe68fc-0203-4da4-8ec9-cc343b14cfca","resolution":{"observed_at":"2026-08-06T05:41:43.927628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:41:43.761476Z","title":null,"venue":null,"work_id":"e88ba7f1-0c2e-45ed-b7ea-656b4bfa78f1","year":null},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.234906Z"},"links":{"citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:6a17a1faf2d6ac154d322a140c9a0782e96df9c7fe3777d36a6b8bb8bd2b44af","observation_id":"6cda450d-7312-4cda-8761-650da2fc7941","resolution":{"observed_at":"2026-08-06T05:41:43.773742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":37,"verified_exact":3,"verified_fuzzy":9},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 4 inbound Pith citation observations for arXiv:2508.01539."}