{"as_of":"2026-08-08T12:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d80aad7401c01735121469158a83503d9fccf6baf80eb6be23ef6e7683772b2a","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:23:01.919344Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T15:39:59.878169Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-14T23:13:15.774007Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"cited_work":{"arxiv_id":"2506.14507","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14507","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.14507 , year=","venue":null,"work_id":"6d1ef9e7-23a0-4f45-8e73-d6e559968eeb","year":null},"citing_paper":{"arxiv_id":"2511.20857","last_updated":"2026-05-18T16:18:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T21:08:07Z","title":"Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory","version":1},"reference_index":248,"source":"arxiv_source","source_observed_at":"2026-05-14T23:13:15.016486Z"},"links":{"cited_paper":"/paper/2506.14507","citing_paper":"/paper/2511.20857"},"observation_digest":"sha256:0f0c9fb42f7c34562ed9a20ad15281ab8b822fc9c24bf42e6ec3e219a82ae9c3","observation_id":"bcff18d3-129c-4ce3-a3e5-0edbe42ff4a2","resolution":{"observed_at":"2026-05-14T23:13:15.777167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14507","snapshot_observed_at":"2026-07-14T15:39:59.878169Z","title":"Can pretrained vision-language embed- dings alone guide robot navigation?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09792","last_updated":"2026-07-09T05:13:02Z","snapshot_observed_at":"2026-08-07T21:59:36.828483Z","submitted_at":"2026-07-09T05:13:02Z","title":"A Comprehensive Survey and Systematic Real-World Evaluation of Embodied Vision-and-Language Navigation","version":1},"reference_index":238,"source":"pdf_text","source_observed_at":"2026-07-14T15:39:59.878169Z"},"links":{"cited_paper":"/paper/2506.14507","citing_paper":"/paper/2607.09792"},"observation_digest":"sha256:39b10c6910aa537d0cae47955c75d0efc67d3009bd6d936c6b6e09df1d52bca2","observation_id":"b634dbf6-4d76-4ab7-98b0-f537bcf8a414","resolution":{"observed_at":"2026-07-14T15:39:59.878169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14507/citation-record","integrity":"/paper/2506.14507/integrity","json":"/paper/2506.14507/citation-record.json","paper":"/paper/2506.14507"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:02.549222Z","title":"Getting vit in shape: Scaling laws for compute-optimal model design,","venue":null,"work_id":"c4e1c074-201b-4ddd-9764-b3f747e8420f","year":null},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.467925Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:7987053de0b03fb2cbb410f692a89f1a993feba2a9f28a231164971d86659d77","observation_id":"e0499a38-1ba4-43d3-b5d9-aeb475c79970","resolution":{"observed_at":"2026-08-07T00:23:02.555563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:02.525841Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabilities, 2024","venue":null,"work_id":"3fdf419d-620c-4a9c-93c0-73096786d1f7","year":2024},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.566662Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:36a3c2baad1e32bf554155b94b9dc151f76d5f63c4642dbe0026bb0c9ed47a81","observation_id":"40e9d7d8-c1a9-4405-acf3-7240dd96a381","resolution":{"observed_at":"2026-08-07T00:23:02.531508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T00:23:00.630568Z","title":"Navila: Legged robot vision-language-action model for navigation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.630568Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:245289c1adc325732c4288aeaf4be2f4b254fb2a56942313e1aa142e44eb601b","observation_id":"ed17b4aa-87dc-430f-a22e-7824d1b5cc3f","resolution":{"observed_at":"2026-08-07T00:23:00.630568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.16649","last_updated":"2022-11-30T00:38:54Z","snapshot_observed_at":"2026-08-05T01:59:25.072832Z","submitted_at":"2022-11-30T00:38:54Z","title":"CLIP-Nav: Using CLIP for Zero-Shot Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.16649","snapshot_observed_at":"2026-08-07T00:23:00.698604Z","title":"Sukhatme","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.698604Z"},"links":{"cited_paper":"/paper/2211.16649","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:46e482b2255848db8934d9ab665b6772194969501ba6eb68295916982cac20bc","observation_id":"3c22e683-59c9-4af2-9a43-b6de6d942bcc","resolution":{"observed_at":"2026-08-07T00:23:00.698604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:02.503080Z","title":"Learning latent dynamics for planning from pixels, 2019","venue":null,"work_id":"40f932f5-2c31-4bf0-b955-5afeab32709e","year":2019},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.783826Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:9eda922d8fd392601aef2784ecf832d2e1ab7ef1efb3d69a2766c2ec3061fc8a","observation_id":"e5e2af88-9c60-4abf-99d4-6749b39fe012","resolution":{"observed_at":"2026-08-07T00:23:02.510339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-07T00:23:00.842906Z","title":"Mastering diverse domains through world models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.842906Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:9ebcc1d44f00ab2a9408a7dbb08f156a65c2504a5f16c601c92c8ce94ad746bf","observation_id":"481ba7a2-3ddb-421e-8953-a4f958356b26","resolution":{"observed_at":"2026-08-07T00:23:00.842906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:02.480054Z","title":"Visual language maps for robot navigation, 2023","venue":null,"work_id":"44d28cca-d198-48c6-9c64-3dd16eafd795","year":2023},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.924004Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:4a07e477bc0b48dc02bf4d35a577d65e67dd5f88b487859a9b5e5fa9952d5936","observation_id":"0040f366-669a-4909-8d08-e03002d5417c","resolution":{"observed_at":"2026-08-07T00:23:02.486795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.02005","last_updated":"2022-02-04T07:30:48Z","snapshot_observed_at":"2026-08-05T03:13:24.650146Z","submitted_at":"2022-02-04T07:30:48Z","title":"BC-Z: Zero-Shot Task Generalization with Robotic Imitation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.02005","snapshot_observed_at":"2026-08-07T00:23:00.963437Z","title":"Bc-z: Zero-shot task general- ization with robotic imitation learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.963437Z"},"links":{"cited_paper":"/paper/2202.02005","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:49311e582ee09ad1589f5561b2c6831a7c6f89133aa8d367cf4e7dc08efa597a","observation_id":"987b5551-2994-42c3-9cad-e7c8825761ad","resolution":{"observed_at":"2026-08-07T00:23:00.963437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.03334","last_updated":"2021-06-10T17:15:46Z","snapshot_observed_at":"2026-08-08T11:48:41.652015Z","submitted_at":"2021-02-05T18:36:11Z","title":"ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.03334","snapshot_observed_at":"2026-08-07T00:23:00.968433Z","title":"Vilt: Vision-and-language transformer without convolu- tion or region supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.968433Z"},"links":{"cited_paper":"/paper/2102.03334","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:cbe5f4751f1b179b5f66513bf797a2bcfc4ac960a93712d428b3e7b55b78c462","observation_id":"a2d883d2-6d9b-4aea-8c14-1e0f207b4e51","resolution":{"observed_at":"2026-08-07T00:23:00.968433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09546","last_updated":"2025-05-14T16:45:51Z","snapshot_observed_at":"2026-08-07T15:45:21.831739Z","submitted_at":"2025-05-14T16:45:51Z","title":"Distilling Realizable Students from Unrealizable Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09546","snapshot_observed_at":"2026-08-07T00:23:01.023823Z","title":"Distilling realizable students from unrealizable teachers, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.023823Z"},"links":{"cited_paper":"/paper/2505.09546","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:d987ce2b48f8a84b019a44c9dc1bddcf430f2f3eb9e25bfe9572b0ce7ba6fbf7","observation_id":"c9a54b4f-259b-4157-ab69-694ee5098b09","resolution":{"observed_at":"2026-08-07T00:23:01.023823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10568","last_updated":"2024-08-20T06:15:56Z","snapshot_observed_at":"2026-08-04T16:41:20.397797Z","submitted_at":"2024-08-20T06:15:56Z","title":"Constrained Behavior Cloning for Robotic Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10568","snapshot_observed_at":"2026-08-07T00:23:01.104551Z","title":"Constrained behavior cloning for robotic learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.104551Z"},"links":{"cited_paper":"/paper/2408.10568","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:014aef8904399da7ac049b37a579bbf0a60c42a362d8b0f55ca63eb15ed0ae1a","observation_id":"1049ce38-98fd-44b0-a912-d685f452942f","resolution":{"observed_at":"2026-08-07T00:23:01.104551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:02.459733Z","title":"ZSON: Zero-shot object-goal navigation using multimodal goal embeddings","venue":null,"work_id":"6bc23752-7026-44fc-b029-7a61ab9cea9a","year":2022},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.190903Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:51bca8b6a2352d35cf21e886ab1ea5281691a1e69e602b541ad27c9418f714be","observation_id":"8389b828-de7b-4414-97ee-71e84bdaa3ed","resolution":{"observed_at":"2026-08-07T00:23:02.465031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:01.237600Z","title":"Orbit: A unified simulation framework for interactive robot learning environ- ments","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.237600Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:bbc398128794428cd25fd751c55078c3367061e87f96d00f0a53b4369f1b11ca","observation_id":"d45a9c07-9fde-4449-b71f-79f99530b241","resolution":{"observed_at":"2026-08-07T00:23:01.237600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20164","last_updated":"2024-07-29T16:49:30Z","snapshot_observed_at":"2026-08-04T04:04:02.368220Z","submitted_at":"2024-07-29T16:49:30Z","title":"Language-Conditioned Offline RL for Multi-Robot Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20164","snapshot_observed_at":"2026-08-07T00:23:01.301764Z","title":"Language-conditioned offline rl for multi-robot navigation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.301764Z"},"links":{"cited_paper":"/paper/2407.20164","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:899378320c632c643facadbf10300f36bfa3f4f6a1a94a937a7e8b366c1d6fd8","observation_id":"c28bb70d-a4d7-4b7d-93d9-cfd44f9e2958","resolution":{"observed_at":"2026-08-07T00:23:01.301764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:02.440235Z","title":"R3m: A uni- versal visual representation for robot manipulation,","venue":null,"work_id":"4719ee93-636f-47dd-ae85-10f0878ba6e9","year":null},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.359403Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:073626dbbea17c79c251ff7cf2828fa9a0f27c08310597b24cebb477aa449ebd","observation_id":"173f7ab1-8664-42c0-a57b-22d6abed694e","resolution":{"observed_at":"2026-08-07T00:23:02.446687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17727","last_updated":"2024-09-26T10:56:35Z","snapshot_observed_at":"2026-08-04T23:59:19.375654Z","submitted_at":"2024-09-26T10:56:35Z","title":"Robotic-CLIP: Fine-tuning CLIP on Action Data for Robotic Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17727","snapshot_observed_at":"2026-08-07T00:23:01.486633Z","title":"Ta, Baoru Huang, Thieu V o, Ngan Le, and Anh Nguyen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.486633Z"},"links":{"cited_paper":"/paper/2409.17727","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:cc5a4ecb77b715f9e86984752dc241d0dccfbbc627977454ee11eaf350cc1ec4","observation_id":"9032cfc7-51d1-4bf7-b85a-1c46bfcda798","resolution":{"observed_at":"2026-08-07T00:23:01.486633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:02.419205Z","title":"Isaac sim","venue":null,"work_id":"3911152a-82b1-404d-83b1-9f877d6d8307","year":2022},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.494307Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:7387506a48e702e52c47656515bef1dc03aeb4c1bc9561334eb4921fb6173333","observation_id":"4dc5ed25-58df-4883-b710-8c2e4851e655","resolution":{"observed_at":"2026-08-07T00:23:02.425411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-07T00:23:01.525716Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.525716Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:99b095383ca30031c53656459433f287b6e047658d5d4fdce377e4b621b83f7c","observation_id":"30a9500b-81ca-4169-880a-acde40926f46","resolution":{"observed_at":"2026-08-07T00:23:01.525716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.08959","last_updated":"2022-09-19T12:27:15Z","snapshot_observed_at":"2026-08-07T05:57:27.721089Z","submitted_at":"2022-09-19T12:27:15Z","title":"Latent Plans for Task-Agnostic Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2209.08959","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.08959","snapshot_observed_at":"2026-08-07T00:23:02.116693Z","title":"Latent Plans for Task-Agnostic Offline Reinforcement Learning","venue":"cs.RO","work_id":"17d10f5b-eb47-443b-a886-db54174ebc51","year":2022},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.592832Z"},"links":{"cited_paper":"/paper/2209.08959","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:76dfc09a25dbf22ecdc3aae19ca779a2eeda819c5a56b3299f0e0040af66f977","observation_id":"c66757b3-508a-4717-aa66-2dc5e06524df","resolution":{"observed_at":"2026-08-07T00:23:02.127836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T00:23:01.655232Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.655232Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:e931d0e553b74ea945c4c7ac2f029bcc696c95e843a56be3e46d30d5ba0e2baf","observation_id":"3f7cb8c2-75c1-4d4f-921f-d2a1ed275cf4","resolution":{"observed_at":"2026-08-07T00:23:01.655232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:02.399348Z","title":"Vlm-social-nav: Socially aware robot navigation through scoring using vision-language models, 2024","venue":null,"work_id":"df0063ec-59d4-4607-8e24-7ca04b05d17c","year":2024},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.734952Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:9928baab78354ccfbb62196ee3f9f042a9fea13f47551dd22b504e2d8ce930b3","observation_id":"3fa81a0a-5c6a-4212-8c6e-6968a2ccc98d","resolution":{"observed_at":"2026-08-07T00:23:02.404975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-07T00:23:01.797762Z","title":"Open- world object manipulation using pre-trained vision- language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.797762Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:a9028540459ee9247362e706a694ec7c9c0411b1b9cda8cf6809a7f4bba30c96","observation_id":"775a35c4-692f-4f85-976b-691f70366aa1","resolution":{"observed_at":"2026-08-07T00:23:01.797762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-07T00:23:01.862440Z","title":"Sigmoid loss for language image pre-training, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.862440Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:1c41508a2317f526fef32c2cb0cd0f92f158ff24e26194d89a20784f2d5ebc69","observation_id":"c50d8b92-015b-4c1a-8568-5378e6677997","resolution":{"observed_at":"2026-08-07T00:23:01.862440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:02.379535Z","title":"RT-2: Vision- language-action models transfer web knowledge to robotic control","venue":null,"work_id":"2315260b-fa87-4610-ba48-6eb6cc1cfcae","year":2023},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.919344Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:9ea6e4199553d144bb16ebd3903fb20b57e8abddd2e7631f1dce9b64958c2aff","observation_id":"8e4c8fb4-92e4-4e61-b02a-a8b3e0cf5ee3","resolution":{"observed_at":"2026-08-07T00:23:02.385497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-02T11:48:59.131827Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-07T00:23:01.438793Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.438793Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:ac472d089f9fb842f989904a08595c16b0bceaec5c9e6d5ce62512e1be1ae866","observation_id":"41596763-d6ca-4f0a-ad20-f00e05c1f39b","resolution":{"observed_at":"2026-08-07T00:23:01.438793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13035","last_updated":"2024-01-09T10:43:02Z","snapshot_observed_at":"2026-07-06T15:30:42.173342Z","submitted_at":"2023-05-22T13:39:28Z","title":"Getting ViT in Shape: Scaling Laws for Compute-Optimal Model Design","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13035","snapshot_observed_at":"2026-08-07T00:23:00.522629Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.522629Z"},"links":{"cited_paper":"/paper/2305.13035","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:a1e50a29b8ae65057d6809f3d6a69d446627a82196ca36635770653ceee4a934","observation_id":"b7bdfaf7-9860-469c-845b-9238aa34cd6f","resolution":{"observed_at":"2026-08-07T00:23:00.522629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 2 inbound Pith citation observations for arXiv:2506.14507."}