{"as_of":"2026-08-15T09:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e87394480236e5d10ff97d90702bb1307a739cd0c2980a907af96766b95cb83b","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:42:43.920548Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:21:28.035076Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.13132","snapshot_observed_at":"2026-07-14T12:26:27.446079Z","title":"Gaussexplorer: 3d gaussian splatting for embodied exploration and reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10350","last_updated":"2026-07-17T17:27:03Z","snapshot_observed_at":"2026-08-02T07:21:21.791047Z","submitted_at":"2026-07-11T15:24:43Z","title":"ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T12:26:27.446079Z"},"links":{"cited_paper":"/paper/2601.13132","citing_paper":"/paper/2607.10350"},"observation_digest":"sha256:3cc0c5e52b2091003d0fa099f213fcf68bc21813f4602bb10b92e011c0de6b7d","observation_id":"5f5f099a-03db-4300-a6b2-1f706f42f00a","resolution":{"observed_at":"2026-07-14T12:26:27.446079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.13132","snapshot_observed_at":"2026-08-02T07:21:28.035076Z","title":"Gaussexplorer: 3d gaussian splatting for embodied exploration and reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10350","last_updated":"2026-07-17T17:27:03Z","snapshot_observed_at":"2026-08-02T07:21:21.791047Z","submitted_at":"2026-07-11T15:24:43Z","title":"ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T07:21:28.035076Z"},"links":{"cited_paper":"/paper/2601.13132","citing_paper":"/paper/2607.10350"},"observation_digest":"sha256:beeceb8c2ea9b3a61af5e1a3ea5e6c7058f780ff3f8f4db9c333439050ae1e71","observation_id":"56795f58-544d-4300-aa2e-a6730af66c44","resolution":{"observed_at":"2026-08-02T07:21:28.035076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.13132/citation-record","integrity":"/paper/2601.13132/integrity","json":"/paper/2601.13132/citation-record.json","paper":"/paper/2601.13132"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:40.422279Z","title":"Videonavqa: Bridging the gap between visual and embodied question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:40.422279Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:99a363df78f57a7f017880817cfdf95b7a9b32bce492233ff144ef34944fe05a","observation_id":"57fdbc44-d8ff-4a07-8662-d8a0cd1b12cf","resolution":{"observed_at":"2026-08-03T09:42:40.422279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:40.499217Z","title":"All you may need for VQA are image captions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:40.499217Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:deb04398d3329f0631e733d45e9b3524f96ff8d8455b161b401ed99cabc16cef","observation_id":"0319f58f-85f3-4629-9e63-3b1fb05c4bdc","resolution":{"observed_at":"2026-08-03T09:42:40.499217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:40.604194Z","title":"Scannet: Richly- annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:40.604194Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:365b0d0c633cdc8fc36aa4d5afac4f8c2f372e62190fa593fb1ed6df6af41a2b","observation_id":"9bba74cc-9279-4b09-908d-de71d5e8626d","resolution":{"observed_at":"2026-08-03T09:42:40.604194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:40.676244Z","title":"Embodied question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:40.676244Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:854ca224c59fb0adc90aa3be5bb9395af2e43daec7c80bc5fb06c2c744e595fb","observation_id":"4c0dba47-db8b-4c31-9634-77e5b20f418c","resolution":{"observed_at":"2026-08-03T09:42:40.676244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:40.805765Z","title":"A density-based algorithm for discovering clusters in large spatial databases with noise","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:40.805765Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:f4d0c83304529e8413cda811821c7eef56da4a23f6cac46c8145e8f5fe7bec74","observation_id":"cfdb7f82-aefe-49c0-883f-e583e79add92","resolution":{"observed_at":"2026-08-03T09:42:40.805765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:40.891148Z","title":"Lightgaussian: Unbounded 3d gaussian compression with 15x reduction and 200+ fps","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:40.891148Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:659c228f0cbe5cc60f23105c963e3dc2b2aeaee403cf93efad4e87c5fdf5fb98","observation_id":"d6315987-96e4-4d34-a40b-6eae8e2374e5","resolution":{"observed_at":"2026-08-03T09:42:40.891148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:40.967844Z","title":"V2pe: Improving multimodal long- context capability of vision-language models with variable visual position encoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:40.967844Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:8e55687976b13cc3db1a681b3cb3cd5ee3d08d25b7dd5964bbf95d17c91e4de5","observation_id":"6b8a1c0f-a88a-42cf-a583-c387561ad08e","resolution":{"observed_at":"2026-08-03T09:42:40.967844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:41.098447Z","title":"Concept- graphs: Open-vocabulary 3d scene graphs for perception and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:41.098447Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:ec5824bca80d6e15924888fe1ac7a5f271267c7f6a42a97d62d1a62938ed4864","observation_id":"bb4ee40c-f0a3-41dd-bda5-d2e513df2e57","resolution":{"observed_at":"2026-08-03T09:42:41.098447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:41.224454Z","title":"Refersplat: Referring segmentation in 3d gaussian splatting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:41.224454Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:1b164f84561762a25c75ef44b9b87e7e2bddf92a9adf3016da17e954c0b18b89","observation_id":"4e6692a6-0d6a-41b8-a19a-3af4b387ea37","resolution":{"observed_at":"2026-08-03T09:42:41.224454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:41.394027Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:41.394027Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:1ba021eb969ac34b7ca8b33836ae72d33383cdd7dc949b8bc5f753caa3688d7f","observation_id":"3694eb2e-d9ff-4c4f-ae48-889135cb4362","resolution":{"observed_at":"2026-08-03T09:42:41.394027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:41.593024Z","title":"Fastlgs: Speeding up language em- bedded gaussians with feature grid mapping","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:41.593024Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:67faa50e689f78d8e1b883f261582cc57a04ba67ee60b80028383cdc62e9b4bd","observation_id":"514b103c-d28e-4ce6-af27-93b74e251342","resolution":{"observed_at":"2026-08-03T09:42:41.593024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:41.681808Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:41.681808Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:de84d635bc5244c445b7e7c81a932b223a3388687d99a622f68890ade395893a","observation_id":"5ff81ce0-cc22-4815-b2db-d92965b7a744","resolution":{"observed_at":"2026-08-03T09:42:41.681808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:41.796310Z","title":"3d gaussian splatting for real-time radiance field rendering.ACM TOG, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:41.796310Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:412a703e4498f73d5628c9d3b0e5986d025d2c50df3d1bd24e1a583984c4b7c3","observation_id":"8e0c746d-98f0-4794-9952-3f9c31e6ddf2","resolution":{"observed_at":"2026-08-03T09:42:41.796310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:41.980177Z","title":"A hierarchical 3d gaussian representation for real-time ren- dering of very large datasets.ACM Transactions on Graphics (TOG), 43(4):1–15, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:41.980177Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:f3280121561c6790165f487cee87366d8c3b7e58db0dd2afb753487533a4fec7","observation_id":"4c77d865-f7f5-46c2-9db5-3f48894b31c5","resolution":{"observed_at":"2026-08-03T09:42:41.980177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:42.101427Z","title":"Topological semantic graph memory for image-goal navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:42.101427Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:752cae073f875001fb53dc560776d3c5e1631d1bde0c9ee9014d5590b560881e","observation_id":"2bc5d344-36eb-4542-9fd8-29890834e003","resolution":{"observed_at":"2026-08-03T09:42:42.101427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:42.225583Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:42.225583Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:dbafe7725028723f2869a87ad51cd216630628728cefce7a37ca513e678ed0ad","observation_id":"9584b7f3-0340-47f8-8e4a-c24539b07159","resolution":{"observed_at":"2026-08-03T09:42:42.225583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:42.285890Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:42.285890Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:b25323d5354cef268a4a927f057f6ebd1d07d822c2d1ef10d34ca43df703e1ae","observation_id":"4d0b40c7-a8d6-4f3c-8054-fe2271185357","resolution":{"observed_at":"2026-08-03T09:42:42.285890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:42.366593Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:42.366593Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:c539973bb035006b232c7953b8d02f1679b9c27b2aa6ff26a1737e3e8a8e22ee","observation_id":"2b09a7e4-7426-4736-b8fb-4b319963860c","resolution":{"observed_at":"2026-08-03T09:42:42.366593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:42.452577Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:42.452577Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:148d4c4ad8493e903836b5604930f23bdb95ac1a9bd4e502f54164cbdb23d5e5","observation_id":"2e77af78-2b7b-4974-8d82-500f9e55e75d","resolution":{"observed_at":"2026-08-03T09:42:42.452577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:42.536157Z","title":"A hybrid approach to hierarchical density-based cluster selection","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:42.536157Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:73f172fc179a4b8cd585be179f05ae0e1640ac8b4a6f5a6e2f16f28ad8557d77","observation_id":"b55f1e7d-4865-4671-b469-698d95a03693","resolution":{"observed_at":"2026-08-03T09:42:42.536157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T09:42:42.598350Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:42.598350Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:44bdcc715a03e6f8de7caa68c20bf586e7b5538ce0a4500d095f1fc80e70da73","observation_id":"1ea39407-8f91-49e9-a0e5-88a9a21c7fb7","resolution":{"observed_at":"2026-08-03T09:42:42.598350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:42.669328Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:42.669328Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:1af7c32266af10d8d2f866b3663842cca610fbb2352ca6586469ecb9c9d659ec","observation_id":"3cbb8218-1bc4-4256-8ffd-8eb1a01b242c","resolution":{"observed_at":"2026-08-03T09:42:42.669328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:42.738224Z","title":"Langsplat: 3d language gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:42.738224Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:b727ba0439f2c33c94a1fdae5407cff4be825c1b1f20d90f0fa8ccc7ddc182b5","observation_id":"f420e2a2-dde7-4e84-9147-317ac57104df","resolution":{"observed_at":"2026-08-03T09:42:42.738224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:42.789328Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:42.789328Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:68e1da16e81d865af0b4f9aaad6ad587793e60f6cc29a2bb1c9784c53de8d89d","observation_id":"01917dac-9303-4042-a509-21f88b6709dc","resolution":{"observed_at":"2026-08-03T09:42:42.789328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:42.879405Z","title":"Habitat-matterport 3d dataset (hm3d): 1000 large-scale 3d environments for embodied ai","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:42.879405Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:176deff1720ee5620013a53fe03a680b45fbb500efee668db2aeca820f15266a","observation_id":"f2d1ed2c-033c-48b7-997f-e09959da50ad","resolution":{"observed_at":"2026-08-03T09:42:42.879405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:42.943588Z","title":"Language- grounded indoor 3d semantic segmentation in the wild","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:42.943588Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:9fcb7653e163d86faca30ea5b9be8b37ef57592ac4f8e18de34ec33c0ad10a32","observation_id":"1d27bc1c-26cf-4584-b7ed-1e018d8b0ecb","resolution":{"observed_at":"2026-08-03T09:42:42.943588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:43.033690Z","title":"Grapheqa: Using 3d semantic scene graphs for real-time embodied question answering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:43.033690Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:f70eb147be96672b3f47d38f19c140fae78be5bcd2c064d8abcd4a522e53cc31","observation_id":"ad01cefe-9d95-4e04-a90c-0e8226c81625","resolution":{"observed_at":"2026-08-03T09:42:43.033690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:43.115223Z","title":"Losing visual needles in image haystacks: Vision language models are easily distracted in short and long contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:43.115223Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:ec1873742508e115211cf0775133fcbbbd3603647a07ec7fe64da24a0593071b","observation_id":"7daaeb53-499e-4a2c-857a-ae8b9c483ec2","resolution":{"observed_at":"2026-08-03T09:42:43.115223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:43.174937Z","title":"Language embedded 3d gaussians for open-vocabulary scene understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:43.174937Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:3d78e4c24800f0365e634aca9675b6fb166b9406066530fb698d74438c050e81","observation_id":"48814442-7353-4bf5-a12d-3de07a6fbcbf","resolution":{"observed_at":"2026-08-03T09:42:43.174937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-03T09:42:43.264599Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:43.264599Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:ec15cad13a7f56e5962aa6b1bc3947f28126ba43d51401833bf29a974ea98ed9","observation_id":"94614cf9-e29e-4e72-b07a-f81a081e5b5e","resolution":{"observed_at":"2026-08-03T09:42:43.264599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:43.351707Z","title":"Yolov8: A novel object de- tection algorithm with enhanced performance and robustness","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:43.351707Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:2d969e3fb3ba8a7360c2225807f45d4e89db619b60cdf0fb3e58333205f5f5f9","observation_id":"450fc78d-a1b9-46b9-aa9b-1effc66a3a71","resolution":{"observed_at":"2026-08-03T09:42:43.351707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:43.398917Z","title":"Mm- longbench: Benchmarking long-context vision-language mod- els effectively and thoroughly","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:43.398917Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:8ac52fdebb2483f33878a7679a8cf46bd10cdd684a0b25c6ac272178a2502dd6","observation_id":"bcebdc89-f5cd-4b9d-9c5f-29b1273c623e","resolution":{"observed_at":"2026-08-03T09:42:43.398917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:43.441704Z","title":"Opengaussian: Towards point-level 3d gaussian-based open vocabulary understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:43.441704Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:ed6a741703993f5790838e736b7b7e1be9ea6dd39b5b23a1f2ab531aa1724345","observation_id":"e6021588-aa68-4c9e-90f4-8328e4b27d38","resolution":{"observed_at":"2026-08-03T09:42:43.441704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:43.522976Z","title":"3d-mem: 3d scene memory for embodied exploration and reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:43.522976Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:74aaea1cac394c23632e0a1074abf1327eb908b57a0296b8026cd81b38d150c5","observation_id":"4a0a0190-28fc-4571-b842-3f712b3598c2","resolution":{"observed_at":"2026-08-03T09:42:43.522976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:43.611054Z","title":"Gaus- sian grouping: Segment and edit anything in 3d scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:43.611054Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:f46604de08047eb13911ef440c9381a8cf9888f1c695d1d94b66837737def2d0","observation_id":"82d55928-78fa-473e-9a32-c62a612e6adc","resolution":{"observed_at":"2026-08-03T09:42:43.611054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:43.670725Z","title":"Sg-nav: Online 3d scene graph prompting for llm-based zero-shot object navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:43.670725Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:fe3de9357b3265f2a9f6e38116fa423ad205f149d433f0cae681c9369361bd85","observation_id":"dfdfef93-0f3b-4762-95a2-aeb2b655770e","resolution":{"observed_at":"2026-08-03T09:42:43.670725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:43.720598Z","title":"Osprey: Pixel understanding with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:43.720598Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:2889283178ff29e86e5474d027a8fdfb08a10300162019950f3e8e9f371f88f0","observation_id":"54103adb-fc50-4367-90e9-2d729fe2c1f4","resolution":{"observed_at":"2026-08-03T09:42:43.720598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:43.805262Z","title":"Open-vocabulary functional 3d scene graphs for real-world indoor spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:43.805262Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:9a851ca78a83afcb5b8ec518e648c1702f63d0906760103753c47eccd4eddffe","observation_id":"0dd1416e-963a-4aeb-a0f9-77df97dacf1f","resolution":{"observed_at":"2026-08-03T09:42:43.805262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:43.854761Z","title":"Feature 3dgs: Supercharging 3d gaussian splatting to enable distilled feature fields","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:43.854761Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:330c07d73c9c3fc005d1a3d4cb2560a43b99e5b370ede24fc9285b6794c7c201","observation_id":"aa66c922-5a44-4e2c-ad63-ecdd429f3472","resolution":{"observed_at":"2026-08-03T09:42:43.854761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:42:43.920548Z","title":"Ewa volume splatting","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T09:42:43.920548Z"},"links":{"citing_paper":"/paper/2601.13132"},"observation_digest":"sha256:a59f63740b4e598ef5f54b6fc8ad4a336f823abf416afb1c5133a913d06dfb2f","observation_id":"bdc8e189-4490-4494-811e-c12b2eb1b153","resolution":{"observed_at":"2026-08-03T09:42:43.920548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.13132","last_updated":"2026-07-13T14:35:28Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T00:28:41.315969Z","submitted_at":"2026-01-19T15:17:58Z","title":"SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 2 inbound Pith citation observations for arXiv:2601.13132."}