{"as_of":"2026-08-10T05:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:778b80ae7b5e528848374fc0c06e2358636fc8f93a595f03ac71880d0ff6c0b2","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T06:17:08.675360Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16309/citation-record","integrity":"/paper/2607.16309/integrity","json":"/paper/2607.16309/citation-record.json","paper":"/paper/2607.16309"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:06.351839Z","title":"RT-2: Vision-language-action models transfer Web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:06.351839Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:5a44aac020f0134d2aa6496be61f076e0e6a260a2dde570e0b47af2eca7962a5","observation_id":"d263901f-240a-4eb7-b69e-07370a46e949","resolution":{"observed_at":"2026-08-02T06:17:06.351839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:06.444928Z","title":"Unified understanding of environment, task, and human for human- robot interaction in real-world environments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:06.444928Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:8ef25ad2be71940ebfa799980457371575ac3213bc8d677107764f5fcd05e4ec","observation_id":"a539d179-78f4-4903-a4b5-cb3766b1c03c","resolution":{"observed_at":"2026-08-02T06:17:06.444928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:06.546576Z","title":"Robots that ask for help: Uncertainty alignment for large language model planners,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:06.546576Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:0303010e89614a0193c177036f5273f841784a3aa9f410c3d612fb2240186b52","observation_id":"0dc70ae7-e1ea-4235-811f-93f0d54df068","resolution":{"observed_at":"2026-08-02T06:17:06.546576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-02T06:17:06.668847Z","title":"Do as I can, not as I say: Grounding language in robotic affordances,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:06.668847Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:4dddac309e48027335232007f06a43b5b73605ee07d540c89944a57595737481","observation_id":"ff1052ea-76ef-4b81-b805-8e21dd8cc5cc","resolution":{"observed_at":"2026-08-02T06:17:06.668847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:06.852981Z","title":"ScanQA: 3D question answering for spatial scene understanding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:06.852981Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:2fbc6fdea32af0d6d0cb071d2a41b496dd6b0e3b114d8e10d223580507a72e07","observation_id":"4e0658c0-23ff-48c7-9ffa-bbed526248c4","resolution":{"observed_at":"2026-08-02T06:17:06.852981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:06.990772Z","title":"Sim VQA: Exploring simulated environments for visual question answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:06.990772Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:f0f321644e2423053ef04d0df02423b16552642ef6b6ad94689198897fde2bb0","observation_id":"1f85819b-8f60-442e-9c63-1ed63144c948","resolution":{"observed_at":"2026-08-02T06:17:06.990772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:07.115800Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:07.115800Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:dd45c7d0133fca9475bca39d8125ebb0f1b0110fa0a95e93fcfa2abeac7aaf84","observation_id":"b6da201d-9753-4786-96fb-6636a67b0d55","resolution":{"observed_at":"2026-08-02T06:17:07.115800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:07.230206Z","title":"3D gaussian splatting for real-time radiance field rendering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:07.230206Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:0cd5b4521f00f3919ff561f565f9e8d76260216dbb1077d66bb8fd18e4aee688","observation_id":"667383be-82f3-4304-9e58-e6a0675b023f","resolution":{"observed_at":"2026-08-02T06:17:07.230206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:07.322936Z","title":"LangSplat: 3D language gaussian splatting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:07.322936Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:ce329641967df739ed7bd5e8f8ec2d85c887e6d5e26e6c842f5f9e118dab840f","observation_id":"ebb0a11f-2b98-4f0e-b3b3-f0b53db1fed3","resolution":{"observed_at":"2026-08-02T06:17:07.322936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:07.434042Z","title":"Language embedded 3D gaussians for open-vocabulary scene understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:07.434042Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:06ae8bee5160b66b4119f226434a48c093c5df6dce88be9102ef9459b0484c2e","observation_id":"aaa167c0-a652-4ea5-b575-8acad708ecfa","resolution":{"observed_at":"2026-08-02T06:17:07.434042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:07.583317Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:07.583317Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:2b206fb4ff69d7a03e324e475258ade24d8345e82b65682f971e809f50131edf","observation_id":"00e14d0c-c49b-4992-aa0c-7a89e5eceee0","resolution":{"observed_at":"2026-08-02T06:17:07.583317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:07.662570Z","title":"NeRF: Representing scenes as neural radiance fields for view synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:07.662570Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:3a18dcc3010a0d6ad3d7f1918386a2d82a09f27f863e57cbac503c553b46f92d","observation_id":"dcbfb4e5-4976-4463-9b9e-fc2fab7d7e33","resolution":{"observed_at":"2026-08-02T06:17:07.662570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:07.721336Z","title":"Gaussian grouping: Segment and edit anything in 3D scenes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:07.721336Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:6aa92e7aba871b728521bd607b5639bd62b7f8b22445e0f620b35b3c6bb0e2fa","observation_id":"fb5fd6af-94da-4f2c-a0ed-7379699ecbe9","resolution":{"observed_at":"2026-08-02T06:17:07.721336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:07.784877Z","title":"LERF: Language embedded radiance fields,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:07.784877Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:af417b4094828fc909096fff82b2b2c487eb4309d6dcdf2ee5d77d4c2bc200f3","observation_id":"a0e8cc83-7a92-4b9c-a49e-06f43bf6f081","resolution":{"observed_at":"2026-08-02T06:17:07.784877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:07.852828Z","title":"Emerging properties in self-supervised vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:07.852828Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:35014b790e4ebf3aa8b37a99ecd8922272589286697c94aa69b5ca94290668f5","observation_id":"e060b0cc-85e3-45d1-b741-4508d59a6263","resolution":{"observed_at":"2026-08-02T06:17:07.852828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:07.940585Z","title":"OpenGaussian: Towards point-level 3D Gaussian-based open vocabulary understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:07.940585Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:5171ba023da02505a9bbe0d7f812bf96c4623f29aa497c5fed6ec4a225a28f9c","observation_id":"8877494b-8c45-4117-b43d-95fd443541de","resolution":{"observed_at":"2026-08-02T06:17:07.940585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00860","last_updated":"2025-02-05T11:25:47Z","snapshot_observed_at":"2026-08-07T14:04:16.848893Z","submitted_at":"2023-12-01T17:15:24Z","title":"Segment Any 3D Gaussians","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00860","snapshot_observed_at":"2026-08-02T06:17:08.020676Z","title":"Segment any 3D Gaussians,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:08.020676Z"},"links":{"cited_paper":"/paper/2312.00860","citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:7dc7e98c5ae052898ec6d8d74a7978c83754d4de40b8558eb5c1ce28da7b1af5","observation_id":"cba1f8f8-5e00-4cff-af06-0cfe9e23acc4","resolution":{"observed_at":"2026-08-02T06:17:08.020676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:08.138313Z","title":"Click-gaussian: Interactive segmentation to any 3D Gaussians,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:08.138313Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:ef5dc86fbdd23a118acf50f2b72341b0b2edb91ef51a11972ce49489c420682b","observation_id":"a2eb2964-c75a-4f01-8d14-5803bf65d87c","resolution":{"observed_at":"2026-08-02T06:17:08.138313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-02T06:17:08.197853Z","title":"Sam 2: Segment anything in images and videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:08.197853Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:f51696ad8fd506d079872336c73fb7f384007f09fe9392a0bc9416729e056d32","observation_id":"95a269f7-b4af-434c-931d-ac7081877de0","resolution":{"observed_at":"2026-08-02T06:17:08.197853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:08.263568Z","title":"Grounding DINO: Marrying DINO with grounded pre-training for open-set object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:08.263568Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:59ba465d8185e8bf0f07ec5a3a08d3f133e26bff0257345ad8ccdf23c8115d99","observation_id":"2a972ddb-2e2c-4432-813c-ac8515b89234","resolution":{"observed_at":"2026-08-02T06:17:08.263568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:08.346267Z","title":"Language-driven semantic segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:08.346267Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:aeb140f8bec04dc1056a12d5f801e11ab1e36309c55bbe5639c9edf2807495dc","observation_id":"571d68d5-85ae-4929-bf5d-3e9a629a4a72","resolution":{"observed_at":"2026-08-02T06:17:08.346267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:08.398656Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:08.398656Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:9fcaf93d66e83bba28a825ac7ef2b08953f0e63e01baca52e3607a3b5c834b9b","observation_id":"6e281a0a-6d49-42c7-9d2b-b626f507ea9d","resolution":{"observed_at":"2026-08-02T06:17:08.398656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:08.458382Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:08.458382Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:8aef32e466f77925cecdbb306bc3a759f933af008620bc5184a8655d7176210b","observation_id":"4106ef7a-10ac-4e7b-a6bf-f7cc7088ea47","resolution":{"observed_at":"2026-08-02T06:17:08.458382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:08.550847Z","title":"GPT-4v(ision) system card,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:08.550847Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:fa8b8318ca6735e024a3865fd48d1d26ca36bf3a252358c587984e4b9646bbb8","observation_id":"3a08ac10-f5ab-40b5-8e93-6ca01308324b","resolution":{"observed_at":"2026-08-02T06:17:08.550847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:08.623096Z","title":"Weakly supervised 3D open-vocabulary segmen- tation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:08.623096Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:1ba374ae97c175996574b9e90f469fc3752762b884182551097345884d6e3504","observation_id":"91a27ecf-63c8-46da-918e-ea4f1a8defae","resolution":{"observed_at":"2026-08-02T06:17:08.623096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:17:08.675360Z","title":"Language-segment anything,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T06:17:08.675360Z"},"links":{"citing_paper":"/paper/2607.16309"},"observation_digest":"sha256:48b23333e44e6e5f6abf39b30c390c38b4fb230745634e1ae6249af7266b1dd3","observation_id":"4ed3d4bd-c099-4e34-8496-8e6613069603","resolution":{"observed_at":"2026-08-02T06:17:08.675360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16309","last_updated":"2026-07-14T15:32:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:05:21.452501Z","submitted_at":"2026-07-14T15:32:10Z","title":"SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2607.16309."}