{"as_of":"2026-08-06T19:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a901195e478f2b5a633209e0aeed2a11a066a9a105c719abd22f1792564e8bfa","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T08:31:08.720736Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.15770/citation-record","integrity":"/paper/2604.15770/integrity","json":"/paper/2604.15770/citation-record.json","paper":"/paper/2604.15770"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openscene: 3d scene understanding with open vocab- ularies","venue":null,"work_id":"fe25762c-bd3d-455b-9b61-340462e8cd5b","year":2023},"citing_paper":{"arxiv_id":"2604.15770","last_updated":"2026-04-23T09:00:00Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:24:14Z","title":"PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:08.720736Z"},"links":{"citing_paper":"/paper/2604.15770"},"observation_digest":"sha256:9882d9aef7eaaa85c24ca2e592a5f31e0c2cf855e64766cb32668fbc9c1d33e9","observation_id":"95d7f15e-7b34-4fc8-89ce-fd688f080e09","resolution":{"observed_at":"2026-05-21T00:24:17.883595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T18:42:49.993527Z","title":"Conceptgraphs: Open-vocabulary 3d scene graphs for perception and planning","venue":null,"work_id":"064812c3-cc99-4929-b9ab-51c8cebdad9b","year":2024},"citing_paper":{"arxiv_id":"2604.15770","last_updated":"2026-04-23T09:00:00Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:24:14Z","title":"PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:08.720736Z"},"links":{"citing_paper":"/paper/2604.15770"},"observation_digest":"sha256:2d05139d2c199feab57d4765d0e38d9bdf14edac52151c34055066081bb1d25e","observation_id":"81a32c7f-77cd-4455-8e30-fce0f5c29963","resolution":{"observed_at":"2026-05-21T00:14:18.796763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:02:57.805167Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"1eb3f634-f943-4366-8ebf-9103f721f4fd","year":2021},"citing_paper":{"arxiv_id":"2604.15770","last_updated":"2026-04-23T09:00:00Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:24:14Z","title":"PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:08.720736Z"},"links":{"citing_paper":"/paper/2604.15770"},"observation_digest":"sha256:aa058d91dd6cff38752ce848edb72862e7a5a0df2b41e13b590544d4e6cfbaee","observation_id":"f4645d52-f4cf-4d84-97ee-634790cc8720","resolution":{"observed_at":"2026-05-21T00:14:18.801196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptfu- sion: Open-set multimodal 3d mapping","venue":null,"work_id":"13d8ff3c-8a7e-48d1-98f3-db28e230ed31","year":2023},"citing_paper":{"arxiv_id":"2604.15770","last_updated":"2026-04-23T09:00:00Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:24:14Z","title":"PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:08.720736Z"},"links":{"citing_paper":"/paper/2604.15770"},"observation_digest":"sha256:9a67900a9aa151f0ca856c2cc33e103321dfdd44a8a09971a65a6af25148c2aa","observation_id":"21df3d4c-ad52-49bb-bc25-88f48338b263","resolution":{"observed_at":"2026-05-21T00:14:18.804996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openmask3d: Open-vocabulary 3d instance segmen- tation","venue":null,"work_id":"4cf9fbfd-e2e7-4362-a9c3-19f61d0b034d","year":2023},"citing_paper":{"arxiv_id":"2604.15770","last_updated":"2026-04-23T09:00:00Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:24:14Z","title":"PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:08.720736Z"},"links":{"citing_paper":"/paper/2604.15770"},"observation_digest":"sha256:bfb708977e85e9b66ab060b8f8dfb49aea18aef2365d52465b116b10171e42a1","observation_id":"d03d22b9-4650-4bc7-a8f7-60ee5d9673dd","resolution":{"observed_at":"2026-05-21T00:14:18.792397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Am-radio: Agglomerative vision foundation model reduce all domains into one","venue":null,"work_id":"9cf5fee2-711e-47fe-8c56-c23095a843ed","year":2024},"citing_paper":{"arxiv_id":"2604.15770","last_updated":"2026-04-23T09:00:00Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:24:14Z","title":"PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:08.720736Z"},"links":{"citing_paper":"/paper/2604.15770"},"observation_digest":"sha256:b078f6f71914b6199e49075e84428dcdae45a693c11ee6d17012e5042264a86e","observation_id":"26af8c7b-e067-49ae-8637-9fb5005b78bf","resolution":{"observed_at":"2026-05-21T00:14:18.812774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06994","last_updated":"2025-04-09T16:06:58Z","snapshot_observed_at":"2026-08-02T13:01:08.779275Z","submitted_at":"2025-04-09T16:06:58Z","title":"RayFronts: Open-Set Semantic Ray Frontiers for Online Scene Understanding and Exploration","version":1},"cited_work":{"arxiv_id":"2504.06994","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.06994","snapshot_observed_at":"2026-07-01T19:36:09.401596Z","title":"Rayfronts: Open-set semantic ray frontiers for online scene understanding and ex- ploration","venue":null,"work_id":"f4da4aac-9dc3-4d63-a190-4b2584f0022b","year":2025},"citing_paper":{"arxiv_id":"2604.15770","last_updated":"2026-04-23T09:00:00Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:24:14Z","title":"PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:08.720736Z"},"links":{"cited_paper":"/paper/2504.06994","citing_paper":"/paper/2604.15770"},"observation_digest":"sha256:859b48baa00dfd90f514e4488c701ee7d86d515bf6ad7a9ec43d9f4afa9a9897","observation_id":"774ddae1-36b6-4640-afdf-05aec72ed9ee","resolution":{"observed_at":"2026-05-10T08:53:05.074208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Inst3d-lmm: Instance- aware 3d scene understanding with multi-modal instruction tuning","venue":null,"work_id":"5da16281-fba4-43f4-885e-a084bcd9c2e5","year":2025},"citing_paper":{"arxiv_id":"2604.15770","last_updated":"2026-04-23T09:00:00Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:24:14Z","title":"PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:08.720736Z"},"links":{"citing_paper":"/paper/2604.15770"},"observation_digest":"sha256:ba253d86df2fde228754788c83df33e070ade05fb039236669d0b64fa8bbeab5","observation_id":"3d48a868-d852-412a-9a37-8899c2785049","resolution":{"observed_at":"2026-05-21T00:14:18.808815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":"82317eee-3256-4afd-863a-551ff2726770","year":2023},"citing_paper":{"arxiv_id":"2604.15770","last_updated":"2026-04-23T09:00:00Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:24:14Z","title":"PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:08.720736Z"},"links":{"citing_paper":"/paper/2604.15770"},"observation_digest":"sha256:12db9cb21c189133fbf912d5387cf91810f87bc92ffea0817bcaad59509ff0d7","observation_id":"bc3bb080-353b-4ff5-838f-ca13d9b65be0","resolution":{"observed_at":"2026-05-21T00:24:17.903751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Radiov2. 5: Improved baselines for agglom- erative vision foundation models","venue":null,"work_id":"e947f035-011b-41bd-8a10-f084861d3cb7","year":2025},"citing_paper":{"arxiv_id":"2604.15770","last_updated":"2026-04-23T09:00:00Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:24:14Z","title":"PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:08.720736Z"},"links":{"citing_paper":"/paper/2604.15770"},"observation_digest":"sha256:02f14950c0444cff7f6dcdc55d008e5b7e689863861cdeb93460f37e0c14b42f","observation_id":"dc7f8c59-c120-4bf2-9a4f-29bf249840aa","resolution":{"observed_at":"2026-05-21T00:24:17.889516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.964521Z","title":"Segment anything","venue":null,"work_id":"13c25dad-afdb-4387-941e-ada5036e01fc","year":2023},"citing_paper":{"arxiv_id":"2604.15770","last_updated":"2026-04-23T09:00:00Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:24:14Z","title":"PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:08.720736Z"},"links":{"citing_paper":"/paper/2604.15770"},"observation_digest":"sha256:7ae71c5b8013edcfb3cf0b00f9d1949599d2d4da41c0ade6393952fccd625df2","observation_id":"48c5a499-f737-4f23-a7b6-66dc01d1d24f","resolution":{"observed_at":"2026-05-21T00:24:17.894879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip-fo3d: Learning free open-world 3d scene representations from 2d dense clip","venue":null,"work_id":"e3d6f0af-7c05-4a20-9046-4c3d382bc32f","year":2023},"citing_paper":{"arxiv_id":"2604.15770","last_updated":"2026-04-23T09:00:00Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:24:14Z","title":"PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:08.720736Z"},"links":{"citing_paper":"/paper/2604.15770"},"observation_digest":"sha256:960a258ef9aba40c1fa521e8a6ffeeb241e63a48eb5172817d6443f92dd5f1a5","observation_id":"efdeb7dc-7c99-44a5-93f3-b9417006bf7d","resolution":{"observed_at":"2026-05-21T00:24:17.899378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural compression-based feature learning for video restoration","venue":null,"work_id":"928dd3b6-7940-43fc-b5e9-7c2892a8e214","year":2022},"citing_paper":{"arxiv_id":"2604.15770","last_updated":"2026-04-23T09:00:00Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:24:14Z","title":"PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:08.720736Z"},"links":{"citing_paper":"/paper/2604.15770"},"observation_digest":"sha256:af9020b9c8c31545359985b26a22dbce08918414def654399083033b7aeaca04","observation_id":"80990d33-5ac8-49a6-8544-7b5a516084a8","resolution":{"observed_at":"2026-05-21T00:24:17.924278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fully sparse 3d occupancy prediction","venue":null,"work_id":"86d02fda-a15c-4500-ad00-d70872e36992","year":2024},"citing_paper":{"arxiv_id":"2604.15770","last_updated":"2026-04-23T09:00:00Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:24:14Z","title":"PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:08.720736Z"},"links":{"citing_paper":"/paper/2604.15770"},"observation_digest":"sha256:66a82c63545d6523351740c671e0c0a34ef9525599a2c7c60f6eb8ebb1657847","observation_id":"1ac679b6-64d8-48f0-87fb-fc50737001a6","resolution":{"observed_at":"2026-05-21T00:24:17.961271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kimera: an open- source library for real-time metric-semantic localization and mapping","venue":null,"work_id":"334f8923-6178-4e57-b668-35b07fbde800","year":2020},"citing_paper":{"arxiv_id":"2604.15770","last_updated":"2026-04-23T09:00:00Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:24:14Z","title":"PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:08.720736Z"},"links":{"citing_paper":"/paper/2604.15770"},"observation_digest":"sha256:478432a5d06c7b86cc128e785b5dd6bee61988d795ebb36377a02d8e1f96a8f5","observation_id":"33f312bb-e2a2-42e0-861b-88d84e9ad648","resolution":{"observed_at":"2026-05-21T00:24:17.934916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"d0ca2afb-6f5d-4fae-addf-2c006aaebdd6","year":2017},"citing_paper":{"arxiv_id":"2604.15770","last_updated":"2026-04-23T09:00:00Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:24:14Z","title":"PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:08.720736Z"},"links":{"citing_paper":"/paper/2604.15770"},"observation_digest":"sha256:ed62dcf5599438a73a383bf43a3455976d5f1d2a122c6a2803897cc94ff8e13d","observation_id":"6fce7cad-7088-4f2f-a82b-ab6c4279fff6","resolution":{"observed_at":"2026-05-21T00:24:17.930626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":"02f7bb81-ab98-4f06-be1b-48334e5df61e","year":2017},"citing_paper":{"arxiv_id":"2604.15770","last_updated":"2026-04-23T09:00:00Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:24:14Z","title":"PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:08.720736Z"},"links":{"citing_paper":"/paper/2604.15770"},"observation_digest":"sha256:2d69a024cc571bd119b57ce07f050188fe6d1607547d1a0f6eae072c697b8273","observation_id":"385430ba-00a5-4d53-97be-84058c86d721","resolution":{"observed_at":"2026-05-21T00:24:17.968513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.15770","last_updated":"2026-04-23T09:00:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:24:14Z","title":"PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2604.15770."}