{"as_of":"2026-08-24T00:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e2bf8a1ee007c2edfdec214e644f526e9409b574301b2d087ecdad3018adc21","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:02:11.879023Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:02:10.585597Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.11804","snapshot_observed_at":"2026-08-03T00:02:10.585597Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:10.585597Z"},"links":{"cited_paper":"/paper/2602.11804","citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:a018549ea31a1b3f0a3ca5c7844e612936924fdc7230caf034d27221a63c24dc","observation_id":"3f326db7-26ca-4ddd-9dfc-4591ce544d38","resolution":{"observed_at":"2026-08-03T00:02:10.585597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.11804/citation-record","integrity":"/paper/2602.11804/integrity","json":"/paper/2602.11804/citation-record.json","paper":"/paper/2602.11804"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:10.531323Z","title":"Its success is largely attributed to large-scale pretraining on SA-1B [1] dataset which contains 11M images and 1B masks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:10.531323Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:ac82dfa35daff36be2f0fe435e2b34c77e66574cffdd9f442bcd9e622013c2a0","observation_id":"f5a11bd2-e1ca-4f5d-a908-d5c70c878935","resolution":{"observed_at":"2026-08-03T00:02:10.531323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.11804","snapshot_observed_at":"2026-08-03T00:02:10.585597Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:10.585597Z"},"links":{"cited_paper":"/paper/2602.11804","citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:a018549ea31a1b3f0a3ca5c7844e612936924fdc7230caf034d27221a63c24dc","observation_id":"3f326db7-26ca-4ddd-9dfc-4591ce544d38","resolution":{"observed_at":"2026-08-03T00:02:10.585597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:10.627809Z","title":"EfficientViT [4] further accelerates SAM with a lightweight vision transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:10.627809Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:4407e934f13c33348a65aff34794072881554072b994eebf2e80b744dc4b12af","observation_id":"720d4a49-6080-4fa1-bc95-ce0ad0f5bfb6","resolution":{"observed_at":"2026-08-03T00:02:10.627809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:10.667456Z","title":"We keep the original SAM prompt encoder and mask decoder unchanged, while replac- ing SAM’s heavy image encoder with EfficientViT to achieve efficiency","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:10.667456Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:4c17071982467b971a64fd075fbde2dd5a9ae5530c7698af65ee57ca871eeb7d","observation_id":"1544fcde-28f0-4aeb-a5fa-78ad0ed84811","resolution":{"observed_at":"2026-08-03T00:02:10.667456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:10.721713Z","title":"Experimental Settings We build on EfficientViT-SAM-L2, which offers the best trade-off between accuracy and computation cost, and extend it with our depth-aware framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:10.721713Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:22f3650516dd9e92bd157274f8531a85037a3f0961b7f5e40c8798b1b66283c5","observation_id":"08450c05-76d3-4ac5-9e83-e20d31b93d6f","resolution":{"observed_at":"2026-08-03T00:02:10.721713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:10.780862Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:10.780862Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:b4d4aede2180ff9c389c14d411f9776c83821f1b6a571ac77976f4f22625a208","observation_id":"b39146f1-7168-4882-a8bb-0fb5b8dc32d0","resolution":{"observed_at":"2026-08-03T00:02:10.780862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:10.827221Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:10.827221Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:851e3d3ed57d63b02b38ca0556ef6457cc26dbd294d442d7d53280e1f70a97a3","observation_id":"72e21640-9081-45cf-b8fc-5e1a32f7e49f","resolution":{"observed_at":"2026-08-03T00:02:10.827221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14289","last_updated":"2023-07-01T07:26:22Z","snapshot_observed_at":"2026-08-20T05:25:54.653744Z","submitted_at":"2023-06-25T16:37:25Z","title":"Faster Segment Anything: Towards Lightweight SAM for Mobile Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14289","snapshot_observed_at":"2026-08-03T00:02:10.884332Z","title":"Faster segment anything: Towards lightweight sam for mobile applications,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:10.884332Z"},"links":{"cited_paper":"/paper/2306.14289","citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:b682905c97d1c94dfeb8a3869bf41adad99a6418ae2f4c6017f20fc6c86640e7","observation_id":"7d30ac30-d30b-4b9c-8c59-afe7ffb71d6d","resolution":{"observed_at":"2026-08-03T00:02:10.884332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12156","last_updated":"2023-06-21T10:08:29Z","snapshot_observed_at":"2026-08-19T15:15:13.657700Z","submitted_at":"2023-06-21T10:08:29Z","title":"Fast Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12156","snapshot_observed_at":"2026-08-03T00:02:10.962607Z","title":"Fast segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:10.962607Z"},"links":{"cited_paper":"/paper/2306.12156","citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:4c4830b1e5a40acb16694b31c780ab4ef2b0aba6bf7c5123a346cf05767b4b26","observation_id":"43547a81-86e5-42d4-9bdb-0d6ba2f72d20","resolution":{"observed_at":"2026-08-03T00:02:10.962607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:11.020771Z","title":"Efficientvit: Mem- ory efficient vision transformer with cascaded group at- tention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:11.020771Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:876ed4d3ea50ec5a0ba4a383484cfddc15d6f06c76a78ded64e1fe1087a09962","observation_id":"49522811-113a-4383-87e6-67345a676f41","resolution":{"observed_at":"2026-08-03T00:02:11.020771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:11.121438Z","title":"Efficientvit- sam: Accelerated segment anything model without per- formance loss,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:11.121438Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:82181da404b79ba391cfb0006a016fb359a3900b092868901edc34f557e66424","observation_id":"1cdda066-df89-4c92-9ff3-5b5967bdfb45","resolution":{"observed_at":"2026-08-03T00:02:11.121438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:11.174321Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:11.174321Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:35c2c578d5003837561079757c879685025d17dbff2edf041e26a12f082e107c","observation_id":"f5ba3267-7a66-41f5-a20f-f5a2ebfe2801","resolution":{"observed_at":"2026-08-03T00:02:11.174321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-16T15:33:58.868647Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-03T00:02:11.238949Z","title":"Segment and track anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:11.238949Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:bcd8ce0e4eda6044c971199061254a81ecc664d7c62ae5e50882557b81926102","observation_id":"c67fe298-7b32-47f0-aff3-30da96baf5c1","resolution":{"observed_at":"2026-08-03T00:02:11.238949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:11.306244Z","title":"Vggt: Visual geometry grounded transformer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:11.306244Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:3b7b60bab39f18ca027a596fbb72a06a867027959769d49ea1d411377f5f4d74","observation_id":"156d2f43-a9e8-416d-80ea-c4b6e496a31c","resolution":{"observed_at":"2026-08-03T00:02:11.306244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:11.346720Z","title":"Evaluating mod- ern approaches in 3d scene reconstruction: Nerf vs gaussian-based methods,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:11.346720Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:3aca0ec7cf031510db0eb5c0eccb803023a1b8fda43074611721b48a13029b2a","observation_id":"6eb0102e-36f9-4daa-9d7f-3770d464fea2","resolution":{"observed_at":"2026-08-03T00:02:11.346720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:11.432665Z","title":"Ddn-slam: Real time dense dynamic neural implicit slam,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:11.432665Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:662347b892e8d39e5f6ed8f47709f53773513d0039f637d5eda8dae27efd4220","observation_id":"dbcd7b73-58b7-4fac-bcca-8cd47106ef65","resolution":{"observed_at":"2026-08-03T00:02:11.432665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:11.466222Z","title":"Dy3dgs-slam: Monocular 3d gaussian splatting slam for dynamic environments,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:11.466222Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:4ffe31651f96b5469d9f3b43d27fb3e02cdde6623d74631b46246421a05e6bb7","observation_id":"446b3389-a808-4261-acf0-3f7698b93d35","resolution":{"observed_at":"2026-08-03T00:02:11.466222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01210","last_updated":"2024-06-04T03:14:19Z","snapshot_observed_at":"2026-08-21T09:42:45.818072Z","submitted_at":"2024-06-03T11:24:15Z","title":"GeminiFusion: Efficient Pixel-wise Multimodal Fusion for Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01210","snapshot_observed_at":"2026-08-03T00:02:11.519487Z","title":"Geminifusion: Efficient pixel-wise multimodal fusion for vision transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:11.519487Z"},"links":{"cited_paper":"/paper/2406.01210","citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:c86096eecaa57fe2d7f290a765da461662b2edb003e268adcdf60badd801c4fe","observation_id":"ce3ce5fa-4e7b-41c1-b94b-627a907ea971","resolution":{"observed_at":"2026-08-03T00:02:11.519487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09668","last_updated":"2024-02-07T11:07:29Z","snapshot_observed_at":"2026-08-16T19:16:34.764885Z","submitted_at":"2023-09-18T11:09:11Z","title":"DFormer: Rethinking RGBD Representation Learning for Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09668","snapshot_observed_at":"2026-08-03T00:02:11.598690Z","title":"Dformer: Rethink- ing rgbd representation learning for semantic segmen- tation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:11.598690Z"},"links":{"cited_paper":"/paper/2309.09668","citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:a2aa428f7a7b5b585dc557e4d803a8222ec083bd1c56c978590ad62df17a69b1","observation_id":"17807937-e839-4460-8b22-f6fb084a057e","resolution":{"observed_at":"2026-08-03T00:02:11.598690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:11.631110Z","title":"Dformerv2: Geometry self-attention for rgbd semantic segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:11.631110Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:d6146e3b4b22c7853c5b988c0eb5277d5175bbd856be56d51ca3e9f87ac79eb9","observation_id":"5a334448-4abc-44e2-8e6f-2b57acf60fdd","resolution":{"observed_at":"2026-08-03T00:02:11.631110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:11.701250Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:11.701250Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:480bab0e241fa4cdbfe2ce7d8d265cb319f805415e9d64cd2dbab682ac5eb9ed","observation_id":"90314db6-3458-4b6c-a1ab-4c50202aa926","resolution":{"observed_at":"2026-08-03T00:02:11.701250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:11.736857Z","title":"Lvis: A dataset for large vocabulary instance segmentation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:11.736857Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:5d5ebb8ad703e700a75101c212c10a6bdb1141a27b146b6dbd1adc1c7cad55ff","observation_id":"190e81ed-c8af-42ff-a389-40be23bb47d4","resolution":{"observed_at":"2026-08-03T00:02:11.736857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:11.772569Z","title":"Exploring plain vision transformer backbones for object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:11.772569Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:47974ecb4116f0f6a59573ac785631043fa5971cf8d72063b7932f77b83b3938","observation_id":"b593a7f9-9be5-4b15-b0af-f766f0aa1392","resolution":{"observed_at":"2026-08-03T00:02:11.772569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:11.824158Z","title":"Uav-yolov8: A small-object- detection model based on improved yolov8 for uav aerial photography scenarios,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:11.824158Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:9ec1b5d3547bd21a6abbbbd39b75825f0aceb624702899898ab1d055194868cf","observation_id":"c56fa57f-ec58-41eb-b236-518a3a8842e3","resolution":{"observed_at":"2026-08-03T00:02:11.824158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:11.879023Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object de- tection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:11.879023Z"},"links":{"citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:7c4876c773219047e9fe46c67e5fdf755e09f6f8155434a640819e69fff9bef9","observation_id":"ed2a4766-63f8-472e-8310-0c809bd05fbb","resolution":{"observed_at":"2026-08-03T00:02:11.879023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T15:16:57.486926Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 1 inbound Pith citation observation for arXiv:2602.11804."}