{"as_of":"2026-08-18T13:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e27663693c55e3ad013b12b9796903193df59a4c4bfa7764672b4e0863e54f89","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:43:31.137505Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.14014/citation-record","integrity":"/paper/2505.14014/integrity","json":"/paper/2505.14014/citation-record.json","paper":"/paper/2505.14014"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:42.278899Z","title":"Ev-segnet: Semantic segmentation for event-based cameras,","venue":null,"work_id":"0dec45ba-8b4e-4bdd-9f44-5d7e34cead55","year":2019},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:19.629117Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:f4be6435ddfeccf8a971a9ab52002ff1396c71e0da2074e83e4523596db2c61a","observation_id":"8a66ec0e-c06d-4282-bb1c-6f05655d3012","resolution":{"observed_at":"2026-08-07T15:43:42.395233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:42.070712Z","title":"Shapeconv: Shape-aware convolutional layer for indoor rgb-d semantic segmentation,","venue":null,"work_id":"17f8ee9f-c01e-48e1-9668-93452525b0a4","year":2021},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:19.754963Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:1e059bf0773f0e485e125a6ac4e0da59d28bb301cf263d1733e9f02e75af386e","observation_id":"b802450d-5456-4f20-8f38-bfd2897fe740","resolution":{"observed_at":"2026-08-07T15:43:42.185553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:41.815795Z","title":"Bi-directional cross-modality feature propagation with separation-and-aggregation gate for rgb-d semantic segmentation,","venue":null,"work_id":"726d633f-0400-40e8-88e2-ac2a4525d66c","year":2020},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:19.863544Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:7b390a07210d691c50a54721f3a955339ebf6ec4b06bc7a4e595ae41cedc8824","observation_id":"5ce17998-7b8b-4695-8264-84e38501be80","resolution":{"observed_at":"2026-08-07T15:43:41.927645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:41.520737Z","title":"Event-based semantic segmentation with posterior attention,","venue":null,"work_id":"2b47f789-59f2-4d10-8eb8-00127119fe74","year":2023},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:19.948878Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:7e45e5bd595f74445c50008c2214921a2482ddc8d71aa46a560f1e2c507ca6e7","observation_id":"f3a5c34e-31f4-4dc9-a512-2a466eeec073","resolution":{"observed_at":"2026-08-07T15:43:41.624962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:20.103651Z","title":"Rtfnet: Rgb-thermal fusion network for semantic segmentation of urban scenes,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:20.103651Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:f9434a52d9cebe703db2e539de11f845ead3fd4434a520228034318aa99c65f5","observation_id":"590ec1ea-639b-42b6-8e13-3a0cc692bc6f","resolution":{"observed_at":"2026-08-07T15:43:20.103651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:41.327536Z","title":"Delivering arbitrary-modal semantic segmentation,","venue":null,"work_id":"446eb031-333a-4c0f-bf8b-b33405f7b42a","year":2023},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:20.223422Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:61a9383224224c2352345a70075d1d7ba03a32b802bf3848461edd036277bec7","observation_id":"c2bb04ee-4b55-411a-8441-fb5389ec28f1","resolution":{"observed_at":"2026-08-07T15:43:41.416425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16108","last_updated":"2024-05-25T07:45:41Z","snapshot_observed_at":"2026-08-18T08:58:32.629714Z","submitted_at":"2024-05-25T07:45:41Z","title":"OmniBind: Teach to Build Unequal-Scale Modality Interaction for Omni-Bind of All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16108","snapshot_observed_at":"2026-08-07T15:43:20.388196Z","title":"Omnibind: Teach to build unequal-scale modality interaction for omni-bind of all,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:20.388196Z"},"links":{"cited_paper":"/paper/2405.16108","citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:5b05f5b8a4293e83634f732b19009f559262f7a0bb8cc63220655f8246c16099","observation_id":"a01a1f47-82be-43db-b868-5d97d38c420b","resolution":{"observed_at":"2026-08-07T15:43:20.388196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:41.025815Z","title":"Fusenet: Incorporating depth into semantic segmentation via fusion-based cnn architecture,","venue":null,"work_id":"838e94c1-f52e-4237-818e-fb04dca35f80","year":2016},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:20.513910Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:64e64f6411fb9e427c4841c9780b457f7f96b706181d3ac660f08dcea13aade6","observation_id":"9cf9c232-6995-48e2-a0cf-257364f9a713","resolution":{"observed_at":"2026-08-07T15:43:41.117067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:40.787098Z","title":"Rgb and lidar fusion based 3d semantic seg- mentation for autonomous driving,","venue":null,"work_id":"968295f9-0ab4-4ba8-b4e8-2950958a5547","year":2019},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:20.632868Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:a52ee0a67ffe59bc910cf57e28ecd05212e23815f25e71bc52257205a0ca93a8","observation_id":"46d97b7b-036a-4641-9d41-dd9160e40c98","resolution":{"observed_at":"2026-08-07T15:43:40.937485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:40.637051Z","title":"Mseg3d: Multi-modal 3d semantic segmentation for autonomous driving,","venue":null,"work_id":"bb3e084e-f903-4ea6-bb56-b78efe7bea96","year":2023},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:20.700868Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:7f2cfa28d9030935a65540f1a7e5417dc7036f798c3aa57120e95bec5c8611a6","observation_id":"75420593-0d46-405a-8e72-02e749318d08","resolution":{"observed_at":"2026-08-07T15:43:40.684186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:40.491222Z","title":"Unibind: Llm-augmented unified and balanced representation space to bind them all,","venue":null,"work_id":"3b04cabe-5f8c-4573-ad75-f9ea19d932f4","year":2024},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:20.785941Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:8a1598509a81d618ef3671143f1b49d03dfe312ee9eabfead65ce026151fa8a3","observation_id":"d21005d1-51e3-4a3a-9a1d-391c8e76c929","resolution":{"observed_at":"2026-08-07T15:43:40.564195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:40.376111Z","title":"Sam-event-adapter: Adapting segment anything model for event-rgb semantic segmentation,","venue":null,"work_id":"37a53fb6-f8fa-4a76-a4cf-a5c9a4f42264","year":2024},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:20.934869Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:d49ff787e362b598b2bc9ec6bfa4fcad78808a84aefd461a84b747177a561512","observation_id":"abbfa9ee-810c-4a0b-9c07-b2aed605584c","resolution":{"observed_at":"2026-08-07T15:43:40.409708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:40.306945Z","title":"Eseg: Event-based segmentation boosted by explicit edge- semantic guidance,","venue":null,"work_id":"2662fe9d-715b-4349-9916-f0a0df7ace98","year":2025},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:21.036434Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:4b363aff75ef64e1385ff18db671a4d7dc0686373a5989c52d20a4d0fc4ad2de","observation_id":"df2c3feb-2416-4730-bfc9-b5d681b663cf","resolution":{"observed_at":"2026-08-07T15:43:40.334738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:40.187242Z","title":"Eventdance: Unsupervised source-free cross-modal adaptation for event-based object recognition,","venue":null,"work_id":"b7b62c19-d3b2-4faa-b604-d6fc9ed3eaf8","year":2024},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:21.178394Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:2eef1c279a8ded4493cf8a37183860a362650e7472cfe7dd0bad628d68b06240","observation_id":"b4d50818-3838-48ed-9e00-7ad3ace12953","resolution":{"observed_at":"2026-08-07T15:43:40.248002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:40.065757Z","title":"Exact: Language-guided conceptual reasoning and uncertainty estimation for event-based action recognition and more,","venue":null,"work_id":"31b63a44-b5ef-4591-9e85-e8b4b8645e99","year":2024},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:21.295285Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:3d829113c008b2d69c06be3bd352c043ea7f0589d7e0904f77728bfe87122d71","observation_id":"9fdc5b25-b3db-441d-9385-fcd759fd57be","resolution":{"observed_at":"2026-08-07T15:43:40.136570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:39.910681Z","title":"Cafuser: Condition-aware multimodal fusion for robust semantic perception of driving scenes,","venue":null,"work_id":"a937f9c1-087f-4cd0-884a-ae7a2054f2c6","year":2025},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:21.403105Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:c3b35dceeca389bcb9cd82c0437f4e04c3d5c05db85831759a0e636d60819009","observation_id":"6077fd7c-9873-4cc0-bf1a-759d447d5135","resolution":{"observed_at":"2026-08-07T15:43:39.986562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01343","last_updated":"2025-08-07T03:50:19Z","snapshot_observed_at":"2026-08-16T13:28:55.769138Z","submitted_at":"2024-08-02T15:41:16Z","title":"StitchFusion: Weaving Any Visual Modalities to Enhance Multimodal Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01343","snapshot_observed_at":"2026-08-07T15:43:21.565090Z","title":"Stitchfusion: Weaving any visual modalities to enhance multimodal semantic segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:21.565090Z"},"links":{"cited_paper":"/paper/2408.01343","citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:df943c622c2f5412fd23196237e7b5b8245e1a9db160b347b643d0031e0bccbf","observation_id":"1d22fb93-76f4-486f-876b-e098bc36075e","resolution":{"observed_at":"2026-08-07T15:43:21.565090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:39.813899Z","title":"Centering the value of every modality: Towards efficient and resilient modality-agnostic semantic segmentation,","venue":null,"work_id":"becbac96-aa46-44e7-8fe3-cceeba165b96","year":2024},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:21.625649Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:69b92033b5931ff30520cae95a4a091eda887c14a65fd7a544810470dcfd0553","observation_id":"f6f33232-fff2-4e43-b3a5-8a1edaad5d2e","resolution":{"observed_at":"2026-08-07T15:43:39.849623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:39.624000Z","title":"Multimodal token fusion for vision transformers,","venue":null,"work_id":"95539c88-8f15-41c5-a7c8-6a16716bc4d5","year":2022},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:21.708209Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:40107a822f0406221a4b79e91837087669ed7252f3804ddfa77455248aeaa91d","observation_id":"906c958f-4da5-445a-bcc0-09988b03394b","resolution":{"observed_at":"2026-08-07T15:43:39.747504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:39.472311Z","title":"360sfuda++: Towards source-free uda for panoramic segmentation by learning reliable category prototypes,","venue":null,"work_id":"d4654b4c-e71f-43d1-a436-9d41cc967339","year":2024},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:21.832567Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:6922a8da98683898b0a3be470bd34e081db4b2e8ac921766600212a39f2fe1b6","observation_id":"1849608d-46cd-4aa7-8a69-bb5dd6c5a2b7","resolution":{"observed_at":"2026-08-07T15:43:39.547930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:39.349435Z","title":"Semantics distortion and style matter: Towards source-free uda for panoramic segmentation,","venue":null,"work_id":"92b0d35f-8557-416e-baf1-0b3b347c0d62","year":2024},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:21.942749Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:c060443b4821e9bcbae32edc390c9a59fc42e8a14986c46fcb4b95f320f7000b","observation_id":"654cf705-dc39-43a7-b89f-a2395b77b0d3","resolution":{"observed_at":"2026-08-07T15:43:39.406412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:39.193841Z","title":"Both style and distortion matter: Dual- path unsupervised domain adaptation for panoramic semantic segmentation,","venue":null,"work_id":"635400e8-e0a0-4473-a89b-da6eba8deb53","year":2023},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:22.015026Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:793ffd8ca8abc50ea224812c8d26b4691398c1b91335f8ec6d8dc47573f9a324","observation_id":"729e770d-5f1f-439c-be19-ae2a87cdd7e5","resolution":{"observed_at":"2026-08-07T15:43:39.272199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:39.062217Z","title":"Look at the neighbor: Distortion-aware unsupervised domain adaptation for panoramic semantic segmentation,","venue":null,"work_id":"0bdfcd30-2e06-4221-846f-2a768101347b","year":2023},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:22.136095Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:f89e93d9b94606a0b34b009a29979de2ee41b9cb44759e96d9df5ebe78d43e34","observation_id":"6c2c6ce8-3eca-4534-9963-470a8870b833","resolution":{"observed_at":"2026-08-07T15:43:39.135517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:38.790839Z","title":"Multimodal material segmentation,","venue":null,"work_id":"172bea7f-5a8f-4e15-8402-129d7cad5200","year":2022},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:22.216920Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:dc20400730ee02f1a2ba04b8eb6c4f0065c0e8819dc7a30b11fc9b239a5662af","observation_id":"0fbd33c4-7342-4ab5-884f-28e1cd43ae31","resolution":{"observed_at":"2026-08-07T15:43:38.924737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:38.524027Z","title":"Multi-shot temporal event localization: A benchmark,","venue":null,"work_id":"460fc00d-528a-485e-b242-8e6e143c651b","year":2021},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:22.304997Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:81ec688c86cfae1567624579c800dab15f9daf02b97f4a41aca7ab8bfe06100b","observation_id":"d41e81c4-716f-4a01-adc1-bf7f3d458fa6","resolution":{"observed_at":"2026-08-07T15:43:38.616643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:38.290806Z","title":"Beyond rgb: Very high resolution urban remote sensing with multimodal deep networks,","venue":null,"work_id":"7f74e3b7-8a71-4789-88c2-0c9d69be58e3","year":2018},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:22.435649Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:e3dfad6c5d5e96298a7135e8e5d0fc39725bb9af4c265f047ce339426ad1f76f","observation_id":"0b9210d6-54ba-4408-9be9-871a0d21566c","resolution":{"observed_at":"2026-08-07T15:43:38.414754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:38.036850Z","title":"U-net ensemble for enhanced semantic segmentation in remote sensing imagery,","venue":null,"work_id":"b715995c-cc07-4729-ae41-7c06869509b7","year":2024},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:22.536695Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:16cdfcd0489616be4c0ea7aa1071aab786d073c9d1dfd38a4de23929dee643db","observation_id":"14e8e53e-c353-477b-99e6-544783d55765","resolution":{"observed_at":"2026-08-07T15:43:38.158670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:37.864833Z","title":"Metasegnet: Metadata-collaborative vision-language representation learning for semantic segmentation of remote sensing images,","venue":null,"work_id":"0ddc3686-abd4-44f8-b403-f9d1e5bdf3fb","year":2024},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:22.626469Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:1513252b23c78d8c18af856525381361fc9c5ad4101d3a55e861a1f401ee2214","observation_id":"f76f8d3e-e85e-4326-9b70-15ef2a7bf59f","resolution":{"observed_at":"2026-08-07T15:43:37.934560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:37.614800Z","title":"Transformer-cnn cohort: Semi-supervised semantic segmentation by the best of both students,","venue":null,"work_id":"57731674-a0bb-43c5-bb24-0e2ce5ddc0bd","year":2024},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:22.700894Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:08b42a698ece96cd94c628c58149d949e3bd078e6a9228d32f6f2f370a2bca5f","observation_id":"19b1a5eb-bd13-4f90-9bdc-8ad2e386c0bd","resolution":{"observed_at":"2026-08-07T15:43:37.754420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:37.305954Z","title":"Distilling efficient vision transformers from cnns for semantic segmentation,","venue":null,"work_id":"17bbc822-3319-4fa3-aad2-26b8ae4597f4","year":2025},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:22.825805Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:3b0ffefb3329e87a917acee85e26949f8c6b1c62a25709e047728461be64ca44","observation_id":"29a21184-eedf-4777-ad94-908eb06f3149","resolution":{"observed_at":"2026-08-07T15:43:37.445302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:37.009160Z","title":"Frozen is better than learning: A new design of prototype-based classifier for semantic segmentation,","venue":null,"work_id":"974e528a-b0fb-4899-b9a9-fc51e05ac228","year":2024},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:22.919462Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:db6ebb58b9b5d0605fd5cd2c116fb67b347e7cebf2e72d280854c27843fd1999","observation_id":"4591c939-a97e-44a6-9d65-758487e655f7","resolution":{"observed_at":"2026-08-07T15:43:37.162825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:36.771243Z","title":"Covered: Collaborative robot environment dataset for 3d semantic segmentation,","venue":null,"work_id":"24d5286d-320e-4958-8c9c-dddce5e35138","year":2022},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:22.976883Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:00b07ec21283244222d9a8169affe3d259e9cfcf5ea372b9512219d886ced1d5","observation_id":"53ba671e-4153-4bbc-a885-c0ef7d5b7b32","resolution":{"observed_at":"2026-08-07T15:43:36.855783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:36.564296Z","title":"Fully convolutional networks for semantic segmentation,","venue":null,"work_id":"2f72f10a-308a-4f01-b9f8-34f96ce6651a","year":2015},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:23.057101Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:6838007753c1072b98105b98756c5e883cbbd1c4db58fff4ea73846c3877e4a8","observation_id":"ed175693-ed6e-4d32-95fe-1dda2d0b7648","resolution":{"observed_at":"2026-08-07T15:43:36.638807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:36.283159Z","title":"Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected crfs,","venue":null,"work_id":"0e64210c-e178-41e2-ad61-2d451ba12039","year":2018},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:23.146581Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:79125fb934ad0248c3020eb0577f7a962ae079db41224ba2998a17ab7b602ac9","observation_id":"47bc5df0-e6a7-453e-9987-2d9f839124e8","resolution":{"observed_at":"2026-08-07T15:43:36.424744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:36.118466Z","title":"Encoder-decoder with atrous separable convolution for semantic image segmentation,","venue":null,"work_id":"4ae92f47-587c-4cf2-bec1-3c2425f54788","year":2018},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:23.252212Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:9bab14498820b4df0f20ff5518685f84e2c39599a0c6689552ab5d81db261170","observation_id":"76bec327-c689-4f56-870d-1895c79bc415","resolution":{"observed_at":"2026-08-07T15:43:36.228807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.921936Z","title":"Strip pooling: Rethinking spatial pooling for scene pars- ing,","venue":null,"work_id":"3549fe06-8911-4a92-a7f0-815c8a99619e","year":2020},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:23.372373Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:1b71b787ef23a7982bc1172da2ee31fec488c8d92c346c8261fa449494888226","observation_id":"d5510f49-f132-4429-a1a8-24b9141e8f9a","resolution":{"observed_at":"2026-08-07T15:43:35.997605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.728737Z","title":"Pyramid scene parsing network,","venue":null,"work_id":"a8b275c5-3d89-4fad-a10f-f40eb1c7ee69","year":2017},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:23.481361Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:c74200aeed5e0fb3e9491d7fb796aaf37735c8b9f7d88fa9136eb6d3bb3d18de","observation_id":"6903c915-77e3-4334-879a-6ded3dec6597","resolution":{"observed_at":"2026-08-07T15:43:35.854743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.485117Z","title":"Cars can’t fly up in the sky: Improving urban-scene segmen- tation via height-driven attention networks,","venue":null,"work_id":"59ef3d46-2b5f-4e68-9741-afb6236dad8e","year":2020},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:23.576350Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:ecd30dc38a3aade89ff65983ee5053050b99b88f333683124ff353760b4de03e","observation_id":"d480ac81-ab70-4009-b2cd-ac816670a632","resolution":{"observed_at":"2026-08-07T15:43:35.614937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.360750Z","title":"Dual attention network for scene segmentation,","venue":null,"work_id":"84c4d3ec-589c-4c8d-ae51-4137340b1562","year":2019},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:23.691982Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:658eec39bbfb4f3987136515610819c3330d52da2f34c179a4cb431bcdb1c0ab","observation_id":"92d355b4-398a-47c8-8c60-463d691b697f","resolution":{"observed_at":"2026-08-07T15:43:35.420901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.214751Z","title":"Ccnet: Criss-cross attention for semantic segmentation,","venue":null,"work_id":"2a70c766-61f6-48e0-b4dc-fe46bcb305c6","year":2019},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:23.763730Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:aab3748f8046c4efdde2af3695b760a461a10afbec22f053d2cf9bba84027e48","observation_id":"c79142b0-867e-4ea1-94b0-1222503d3d75","resolution":{"observed_at":"2026-08-07T15:43:35.290124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.060513Z","title":"Ocnet: Object context for semantic segmentation,","venue":null,"work_id":"b330def7-6467-4710-a1ef-463d9c60619b","year":2021},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:23.883094Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:b48e902da2b4b32a371505381c3b3fecb8a4406d71e1b6f1b3e46dc868350784","observation_id":"3afe158c-4e6e-4c07-a019-0d4b862520d2","resolution":{"observed_at":"2026-08-07T15:43:35.149219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:34.916424Z","title":"Inverseform: A loss function for structured boundary-aware segmentation,","venue":null,"work_id":"d1634ca1-477d-40a7-89c0-e45ad5ec07c1","year":2021},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:24.088993Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:e6390849e0b391eb4d07ba186e78217f5892e18c7105240db06ad4cf7e99e55f","observation_id":"7315b37d-8e75-41e9-9eae-ebcf55fbd7c0","resolution":{"observed_at":"2026-08-07T15:43:34.979664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:34.739809Z","title":"Boundary-aware feature propagation for scene segmentation,","venue":null,"work_id":"74f309eb-459c-458e-bb32-ad993e23e670","year":2019},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:24.263393Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:b0c75d6f6dd8743de92ce70ed0097944e0974ecd2b048fb472024e1557d2b3f6","observation_id":"33464a97-6933-4e7c-a888-90b3741023e2","resolution":{"observed_at":"2026-08-07T15:43:34.844907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:34.500653Z","title":"Improving semantic segmentation via decoupled body and edge supervision,","venue":null,"work_id":"178107ca-7afc-4139-b4d0-88f203d47f15","year":2020},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:24.426298Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:8c627db6779b5bc4a59a4278986edcb410dc6be5535c0d043b6f26f4a0621658","observation_id":"6a7c3037-c79a-4c64-92ee-e5724f1e03a1","resolution":{"observed_at":"2026-08-07T15:43:34.612020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06195","last_updated":"2021-06-11T06:53:09Z","snapshot_observed_at":"2026-08-16T18:17:53.496727Z","submitted_at":"2021-06-11T06:53:09Z","title":"MlTr: Multi-label Classification with Transformer","version":1},"cited_work":{"arxiv_id":"2106.06195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06195","snapshot_observed_at":"2026-08-07T15:43:31.311152Z","title":"MlTr: Multi-label Classification with Transformer","venue":"cs.CV","work_id":"5d6fb498-92b0-40e3-bfe8-c35394dcb9af","year":2021},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:24.605591Z"},"links":{"cited_paper":"/paper/2106.06195","citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:fcda62e12d5b695d5caebac3d27a0ba45efb25e3fbf51b2c832fc1f07b98e9f8","observation_id":"bac542c9-a8da-449d-9fd4-cfff72843407","resolution":{"observed_at":"2026-08-07T15:43:31.372825Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:34.269747Z","title":"Multi- scale high-resolution vision transformer for semantic segmentation,","venue":null,"work_id":"c9016783-721a-4d4c-b05f-7cca16f562a4","year":2022},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:24.686984Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:9e5abe303606d2b922c5080179cd7fbe1cc734f339aee86669c4fd4bd7743943","observation_id":"c6652629-e761-45f7-b42c-1ba888870863","resolution":{"observed_at":"2026-08-07T15:43:34.375561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:34.085807Z","title":"Segnext: Rethinking convolutional attention design for semantic segmentation,","venue":null,"work_id":"718615eb-4b32-44ed-a996-59b5fbec4046","year":2022},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:24.774124Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:684e426e646d1bf446fea4d9aabcdc59884d2657ef8898ba9ea4cc7a91477be5","observation_id":"67a19b09-c1fc-4e3a-9c0f-dda4b6712f1f","resolution":{"observed_at":"2026-08-07T15:43:34.158848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:33.911461Z","title":"Swin transformer v2: Scaling up capacity and resolution,","venue":null,"work_id":"b3851718-15b6-46e5-ab93-5cb65536ac4c","year":2022},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:24.914746Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:4fb503d333b25b63f42592e0360e42e8423e3abbaf942496701b9012c07a17fd","observation_id":"7babdc00-a427-45ca-aabb-469d62fd7a3a","resolution":{"observed_at":"2026-08-07T15:43:34.026301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:33.764053Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":"caa0c301-4292-4144-a287-e4bcb5b10722","year":2021},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:25.054740Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:5981ae6df8a239872701852086579d245f7faa7af63466cf6424085bcdaa29ad","observation_id":"8ff00dc9-0660-4ff0-913f-9e39a115d27c","resolution":{"observed_at":"2026-08-07T15:43:33.835479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:33.598864Z","title":"Segmenter: Transformer for semantic segmen- tation,","venue":null,"work_id":"131375c8-30a2-4ff9-a8d4-ee608bd568b0","year":2021},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:25.269636Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:393ea270db3863f309271a0afe5498a45cff125739774ad8f72e8d6deb98e70d","observation_id":"d4edc1c9-213e-4035-90a5-c8239dc1c2f6","resolution":{"observed_at":"2026-08-07T15:43:33.690279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:33.386262Z","title":"Segformer: Simple and efficient design for semantic segmentation with transformers,","venue":null,"work_id":"c7b6076d-ccbf-42db-bb67-e032cee13dd0","year":2021},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:25.391926Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:bc447de89b018d4a1d2e8883785f957de5196cb5d10ffe2a8d482a934232416f","observation_id":"08ec65df-c570-4c7e-8461-2509f40f64c6","resolution":{"observed_at":"2026-08-07T15:43:33.489885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:33.168045Z","title":"Segvit: Semantic segmenta- tion with plain vision transformers,","venue":null,"work_id":"a58bcf5c-469d-4ad3-aeda-d341b04671cc","year":2022},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:25.540311Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:7f4327c4fd07171d51b6d8d9e5a568b0eab0a1afcec5d850a7cac290263a2923","observation_id":"d6af9378-5bda-4628-a1c3-6581a083e3f5","resolution":{"observed_at":"2026-08-07T15:43:33.287570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:32.938248Z","title":"Rethinking semantic segmentation from a sequence-to-sequence perspective with transformers,","venue":null,"work_id":"cd05a429-9f40-48de-a0c7-8633dc10d0cc","year":2021},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:25.622256Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:cf0095fe65886d56728d3613dabb5ccced2cde30edcb65e9775f3b90ed31bbfb","observation_id":"db6c9336-8d92-4d02-b597-6f029ace0f29","resolution":{"observed_at":"2026-08-07T15:43:33.049846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:32.675435Z","title":"X- align: Cross-modal cross-view alignment for bird’s-eye-view segmentation,","venue":null,"work_id":"2c9c24e7-8be5-470b-ac1c-fd9fefeddbe8","year":2023},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:25.739601Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:8d23244c0f6dda170e1c31182da7db1f348f7b4d81045365f43b93cc1d2a42f7","observation_id":"6f034958-a4b5-474c-b7fd-2562147aee1f","resolution":{"observed_at":"2026-08-07T15:43:32.778652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:32.440976Z","title":"Modality-induced transfer-fusion network for rgb-d and rgb-t salient object detection,","venue":null,"work_id":"a582a2cf-f56c-454f-b1e1-0010e89233a8","year":2022},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:25.851871Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:ea1f0a8faad4caba86af5c411573e4c85e88b62b38e9df4ccf699cc36d054cfe","observation_id":"417abd1f-41f4-40cb-915f-36b466f506a4","resolution":{"observed_at":"2026-08-07T15:43:32.552356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:32.242602Z","title":"Bridging search region interaction with template for rgb-t tracking,","venue":null,"work_id":"98d36952-43c5-49a7-be73-b71d6c23894a","year":2023},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:25.991772Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:81c5cadd4945e41a85eed8503413302a8512190c3d2d733a089c6756e8d8789b","observation_id":"64f00d39-1888-49e5-8f23-f55c8836773b","resolution":{"observed_at":"2026-08-07T15:43:32.348897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:31.974113Z","title":"Cross-collaborative fusion-encoder network for robust rgb-thermal salient object detection,","venue":null,"work_id":"fedd8e7a-828e-4544-bcf3-dd5fa1c29644","year":2022},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:27.054744Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:5b205ca0942bfbe788ec26f8fa41f4476538e5d89bf8a1ae0a253323b9e892a9","observation_id":"597d87b1-14ae-406b-a258-1e5cf548d3f2","resolution":{"observed_at":"2026-08-07T15:43:32.111387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:31.832715Z","title":"Glass segmentation using intensity and spectral polarization cues,","venue":null,"work_id":"79adbd59-2278-480a-b4fa-87f279d20e43","year":2022},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:30.177633Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:5f19a0d381ee2583b9e96317b9db32ef87afd0f23634e77cb6af88d0d59d21a4","observation_id":"d791a267-1f3f-4237-9e0a-8076ea581011","resolution":{"observed_at":"2026-08-07T15:43:31.898665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:31.645099Z","title":"Caver: Cross-modal view-mixed transformer for bi- modal salient object detection,","venue":null,"work_id":"aca499b1-066f-46a3-8d18-9501eff54b23","year":2023},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:30.270272Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:82d007e8afc7334d122c07733ca127b77c158384f7d883513b9447a39f4b5c20","observation_id":"3053928f-2c35-4c1d-a47e-e0ad78526424","resolution":{"observed_at":"2026-08-07T15:43:31.743634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18445","last_updated":"2025-04-10T08:56:52Z","snapshot_observed_at":"2026-08-18T08:57:39.236049Z","submitted_at":"2025-03-24T08:46:52Z","title":"Benchmarking Multi-modal Semantic Segmentation under Sensor Failures: Missing and Noisy Modality Robustness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18445","snapshot_observed_at":"2026-08-07T15:43:30.415428Z","title":"Benchmarking multi-modal semantic segmentation under sensor failures: Missing and noisy modality robustness,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:30.415428Z"},"links":{"cited_paper":"/paper/2503.18445","citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:f0db6d239c154c5795e3122487f1808371b5dce3f22963c0d116e9a42212e7b8","observation_id":"09daef4c-3a61-4675-a78d-c635eda57b43","resolution":{"observed_at":"2026-08-07T15:43:30.415428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06635","last_updated":"2025-05-10T12:58:15Z","snapshot_observed_at":"2026-08-17T18:52:10.932653Z","submitted_at":"2025-05-10T12:58:15Z","title":"Reducing Unimodal Bias in Multi-Modal Semantic Segmentation with Multi-Scale Functional Entropy Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06635","snapshot_observed_at":"2026-08-07T15:43:30.492138Z","title":"Reducing unimodal bias in multi-modal semantic segmentation with multi-scale functional entropy regularization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:30.492138Z"},"links":{"cited_paper":"/paper/2505.06635","citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:94bbbb3029cebfb83e0e6513774d539726d0c589a083ae973080053322557764","observation_id":"e45e6ac9-3e93-41c6-abc1-da0260c12089","resolution":{"observed_at":"2026-08-07T15:43:30.492138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06700","last_updated":"2025-03-20T18:36:20Z","snapshot_observed_at":"2026-08-18T08:58:35.718160Z","submitted_at":"2025-03-09T17:33:15Z","title":"MemorySAM: Memorize Modalities and Semantics with Segment Anything Model 2 for Multi-modal Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06700","snapshot_observed_at":"2026-08-07T15:43:30.606779Z","title":"Memorysam: Memorize modalities and semantics with segment anything model 2 for multi-modal semantic segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:30.606779Z"},"links":{"cited_paper":"/paper/2503.06700","citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:f8634900bc973f2855e3fb8f937eb0c7a20baa112cbe522cf1bc508f3a05c2ab","observation_id":"e0823244-7e6e-44c5-9e99-9363d482538d","resolution":{"observed_at":"2026-08-07T15:43:30.606779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02581","last_updated":"2025-07-22T13:20:58Z","snapshot_observed_at":"2026-08-18T08:58:31.049671Z","submitted_at":"2025-03-04T13:04:46Z","title":"Unveiling the Potential of Segment Anything Model 2 for RGB-Thermal Semantic Segmentation with Language Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02581","snapshot_observed_at":"2026-08-07T15:43:30.697183Z","title":"Unveiling the potential of segment anything model 2 for rgb-thermal semantic segmentation with language guidance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:30.697183Z"},"links":{"cited_paper":"/paper/2503.02581","citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:fe6bc21bff12b763838f1c2469818cdf65fc34dbbda4daed27943199b4f1b184","observation_id":"385a25b5-c5b0-41fe-bbb8-94eced14162c","resolution":{"observed_at":"2026-08-07T15:43:30.697183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:31.497843Z","title":"Learning modality-agnostic representation for semantic segmentation from any modalities,","venue":null,"work_id":"d2e335cb-f0f7-4e4b-8848-6e6e948d296e","year":2024},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:30.779455Z"},"links":{"citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:4c84ced9bfdee84a9fd7fa1832d0d0e0bc075951dce681016aca8ffb296c1555","observation_id":"b0484a68-1d0f-4113-a70c-1f2129c8f129","resolution":{"observed_at":"2026-08-07T15:43:31.579638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16876","last_updated":"2024-12-22T06:12:03Z","snapshot_observed_at":"2026-08-15T05:47:29.055177Z","submitted_at":"2024-12-22T06:12:03Z","title":"MAGIC++: Efficient and Resilient Modality-Agnostic Semantic Segmentation via Hierarchical Modality Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16876","snapshot_observed_at":"2026-08-07T15:43:30.875068Z","title":"Magic++: Efficient and resilient modality-agnostic semantic segmentation via hierarchical modality selection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:30.875068Z"},"links":{"cited_paper":"/paper/2412.16876","citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:a9f226ada58ee5b72a09e1abef24cc8e3451f01d107c4b9c44edc676a72b0e52","observation_id":"5d777c08-7668-4511-868e-d32d9f293875","resolution":{"observed_at":"2026-08-07T15:43:30.875068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04220","last_updated":"2024-12-05T14:54:31Z","snapshot_observed_at":"2026-08-17T23:29:24.004954Z","submitted_at":"2024-12-05T14:54:31Z","title":"Customize Segment Anything Model for Multi-Modal Semantic Segmentation with Mixture of LoRA Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04220","snapshot_observed_at":"2026-08-07T15:43:30.986674Z","title":"Customize segment anything model for multi- modal semantic segmentation with mixture of lora experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:30.986674Z"},"links":{"cited_paper":"/paper/2412.04220","citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:5637bcbee4d5c3a704cfb3f41a150434a35d8fe561f8363c671dd7b14b881e0c","observation_id":"23142e38-3826-4f6e-84e0-5ec416d80ece","resolution":{"observed_at":"2026-08-07T15:43:30.986674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08890","last_updated":"2024-04-11T15:34:46Z","snapshot_observed_at":"2026-08-17T09:05:47.162911Z","submitted_at":"2023-02-17T14:19:28Z","title":"Deep Learning for Event-based Vision: A Comprehensive Survey and Benchmarks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08890","snapshot_observed_at":"2026-08-07T15:43:31.137505Z","title":"Deep learn- ing for event-based vision: A comprehensive survey and benchmarks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:31.137505Z"},"links":{"cited_paper":"/paper/2302.08890","citing_paper":"/paper/2505.14014"},"observation_digest":"sha256:af2e2d2d67caa3142fc5820236f9769bd16f4554b33316507b8861cb9bfa7610","observation_id":"5aa8b794-8c96-49ba-815b-1d8f51cb48b6","resolution":{"observed_at":"2026-08-07T15:43:31.137505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14014","last_updated":"2025-05-20T07:08:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T05:47:33.930422Z","submitted_at":"2025-05-20T07:08:49Z","title":"EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":56},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2505.14014."}