{"as_of":"2026-08-07T09:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb787532adca06673f1809a80362ea964204efef79e0a5d58acdc726f0c0cd8e","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:39:24.422182Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16012/citation-record","integrity":"/paper/2607.16012/integrity","json":"/paper/2607.16012/citation-record.json","paper":"/paper/2607.16012"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:20.087838Z","title":"Bev- former: learning bird’s-eye-view representation from lidar-camera via spatiotemporal transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:20.087838Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:8babedc785b84560f4c84cd284ab90bcc8573ffc457501dbee1e3852cf948d48","observation_id":"a42aba28-ecac-478d-8e0c-665b7e4395bf","resolution":{"observed_at":"2026-08-01T21:39:20.087838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13243","last_updated":"2026-04-17T23:12:55Z","snapshot_observed_at":"2026-08-04T01:21:26.466156Z","submitted_at":"2024-02-20T18:55:09Z","title":"VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13243","snapshot_observed_at":"2026-08-01T21:39:20.190604Z","title":"Vadv2: End-to-end vectorized autonomous driving via probabilistic planning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:20.190604Z"},"links":{"cited_paper":"/paper/2402.13243","citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:d1c327a64dadba28cf29076bfab44202122b5c94bb4d1ffff07233587e04f577","observation_id":"2dbe5741-4ef0-4c4b-ba92-b27935d75f60","resolution":{"observed_at":"2026-08-01T21:39:20.190604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:20.348160Z","title":"Scene as occupancy,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:20.348160Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:5ee2ccc0d86d3e4f668a6a062fcd0430a63ad291182e0bf661a9e6f50bfc5ffd","observation_id":"1eac1d79-3684-45f9-8fca-a19ded0192e2","resolution":{"observed_at":"2026-08-01T21:39:20.348160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:20.517576Z","title":"Sam 2: Segment anything in images and videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:20.517576Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:2fcaff536b5656d2e011880abc5f2bfec020e61643d16a6063c472416a1cd1e3","observation_id":"75f94149-85c6-419e-a4d5-87f72161a241","resolution":{"observed_at":"2026-08-01T21:39:20.517576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:20.690201Z","title":"Depth anything v2,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:20.690201Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:90f17440fb84cca5b685792a62eb41fb10b89b228df9f153e41421a028e96a31","observation_id":"6d8e5135-e9d6-4746-9533-a5cd310102ec","resolution":{"observed_at":"2026-08-01T21:39:20.690201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:20.801836Z","title":"Multi-task learning for dense prediction tasks: A survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:20.801836Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:8c4c08bea6f0adce2c71f9d29de55558fa85ec9b4700706f63dda5a8f4fcea40","observation_id":"bb445614-6e72-4c16-8d9f-36e61a252dd4","resolution":{"observed_at":"2026-08-01T21:39:20.801836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:20.908002Z","title":"Multitask learning,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:20.908002Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:6f6a318e8289544c2c57f2b9440e11ad7dadf6dfc9b6f9c131dd1774c4c5eb3e","observation_id":"37a61f88-1401-487d-88c6-e49d7680e98b","resolution":{"observed_at":"2026-08-01T21:39:20.908002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:20.998305Z","title":"Cross-stitch net- works for multi-task learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:20.998305Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:6db98b1d07f5e2d6cddc0a3872680254824436b92338687e15deaaefa8191d5c","observation_id":"f4984b3a-8f60-469b-beb2-e0416cf34a4c","resolution":{"observed_at":"2026-08-01T21:39:20.998305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:21.092492Z","title":"Vision transformers for dense prediction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:21.092492Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:6567529bcd08c343545b6622e7f3209d91504fe91dc72f44e093ba43ed89b349","observation_id":"1bdc3b10-fa49-48f8-bfcf-a460e08589d6","resolution":{"observed_at":"2026-08-01T21:39:21.092492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:21.184379Z","title":"Invpt++: Inverted pyramid multi-task transformer for visual scene understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:21.184379Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:2dcb2938645255938c9af6f10ff73ed04f6d2ada209991cab42039a82e673395","observation_id":"503fba60-17cf-442a-be50-ef23b0f82750","resolution":{"observed_at":"2026-08-01T21:39:21.184379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:21.292999Z","title":"Taskprompter: Spatial-channel multi-task prompting for dense scene understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:21.292999Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:a64d128100ce4fb0c1a48d08b5ec3793f80303cf89a0b457adae7698c93a87e5","observation_id":"6a65a397-4813-4430-bdd2-6905732cf5f8","resolution":{"observed_at":"2026-08-01T21:39:21.292999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:21.450868Z","title":"Mtmamba: Enhancing multi-task dense scene understanding by mamba-based decoders,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:21.450868Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:ad4bee92a863852357369ed338f2f1e00efeb0e8e321190e5aa3c64bd031babb","observation_id":"36c726f3-f20a-4859-a6d8-617709dc29d2","resolution":{"observed_at":"2026-08-01T21:39:21.450868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:21.580316Z","title":"Multi-task dense prediction via mixture of low-rank experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:21.580316Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:1ad2b667ae7bde73e20a13f811dbfa1f589d9fe8f2d680296d1721fab03a4510","observation_id":"fd184f49-2ecc-4c73-8e87-7433931b03af","resolution":{"observed_at":"2026-08-01T21:39:21.580316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:21.676394Z","title":"Swinmtl: A shared architecture for simultaneous depth estimation and semantic segmentation from monocular camera images,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:21.676394Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:9e37559773435cdf38ec362b932146c86f2025b18aee32544411fd3918ae513a","observation_id":"7f043a43-c489-497b-b699-fdc89adaffd9","resolution":{"observed_at":"2026-08-01T21:39:21.676394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:21.780619Z","title":"M2h: Multi-task learning with efficient window-based cross-task attention for monocular spatial perception,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:21.780619Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:de0e00d8e63b65bb1ce9d9211f476830787ad89f76b75e5e44ce8a7b3d8c48ea","observation_id":"dd833e50-027d-470d-b8df-ec8ce9a11f4d","resolution":{"observed_at":"2026-08-01T21:39:21.780619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:21.890664Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:21.890664Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:d1a3fc79c9565dbf0a5ea2d44003f2e9b9c5b4480c765083ab8bb762da2ca444","observation_id":"6bb956cc-76e5-479c-be18-4792975e63f4","resolution":{"observed_at":"2026-08-01T21:39:21.890664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04861","last_updated":"2017-04-17T03:57:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-04-17T03:57:34Z","title":"MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04861","snapshot_observed_at":"2026-08-01T21:39:21.993772Z","title":"Mobilenets: Efficient convolutional neural networks for mobile vision applications,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:21.993772Z"},"links":{"cited_paper":"/paper/1704.04861","citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:4f5fd6a131a792b2d82a595e9b25da8ff6dc7519ce619888b6f9b96ea2ab303c","observation_id":"70ccb75b-937a-48a6-8b1a-a28df5b97b28","resolution":{"observed_at":"2026-08-01T21:39:21.993772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:22.136360Z","title":"Mo- bilenetv2: Inverted residuals and linear bottlenecks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:22.136360Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:5e8b735ba25f87e9ce45e89d59f1a867ef7e23a5f607c632e0f8d2e48f2c80f5","observation_id":"248cb5d4-6c4f-4ee7-ae7e-d78ded7cebd7","resolution":{"observed_at":"2026-08-01T21:39:22.136360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:22.242353Z","title":"Efficientnet: Rethinking model scaling for con- volutional neural networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:22.242353Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:c3eac9e6ab14f0caed93c83defdcf6c52f8cdb6f9f9c6dc99d12d16f9c74bbd8","observation_id":"40b8a7dd-e098-4d5b-857c-6b1f88155400","resolution":{"observed_at":"2026-08-01T21:39:22.242353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:22.371229Z","title":"A convnet for the 2020s,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:22.371229Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:40e94ec5acfaac39ba4621b714d9e5ac387765c2193cfb182f13e17b9faa3697","observation_id":"cbbb8472-413e-4abf-ba58-961310a09e6d","resolution":{"observed_at":"2026-08-01T21:39:22.371229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:22.378408Z","title":"Refinenet: Multi-path refinement networks for high-resolution semantic segmentation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:22.378408Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:c275e7658c899f9c773c403d1da6e8ed53dcfd8a9e29ec7c19a89fc46d2a8597","observation_id":"18404710-5adb-44ef-886d-5d5a44453edd","resolution":{"observed_at":"2026-08-01T21:39:22.378408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-01T21:39:22.477867Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:22.477867Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:c34fef27ec92d9bb4b205fae1cae2e821b1775f68967fe69403ebf22eb54dfdc","observation_id":"b10f0a08-cddc-4eec-a845-f0e9799ba0c6","resolution":{"observed_at":"2026-08-01T21:39:22.477867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:22.586658Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:22.586658Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:66bf7f2791dd711f1d9d99af9f76f8f2ef82249bcb88bd3b1c46d399547b27a2","observation_id":"8afa474c-fde5-406f-93f5-c778ab78de4f","resolution":{"observed_at":"2026-08-01T21:39:22.586658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:22.649676Z","title":"Emerging properties in self-supervised vision trans- formers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:22.649676Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:bb4c736cc04a6bc26fd08b67938a68d5ae5ff8aef09224e6ef1fa8c54b469e26","observation_id":"ea50270a-1cd9-4585-801e-351553bd6b9d","resolution":{"observed_at":"2026-08-01T21:39:22.649676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-01T21:39:22.684139Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:22.684139Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:2725813b49d7ce9537524b8fc63308c714fdddf01d17c2263417785399676e46","observation_id":"6d02121e-637b-4880-afa6-009adfabb212","resolution":{"observed_at":"2026-08-01T21:39:22.684139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:22.719880Z","title":"Vision transform- ers need registers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:22.719880Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:1633b8498badb4cd64f4273e66cfde79178729329f441ada891bbd696dcd13c0","observation_id":"bd3e65d7-b33c-42cd-a7af-848fea24c4bf","resolution":{"observed_at":"2026-08-01T21:39:22.719880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:22.727720Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:22.727720Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:d3299d34e0db11ccbfda54c0680f85d2f753515f813fac0e529159aafb1052b2","observation_id":"d2b61879-2ea6-4fe1-b5e0-b92cb0f8caf1","resolution":{"observed_at":"2026-08-01T21:39:22.727720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:22.817702Z","title":"Feature pyramid networks for object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:22.817702Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:05a3be5e2d000bbba5d7ffac0c35a409d9faf8c9f25d8048bfa12edd944393f6","observation_id":"c350b8ef-684f-44fb-8932-e32636b6b3e0","resolution":{"observed_at":"2026-08-01T21:39:22.817702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:22.861298Z","title":"Eff-unet: A novel architecture for semantic segmentation in unstructured environment,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:22.861298Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:6c891cebb08d2fcaad99ad3618bfb9d732d21701e49a94bd04fee4ae556ca179","observation_id":"664cdfd0-40eb-4ce2-b769-fdc983c61fc4","resolution":{"observed_at":"2026-08-01T21:39:22.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:22.966049Z","title":"Swin transformer v2: Scaling up capacity and resolution,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:22.966049Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:b933ed1c3211e512b47a413064b728327c99ff80e7ec6c1baa9cdf4a7297318e","observation_id":"06d8129e-6684-41b3-abbb-cb6aebed2fde","resolution":{"observed_at":"2026-08-01T21:39:22.966049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:22.978458Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:22.978458Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:8702976993eb164ff4341abe88242887a55769c3528243cdcd4304c99367c95b","observation_id":"44afdaec-8ba7-48d4-9230-fb9b06287773","resolution":{"observed_at":"2026-08-01T21:39:22.978458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:23.107782Z","title":"Dino- foresight: Looking into the future with dino,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:23.107782Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:d3361d843aa9081d2b0b08065ac26fc3dfba9bdfcf9dbebd05e085f4404b68fb","observation_id":"372b8235-a792-4f7a-9076-996b7e6192fd","resolution":{"observed_at":"2026-08-01T21:39:23.107782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:23.163683Z","title":"Pidnet: A real-time semantic segmentation network inspired by pid controllers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:23.163683Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:1bdffc6a8a01782833231790114ece482fe38d32be5bbdc96720f8596565c829","observation_id":"4661902d-3a49-4d4d-85b2-5ba07fee187c","resolution":{"observed_at":"2026-08-01T21:39:23.163683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:23.223239Z","title":"Boundary-aware multitask learning for remote sensing imagery,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:23.223239Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:b45404b71c5a41e66e5a3a1f36e1e10ddd75063227fa1ccdb5033f29960a62d7","observation_id":"1ba41f3d-9f56-46be-b7cd-11f23b614b68","resolution":{"observed_at":"2026-08-01T21:39:23.223239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:23.257861Z","title":"Training region-based object detectors with online hard example mining,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:23.257861Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:8e871952e8e112866d6806e3653c751367a13861efee928835ff6970cb14cf10","observation_id":"77ea184a-c799-49d9-830e-1bda3833646e","resolution":{"observed_at":"2026-08-01T21:39:23.257861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:23.345745Z","title":"Depth map prediction from a single image using a multi-scale deep network,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:23.345745Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:1fe79a40efea7cdcf3aba6699a308e6a174402dbb68d6a2a5cb7d8f4a6ed4da9","observation_id":"72d42e67-451f-4c09-9a8e-3ab1dba1cd3f","resolution":{"observed_at":"2026-08-01T21:39:23.345745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:23.483569Z","title":"Multi-task learning using uncertainty to weigh losses for scene geometry and semantics,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:23.483569Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:1952fef0627d93a6a9927727ef39436fec8cde2a77a06334e7c51f90c82371d0","observation_id":"4988c1ad-a291-4828-a680-1bef7ff3d1f6","resolution":{"observed_at":"2026-08-01T21:39:23.483569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:23.563214Z","title":"Pad-net: Multi-tasks guided prediction-and-distillation network for simultaneous depth es- timation and scene parsing,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:23.563214Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:11f5a0c7e9ecaf32f84f06deec884c730dd6cded31dc5ff03bfa62dc03aac429","observation_id":"a9d016c2-3bf7-434e-b40d-2be14d22bd92","resolution":{"observed_at":"2026-08-01T21:39:23.563214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:23.627476Z","title":"Cross-task attention mecha- nism for dense multi-task learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:23.627476Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:ca73943f7e4e4152125b7486e304c73f007a5768007e878431d899663a2ea55c","observation_id":"c876027e-ed34-4501-aedc-0f60558f8db5","resolution":{"observed_at":"2026-08-01T21:39:23.627476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:23.682895Z","title":"Three ways to improve semantic segmentation with self-supervised depth estimation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:23.682895Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:935822c7b4576e7bbb0084d070219dd44d01b795085f71d2270134d042e122e6","observation_id":"729a26a2-475c-4bdb-92e4-3c3a4c5e1e60","resolution":{"observed_at":"2026-08-01T21:39:23.682895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:23.760682Z","title":"Inverted pyramid multi-task transformer for dense scene understanding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:23.760682Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:a9e1893420a1b7cbcb17ab60c3eb1501f655fd06e21e1c51e7bd32546e49aeac","observation_id":"fa268218-5fd9-492e-9582-d850a25f5f32","resolution":{"observed_at":"2026-08-01T21:39:23.760682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:23.939186Z","title":"Mtmamba++: Enhancing multi-task dense scene understanding via mamba-based decoders,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:23.939186Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:486b6f2375148b76eff0a9ffff44701d6685aa7e3022a67e7d63cb09051b3e99","observation_id":"aa2bc522-0c5b-489b-9924-4ad2b676b3ef","resolution":{"observed_at":"2026-08-01T21:39:23.939186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:24.096978Z","title":"The cityscapes dataset for semantic urban scene understanding,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:24.096978Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:c3dd858a0d5ab303d48c184808fffae3fd5876d1dd12752a2493ec2c4fdea86b","observation_id":"85f56974-1f29-4d44-81e6-8c10352f6806","resolution":{"observed_at":"2026-08-01T21:39:24.096978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:24.275077Z","title":"Practical stereo matching via cascaded recurrent network with adaptive correlation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:24.275077Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:9bdf487024b6aab0f76b92d0fabb85f0fae101229fa6254fea4fbfb5f3cce7fe","observation_id":"74341a56-c0ca-4106-b5f4-79bd47007f7b","resolution":{"observed_at":"2026-08-01T21:39:24.275077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:39:24.422182Z","title":"Indoor segmenta- tion and support inference from rgbd images,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T21:39:24.422182Z"},"links":{"citing_paper":"/paper/2607.16012"},"observation_digest":"sha256:7483bb2f855401306c514155d53763d96382efbf7530d1d485059a04b536da16","observation_id":"c70b12dd-9c79-4656-84bf-64ac0fbf718f","resolution":{"observed_at":"2026-08-01T21:39:24.422182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16012","last_updated":"2026-07-17T14:46:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T18:41:08.667666Z","submitted_at":"2026-07-17T14:46:39Z","title":"DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2607.16012."}