{"as_of":"2026-08-07T18:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7a4938142f397dcf6a97f6408c955a68c833e6745c1d00310601a342b9d15461","coverage":[{"denominator":221,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:34:12.008044Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.13552/citation-record","integrity":"/paper/2506.13552/integrity","json":"/paper/2506.13552/citation-record.json","paper":"/paper/2506.13552"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:59.162092Z","title":"Fully convolutional networks for semantic segmentation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:59.162092Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:f87c149762960d095d164af07d1701d75aabe8f1f97f12cc7296c4603b9090e8","observation_id":"84687d9c-875f-4567-8128-0f62135c15fa","resolution":{"observed_at":"2026-08-07T00:33:59.162092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:59.259043Z","title":"Deep feature flow for video recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:59.259043Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:9e9585055f8345aa5f68359d110b202909d8f189257387de8f094e7b70786829","observation_id":"0f8d4ce9-1715-4f35-85a6-b5966dbb718c","resolution":{"observed_at":"2026-08-07T00:33:59.259043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:59.462375Z","title":"Semantic video CNNs through representation warping,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:59.462375Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:24ed1e2cbfa3f41f02236d68ea02f0d4c10c26cfb1be17f7e84455ebc96813fb","observation_id":"e49f7b1c-d6e3-495a-95dd-92a34b3ba2b4","resolution":{"observed_at":"2026-08-07T00:33:59.462375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:59.614046Z","title":"Accel: A corrective fusion network for efficient semantic segmentation on video,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:59.614046Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:018484881d703703983d4482d23ee1246e13833c69fb9ef3d30db50ea4a64f6b","observation_id":"cc7701fb-96ec-424e-a689-ed74fec8b551","resolution":{"observed_at":"2026-08-07T00:33:59.614046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:59.743336Z","title":"Feature space optimization for semantic video segmentation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:59.743336Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:9412c83e1ee7cbe3152f548385e0d73d12fb543f4833e6222a7a41aa841eb6b2","observation_id":"2b5fcb1e-3f4b-4062-8b16-712e434e6e1e","resolution":{"observed_at":"2026-08-07T00:33:59.743336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:59.924767Z","title":"GSVNet: Guided spatially- varying convolution for fast semantic segmentation on video,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:59.924767Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:2a81c9559128fd181a4dc9e60a43b4aa2db75c45ad551f6d175bd7b2556bbced","observation_id":"dac8bbe6-599a-42b9-aac8-38ec1dd17ac0","resolution":{"observed_at":"2026-08-07T00:33:59.924767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.074750Z","title":"Faster R-CNN: Towards real-time object detection with region proposal networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:00.074750Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:b2f9c7f296fd483348aa2f3b19d96f87d1a4e749c02b8cfccc80e938f28b19e1","observation_id":"836ed6cd-b920-489c-bb5b-94b17f14f3ef","resolution":{"observed_at":"2026-08-07T00:34:00.074750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.00557","last_updated":"2018-03-27T10:02:26Z","snapshot_observed_at":"2026-07-06T06:26:10.399472Z","submitted_at":"2018-03-01T18:56:36Z","title":"The 2018 DAVIS Challenge on Video Object Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.00557","snapshot_observed_at":"2026-08-07T00:34:00.204825Z","title":"The 2018 DA VIS challenge on video object segmentation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:00.204825Z"},"links":{"cited_paper":"/paper/1803.00557","citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:f5f53db9d4f8ed6db4d9af8448dcbe839a29472f00beaced6163d433d3665975","observation_id":"9fae1e36-1e5d-4815-936f-771abdc2910b","resolution":{"observed_at":"2026-08-07T00:34:00.204825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.315364Z","title":"Video segmentation using color difference histogram,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:00.315364Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:7ed6e35e957bfe71f7e4d90936bdedfd34a3738018413956fd82797e8a2c25f5","observation_id":"98dd2a0a-16e9-4355-ac21-c06e01bf2dce","resolution":{"observed_at":"2026-08-07T00:34:00.315364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.437943Z","title":"Dynamic texture detection based on motion analysis,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:00.437943Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:5c4b7cc1e06d70b848e96894ee98dc7709aa92fd4df62027eac1914dac1bfdae","observation_id":"2b755c7e-d26e-425e-9bf3-e1520ead7135","resolution":{"observed_at":"2026-08-07T00:34:00.437943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.540061Z","title":"Illumination robust optical flow model based on histogram of oriented gradients,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:00.540061Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:5112c985829ca2e679f3962ea57faa4f6e4d8c9fa53344af7148d8b27ccbe0d0","observation_id":"826bf546-1f70-411c-b6af-65ef57a52138","resolution":{"observed_at":"2026-08-07T00:34:00.540061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.657927Z","title":"Efficient video seg- mentation using parametric graph partitioning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:00.657927Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:98ee24d63d97861577437b78e28a425123aa078ce6226ab8f02a01a7bd13898a","observation_id":"fd39d94e-48ce-4edc-a2f4-d1ee7b9e2ee0","resolution":{"observed_at":"2026-08-07T00:34:00.657927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.772732Z","title":"Efficient hierarchical graph-based video segmentation,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:00.772732Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:e69891a70196389a7a01c5f1909cf51885d47c16dd9cec1f0783e808bffc60c9","observation_id":"b9268be7-2f4f-40db-803f-b3f43a37ccac","resolution":{"observed_at":"2026-08-07T00:34:00.772732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.887346Z","title":"Fully connected object proposals for video segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:00.887346Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:2f50ceb9a53fe1212d7afa391d08b61dbd8c9525e46e18f98bf72552896d2e02","observation_id":"21bbe05e-6f2b-4aca-b0c9-2aeef630cd0c","resolution":{"observed_at":"2026-08-07T00:34:00.887346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.962544Z","title":"Semi-supervised video segmentation using tree structured graphical models,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:00.962544Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:35c3e984310fd1f5dd37fa6a34ef0c44f5bc59e1e177c756c0dd554becc7c667","observation_id":"d874cbd4-6a11-4328-b040-f514b3e5cdac","resolution":{"observed_at":"2026-08-07T00:34:00.962544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.134824Z","title":"Streaming video segmentation via short- term hierarchical segmentation and frame-by-frame markov random field optimization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.134824Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:baf99576b92a721707d42f4cf629194fa88a9bb052c5c7a78df673dd72bc9d6e","observation_id":"d45b4452-7eee-4ab3-8ee1-56f3c3fba46a","resolution":{"observed_at":"2026-08-07T00:34:01.134824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.254806Z","title":"Multiclass semantic video segmentation with object- level active inference,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.254806Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:ee78f752c80523026fd9e7b4e9b36cc52036301dfa5d490d4c1587aa6b0398f4","observation_id":"5c3dc480-6114-46c8-b06a-781fd5cf5872","resolution":{"observed_at":"2026-08-07T00:34:01.254806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.358790Z","title":"DeepLab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected CRFs,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.358790Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:c0ea92da0601b74b4a4de84042bccf6e90118bae889043f8921279a62b35587e","observation_id":"7d3531d0-717a-4131-97df-7c23a7013199","resolution":{"observed_at":"2026-08-07T00:34:01.358790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.524806Z","title":"Pyramid scene parsing network,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.524806Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:df48db9133b3ff4ff0881b2c4247522bd0ccfcdbc7a99a6dc8450cf63bd411ad","observation_id":"f0a5131e-b252-43cc-8358-6901bc0dc772","resolution":{"observed_at":"2026-08-07T00:34:01.524806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.663825Z","title":"Context contrasted feature and gated multi-scale aggregation for scene segmen- tation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.663825Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:aec39aa22bb250ff1111c460e4497768d9312c60881fac9e3bdfb825dacf2b98","observation_id":"3b1c9897-241f-426a-ba6b-13b6fc353a6d","resolution":{"observed_at":"2026-08-07T00:34:01.663825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.780136Z","title":"Video segmentation via object flow,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.780136Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:739ff6e37bde0ee60c05d06fc23b05d0171978dd5c61c87b6cb5477fd8d4959b","observation_id":"fe71bb6f-a9cd-4137-9b49-4df2f3c6e06f","resolution":{"observed_at":"2026-08-07T00:34:01.780136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.905781Z","title":"Improving semantic segmentation via video propagation and label relaxation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.905781Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:7368698050b8d3003bcb08a099abfb35d45eddfd0efc0f304fada55aa5fbd1f6","observation_id":"4e4524fb-958f-4d3a-9103-d15e4a2433f7","resolution":{"observed_at":"2026-08-07T00:34:01.905781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.983027Z","title":"Efficient uncertainty estimation for semantic segmentation in videos,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.983027Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:b2ec1fd936a85ec775651a8e5d6d48590e3f474114d921ab8045527637dc09d5","observation_id":"aa3ab57a-6a4d-4e52-ac8a-665b3263a62c","resolution":{"observed_at":"2026-08-07T00:34:01.983027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.118408Z","title":"Efficient video semantic segmentation with labels propagation and refinement,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.118408Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:e3cb57973f81d1f50968953d797148cb2e3e7e62709dc9e800ce261be78f7d19","observation_id":"1a9566cb-4b55-4da2-9561-8f4d815920de","resolution":{"observed_at":"2026-08-07T00:34:02.118408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.274746Z","title":"ICNet for real-time semantic segmentation on high-resolution images,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.274746Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:0462ef0fe4fb83952f423b23ccdcc82f7f9ee53c1537f654a7903f97922c0f47","observation_id":"01e104bc-a325-4770-8b07-95ccbeea9590","resolution":{"observed_at":"2026-08-07T00:34:02.274746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.354824Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.354824Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:e812964f307f41c05c5797434598469967fa605e0ee8d041464bbb5c12ba1720","observation_id":"57ccfefb-d02b-40b1-bf46-c2bf6e3c7705","resolution":{"observed_at":"2026-08-07T00:34:02.354824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.491445Z","title":"Scaling vision transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.491445Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:5ff7b73c7880d678a19a53acec1c3a358976be255f2cf4ee6cb8cb1e34203f9f","observation_id":"af50bf9e-9394-4bf8-ab46-878140ca936a","resolution":{"observed_at":"2026-08-07T00:34:02.491445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.598264Z","title":"AdaViT: Adaptive vision transformers for efficient image recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.598264Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:96235f3ab0e89a81f0ad32b8791c557f29539f16b9ba2bfb1a3e2269b63a9f12","observation_id":"d38aac0a-979c-40d8-abfe-993545434070","resolution":{"observed_at":"2026-08-07T00:34:02.598264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.731986Z","title":"Vision transformers with hierarchical attention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.731986Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:1626417509dfbcd1e6ce4d19a85d829f9de8df4a8ec2f3296a5037b0467d00bb","observation_id":"88718df6-0c68-44d3-add3-3df52ae403ad","resolution":{"observed_at":"2026-08-07T00:34:02.731986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.897966Z","title":"Swin transformer v2: Scaling up capacity and resolution,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.897966Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:04dd048e4fbb6b6025b9c087573589409ab30155f36c940567e0ef31125ca84c","observation_id":"26f969ce-7a08-4fe7-9d0a-5aff96aecef5","resolution":{"observed_at":"2026-08-07T00:34:02.897966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:03.024457Z","title":"Scaling vision transformers to gigapixel images via hierarchical self-supervised learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.024457Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:48df1b5e33b601734caa965fb8ba105d8c62d79ace54741930437b29dbced0a3","observation_id":"5ca3b003-6c26-46e3-bba3-498b4a2b587c","resolution":{"observed_at":"2026-08-07T00:34:03.024457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:03.157873Z","title":"Multiview transformers for video recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.157873Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:23bc1a2783e861248f77d083eb8044148c70e96cfc7e90d3959ded7b3a7ddaab","observation_id":"1d63dca3-9cbd-43d0-a1a3-a326da4511d8","resolution":{"observed_at":"2026-08-07T00:34:03.157873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:03.300273Z","title":"Multi-scale high-resolution vision transformer for semantic segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.300273Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:0bcedecaef6b1baa163bad6f01acbcd07eb5c0836230d3f5feca64ba24fdaea1","observation_id":"6253633b-6fb3-43a4-910f-74291bbea2fe","resolution":{"observed_at":"2026-08-07T00:34:03.300273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:03.430524Z","title":"UniRepLKNet: A universal perception large-kernel ConvNet for audio video point cloud time-series and image recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.430524Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:71b39d94b67fdbcfa968ce320f80b5b56842deba308f5cd07d2d6eaeeaa50f11","observation_id":"50c4e153-72fd-4b2b-9019-e562182067dc","resolution":{"observed_at":"2026-08-07T00:34:03.430524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:03.541148Z","title":"P2T: Pyramid pooling transformer for scene understanding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.541148Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:7b56a16f4b089a1babf37931127c8f50e8117d2c9d95e26cfd3d78e6a5322af3","observation_id":"76cab0f6-13f2-4b7d-b2b9-2d4bac21c7f5","resolution":{"observed_at":"2026-08-07T00:34:03.541148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:03.699407Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.699407Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:fdcd454185df44b29a295727ad6580851023fc6dc0c15f9f1c68f465effef6f9","observation_id":"feff35e6-f6cb-40ee-9f4b-f1fe2c8d19d5","resolution":{"observed_at":"2026-08-07T00:34:03.699407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:03.814874Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.814874Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:eb32ece0711fc9f9ffb14ef7cfb792a0b7c55d0124e0a2834bdd85f8721fc747","observation_id":"5b3c5e1c-89b7-4287-878f-60a471fc103f","resolution":{"observed_at":"2026-08-07T00:34:03.814874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.036666Z","title":"MOTS: Multi-object tracking and segmenta- tion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.036666Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:be9d3326fec9eeb39c2a7a4bb67289baae10edda93979a78523b11893a054d1e","observation_id":"a63cacb4-4800-4ef4-ad94-4506df7464e3","resolution":{"observed_at":"2026-08-07T00:34:04.036666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.157555Z","title":"Tracking anything with decoupled video segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.157555Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:2a8c7b5eb27ffba6b576e1e1c49f76b9747d15f28455f2e0c0bdedf4380e1347","observation_id":"85ac7ed9-7e3d-4026-bca3-83a18cdf4ef4","resolution":{"observed_at":"2026-08-07T00:34:04.157555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.334747Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.334747Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:ab2ebbb0ea50fd1f6fb1c7787d6bd2baa77864f98be3d5da6785301d6593499f","observation_id":"fca3ca01-358b-455f-94c6-29231202822d","resolution":{"observed_at":"2026-08-07T00:34:04.334747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.454404Z","title":"Global knowledge calibration for fast open- vocabulary segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.454404Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:9224b55dbad73595af2596a628c8e91a21f16df8b1ce5ee6c9b3796daf9629b5","observation_id":"6f77b031-5bf3-42fa-9f10-99e91fdbfec8","resolution":{"observed_at":"2026-08-07T00:34:04.454404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.549524Z","title":"A simple framework for open-vocabulary segmentation and detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.549524Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:8a4a6b2f5ba60cbd6dddc37b88328645052c7ab3dd80996cd773794f6bddac2e","observation_id":"9f24150a-34a5-4612-ae49-d36174dcf1aa","resolution":{"observed_at":"2026-08-07T00:34:04.549524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.674352Z","title":"Learning open-vocabulary semantic segmentation models from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.674352Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:3c0a7f650a556abbe9515a515f3a7274b0c5a9fa72cc7401b3090884e6bfa4cb","observation_id":"b99e28f0-256b-4aab-85d6-3e36d14fc9a8","resolution":{"observed_at":"2026-08-07T00:34:04.674352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.793483Z","title":"Open-vocabulary semantic segmentation with decoupled one-pass network,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.793483Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:12a0ca0a2d1e1af26e0fe0a1b1f7cefd8f8b2534868ee894050b3330ee44eb4b","observation_id":"942f287c-b8d9-4e89-978c-d54af22f3ad3","resolution":{"observed_at":"2026-08-07T00:34:04.793483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.894745Z","title":"Open-vocabulary panoptic segmentation with embedding modulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.894745Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:c2470609bc4e987a8af2dc170f17b51f974e5996238f74208887088edbdbb6cb","observation_id":"668d5ff7-4099-45d4-8035-6079a104b7d4","resolution":{"observed_at":"2026-08-07T00:34:04.894745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.004746Z","title":"A survey on deep learning technique for video segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:05.004746Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:4f2121cc6496593ef63e3a690867200d9dfca7ce41a1cd8f307ff23e87e76567","observation_id":"e5cc146d-af16-41e0-9343-732a6030d9df","resolution":{"observed_at":"2026-08-07T00:34:05.004746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.121390Z","title":"Transformer-based visual segmentation: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:05.121390Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:feb78137309d22f1b6b840e7f2f1c01a31ee6669235ac3c750a5e7c82b885da7","observation_id":"e7600f4b-01f7-47e7-8905-16648de4911e","resolution":{"observed_at":"2026-08-07T00:34:05.121390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.316659Z","title":"Large- scale video panoptic segmentation in the wild: A benchmark,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:05.316659Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:f1d40cb147736d81f9a2cce374792747679a012feee4263b97ff806765841c2e","observation_id":"4b72136b-d99f-4c28-a332-a0b9948b9484","resolution":{"observed_at":"2026-08-07T00:34:05.316659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.427453Z","title":"Machine perception of three-dimensional, so lids,","venue":null,"work_id":null,"year":1961},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:05.427453Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:d54fef19227df013230fc2de847c5ec30b9d89616f20d32690f41c9d4ddef20d","observation_id":"defb666c-a057-4e7e-b1ad-d5bbf7f1b19c","resolution":{"observed_at":"2026-08-07T00:34:05.427453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.517844Z","title":"Evaluation of super-voxel methods for early video processing,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:05.517844Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:757455c918f6c9425376142ccbe122478377c2e419b40a5192af47ec2f32ed86","observation_id":"30af391d-a1aa-4387-a794-f94f1af6d060","resolution":{"observed_at":"2026-08-07T00:34:05.517844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.617779Z","title":"A video representation using temporal superpixels,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:05.617779Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:282140ead6b467f908201b9da4e709a373b3be615f22769e098b6d15f1455f49","observation_id":"493adf38-e6db-4b65-9e85-d570c0614480","resolution":{"observed_at":"2026-08-07T00:34:05.617779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.734262Z","title":"Segmentation of moving objects by long term video analysis,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:05.734262Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:af3893e66a04b92094f3fbb8dda8f6da482c468ad64dc8b5a8836b323fb42b28","observation_id":"ec968894-d535-46d0-b04f-4733bb3f35ad","resolution":{"observed_at":"2026-08-07T00:34:05.734262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.864747Z","title":"Fast object segmentation in uncon- strained video,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:05.864747Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:0c5c86a1f417e2303f75a763d7640eb6d022fe268ba2ee7ff5b9374fc3af92a6","observation_id":"f23c7d2a-aa8a-4d8f-a121-66c6b81934a2","resolution":{"observed_at":"2026-08-07T00:34:05.864747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.990851Z","title":"Coherent motion segmentation in moving camera videos using optical flow orientations,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:05.990851Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:8096541c6d3989e78ae9df925b20b13519e95d2c9b4b37134c67cfa336695f6b","observation_id":"f5978731-1006-4bfe-82e0-aab0ed50bfdc","resolution":{"observed_at":"2026-08-07T00:34:05.990851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.149809Z","title":"Layered segmentation and optical flow estimation over time,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:06.149809Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:9b6c2c6a7b861293313851e86f0c2e92dbc79dc42acb55d5f5ebfef1d62c034a","observation_id":"ec056af4-a82a-47e7-ba6e-a6f447a42423","resolution":{"observed_at":"2026-08-07T00:34:06.149809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.257921Z","title":"Dynamic color flow: A motion- adaptive color model for object segmentation in video,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:06.257921Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:2b544de1c5b536d3ad86fca7728186eae047e835fc17ca84fe8074b683b704af","observation_id":"9e3e3670-ff4a-49a8-8747-5abf5f0596b5","resolution":{"observed_at":"2026-08-07T00:34:06.257921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.351798Z","title":"Steadyflow: Spatially smooth optical flow for video stabilization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:06.351798Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:9603e3ff51876a50dee33a3841f97e54f48a6f9864931832f56e66507e7c68c2","observation_id":"cb414276-5bfe-4268-a0f5-1bad1700f066","resolution":{"observed_at":"2026-08-07T00:34:06.351798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.517994Z","title":"Classifier based graph construction for video segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:06.517994Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:87ee5603e705bdf55f239c572f3f4667d80dc280b26a977bce95b4176bb3384c","observation_id":"d5e6821c-bf24-45e3-a1fa-2f12c398f375","resolution":{"observed_at":"2026-08-07T00:34:06.517994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.614912Z","title":"Jf-cut: A parallel graph cut approach for large-scale image and video,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:06.614912Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:c568e8c85f7ff76354fc68fbd912bef75da3b73c1805dbd3113a456a48c9e83d","observation_id":"53f68458-7286-4678-8e6e-baa4f0d90d56","resolution":{"observed_at":"2026-08-07T00:34:06.614912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.689435Z","title":"Video scene parsing with predictive feature learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:06.689435Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:0acdf309f414e32fdcdb178009f32281d6baa3e8f274bba9e6f826eb33443c45","observation_id":"93b17d4e-2f43-4eb3-82ca-22fc80d5acb8","resolution":{"observed_at":"2026-08-07T00:34:06.689435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.768951Z","title":"Neural window fully- connected CRFs for monocular depth estimation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:06.768951Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:cbd67185bf731c3012e982f97494a69aea9df8245a412b999d6b1cc29f643bf6","observation_id":"aa74bac6-7cf4-4ba4-bbb3-79c28b33800b","resolution":{"observed_at":"2026-08-07T00:34:06.768951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.951794Z","title":"Video instance segmentation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:06.951794Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:db7b2214aeed32da96f2c8bad5172f1b6deb32ba45dc9b10c4f2eb6e9d218aac","observation_id":"1b581c6d-02b8-4d04-8385-c6c970a35697","resolution":{"observed_at":"2026-08-07T00:34:06.951794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.087147Z","title":"Naive-Student: Leveraging semi- supervised learning in video sequences for urban scene segmentation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:07.087147Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:dc8a1dd170617ed87501d6fb00ec1a073a56211f38314204f8337c444be6b4bf","observation_id":"7eaa0722-be22-4a8d-807f-440f537397f5","resolution":{"observed_at":"2026-08-07T00:34:07.087147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.220205Z","title":"Three ways to improve semantic segmentation with self-supervised depth estimation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:07.220205Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:b2eeaad6c5cf3ce6e304b2396502265d2e6e36bb07af06fd1efc75c04e4b05d1","observation_id":"91869e41-006a-462f-894b-7b9ebbd31af7","resolution":{"observed_at":"2026-08-07T00:34:07.220205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.322429Z","title":"Simultaneously short- and long-term temporal modeling for semi- supervised video semantic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:07.322429Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:3e3446018d89b678076daa74913bebd5b5bbcc50033da4bb85424631c0b2f2c1","observation_id":"26f49e3a-54d1-4499-83fa-05895d62826d","resolution":{"observed_at":"2026-08-07T00:34:07.322429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.410551Z","title":"Clockwork convnets for video semantic segmentation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:07.410551Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:6a97c1eb3420392cb6c5f4b4043da2bcb2f37345dfc4fbba6acedd7a1d928cd4","observation_id":"76ea655f-c773-482c-acf5-58631723679f","resolution":{"observed_at":"2026-08-07T00:34:07.410551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.538732Z","title":"Real-time, accurate, and consistent video semantic segmentation via unsupervised adaptation and cross-unit deployment on mobile device,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:07.538732Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:6514fdabc13e442917660caae8c1d8dc29bc506ae21bc5a3aabb662dbf58a534","observation_id":"7e14442a-e063-4f20-a6f1-02d23b1a5754","resolution":{"observed_at":"2026-08-07T00:34:07.538732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.637631Z","title":"Dynamic video segmen- tation network,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:07.637631Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:c85143a8b8ee9b652d4a5bdd954209c4312094500d53d73489d17c56e9597b66","observation_id":"b0aa6c78-40e9-493b-a535-526753f4d148","resolution":{"observed_at":"2026-08-07T00:34:07.637631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.702695Z","title":"Low-latency video semantic segmentation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:07.702695Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:5ebefd7c55ad32cc456cb0a5f2c0cc100fab0ba4f3b485cca54c7ac799c4c85b","observation_id":"1df01040-2989-4ef0-a59e-b1b810e1a92f","resolution":{"observed_at":"2026-08-07T00:34:07.702695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.882630Z","title":"Coarse-to- fine feature mining for video semantic segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:07.882630Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:25a9270d2161b35c3df55fe34acd006c1dd0d2224d2cdfe9ccc82b1fc8e3f7dc","observation_id":"a8015a52-48ec-4f38-90cc-62edddd31683","resolution":{"observed_at":"2026-08-07T00:34:07.882630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.053230Z","title":"Mining relations among cross-frame affinities for video semantic segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:08.053230Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:77cfbb7547efb69de14e9e206d6aafafaee702f3ad7644f2475543001f8ac5b0","observation_id":"b1a395de-f098-46d8-a78c-0a84c115415f","resolution":{"observed_at":"2026-08-07T00:34:08.053230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.179151Z","title":"Deep dual learning for semantic image segmentation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:08.179151Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:61003c51b7a915e5c060dd59f8497eae83d0502bf344fde06f3250d986bd3c80","observation_id":"8cf99ca0-11e9-447e-9e5d-9fc38d6b35cc","resolution":{"observed_at":"2026-08-07T00:34:08.179151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.316560Z","title":"Learning pixel-level semantic affinity with image- level supervision for weakly supervised semantic segmentation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:08.316560Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:5016327a460af5c1fe1b9b327eaba934e1f62dea40f806be5977b9ba76042d1c","observation_id":"bab2890b-ed1d-4cf4-9dfb-caa986604e39","resolution":{"observed_at":"2026-08-07T00:34:08.316560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.433953Z","title":"PANet: Few-shot image semantic segmentation with prototype alignment,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:08.433953Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:af59556237d2701c15e4bd75c1f33286502ebce03d66bd785c575aecac03550b","observation_id":"6bffa7a0-cab6-44ae-b0a1-d81b6d93186e","resolution":{"observed_at":"2026-08-07T00:34:08.433953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.552660Z","title":"Single-stage semantic segmentation from image labels,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:08.552660Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:6db85f66bac03d1695dd497d0a646bf9cb73695cdc614b1159204969ce57e3c7","observation_id":"03fe4280-f756-4b20-9fa7-161eb89560ad","resolution":{"observed_at":"2026-08-07T00:34:08.552660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.807396Z","title":"CIAN: Cross-image affinity net for weakly supervised semantic segmentation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:08.807396Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:8a6fb4106fd7b56bf451147cfde906880b7b238a58eafd92384c2a9f9377ccd5","observation_id":"d784f311-dcf0-4374-a0e7-4193f9bb52c7","resolution":{"observed_at":"2026-08-07T00:34:08.807396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.967364Z","title":"Budget-aware deep semantic video segmentation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:08.967364Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:e9bde456fe20158174a5e57e5e4be76e2b8b69aec8aacab38219c0189c07186d","observation_id":"66173f4d-b1f1-429c-a8b9-e37e835146a2","resolution":{"observed_at":"2026-08-07T00:34:08.967364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.050085Z","title":"Convolutional gated recurrent networks for video segmentation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:09.050085Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:ecf496126f8538d40622ddf5489d74f1a6a280c52c24e18fb77a873102421361","observation_id":"3de167c1-b845-4f9d-a313-3ac30b176ec5","resolution":{"observed_at":"2026-08-07T00:34:09.050085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.221211Z","title":"One-shot video object segmentation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:09.221211Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:92326e1dd2f612884ab8ce331c5e9d3a54c2f974a08d522978815b1c4efe6401","observation_id":"48ec189a-952b-4e61-978b-975baeb2c2f8","resolution":{"observed_at":"2026-08-07T00:34:09.221211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.410907Z","title":"Space-time memory networks for video object segmentation with user guidance,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:09.410907Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:224239087a986c2d81932dcf6469ffcea315541c1e01074ccf965e3adb34abcf","observation_id":"ab45e62e-9047-4cd8-b022-282682be1c71","resolution":{"observed_at":"2026-08-07T00:34:09.410907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.538200Z","title":"Learning video object segmentation from static images,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:09.538200Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:644d2cd643c3daa4ef7098ec4af6ff09d7555b0e226dea9e9339f8f8cff80bb7","observation_id":"e72f6cd8-f6d1-4f7c-8daa-fc52f9512106","resolution":{"observed_at":"2026-08-07T00:34:09.538200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.674391Z","title":"RVOS: End-to-end recurrent network for video object segmentation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:09.674391Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:6b7046120f4045309bc50a9ba2d4835dea80626c87d6742fcf077db0c900e314","observation_id":"4108a4f6-2476-4791-900f-a4dc2907b98b","resolution":{"observed_at":"2026-08-07T00:34:09.674391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.768766Z","title":"Putting the object back into video object segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:09.768766Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:80e67f77dbd3bf71b3e5852d548748c11d0c3a08e85b238b82ffa7eb2a096157","observation_id":"0cdc3b50-8389-44b3-9cc3-5944b550aeb6","resolution":{"observed_at":"2026-08-07T00:34:09.768766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.984899Z","title":"Towards high performance video object detection,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:09.984899Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:0b8a3cc9c38de33da648be9a55ef2d4650e6b38369ea1e44cc2b06b171c2e8d8","observation_id":"2877c12f-52df-4d30-b9ce-8ac9d90f0a77","resolution":{"observed_at":"2026-08-07T00:34:09.984899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.089214Z","title":"Flow-guided feature aggregation for video object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:10.089214Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:e8f8aa6b5e6b04c6da9a7151b98e0ae5585f9bf7a4bca87d28252ae417a8d7a1","observation_id":"3a5ff8af-2fd4-4ba8-8b0b-1155b71644ee","resolution":{"observed_at":"2026-08-07T00:34:10.089214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.206279Z","title":"Fully motion-aware network for video object detection,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:10.206279Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:a43a6bc5ea016ce89bac35243da9945634ee1d54fc4b53e78c2f35f6c1787222","observation_id":"401d48b9-333b-4553-b120-d1558fe53cd2","resolution":{"observed_at":"2026-08-07T00:34:10.206279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.408814Z","title":"Mamba: Multi-level aggregation via memory bank for video object detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:10.408814Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:f9b0dab52c6a693dd104f25a3ef7eb63d158d63d2e5e828d044b13059a232b2c","observation_id":"18847c93-7024-4125-a2d3-2d97984c1b9d","resolution":{"observed_at":"2026-08-07T00:34:10.408814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.516369Z","title":"Dynamic context-sensitive filtering network for video salient object detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:10.516369Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:59a64fbfcdac336a3b77d96bb09c6166730261dfc553a6052cff95da59b1ef55","observation_id":"14212d00-720d-41b0-91a6-6e47b9900d0c","resolution":{"observed_at":"2026-08-07T00:34:10.516369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.608917Z","title":"SAM-PM: Enhancing video camouflaged object detection using spatio-temporal attention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:10.608917Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:ddec816d9ddee4f16ceecff039077220bbfcbb384d111b0abceecbc67b20b246","observation_id":"b03afc6c-1d24-4121-9e18-cb9336d54482","resolution":{"observed_at":"2026-08-07T00:34:10.608917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.723158Z","title":"Deep spatio-temporal random fields for efficient video segmentation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:10.723158Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:bf4ac9d9f343d7d9186ecbbf381bb40e32fc8a7f4b0d550fba7a1fc9f44f5a5f","observation_id":"f10ddbd0-4931-4b52-ba39-660b6f4d8fbc","resolution":{"observed_at":"2026-08-07T00:34:10.723158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.807229Z","title":"A benchmark dataset and evaluation methodol- ogy for video object segmentation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:10.807229Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:69654a592b7f37343d7e23154750d5b023b42a099da6e668538a29114ac07eab","observation_id":"640e3704-d736-41c0-9d73-0903ad916b86","resolution":{"observed_at":"2026-08-07T00:34:10.807229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-07T00:34:10.897294Z","title":"The 2017 DA VIS challenge on video object segmen- tation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:10.897294Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:bcc2cf0798a3707c805c6202ffacd7a508b395a42d78835f1838fc94913064b8","observation_id":"920a33d2-f88a-4861-8327-2946fec61488","resolution":{"observed_at":"2026-08-07T00:34:10.897294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:11.079998Z","title":"Segmentation and recognition using structure from motion point clouds,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:11.079998Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:ffe1e392b66f855d5f4332e330bf86052f309b69060ce3d79d8800cf16993ca5","observation_id":"518bf01a-d599-4974-8350-37fc7e1d69a6","resolution":{"observed_at":"2026-08-07T00:34:11.079998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:11.213688Z","title":"The Cityscapes dataset for semantic urban scene understanding,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:11.213688Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:058272779255d9cffecfbc4c3d70eac90839a9bfeeae64bbf80428c69271c678","observation_id":"7e3ca2fa-f333-4886-8dcc-aa20811fbf36","resolution":{"observed_at":"2026-08-07T00:34:11.213688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:11.333781Z","title":"Semantic video segmentation by gated recurrent flow propagation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:11.333781Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:16a52ccd1181b84e365891873616713f3f366812855d26507bbeeea48e5966b4","observation_id":"2a09aeff-32dd-4884-a9c5-b1bc2c4c6632","resolution":{"observed_at":"2026-08-07T00:34:11.333781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:11.453873Z","title":"Are we ready for autonomous driving? the KITTI vision benchmark suite,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:11.453873Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:e73afb399c906691bbfb53156ec8e8dd743167a6c581d35059cc7841c9166800","observation_id":"fb05ac8b-dcd3-413c-a5c8-dd75aa83b326","resolution":{"observed_at":"2026-08-07T00:34:11.453873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:11.554961Z","title":"Every frame counts: Joint learning of video segmentation and optical flow,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:11.554961Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:62344c44abe1080e56eb72069d879dbc02ae879f4f2f4da25f2c5de8234f1aab","observation_id":"865a67a5-87a4-439c-974b-b74799cae546","resolution":{"observed_at":"2026-08-07T00:34:11.554961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:11.696336Z","title":"Temporally distributed networks for fast video semantic segmenta- tion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:11.696336Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:33b6027cf1233a6369f4dc9ef34518f355cca7b4169ba438d4371a9c5a6d2d87","observation_id":"5b761abc-a22e-403b-bb5b-ab8fd61c20d7","resolution":{"observed_at":"2026-08-07T00:34:11.696336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:11.807488Z","title":"Indoor segmentation and support inference from RGBD images,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:11.807488Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:04c69f6dcd2103b77e530509b7cf0ea6f359e8adf5096ad8fa5be55a4128ceb0","observation_id":"5bfd9120-3240-416f-a22e-bb7f82605c33","resolution":{"observed_at":"2026-08-07T00:34:11.807488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:12.008044Z","title":"Efficient semantic video segmentation with per-frame inference,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:12.008044Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:9ac4b1708b919aa756786c71c3ee94fe1f04f052541e6eeea7a0363b1d09106a","observation_id":"fe08dc35-0ba6-4ec5-b895-6e3ad8c1f9b9","resolution":{"observed_at":"2026-08-07T00:34:12.008044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":221},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 221 outbound references and 0 inbound Pith citation observations for arXiv:2506.13552."}