{"as_of":"2026-08-07T16:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd2d13c3220e101a65e8f13a60e221484759a06e9318f20cfba185a45cb12906","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:17:34.548221Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.05948/citation-record","integrity":"/paper/2507.05948/integrity","json":"/paper/2507.05948/citation-record.json","paper":"/paper/2507.05948"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.221621Z","title":"Stem-seg: Spatio-temporal em- beddings for instance segmentation in videos","venue":null,"work_id":"7a27a874-3135-44e5-b29b-643021d70ea1","year":2020},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:30.801393Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:2812f00b453b8f3b8a554b43887a7ad11ff9e63f38832080141d24ea4d827028","observation_id":"44cec9f3-2f55-4dd1-946f-2731467497a5","resolution":{"observed_at":"2026-08-06T19:17:35.225576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.211980Z","title":"Is space-time attention all you need for video understanding? In International Conference on Machine Learning, 2021","venue":null,"work_id":"d07e7b6f-ea90-4ab3-a9db-42a5182a25fc","year":2021},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:30.900956Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:ec1b8c2d0644a87c29231e971cadd44112d84c2e90d51ac5711a51f027abc774","observation_id":"4aa3b6fc-8dfd-4296-950a-de684d2ad91e","resolution":{"observed_at":"2026-08-06T19:17:35.215551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14460","last_updated":"2023-07-26T19:01:49Z","snapshot_observed_at":"2026-08-05T14:21:33.902926Z","submitted_at":"2023-07-26T19:01:49Z","title":"MiDaS v3.1 -- A Model Zoo for Robust Monocular Relative Depth Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14460","snapshot_observed_at":"2026-08-06T19:17:31.044998Z","title":"Midas v3.1 – a model zoo for robust monocular relative depth estimation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:31.044998Z"},"links":{"cited_paper":"/paper/2307.14460","citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:521cfdf74168561705bf354597eaf6c997034a06a3a2e328cac39a209dd33cdc","observation_id":"4fd57a2b-e37a-4bd8-a81b-f11ca7fe49d5","resolution":{"observed_at":"2026-08-06T19:17:31.044998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-06T19:17:31.260099Z","title":"Stable video diffusion: Scaling la- tent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:31.260099Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:974a83b4504a1f6f985fb124bda532d678a25f070afacab82f5b9add1f66f83d","observation_id":"f42aa1f6-bfb6-4184-b5cd-a5166450ac14","resolution":{"observed_at":"2026-08-06T19:17:31.260099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.202494Z","title":"End-to- end object detection with transformers","venue":null,"work_id":"9bea9131-38e0-47da-9968-5a3e468cec56","year":2020},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:31.370901Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:03f1272094afc6438570ade5c5751902d00de936d57751afdaa0a7c1789c6416","observation_id":"40888369-7740-4196-8a40-0ca91b09051e","resolution":{"observed_at":"2026-08-06T19:17:35.205943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.191947Z","title":"Liu, Yen-Cheng Liu, and Yu- Chiang Frank Wang","venue":null,"work_id":"dfdeb090-cbe0-4d03-a948-87effde44311","year":2019},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:31.495860Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:08295b5a77a08129b8cbcfef1428a731c3adf60480eba2f2d722dbb652f9c0bc","observation_id":"de672815-1933-4925-b478-5ca43aa28665","resolution":{"observed_at":"2026-08-06T19:17:35.195868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.08534","last_updated":"2023-02-13T15:50:22Z","snapshot_observed_at":"2026-07-06T13:10:56.430851Z","submitted_at":"2022-05-17T17:59:11Z","title":"Vision Transformer Adapter for Dense Predictions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.08534","snapshot_observed_at":"2026-08-06T19:17:31.571904Z","title":"Vision transformer adapter for dense predictions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:31.571904Z"},"links":{"cited_paper":"/paper/2205.08534","citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:2ebe2cc8d8a112a57ad0974b56f637cd3023e80d5b6a2b0122e5e1d86b7a0a56","observation_id":"883b2de5-6e7e-4ce7-82b9-f04d83ff57dc","resolution":{"observed_at":"2026-08-06T19:17:31.571904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.181165Z","title":"Collins, Yukun Zhu, Ting Liu, Thomas S","venue":null,"work_id":"5769f23f-21c6-401b-9550-746b687de401","year":2020},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:31.648706Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:9fe3cf9e60f266b23fcd736c2162de0ee4499c5a8c759fb63f2562ba6ffb3786","observation_id":"bee4c805-d516-4b99-a360-31bdf9138c91","resolution":{"observed_at":"2026-08-06T19:17:35.185091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-06T19:17:31.737828Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:31.737828Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:71f6dc005244320fe7e4e69ce9fea4168e28c5d1b4a7ddba462148530dd6ec16","observation_id":"bd7d29b2-c6db-4d8c-b6fc-7cec9ca92856","resolution":{"observed_at":"2026-08-06T19:17:31.737828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.170649Z","title":"Per- pixel classification is not all you need for semantic segmen- tation","venue":null,"work_id":"12f15cb8-7494-4ba9-b7ba-fe56b29c1924","year":null},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:31.802513Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:e83b0eb0d19d5d5f2daae1dba3abbb82f2ee1bd8c7c7e5f3b4748373e762d76c","observation_id":"f2b25763-c8f1-4016-af5e-0fa2158affd1","resolution":{"observed_at":"2026-08-06T19:17:35.174848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.160241Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":"0ae1c807-7a8e-4df3-937e-977b5419ec78","year":2022},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:31.862573Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:a363a5518d3c8161213f352760ea864d588f2e607f86baf4b8c797bfa3ebaf2f","observation_id":"f6b9670c-78a4-47e4-9fc6-780bc041e9df","resolution":{"observed_at":"2026-08-06T19:17:35.164477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.149989Z","title":"MeViS: A large-scale benchmark for video segmentation with motion expressions","venue":null,"work_id":"ba52817c-2a2e-4b41-84a5-2104880014c7","year":2023},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:31.953003Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:ff676359cd6b2049f226ca545c1749179203b5e8b37dd8b849af08bce2d88fc8","observation_id":"eecf82d2-8b0c-41c0-bc50-4a1879bd9af6","resolution":{"observed_at":"2026-08-06T19:17:35.153426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.139610Z","title":"MOSE: A new dataset for video object segmentation in complex scenes","venue":null,"work_id":"31ff37b3-098d-4c03-93ee-e99d9ea9b32a","year":2023},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:32.053673Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:60529a9d5c554b49df811dc549e39ed6b717978953348469a8e088b959b5abff","observation_id":"f81a655b-2269-4813-b6dd-62845d006d2c","resolution":{"observed_at":"2026-08-06T19:17:35.143479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.128578Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"0db43ed3-ac92-44dc-8f45-2a5c1e1e2074","year":2021},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:32.120327Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:addd3bcaad4b2c0c12d16e5d7985591173232b19323d19a2dbfbaa001e1eb3c6","observation_id":"4ea2f2aa-c283-4462-aa95-184f0563ba7c","resolution":{"observed_at":"2026-08-06T19:17:35.132546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.118132Z","title":"Depth map prediction from a single image using a multi-scale deep net- work","venue":null,"work_id":"b44cad1d-ca56-4d07-b0c8-235bef2abd90","year":2014},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:32.186887Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:b6f2ea1a99b859d8d2d646f663795b0c3eaa84a163d6ff1ec2121b440f2fb0e0","observation_id":"2037d9f0-e08e-4e28-a9a3-0c6ebf7a7c0c","resolution":{"observed_at":"2026-08-06T19:17:35.121778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.107744Z","title":"Deep Ordinal Regression Network for Monocular Depth Estimation","venue":null,"work_id":"da8f3546-b20c-42c1-b122-f65fd1e81aee","year":2018},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:32.259930Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:e978c5faf90f8a3d65ffcebb1c98c597457d5186b0081d7beba1146b47538b06","observation_id":"19f79190-0953-41c4-9daa-0e0f6c04b649","resolution":{"observed_at":"2026-08-06T19:17:35.111325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.097518Z","title":"Gratt-vis: Gated residual atten- tion for video instance segmentation","venue":null,"work_id":"a6d274fa-ff60-4799-8418-276ec33eb303","year":null},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:32.350163Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:c1adf0cb5de5728931499e070c097c8b7a33d91a125e1179d13e5b7a6d294730","observation_id":"e1676818-0491-41a7-bc6c-4f4c2cc0a5ea","resolution":{"observed_at":"2026-08-06T19:17:35.100906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.086574Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"953acd43-2cee-4789-9c53-4c1087f5d6ca","year":2016},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:32.414701Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:47ea59e84ca08b5168a6de62f316dafbaff34a3c9b4ebbc07888ac9db1da697b","observation_id":"dfe9f3e3-c457-4e73-a771-9c6023ce1132","resolution":{"observed_at":"2026-08-06T19:17:35.090612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.075068Z","title":"Vita: Video instance segmentation via object token association","venue":null,"work_id":"7d80e8a4-c885-451f-979c-ea60193acf18","year":2022},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:32.485519Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:156dbc2fbf67f568385701dbe8fa844843f75a989b6c6f350e358a739f5f5ac5","observation_id":"b898921b-6756-44f9-b53b-4806e2b439ab","resolution":{"observed_at":"2026-08-06T19:17:35.080147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.064211Z","title":"A generalized framework for video instance segmentation","venue":null,"work_id":"03282976-0639-4e78-ad05-9a35447d3c92","year":null},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:32.555234Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:e91e2cb2203c30f8c7cf4570375bd45d45b44031452898194f8b48008c3ea71a","observation_id":"d1b04145-c257-4b6e-8936-eb3f465a6564","resolution":{"observed_at":"2026-08-06T19:17:35.067855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.052875Z","title":"Metric3d v2: A versatile monocular geomet- ric foundation model for zero-shot metric depth and surface normal estimation","venue":null,"work_id":"d557d652-2b71-450d-8165-404ed42a99fe","year":2024},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:32.638086Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:9691792b3abb53b0b827353b06beaf3ee9173daae98186b83817b2e9dd0c2410","observation_id":"47c16f76-4c88-48f2-8444-e17c89f1fdba","resolution":{"observed_at":"2026-08-06T19:17:35.056740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.042926Z","title":"Min- vis: A minimal video instance segmentation framework without video-based training","venue":null,"work_id":"64929655-71b4-4107-b9f8-aa61f115a5d5","year":2022},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:32.704845Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:69f95fab3fdf022a3fa7617c00f1f6ef3cafde6050ff166a90df03d858cae79e","observation_id":"a80c305d-816f-4cb4-92ea-bdd5366268d3","resolution":{"observed_at":"2026-08-06T19:17:35.046211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.031641Z","title":"Video object segmentation with language referring expressions","venue":null,"work_id":"e9f750c2-eb91-42f1-bc47-65ea0ebd30e3","year":2018},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:32.777215Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:d993e8fdd1963e88cf7397485657e0be3ca45b4dd09a0f5f3f3b2ae68128ce1a","observation_id":"92e1425d-cafc-45f8-89f8-662caf0af0ba","resolution":{"observed_at":"2026-08-06T19:17:35.035711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.018452Z","title":"Self-Supervised Monocular Depth Es- timation: Solving the Dynamic Object Problem by Seman- tic Guidance","venue":null,"work_id":"925302f2-cb45-4a41-9c4d-0f9ba7334531","year":null},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:32.849148Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:8c8ca7b57c01e40ba0736400b79bae4c7acd3646312759639544a2d848b4a5f8","observation_id":"f48d6ef3-5bee-4933-8c66-12578057479c","resolution":{"observed_at":"2026-08-06T19:17:35.023162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03010","last_updated":"2025-07-09T12:23:10Z","snapshot_observed_at":"2026-08-06T18:58:57.782468Z","submitted_at":"2024-07-03T11:11:16Z","title":"CAVIS: Context-Aware Video Instance Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03010","snapshot_observed_at":"2026-08-06T19:17:32.925664Z","title":"Context-aware video instance segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:32.925664Z"},"links":{"cited_paper":"/paper/2407.03010","citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:e1bb61e8fa6c754b6bc477e519d3d1930010095750578a57c5cc2717a00379f1","observation_id":"a105ac78-8cbf-4cd0-b8fd-1e2449f60562","resolution":{"observed_at":"2026-08-06T19:17:32.925664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:35.006328Z","title":"Tcovis: Temporally consistent online video instance seg- mentation","venue":null,"work_id":"cdaccd38-bb20-4a17-bec5-06c0fa04adbe","year":null},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:33.011814Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:67db118a427b1eef8a2242f665873fc11252e1611f1d21a639290dae474cdeb1","observation_id":"3e00813c-e74e-4afb-85a3-4eeab842981a","resolution":{"observed_at":"2026-08-06T19:17:35.010380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.993808Z","title":"Video k-net: A simple, strong, and unified baseline for video segmentation","venue":null,"work_id":"de22da64-50ae-40e0-bb2e-f5a73e23a7a8","year":2022},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:33.092555Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:ca33b00ec675e12970642823644e7b7dbcf0681d3e2e78a263e9b8de435ff2ec","observation_id":"97a9959c-2aba-4451-9256-df2fac6f7eab","resolution":{"observed_at":"2026-08-06T19:17:34.998688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.980449Z","title":"Transformer-based visual segmenta- tion: A survey","venue":null,"work_id":"ab2d95a5-1305-4bf8-9ce8-ceb9b0661b99","year":2024},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:33.214189Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:d12e7d795562de256a0f0b077b128ad158662f5c8c22d084332f162586ac5b57","observation_id":"2f402b5d-1fa7-45e1-acea-a5cfffc5d4e9","resolution":{"observed_at":"2026-08-06T19:17:34.984574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.968563Z","title":"Omg-seg: Is one model good enough for all segmentation? In Conference on Computer Vision and Pattern Recognition,","venue":null,"work_id":"61d61480-935a-4d0a-acc7-513d4c5d2f4a","year":null},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:33.279285Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:cfc8a1033ea575a32dcc97229e05f011fbff1bf1b9282a2a106e8465ea93e1c5","observation_id":"1fb97ea8-58a2-4419-a407-c80f8ccb521d","resolution":{"observed_at":"2026-08-06T19:17:34.972284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:33.336373Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:33.336373Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:179c071b9093c662772a2f7526988a7102bd3da015690f0684f52e05779a20db","observation_id":"68151916-4bf7-463c-89ba-f2551fba9e48","resolution":{"observed_at":"2026-08-06T19:17:33.336373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.952473Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"bd3467de-df05-43a4-a4a4-74a023f0c2ea","year":2021},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:33.406701Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:98b0a786d77531389364f0dbc154f9a9a6397bd3b96d139847cb1cb8299101ff","observation_id":"fb27e04d-cf28-4f62-9267-6313a358a888","resolution":{"observed_at":"2026-08-06T19:17:34.956085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:33.456111Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:33.456111Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:3e3e97cd4e1ee7f465ed11a2074782dd1f02320757d65d3fd31d008f055422d7","observation_id":"54b62558-b8a6-4d0a-938d-3233084b5af9","resolution":{"observed_at":"2026-08-06T19:17:33.456111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.934011Z","title":null,"venue":null,"work_id":"9bd42838-1caf-4965-8855-539afd2fec1b","year":2024},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:33.525177Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:aeabf09a86b089b7bca5c081729e2070c126665708580212b7c1c3677ffb0d21","observation_id":"8abc1bd3-3b74-4663-b440-c98b2466d8cb","resolution":{"observed_at":"2026-08-06T19:17:34.937844Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.922749Z","title":"Keeping your eye on the ball: Trajec- tory attention in video transformers","venue":null,"work_id":"e5b29823-109c-4fc0-a6d2-155613eb18a0","year":2021},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:33.620382Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:05a5d15e23cb782e52be67643b3c83ed4244bb60d2c4a36d787138e1ac25dc7c","observation_id":"b76ac901-acca-46a2-a6b2-c304a2344ab0","resolution":{"observed_at":"2026-08-06T19:17:34.926944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.910431Z","title":"A benchmark dataset and evaluation methodology for video object segmentation","venue":null,"work_id":"7012ca18-bad6-4e28-a75f-5226d9ced4c8","year":2016},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:33.639897Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:8ece0fc3fab631a9cc6ff1e994b8ac6c7cb043a4b52466cb2d1e741f611aca08","observation_id":"4561aba0-e6f1-4af7-aea8-2c6015f83e70","resolution":{"observed_at":"2026-08-06T19:17:34.913748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.898725Z","title":"Occluded video instance segmentation: A bench- mark","venue":null,"work_id":"5759dde6-4257-46dc-b0bf-249a26f90b56","year":2022},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:33.718789Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:565fc9b548e7fae9a2802f7545881ca444c1c9630285e9863f24fd6c5cf6d60b","observation_id":"98ad0c44-f3dc-4db5-96f9-c420c1c8def2","resolution":{"observed_at":"2026-08-06T19:17:34.902520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.05258","last_updated":"2020-12-09T19:00:35Z","snapshot_observed_at":"2026-08-07T15:44:58.000647Z","submitted_at":"2020-12-09T19:00:35Z","title":"ViP-DeepLab: Learning Visual Perception with Depth-aware Video Panoptic Segmentation","version":1},"cited_work":{"arxiv_id":"2012.05258","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.05258","snapshot_observed_at":"2026-08-06T19:17:34.586130Z","title":"ViP-DeepLab: Learning Visual Perception with Depth-aware Video Panoptic Segmentation","venue":"cs.CV","work_id":"6341c13b-da45-46f5-ba60-b32dfb48858f","year":2020},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:33.822660Z"},"links":{"cited_paper":"/paper/2012.05258","citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:99887af5a270740babeaa4a31bbcd1a43df6321c1bc5d88c8749384897730522","observation_id":"096fb90e-f66d-4bc0-aaff-31b9fe73e979","resolution":{"observed_at":"2026-08-06T19:17:34.592459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.886122Z","title":"Vi- sion transformers for dense prediction","venue":null,"work_id":"470b91eb-dba1-4d6b-828f-2e8010a5531f","year":2021},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:33.965005Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:4476fea1cd4869c59c92c46741c4708f79fa634d6d1001c67f8e107644b217ef","observation_id":"b8ff83cf-20d8-4991-94ad-7925dcb7cca5","resolution":{"observed_at":"2026-08-06T19:17:34.890407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.876754Z","title":"Towards robust monocular depth estimation: Mixing datasets for zero-shot cross-dataset transfer","venue":null,"work_id":"de03bd2a-00e6-47b9-91d7-effe47721a1b","year":2022},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.075884Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:63bd4bf96080e788dfb1c83f2f8bcaa3e215cfe04388c7dff05428380e88e105","observation_id":"069c13b9-6382-42de-8880-d43d1eddbc4b","resolution":{"observed_at":"2026-08-06T19:17:34.880084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.863878Z","title":"Boosting monocular depth with panoptic segmentation maps","venue":null,"work_id":"286ac4f3-2f4e-43fc-83c5-725e5a7617ad","year":2021},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.280261Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:ddc794f5d2906b747ad1282fc15100a3e9ae12646773f2e937fca5b6c16b515b","observation_id":"b6ed3fb2-ff4f-49d4-b10b-fec2342cbc41","resolution":{"observed_at":"2026-08-06T19:17:34.868877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.853373Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"b5cf617d-dcf4-4a58-b4f6-e45015832a06","year":2017},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.460870Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:5c79689914a47425beaffc8df4dd9ff79addd753352f40978efa6aa8155dcb2a","observation_id":"faf64410-40a8-4a62-a17c-9a8c78694bee","resolution":{"observed_at":"2026-08-06T19:17:34.856873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.841933Z","title":"Sigma: Siamese mamba network for multi-modal semantic segmentation","venue":null,"work_id":"a602f3b2-d6d9-4366-860a-8514e3d1215d","year":null},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.492979Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:2cb4c991954667fc1a1034428adc0e2ee5c85d7441f52c349620c7f27196c6b4","observation_id":"2b611cf6-04e3-4099-900f-d70730844b99","resolution":{"observed_at":"2026-08-06T19:17:34.846739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.830666Z","title":"Sdc-depth: Semantic divide-and-conquer net- work for monocular depth estimation","venue":null,"work_id":"e171d1d8-3d32-46aa-84e9-eb302c4e6fd5","year":2020},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.496984Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:a70e8d53bd2dbbcaa00d86de3ab1b9b92b061b1eec81e535de84d21d27578960","observation_id":"f244ce5c-8d5f-48ac-8843-81dac7de53ce","resolution":{"observed_at":"2026-08-06T19:17:34.835266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.819194Z","title":"End-to-end video instance segmentation with transformers","venue":null,"work_id":"b25ea5c7-77c8-4807-b4d2-e525d375ed9f","year":2021},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.499751Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:dd1bbc30eabaf24adb1bc7a33c2e3fb693261c9a231ba80b818ade21cb08e837","observation_id":"85d59161-665f-4a1c-ac11-b17da801093c","resolution":{"observed_at":"2026-08-06T19:17:34.822760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.809612Z","title":"Metric3d: Towards zero-shot metric 3d prediction from a single image","venue":null,"work_id":"69c1ea7c-d326-44be-87dc-083a8e9dcb65","year":2023},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.503601Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:36d2ffc493320e4df2a8c3529af895ce7c2c8ad7986a497ba63bcb95d0a5def7","observation_id":"a4cb9d1e-976b-410b-9635-cc681dc350b4","resolution":{"observed_at":"2026-08-06T19:17:34.812977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.799726Z","title":"Seqformer: Sequential transformer for video instance segmentation","venue":null,"work_id":"86b5d29e-c0b6-4d2f-9429-31d822c682e6","year":null},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.507477Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:04aa7cae436c0b1e67aa46b1f8724daa30ef84929a09141484f7dd351187ecf8","observation_id":"44fad11c-bfcd-4554-bbf2-cabbca2bbdf3","resolution":{"observed_at":"2026-08-06T19:17:34.803309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.789307Z","title":"In defense of online models for video instance segmentation","venue":null,"work_id":"23e76d3d-6b65-454d-8023-37999e2adf25","year":null},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.510411Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:e55be16fdc930c2ffc2392d374d743cc551f1a5b3e67410f404a955f635a1d6f","observation_id":"0986d5df-f94b-4fe6-beb2-80d01711e7f5","resolution":{"observed_at":"2026-08-06T19:17:34.792784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10815","last_updated":"2025-03-12T09:16:59Z","snapshot_observed_at":"2026-08-02T03:23:18.701055Z","submitted_at":"2024-10-14T17:59:46Z","title":"Depth Any Video with Scalable Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10815","snapshot_observed_at":"2026-08-06T19:17:34.513382Z","title":"Depth any video with scalable synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.513382Z"},"links":{"cited_paper":"/paper/2410.10815","citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:2018292f313e2eb390a27bb2f42854525230846a8df395d3c6b15d36efdfe8b8","observation_id":"a4435c75-3b7d-47ec-a1ab-a37ebf32d005","resolution":{"observed_at":"2026-08-06T19:17:34.513382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.777572Z","title":"Video instance seg- mentation","venue":null,"work_id":"31f2b03e-2500-4876-9d2f-f49fc5a61f97","year":null},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.516735Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:7c4d632e4f670d34b2d35fcb709bb95e4b56886642aa65b06ad7dc24a8189b3e","observation_id":"b603f057-5f35-41a2-9a6e-ca11f6a59264","resolution":{"observed_at":"2026-08-06T19:17:34.781260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.764236Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"be8775ed-3a7b-4ae6-98f3-3bc573882fe0","year":2024},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.519533Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:ff4e125efcd8857d899f60afe1508f30b6b5ac9552908068f6e877bbff2a1957","observation_id":"5ce503cb-9725-4c3e-bc4e-48fdd850bb6d","resolution":{"observed_at":"2026-08-06T19:17:34.769290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.753822Z","title":"Depth any- thing v2","venue":null,"work_id":"4f398bfd-9e81-40dd-afc3-db7a31ae8fae","year":2024},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.522356Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:13428393e0c22a5a3050c2652424b98d15275b40bedd88dc9eea578e88462169","observation_id":"249a832b-6022-41b9-bfe0-e82b34dad44e","resolution":{"observed_at":"2026-08-06T19:17:34.757631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.741605Z","title":"Ctvis: Consistent train- ing for online video instance segmentation","venue":null,"work_id":"aa3161a7-8846-4e94-b900-b6963415ef46","year":2023},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.525132Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:a9d499da979c35a724e2fc82ae0e45ee452cf12bf2594209c1867c92b8ee2194","observation_id":"43c01758-bda8-406c-9a97-f7f7c2c6ee56","resolution":{"observed_at":"2026-08-06T19:17:34.745864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.729666Z","title":"Polyphonicformer: Unified query learning for depth-aware video panoptic segmentation","venue":null,"work_id":"2ccab9fc-978d-4a6c-9c97-2dad6a6b98f2","year":2022},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.528509Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:3106bf0b88a5adac0047cf74d981b287c071352af3b27d826113b5f455423fc8","observation_id":"9448895f-a749-442b-907e-7e7bed8179af","resolution":{"observed_at":"2026-08-06T19:17:34.733631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.717579Z","title":"Geometry meets semantic for semi-supervised monocular depth estimation","venue":null,"work_id":"fe3e0022-beb9-4cb6-9b65-da58168a4b72","year":2018},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.531650Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:6825c318a651f654974a4ad8f5c5c6ba437d33ca4abc2c26a4b382eedebca51b","observation_id":"ee2c0955-4265-45f8-bb61-2b8b621a1eae","resolution":{"observed_at":"2026-08-06T19:17:34.721040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.706525Z","title":"Cmx: Cross-modal fusion for rgb-x semantic segmentation with transformers","venue":null,"work_id":"de0c4377-f27d-4e20-a27a-4fb0fbbd10ac","year":2023},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.534259Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:a8b26ff297986a4937326c525151f6f6980bed1be46d8808d113381cc07c49ac","observation_id":"cf7c2cbb-991d-4625-a445-749a2e551d55","resolution":{"observed_at":"2026-08-06T19:17:34.710318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.694425Z","title":"Delivering arbitrary-modal semantic segmentation","venue":null,"work_id":"af62ed24-119e-4f2a-a7ea-e6eabc3a2963","year":2023},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.536874Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:8cdd60096dd55d208e8f456393968e3d7466ed9583330e53713097714d0e89c2","observation_id":"33a3296b-c367-409b-b49a-db6338d5efd5","resolution":{"observed_at":"2026-08-06T19:17:34.698098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.684733Z","title":"Dvis: Decoupled video in- stance segmentation framework","venue":null,"work_id":"1b8527db-1edb-4a24-a38d-362a7df8eae4","year":2023},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.539546Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:a8166f2c68367c179f7e6972b159a5273c0a8ec2fa06539b02e24ac50f2a081b","observation_id":"4ba3d615-4146-414e-975e-0459af2efcc2","resolution":{"observed_at":"2026-08-06T19:17:34.688108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.673340Z","title":"Dvis++: Improved decoupled frame- work for universal video segmentation","venue":null,"work_id":"843f6cde-cb13-4062-966f-efeb3fa375ba","year":2025},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.542429Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:20e4ba56d2a1eb7812d3f6a3276ce79d1d8d0e6afd00765cbdfc66588708c265","observation_id":"648c8882-4c46-458c-8834-57f0771046d8","resolution":{"observed_at":"2026-08-06T19:17:34.677425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.662645Z","title":"Dvis-daq: Improving video segmentation via dynamic anchor queries","venue":null,"work_id":"af9ac507-f5a8-42b0-a2e8-dc2b64e0e19c","year":2024},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.545623Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:843894836494d83a2cd0293308ed39c88406e1b5757680d5560243c29fd2e43b","observation_id":"fc0301be-19a4-4b39-a3f9-c4686cf35dbe","resolution":{"observed_at":"2026-08-06T19:17:34.666323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:17:34.652167Z","title":"Deformable detr: Deformable transformers for end-to-end object detection","venue":null,"work_id":"dd52a78b-c10a-49e0-bb8b-db8c684c8d6f","year":2021},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:34.548221Z"},"links":{"citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:c66f3acd0937a7ce73a1f73727fb48f2a6b1947bbd0d963d2aafa11214e0aa6e","observation_id":"f903c52f-5a6a-4f45-9b73-c3fdb9922883","resolution":{"observed_at":"2026-08-06T19:17:34.655837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":50},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2507.05948."}