{"as_of":"2026-08-07T15:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:00db0a47c7df3b49037540010fe2e5d47b4516483fc7ac73851d948008cbfc12","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:25:44.060493Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T03:06:43.601051Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":"2112.10764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-07-10T03:06:43.601051Z","title":"Mask2former for video instance segmentation","venue":"cs.CV","work_id":"b1131c21-30c6-499a-a423-eef12442cb11","year":2021},"citing_paper":{"arxiv_id":"2503.01835","last_updated":"2026-04-30T12:56:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T18:56:29Z","title":"Primus: Enforcing Attention Usage for 3D Medical Image Segmentation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T01:22:29.901174Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2503.01835"},"observation_digest":"sha256:c3895476b444b486604aec757fbfa7da19444d3f075c4f5ad6cf399b79fc8c58","observation_id":"164a91ab-6c2d-4928-8067-bfaaf7be41f5","resolution":{"observed_at":"2026-05-23T01:25:16.506146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-07T05:25:44.060493Z","title":"Mask2former for video instance segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07977","last_updated":"2025-06-26T15:47:09Z","snapshot_observed_at":"2026-08-07T05:18:51.807244Z","submitted_at":"2025-06-09T17:50:21Z","title":"OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:44.060493Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2506.07977"},"observation_digest":"sha256:6453b07f12c47645c0121cfa8a4f288d60433f09dbef51e588534b15d5afeefb","observation_id":"10f86999-c4bc-44b4-bc1c-5005dc1bc195","resolution":{"observed_at":"2026-08-07T05:25:44.060493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-06T23:50:23.286782Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16058","last_updated":"2025-06-24T03:11:42Z","snapshot_observed_at":"2026-08-06T23:41:59.563520Z","submitted_at":"2025-06-19T06:32:53Z","title":"Stepping Out of Similar Semantic Space for Open-Vocabulary Segmentation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.286782Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2506.16058"},"observation_digest":"sha256:ec98596c4433d990290da6ba96b47297ba8a615ef8ae07745db50738c8c74bf5","observation_id":"cab951f1-9f45-4213-978b-f68eea78264e","resolution":{"observed_at":"2026-08-06T23:50:23.286782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-06T19:21:13.164766Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.05887","last_updated":"2025-07-18T12:41:26Z","snapshot_observed_at":"2026-08-06T19:13:34.578871Z","submitted_at":"2025-07-08T11:21:03Z","title":"GeoMag: A Vision-Language Model for Pixel-level Fine-Grained Remote Sensing Image Parsing","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:13.164766Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2507.05887"},"observation_digest":"sha256:863396fcf8de12a533b93c12b85790a23fdb4deffcc3b8be6f6191e61cf55eb4","observation_id":"87b8979b-f055-487d-850c-6ce6b719beea","resolution":{"observed_at":"2026-08-06T19:21:13.164766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-06T19:17:31.737828Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-06T19:12:03.074057Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:31.737828Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:71f6dc005244320fe7e4e69ce9fea4168e28c5d1b4a7ddba462148530dd6ec16","observation_id":"bd7d29b2-c6db-4d8c-b6fc-7cec9ca92856","resolution":{"observed_at":"2026-08-06T19:17:31.737828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-06T14:37:32.089540Z","title":", author Choudhuri, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.18330","last_updated":"2025-07-25T17:32:47Z","snapshot_observed_at":"2026-08-07T11:33:41.628642Z","submitted_at":"2025-07-24T11:57:59Z","title":"GVCCS: A Dataset for Contrail Identification and Tracking on Visible Whole Sky Camera Sequences","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T14:37:32.089540Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2507.18330"},"observation_digest":"sha256:8e6a0d246206db661a0c8b80ca9b50a93d1aa086b17051944955da9a2173cf76","observation_id":"d6d28bd7-fe06-4d42-8334-568ec688b40d","resolution":{"observed_at":"2026-08-06T14:37:32.089540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-06T14:22:13.254653Z","title":"Mask2former for video instance segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19451","last_updated":"2025-08-02T16:10:54Z","snapshot_observed_at":"2026-08-06T20:10:21.455978Z","submitted_at":"2025-07-25T17:33:23Z","title":"GS-Occ3D: Scaling Vision-only Occupancy Reconstruction with Gaussian Splatting","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:22:13.254653Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2507.19451"},"observation_digest":"sha256:61689589d209e1f08d9a739f075d577c74fff5b4a91db756c6be07fa0d84aaea","observation_id":"2489c505-f001-449f-97bc-6756f5153e56","resolution":{"observed_at":"2026-08-06T14:22:13.254653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-06T14:08:43.698403Z","title":"Mask2former for video instance segmentation.arXiv preprint arXiv:2112.10764, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19754","last_updated":"2025-07-26T02:52:41Z","snapshot_observed_at":"2026-08-06T19:35:53.769617Z","submitted_at":"2025-07-26T02:52:41Z","title":"Latest Object Memory Management for Temporally Consistent Video Instance Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:08:43.698403Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2507.19754"},"observation_digest":"sha256:2b51c9ae5a3d4ed088bf3eb359b5c7903f53ec75756d31fa5cfd8c2a913992ea","observation_id":"c6ff474e-4aed-44d8-83bf-b09ba6be3630","resolution":{"observed_at":"2026-08-06T14:08:43.698403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-05T23:11:37.909813Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.05851","last_updated":"2025-08-07T20:52:49Z","snapshot_observed_at":"2026-08-05T23:10:55.009718Z","submitted_at":"2025-08-07T20:52:49Z","title":"Temporal Cluster Assignment for Efficient Real-Time Video Segmentation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T23:11:37.909813Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2508.05851"},"observation_digest":"sha256:afbb3e1edaa0ec9cda7150961e684602d4e136f6d473db255bd1536bbbcc92fd","observation_id":"6f339dd2-819a-4472-a54d-7544ee0bdf16","resolution":{"observed_at":"2026-08-05T23:11:37.909813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-05T21:35:35.401431Z","title":"Mask2former for video instance segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.08498","last_updated":"2025-08-11T22:08:57Z","snapshot_observed_at":"2026-08-06T05:37:01.585501Z","submitted_at":"2025-08-11T22:08:57Z","title":"CObL: Toward Zero-Shot Ordinal Layering without User Prompting","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T21:35:35.401431Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2508.08498"},"observation_digest":"sha256:7d106e07a46bc5bae09d4bd9a842a8da850c7ae46081b825d7aeb7c61a84b197","observation_id":"a89c39a0-f55f-4a9b-8ba0-b528648f14c8","resolution":{"observed_at":"2026-08-05T21:35:35.401431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-05T20:30:02.984463Z","title":"Mask2former for video instance segmentation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10430","last_updated":"2025-08-14T08:02:54Z","snapshot_observed_at":"2026-08-06T00:05:26.590509Z","submitted_at":"2025-08-14T08:02:54Z","title":"Interleaved Transceiver Design for a Continuous- Transmission MIMO-OFDM ISAC System","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:02.984463Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2508.10430"},"observation_digest":"sha256:f6702e6c68317dde3407ec4ec9166d88b95ca4752526a6293bc118d1f0b1e1c7","observation_id":"453aadd4-07b8-4fe4-8e23-54c911b8f2fb","resolution":{"observed_at":"2026-08-05T20:30:02.984463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-05T15:33:15.913482Z","title":"Mask2former for video instance segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19808","last_updated":"2025-08-27T11:52:41Z","snapshot_observed_at":"2026-08-07T07:46:20.165893Z","submitted_at":"2025-08-27T11:52:41Z","title":"AutoQ-VIS: Improving Unsupervised Video Instance Segmentation via Automatic Quality Assessment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:33:15.913482Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2508.19808"},"observation_digest":"sha256:104e59b2cd2571233c149fda8c44a7ced0f02f1cba9cbcc40c7daa982173dfb9","observation_id":"500da900-2e9b-4573-94d9-6a9d882cd9a5","resolution":{"observed_at":"2026-08-05T15:33:15.913482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-04T09:31:55.211242Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-07T08:43:42.486523Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:55.211242Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:978f363b8b89bae7a881186e54c4021138ea5ba5daff2b8d5cfbfea5ec6fa700","observation_id":"10c61aa5-734c-4aec-b0a5-643ae63bd371","resolution":{"observed_at":"2026-08-04T09:31:55.211242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":"2112.10764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-07-10T03:06:43.601051Z","title":"Mask2former for video instance segmentation","venue":"cs.CV","work_id":"b1131c21-30c6-499a-a423-eef12442cb11","year":2021},"citing_paper":{"arxiv_id":"2604.13294","last_updated":"2026-04-30T06:11:12Z","snapshot_observed_at":"2026-07-06T23:01:19.191464Z","submitted_at":"2026-04-14T20:55:17Z","title":"PAT-VCM: Plug-and-Play Auxiliary Tokens for Video Coding for Machines","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:45:09.913980Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2604.13294"},"observation_digest":"sha256:b9b911b28d5cc15855e7ea01eb8c271453cebaa069b7867c651e18a0828b4360","observation_id":"be6a2d55-45cc-495b-a708-0f4ef7620b64","resolution":{"observed_at":"2026-05-11T09:56:01.846052Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":"2112.10764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-07-10T03:06:43.601051Z","title":"Mask2former for video instance segmentation","venue":"cs.CV","work_id":"b1131c21-30c6-499a-a423-eef12442cb11","year":2021},"citing_paper":{"arxiv_id":"2604.19411","last_updated":"2026-04-21T12:39:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T12:39:41Z","title":"GOLD-BEV: GrOund and aeriaL Data for Dense Semantic BEV Mapping of Dynamic Scenes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T03:20:24.032405Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2604.19411"},"observation_digest":"sha256:77642e0a1cec45672b4f840a6bf88f15679d6f6d777bfeb19a64c68e26c9ee5e","observation_id":"adf30736-1412-4539-9207-ce3599cc819d","resolution":{"observed_at":"2026-05-11T12:41:01.637082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":"2112.10764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-07-10T03:06:43.601051Z","title":"Mask2former for video instance segmentation","venue":"cs.CV","work_id":"b1131c21-30c6-499a-a423-eef12442cb11","year":2021},"citing_paper":{"arxiv_id":"2606.07394","last_updated":"2026-06-05T15:32:48Z","snapshot_observed_at":"2026-08-02T20:31:00.881598Z","submitted_at":"2026-06-05T15:32:48Z","title":"Mind the Gap: Disentangling Performance Bottlenecks in Video Instance Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:36.011508Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2606.07394"},"observation_digest":"sha256:c0378ea81cc06594c2af7a8e977934f42e2d002634373257ed19762ceed5a9dd","observation_id":"fc1c1c04-981c-4149-8ea9-74bbae5d0e56","resolution":{"observed_at":"2026-07-02T17:07:12.925722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":"2112.10764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-07-10T03:06:43.601051Z","title":"Mask2former for video instance segmentation","venue":"cs.CV","work_id":"b1131c21-30c6-499a-a423-eef12442cb11","year":2021},"citing_paper":{"arxiv_id":"2606.20140","last_updated":"2026-06-29T11:14:49Z","snapshot_observed_at":"2026-07-06T23:55:20.134506Z","submitted_at":"2026-06-18T12:03:04Z","title":"SA-VIS: Sparse frame Annotations for training Video Instance Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T18:19:56.997875Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2606.20140"},"observation_digest":"sha256:721367ce512758cf034cfff135cceabfb4fa393516edffd8403ce2f0c32a6dc0","observation_id":"7f9d0ede-c8c2-4449-8697-5369740011c7","resolution":{"observed_at":"2026-07-04T03:09:30.493585Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":"2112.10764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-07-10T03:06:43.601051Z","title":"Mask2former for video instance segmentation","venue":"cs.CV","work_id":"b1131c21-30c6-499a-a423-eef12442cb11","year":2021},"citing_paper":{"arxiv_id":"2606.20140","last_updated":"2026-06-29T11:14:49Z","snapshot_observed_at":"2026-07-06T23:55:20.134506Z","submitted_at":"2026-06-18T12:03:04Z","title":"SA-VIS: Sparse frame Annotations for training Video Instance Segmentation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T10:45:35.568212Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2606.20140"},"observation_digest":"sha256:137cec9ecd3ff286c518611704c64d88d8ae2027e16e9c347b07236d1fa18080","observation_id":"46758175-4b06-49e8-a5a7-1e1fe1319b2f","resolution":{"observed_at":"2026-06-30T10:54:37.012591Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":"2112.10764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-07-10T03:06:43.601051Z","title":"Mask2former for video instance segmentation","venue":"cs.CV","work_id":"b1131c21-30c6-499a-a423-eef12442cb11","year":2021},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-05T21:36:20.633854Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:8f7ebedf46a14501356d37da3821f99b01adbddb2b5cfb37948444ceaa0ddc6e","observation_id":"aacbb5a3-64a2-4e90-bd87-ffdedc95b691","resolution":{"observed_at":"2026-07-10T03:06:43.602664Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-05T22:20:46.977826Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T15:25:09.585005Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.977826Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:e0bb74303c229fe8512c1f28ee360a5d5b36520049d2e977e07c064546f2f586","observation_id":"c631030b-3c73-4f78-a06e-796a12b477db","resolution":{"observed_at":"2026-08-05T22:20:46.977826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2112.10764/citation-record","integrity":"/paper/2112.10764/integrity","json":"/paper/2112.10764/citation-record.json","paper":"/paper/2112.10764"},"outbound":[],"paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2112.10764."}