{"as_of":"2026-08-19T18:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8fac3c90982179294fb7f56538cd7ae4e6938107b254f6de723a435623da60f8","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:28:55.043436Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T06:01:19.889564Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T06:01:20.333852Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":"2412.04434","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04434","snapshot_observed_at":"2026-08-16T06:01:20.333852Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","venue":"cs.CV","work_id":"c4f471b8-dc3e-4b8c-abba-5a93ea07e3fd","year":2024},"citing_paper":{"arxiv_id":"2504.19266","last_updated":"2025-04-27T14:46:43Z","snapshot_observed_at":"2026-08-17T03:27:36.379346Z","submitted_at":"2025-04-27T14:46:43Z","title":"OpenFusion++: An Open-vocabulary Real-time Scene Understanding System","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T06:01:19.889564Z"},"links":{"cited_paper":"/paper/2412.04434","citing_paper":"/paper/2504.19266"},"observation_digest":"sha256:04c09b665305bb6acf2b175fab4c57133a6d9af33567bb3148ea7de96141e444","observation_id":"ba96b6eb-c730-4041-940b-ce05dfa59553","resolution":{"observed_at":"2026-08-16T06:01:20.339228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04434/citation-record","integrity":"/paper/2412.04434/integrity","json":"/paper/2412.04434/citation-record.json","paper":"/paper/2412.04434"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T21:28:54.761939Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.761939Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:6105cb486d5f902d9f1b1745e14c359b64437741426facc4479fe459f7c858f6","observation_id":"3e94c777-44a9-4294-8980-602f10de40f4","resolution":{"observed_at":"2026-08-11T21:28:54.761939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:56.281568Z","title":"Tarvis: A unified approach for target-based video segmentation","venue":null,"work_id":"5f101459-ea52-4090-a24e-03c429418b03","year":2023},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.768390Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:593e2e900548d74c3de60d06b71a39cb93ad4aa60b9c2f85b81619dd9bf9e089","observation_id":"a29efce4-5d58-4c6f-989a-397d5e083c5f","resolution":{"observed_at":"2026-08-11T21:28:56.286659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:56.264489Z","title":"Burst: A benchmark for unifying object recognition, segmentation and tracking in video","venue":null,"work_id":"ce0dba61-f2f7-4f78-b5f6-8ff11a66c896","year":2023},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.773331Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:b66b19205b649fee7b9f39e9731a59533414a2e8e37f2105c551419e9ed8b7af","observation_id":"c84a1983-93bf-4801-929e-80b38bbb6581","resolution":{"observed_at":"2026-08-11T21:28:56.269868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:56.248307Z","title":"Simple online and realtime tracking","venue":null,"work_id":"5309e398-2bb4-4bd9-9766-b7c54434d40e","year":2016},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.778521Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:345a76e78bec7f03048a839e23a67c9f919e9e8ba9d4d74e0e2f034fc429052e","observation_id":"1d621219-4170-4760-8369-45afe20c6487","resolution":{"observed_at":"2026-08-11T21:28:56.253565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:56.230792Z","title":"Efficientvit: Lightweight multi-scale attention for high- resolution dense prediction","venue":null,"work_id":"96dc3963-62d1-4457-8452-94c99929690c","year":2023},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.783547Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:0de10fffb280e8d9815343a5d86427531a2a598e94a5383aec030c5c10502a45","observation_id":"fc2e99c9-e58c-4ee5-8419-5c6e734f8232","resolution":{"observed_at":"2026-08-11T21:28:56.236364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:54.789052Z","title":"End-to- end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.789052Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:b607d3f0acd657fd169cd3a63db7af7cc802309b372c20252cf580f7655167ec","observation_id":"7c28fd84-81e1-4892-a348-4f2a5f99f6b9","resolution":{"observed_at":"2026-08-11T21:28:54.789052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:56.203488Z","title":"Xmem: Long- term video object segmentation with an atkinson-shiffrin memory model","venue":null,"work_id":"b51435cc-9a23-4b94-9e29-e83079ad0822","year":2022},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.794234Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:f2ba53d7e3a4745dbb87d6e907d1eb980fe968679e4bea0a4918a491f62a31a3","observation_id":"85cdf484-b9d5-4cc2-a366-7b6e369d4e48","resolution":{"observed_at":"2026-08-11T21:28:56.208807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:56.187954Z","title":"Yolo-world: Real-time open-vocabulary object detection","venue":null,"work_id":"cd002f68-9e70-4dfa-a189-384960233d91","year":2024},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.799665Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:ee1aab9557d2d6d05bbd9ef68dca80b5123ebb090ca7fde211266efc72457dd1","observation_id":"f7fa137d-5f9a-4511-977b-38c42d7d3f10","resolution":{"observed_at":"2026-08-11T21:28:56.192660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:54.804105Z","title":"Xception: Deep learning with depthwise separable convolutions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.804105Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:5b0726febf3f5387b145fda0d60d3e5fe552fad1182d7ae870cb93a9de8a1f66","observation_id":"b4e42626-faaa-4785-bcc7-01cf2ff2a6ae","resolution":{"observed_at":"2026-08-11T21:28:54.804105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:56.163598Z","title":"Tao: A large-scale benchmark for tracking any object","venue":null,"work_id":"7936a78c-6234-4932-8a85-709ac2e2a0dc","year":2020},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.808717Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:e0231868805f58bedb3dc6731d314e9d2d859f2b628ca65a61ac5bdd1bea746b","observation_id":"a7cc4a43-ba9d-4841-95e5-ed1d385f2b77","resolution":{"observed_at":"2026-08-11T21:28:56.168140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-11T21:28:54.813272Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.813272Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:2df45433cc0238e001e5ab36a4ddde74e18945203f83b5b22362273c52faac23","observation_id":"2e78778b-0129-4ca9-a24f-9a61a6957124","resolution":{"observed_at":"2026-08-11T21:28:54.813272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11331","last_updated":"2023-03-22T14:10:37Z","snapshot_observed_at":"2026-08-16T15:46:46.482584Z","submitted_at":"2023-03-20T17:59:59Z","title":"EVA-02: A Visual Representation for Neon Genesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11331","snapshot_observed_at":"2026-08-11T21:28:54.818470Z","title":"Eva-02: A visual representation for neon genesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.818470Z"},"links":{"cited_paper":"/paper/2303.11331","citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:08c2d2c5a5391af2d30ad43afca18af4e4ccac88c3e74594c0c22342d63fa981","observation_id":"781acbd7-3fdd-4ba4-8e52-fbb51a83a4de","resolution":{"observed_at":"2026-08-11T21:28:54.818470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:56.149283Z","title":"Ultralyt- ics yolov8","venue":null,"work_id":"36e43bae-7043-4c7c-9397-663ed2c68e21","year":2023},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.823357Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:6c44ba9651d62654ce86c4f1d376fd8431ee9ab173b9f582366915afaf2b7bb8","observation_id":"8ddc3d53-07c3-4754-98ef-38deda2fc02b","resolution":{"observed_at":"2026-08-11T21:28:56.153642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:56.135078Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"847df976-f384-4553-9eba-f9468a06594c","year":2019},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.827789Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:60def874c5e836574130676d912997d2def7d17a9cd9a8779397c4983ed1733b","observation_id":"a1ff6b3e-ff4a-44e5-a23e-c0318f47520b","resolution":{"observed_at":"2026-08-11T21:28:56.139497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:54.833305Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.833305Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:e9a4cd5c87e15b24270bbc4d78e5dd5133b013562b5da5dbbdaea66af0e3830c","observation_id":"f595326f-757b-458a-8f42-e9b126249d96","resolution":{"observed_at":"2026-08-11T21:28:54.833305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:54.837996Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.837996Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:1576d9060718999c3754fea029f968ba21de4935549768ff393049662ce57e75","observation_id":"cd8713f0-25dd-4c26-85a0-1df7c81f1cd2","resolution":{"observed_at":"2026-08-11T21:28:54.837996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-11T21:28:54.842846Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.842846Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:782dba51a756daeb89b00532a3ef4de4e8c5a2cdfe0e76fa54edc50b78a56ac8","observation_id":"a656057d-3610-46ef-b34c-9b7f9707ea22","resolution":{"observed_at":"2026-08-11T21:28:54.842846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:56.100674Z","title":"Segment any- thing","venue":null,"work_id":"4a0857d8-9d00-4537-b096-11543069cc05","year":2023},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.848250Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:21b54c0b4635dd9e25636248d530719886c6d8d130630271fc02bcb4e2314842","observation_id":"1b71396c-6a87-4142-a623-c2e7337fbf99","resolution":{"observed_at":"2026-08-11T21:28:56.105035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:54.853078Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.853078Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:70b7079001c8f7457d364c9ab5e595c69f2da7ddc8b2d1b228dd87b3d42dd478","observation_id":"b75216db-7462-48ae-890b-2a3efddfe9a2","resolution":{"observed_at":"2026-08-11T21:28:54.853078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:56.076224Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":"e73b3d66-b275-4237-b60e-5966b84e36a2","year":2020},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.858059Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:8f04ee9fd8794462bc4cacfb723bb28102393e2551e2287277b943fec58c5a23","observation_id":"543a8b65-88e5-42a7-a03a-de63292f208e","resolution":{"observed_at":"2026-08-11T21:28:56.080782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:56.060815Z","title":"Mask dino: Towards a unified transformer-based framework for object detection and segmentation","venue":null,"work_id":"330e672e-0aa9-4bf7-a0e3-96d951c550b8","year":2023},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.862894Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:691e183cde14050e9e7d75db0463ab3a0c84e18d84217b9ee0ddfdeaed910271","observation_id":"589522ef-17e3-4bc1-aa10-f092658650f7","resolution":{"observed_at":"2026-08-11T21:28:56.065644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:54.867565Z","title":"Grounded language-image pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.867565Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:beb4e64e396d14a2ee49c90776bc3d4acb0d17372d7214841dcd44d674c6d453","observation_id":"159d557d-cd6e-4e99-bf8f-5923a404fdac","resolution":{"observed_at":"2026-08-11T21:28:54.867565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:54.872535Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.872535Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:28b8b31c3787d3cd815b757aa00916122a0706b91bc3287ac91be7e3a734923a","observation_id":"fec45a30-ffa7-442c-870d-76937071e0ac","resolution":{"observed_at":"2026-08-11T21:28:54.872535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:54.876618Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.876618Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:73047927cf597d43676eed5f8fac830c94aa43db535cd34b277f47a7b16937cf","observation_id":"c459ebd0-5c65-4ad1-a996-b5df0b545310","resolution":{"observed_at":"2026-08-11T21:28:54.876618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:56.011317Z","title":"Hota: A higher order metric for evaluating multi-object tracking","venue":null,"work_id":"16973335-5c85-49e5-9a65-4fd062191350","year":2021},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.880807Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:240c74bd7efd177a1923b59161ce97c543c6e00b93bf227d4b0b092c6b5d891e","observation_id":"4421389a-56da-44ab-a5f0-be0f8efefa08","resolution":{"observed_at":"2026-08-11T21:28:56.016861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.990616Z","title":"Simple open-vocabulary object detection with vision transformers","venue":null,"work_id":"9bf165bd-d33d-477b-9027-174df75b6d9d","year":2022},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.884963Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:e1e95e2fc742914dd5526a8f635d29b69891dd5338694fa49d059ba9b90c2077","observation_id":"07451f5e-d3f5-4529-a935-28dc8f951fcc","resolution":{"observed_at":"2026-08-11T21:28:55.999831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.927361Z","title":"Mod- eling context between objects for referring expression under- standing","venue":null,"work_id":"6d743c33-4a85-4c1a-892f-a2009eff40e4","year":2016},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.889282Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:0638970148f040c45cb3103e0810d8678c942a88e4314eacf441e773e0d1deb1","observation_id":"a58e9310-84e4-4cba-bc00-795b1ce87eab","resolution":{"observed_at":"2026-08-11T21:28:55.954424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.870140Z","title":null,"venue":null,"work_id":"5f1a88ad-30d7-470b-bf10-7ee76e28e0d6","year":2024},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.893659Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:5b769379a1c3fe3bc0df2db5d4aaeb743f4e32c4d789c89d74a942a922577d41","observation_id":"14687239-aa48-4659-8102-819bcc475362","resolution":{"observed_at":"2026-08-11T21:28:55.895004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-11T21:28:54.897763Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.897763Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:852b10fae5fe19b6f0f6467e8cfc0dd57bc23ee8a06e13b977ac43fdd43a8bd9","observation_id":"499ed06f-3d6b-4bd7-a01a-a205707cc40f","resolution":{"observed_at":"2026-08-11T21:28:54.897763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.833741Z","title":"Occluded video instance segmentation: A bench- mark","venue":null,"work_id":"fde3eb7a-e60c-4896-98fe-bc1c903a79c7","year":null},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.902315Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:0f9ac15bac9090b601ba48d631f734059ecc74221fd052e586ba69d20f7c893f","observation_id":"90f47f70-3228-4574-8ddf-a352cd0132ca","resolution":{"observed_at":"2026-08-11T21:28:55.838610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:54.907132Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.907132Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:6bd4b8defd79b877544f309e4abbd167addfe1b143e5a5c910d0491e0dbcba99","observation_id":"c9c2d132-4a86-4125-ac12-fcdaee5589c5","resolution":{"observed_at":"2026-08-11T21:28:54.907132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-11T21:28:54.911708Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.911708Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:946f6f6e910d0b96a7292949705b08b7cdfe7419db7334675ea8415c1cfea8e5","observation_id":"3e7912d9-9ca6-486e-b049-9e19c9cb377e","resolution":{"observed_at":"2026-08-11T21:28:54.911708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10300","last_updated":"2024-06-01T03:35:22Z","snapshot_observed_at":"2026-08-18T15:29:02.493000Z","submitted_at":"2024-05-16T17:54:15Z","title":"Grounding DINO 1.5: Advance the \"Edge\" of Open-Set Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10300","snapshot_observed_at":"2026-08-11T21:28:54.916967Z","title":"Grounding dino 1.5: Advance the” edge” of open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.916967Z"},"links":{"cited_paper":"/paper/2405.10300","citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:e2519a4ad680ce29b30e0860f07b22cae70ffbcf45c315420dc67faa2cb45a9e","observation_id":"62526b83-200d-4dad-9747-52774a27aefa","resolution":{"observed_at":"2026-08-11T21:28:54.916967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:54.921908Z","title":"Urvos: Unified referring video object segmentation network with a large-scale benchmark","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.921908Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:789f56b669d05cb6316b7dea5762b1b3ac3e0ded61d2e3c08efbd4f7bcda98ea","observation_id":"3be39989-6f43-4632-94ad-1e02bf43a07d","resolution":{"observed_at":"2026-08-11T21:28:54.921908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:54.926722Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.926722Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:acd2a32b4ee6392b24bdd989eb50915133bf0c8f65edf53f4e708ed4d671b3c1","observation_id":"3982d794-fca4-4bfc-887f-5bbdee313914","resolution":{"observed_at":"2026-08-11T21:28:54.926722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:54.931766Z","title":"Aligning and prompting everything all at once for univer- sal visual perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.931766Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:ff9f1443106240fb23fbfd49ee9b0f422ec42477398c615a1d49d7b0d68dd55b","observation_id":"68076fcd-b3a6-445f-aee0-b07a2c02b502","resolution":{"observed_at":"2026-08-11T21:28:54.931766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:54.936305Z","title":"Mobile- clip: Fast image-text models through multi-modal reinforced training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.936305Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:9611cf7f2985a07c825356df798219e1699cce06fe64a5386912a242a2befd1a","observation_id":"1ddeb0bf-fb3c-4bac-89e6-3ab96e5ef369","resolution":{"observed_at":"2026-08-11T21:28:54.936305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.764669Z","title":"Towards open-vocabulary video instance segmentation","venue":null,"work_id":"a94099c6-4a64-4930-b59e-4c591483a7e7","year":2023},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.940955Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:008c82525c7f34f5d6c160c20bc3fc230b28334919dee2f6ed0e8ba99e98ab6f","observation_id":"b2468e4d-2f0f-48de-a663-ccbcc89386c2","resolution":{"observed_at":"2026-08-11T21:28:55.769769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.748840Z","title":"Unidentified video objects: A benchmark for dense, open- world segmentation","venue":null,"work_id":"a684ef6b-4953-4c6d-a774-dccbe64430f9","year":2021},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.945339Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:0042e7bc3dcb13fcd34bd7f10438e48b27ca167f8ce882ef7be2f623b210872b","observation_id":"3bf861b6-1381-45e4-a839-585c3026939b","resolution":{"observed_at":"2026-08-11T21:28:55.754142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.732141Z","title":"General object foundation model for images and videos at scale","venue":null,"work_id":"e5baeae7-e2ac-47ab-a9da-ae61c8cc40b6","year":2024},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.949698Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:45e605b2e429f07745a8ba1c2b29de2caf53e2db785970f492de356b6fbf31f4","observation_id":"eecf87ff-dbfe-443a-8e45-b59ece3621c8","resolution":{"observed_at":"2026-08-11T21:28:55.738618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:54.954002Z","title":"Tinyclip: Clip dis- tillation via affinity mimicking and weight inheritance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.954002Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:b5ff34de562a9a80340e4aee6addc7f28d3cfda155d074b19bcc4b410f6939ff","observation_id":"708f9edf-2dc7-4dc8-8c98-f5a173fb2d5a","resolution":{"observed_at":"2026-08-11T21:28:54.954002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:54.958007Z","title":"Efficientsam: Leveraged masked image pretraining for efficient segment anything","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.958007Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:dfaf26a2c3d54d6be36d72e64823c40dca8d20a3baa23c55a5cc144c0f3867a3","observation_id":"62984b1b-28ce-4406-9ae9-7a45a2649f45","resolution":{"observed_at":"2026-08-11T21:28:54.958007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.695633Z","title":null,"venue":null,"work_id":"ca5f6945-74da-4a9e-843f-292eb7facca0","year":2021},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.962201Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:acae0c6a4d38191875f5519fe10d9d3e3d6b3d90e8e8f659953ff87a595e5658","observation_id":"6f0406ce-7348-4173-ba9a-7d2466ac8fe5","resolution":{"observed_at":"2026-08-11T21:28:55.700465Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.680947Z","title":"Towards grand unification of object tracking","venue":null,"work_id":"9bec6739-66bc-4d40-aebd-ca45a5dc7036","year":2022},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.966760Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:0def9a5bbed99b3952672a510c90002abea53cd56fbc78d913f62137b4c824b5","observation_id":"7007955f-20c0-49f0-88bd-1668fed77baa","resolution":{"observed_at":"2026-08-11T21:28:55.685614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.664746Z","title":"Universal instance perception as object discovery and retrieval","venue":null,"work_id":"d26bbd16-58f0-4003-81fa-16f749b7a128","year":2023},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.971168Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:c27aedf92db1f69d1645ab11d8805699e7ea65948d6b2422ac6f807296aa0a20","observation_id":"db941ade-d092-48a5-af24-cf9f1753c7e9","resolution":{"observed_at":"2026-08-11T21:28:55.670114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.648890Z","title":"Video instance seg- mentation","venue":null,"work_id":"710f1124-7b9b-4e52-867e-c7ede9a4f799","year":2019},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.975232Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:2ef62e1f8fb87d28373bf79abae664b80631e17b95ed8e2152ff187c7594abc7","observation_id":"34639510-a8e1-4a42-acca-2838e1b48694","resolution":{"observed_at":"2026-08-11T21:28:55.653838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.569471Z","title":"Detclip: Dictionary-enriched visual-concept paralleled pre- training for open-world detection","venue":null,"work_id":"20b0d869-e57b-4971-8b71-3036cf2e9bc6","year":2022},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.979749Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:4e82c69fcc56f9ef1891f6f8f053bb02d7d650f397dab33a7ec113a868a84176","observation_id":"3ad41a81-dc22-4820-ba08-b47c73db1561","resolution":{"observed_at":"2026-08-11T21:28:55.616550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.390985Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"66c13080-5de4-443c-8ac1-de625c087162","year":2016},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.984216Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:0dd21f310e19a52a769b2a87edab6d8f057f41588a750465be015a4143f68175","observation_id":"0f5cccf9-b0e7-44e3-a958-50c6770a29f3","resolution":{"observed_at":"2026-08-11T21:28:55.466578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.374569Z","title":"Open-vocabulary object detection using captions","venue":null,"work_id":"30811289-e9ad-4e44-a26d-ea310055802e","year":2021},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.988836Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:5d5c39f9897494c167bb90f996b5c7e11714daec31ecae0de08550dec4a4e9b7","observation_id":"cd55fee2-5ded-4457-b71d-d187a4268cd3","resolution":{"observed_at":"2026-08-11T21:28:55.379460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14289","last_updated":"2023-07-01T07:26:22Z","snapshot_observed_at":"2026-08-12T07:11:05.316372Z","submitted_at":"2023-06-25T16:37:25Z","title":"Faster Segment Anything: Towards Lightweight SAM for Mobile Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14289","snapshot_observed_at":"2026-08-11T21:28:54.993311Z","title":"Faster segment anything: Towards lightweight sam for mo- bile applications","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.993311Z"},"links":{"cited_paper":"/paper/2306.14289","citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:8870e896e6d84e39b72099c6aa6e3f3c0f6ea61244d4e95b6df228de9d67547e","observation_id":"b9459cb0-f3fd-49a2-9f1a-e75ad850283d","resolution":{"observed_at":"2026-08-11T21:28:54.993311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.359720Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection","venue":null,"work_id":"d4d2d8c6-0756-4910-98b1-940a5647478d","year":2023},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:54.998071Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:948076d9c17af10d47a9188f1f3f2af2377168c6188a66c933a39bf6911168ba","observation_id":"681f3d4a-f930-4ef8-8ae6-be68c7466da3","resolution":{"observed_at":"2026-08-11T21:28:55.364331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.344069Z","title":"A simple framework for open-vocabulary segmentation and detection","venue":null,"work_id":"2e55f6f4-01f1-4b79-a42f-cb9f1cff8f77","year":2023},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:55.003046Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:9117c40c1a25af2e0eaeffa6bcb39a8a4a5d5c86bfe09f52b49baf7b97ace4f3","observation_id":"acfc595e-9e74-477c-9e65-b6a25a57e134","resolution":{"observed_at":"2026-08-11T21:28:55.348767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.329579Z","title":"Mobileinst: Video in- stance segmentation on the mobile","venue":null,"work_id":"a26bcd21-ca2b-4dea-adaf-5c04410cca16","year":2024},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:55.007766Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:ed645f227bd8afa2e33af4c0e2ace7992751821d945744891db3f8f8b5934509","observation_id":"354ff347-eaf0-4477-9e7c-81c8eb486e71","resolution":{"observed_at":"2026-08-11T21:28:55.333912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.314732Z","title":"Bridging the gap between anchor-based and anchor-free detection via adaptive training sample selection","venue":null,"work_id":"fd0a2d52-19b9-46c5-82b2-10c66e02fd85","year":2020},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:55.012213Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:73ef4f861caeb8c983cd3a53a8765ff262820340094750bb334e1dd0a6ab32a2","observation_id":"fd06e973-41b9-4ee3-9f55-d8689cac4e7e","resolution":{"observed_at":"2026-08-11T21:28:55.319777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05008","last_updated":"2024-05-16T20:51:52Z","snapshot_observed_at":"2026-08-16T14:20:32.302906Z","submitted_at":"2024-02-07T16:28:36Z","title":"EfficientViT-SAM: Accelerated Segment Anything Model Without Accuracy Loss","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05008","snapshot_observed_at":"2026-08-11T21:28:55.016917Z","title":"Efficientvit-sam: Accelerated segment anything model without performance loss","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:55.016917Z"},"links":{"cited_paper":"/paper/2402.05008","citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:c7be6e08e0901df1e4f89b97b1a3fbb4915aca2b88246b38189745774d3eef90","observation_id":"85b4331f-947e-4f74-84bc-55d042a08cd9","resolution":{"observed_at":"2026-08-11T21:28:55.016917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06892","last_updated":"2024-12-02T11:24:20Z","snapshot_observed_at":"2026-08-16T14:10:54.077277Z","submitted_at":"2024-03-11T16:48:25Z","title":"Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06892","snapshot_observed_at":"2026-08-11T21:28:55.021270Z","title":"Real-time transformer-based open-vocabulary detection with efficient fusion head","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:55.021270Z"},"links":{"cited_paper":"/paper/2403.06892","citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:0c6237eb958de80098540c00dacbc09c5cd1cd652ff27ebc85dc64b5fc973389","observation_id":"dc8f0053-2b15-458b-acad-3b21d14fae45","resolution":{"observed_at":"2026-08-11T21:28:55.021270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.026043Z","title":"Detrs beat yolos on real-time object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:55.026043Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:7e99f0e51d4c3a3803b217632878ce17e95ac31df45ab2b3139a9ca68ad71395","observation_id":"437f8fc6-39ae-42a8-97d9-1023dfa6b882","resolution":{"observed_at":"2026-08-11T21:28:55.026043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.290057Z","title":"Detecting twenty-thousand classes using image-level supervision","venue":null,"work_id":"9d3d0975-4aa6-47c7-b453-e8f464676cc8","year":null},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:55.030130Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:d7324e1ab67761f4f7e48d6b3fcccbc2fa7c2acbf4d276c430bc325636d7f4f5","observation_id":"f8db961c-cbfa-4413-90f4-f58632584898","resolution":{"observed_at":"2026-08-11T21:28:55.294472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.256689Z","title":"Deformable detr: Deformable transformers for end-to-end object detection","venue":null,"work_id":"ef21ed4e-0b71-422b-a98e-5d44e3ea72bc","year":2021},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:55.039208Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:881c7b6f5e400014185e67836941293ff35906173eff83829d212fb650848d36","observation_id":"d1a1aa1c-08fb-4fac-a53f-8ace31c28fbc","resolution":{"observed_at":"2026-08-11T21:28:55.263466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.043436Z","title":"Generalized decoding for pixel, image, and lan- guage","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:55.043436Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:b34fbe37507d3de787fbdb2f20a394d9e561fc04827c00819f17f665a2001a5e","observation_id":"987506cd-d1fd-4508-9785-c5d1b9180110","resolution":{"observed_at":"2026-08-11T21:28:55.043436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:55.274481Z","title":null,"venue":null,"work_id":"d8dc949c-94d8-4281-863a-e80519313deb","year":2022},"citing_paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation","version":1},"reference_index":368,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:55.034788Z"},"links":{"citing_paper":"/paper/2412.04434"},"observation_digest":"sha256:235eecdb67c9234a1f091776ad4e172877333d4fc6221aaf40dd71124ec66950","observation_id":"cac69651-d2c3-48db-83f1-c4c4b25cd614","resolution":{"observed_at":"2026-08-11T21:28:55.279097Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.04434","last_updated":"2024-12-05T18:53:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T15:42:33.327137Z","submitted_at":"2024-12-05T18:53:13Z","title":"Towards Real-Time Open-Vocabulary Video Instance Segmentation"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":29,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 1 inbound Pith citation observation for arXiv:2412.04434."}