{"as_of":"2026-08-21T05:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b06e8b87533e5ba8f81cb20bce9176a233bb6f41ff4e9a5bd3d6934352463842","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:17:55.440061Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09302/citation-record","integrity":"/paper/2608.09302/integrity","json":"/paper/2608.09302/citation-record.json","paper":"/paper/2608.09302"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.102416Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.102416Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:f3c984aa49b45f5654a9752f7b208cb5206e9ec5b86cf5ce5dc5538afcf148e9","observation_id":"10986c8e-5635-4d2a-b9bd-6d729e7bc667","resolution":{"observed_at":"2026-08-14T04:17:55.102416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.113575Z","title":"Artificial intelligence and surgical decision-making","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.113575Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:0a3ef53c89b9cc706b1a29246521913f55d4a67921269af8282e00f63e857d25","observation_id":"5329eb6a-88c6-4b12-a272-4d96cbf2cc8a","resolution":{"observed_at":"2026-08-14T04:17:55.113575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.143826Z","title":"Surgical data science–from concepts toward clinicaltranslation.Medicalimageanalysis,2022,76:102306","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.143826Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:cd77cafa9a017072df8c368faf3ce7b6d8c12acfb8756562b094e4d3b5b519db","observation_id":"2432043a-637d-4c0f-9afd-549a871bb0f0","resolution":{"observed_at":"2026-08-14T04:17:55.143826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.11190","last_updated":"2020-08-03T01:55:24Z","snapshot_observed_at":"2026-08-18T20:49:18.953792Z","submitted_at":"2020-01-30T06:37:07Z","title":"2018 Robotic Scene Segmentation Challenge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.11190","snapshot_observed_at":"2026-08-14T04:17:55.149493Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.149493Z"},"links":{"cited_paper":"/paper/2001.11190","citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:1d6cc358397ffd0439383533a6a7dfb9897c61d12f7dd9468ca3620594d9014d","observation_id":"065f6050-40c0-4e8c-be2e-33b7287cb60b","resolution":{"observed_at":"2026-08-14T04:17:55.149493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.157685Z","title":"Association of surgical skill assessment with clinical outcomesincancersurgery.JAMAsurgery,2020,155(7):590-598","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.157685Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:261c7b5d1af96a59a0ba579b72018c8aa879478a86997bb940a22d1dd7d3c5d6","observation_id":"451648f2-029d-45c5-8c56-3a546481c691","resolution":{"observed_at":"2026-08-14T04:17:55.157685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.161421Z","title":"Towards unified surgical skill assessment","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.161421Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:206412c26db4f595cc1ea2cfc5651e1c941db1b4e815c8fc8e4caec12bfb9e29","observation_id":"5ab84a5a-8e8b-4554-9366-bf0b295618c1","resolution":{"observed_at":"2026-08-14T04:17:55.161421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.168057Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.168057Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:f20f8c1f8a585d8124bbb0a5e052da1e8405b7efec26aef5e83ddcd3cace6b87","observation_id":"69ac6112-a9e5-4085-9d77-4f4ee607d1b3","resolution":{"observed_at":"2026-08-14T04:17:55.168057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.173959Z","title":"Pseudo-label guided cross-video pixel contrast for robotic surgical scene segmentation with limited annotations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.173959Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:055a89478d4bd94fa7fac35d648f799d1f9899dfc45b6d61d35644dd85e14bb3","observation_id":"60101d07-8488-48fe-a96a-9d32aa2822e9","resolution":{"observed_at":"2026-08-14T04:17:55.173959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.177071Z","title":"Pixel-wise contrastive learning for multi-class instrument segmentation in endoscopic robotic surgery videos using dataset-wide sample queues[J]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.177071Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:a1ff6160699cc0cb7d5dd4f6b40ade1c7561cb49ee053cb9f3a81ae55ec968c1","observation_id":"29571b67-5fbc-4347-a4cb-6c114cd34572","resolution":{"observed_at":"2026-08-14T04:17:55.177071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.180266Z","title":"International Journal of Computer Assisted Radiology andSurgery,2022,17(10):1903-1913","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.180266Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:e272b464e141a8be1c12295f742287ecdd014610335b14132652426e2bb0be00","observation_id":"cb8c81c3-ab3a-4176-b565-9265ae20b97f","resolution":{"observed_at":"2026-08-14T04:17:55.180266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.190915Z","title":"Deep learning approach for bubble segmentation from hysteroscopicimages.Medical&BiologicalEngineering&Computing,2022,60(6):1613-1626","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.190915Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:bcb6138005f7c6785e0943faa171452f935226e95fd27c149743c56712d6d1be","observation_id":"fab10d33-22c8-436e-90a9-c8e61d62cd34","resolution":{"observed_at":"2026-08-14T04:17:55.190915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.199381Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.199381Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:695e40b3467190458ed399ae79acb4c5488cc28c7f75b9239c52a69e36e83708","observation_id":"cfc0f05a-3a65-4221-9cdc-7045f03124a0","resolution":{"observed_at":"2026-08-14T04:17:55.199381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.203272Z","title":"Blip: Bootstrapping language-image pre-training for unified vision- language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.203272Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:2cfefc6c3a9ccc1f58e4e840c011254c43e43689a12ddbc5a37f70a88fca97ce","observation_id":"65deb2c7-c745-42d3-ba3c-bdae6c4de107","resolution":{"observed_at":"2026-08-14T04:17:55.203272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.207445Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing.2024:1081-1093","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.207445Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:36e69995be7ecc0465f2470152de0b7f132962f1493d1c9c31b1dc94b09f16d9","observation_id":"62110cf3-6547-4aa5-9643-cc378edbf441","resolution":{"observed_at":"2026-08-14T04:17:55.207445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.210957Z","title":"DB-SAM: Delving into High Quality Universal Medical Image Segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.210957Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:e00c4137cf3ccd020d74327d7f9c6577ced63bba0ab7c6b2852abf5120232e48","observation_id":"d738438a-0a1a-4b04-b9f9-ffc1203e3730","resolution":{"observed_at":"2026-08-14T04:17:55.210957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.214619Z","title":"Medclip: Contrastive learning from unpaired medical images and text[C]//Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing.2022:3876-3887","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.214619Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:59f8b257974025e1890aec7942db9f5474a2c948e1ed201928031622e8874917","observation_id":"0b250cd1-6c66-4d5b-a565-b0a9eb3ba753","resolution":{"observed_at":"2026-08-14T04:17:55.214619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.222475Z","title":"Unet++: A nested u-net architecture for medicalimagesegmentation.DeepLearninginMedicalImageAnalysisandMultimodalLearning forClinicalDecisionSupport,Springer(2018),pp.3-11","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.222475Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:3dbed8b4f904fb0fc42af904ed0b66cc6eeea38c70229d646f1128684b3677df","observation_id":"f51b6e84-3aba-4898-916c-da4007246855","resolution":{"observed_at":"2026-08-14T04:17:55.222475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05587","last_updated":"2017-12-05T18:06:21Z","snapshot_observed_at":"2026-08-16T09:04:18.586776Z","submitted_at":"2017-06-17T22:48:57Z","title":"Rethinking Atrous Convolution for Semantic Image Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05587","snapshot_observed_at":"2026-08-14T04:17:55.227054Z","title":"Rethinking atrous convolution for semantic image segmentation.arXivpreprintarXiv:1706.05587,2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.227054Z"},"links":{"cited_paper":"/paper/1706.05587","citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:55ad98a8041c4bc5ea2b4a2e7f1b0e16e3da863d4efb02d8c4064127d79a5e31","observation_id":"f4d3f5ce-55b7-4233-9986-8df681374817","resolution":{"observed_at":"2026-08-14T04:17:55.227054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.233412Z","title":"nnU-Net: a self-configuring method for deep learning- basedbiomedicalimagesegmentation[J].Naturemethods,2021,18(2):203-211","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.233412Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:f6a400be059cd9ece43a8fb61803b8ba57cb99270ad52d6db70c3b9e4f1f2316","observation_id":"9ed913a2-6733-4e84-aa6c-5328742e278f","resolution":{"observed_at":"2026-08-14T04:17:55.233412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.237467Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.237467Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:1eeac7c08bf414f8683cc9e618682c39877df535c847840ae6c7a463c08d25ea","observation_id":"93d04296-acc8-4c0c-98c8-0c6ee69defe8","resolution":{"observed_at":"2026-08-14T04:17:55.237467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.248313Z","title":"Segment anything in medical images[J]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.248313Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:bc1b28966f230e34f10717c29c338535b5d523c54068109d8ca9b394d584187e","observation_id":"fd3a6b0a-d245-4831-a59d-9337fa859f9d","resolution":{"observed_at":"2026-08-14T04:17:55.248313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.259485Z","title":"Surgicalsam: Efficient class promptable surgical instrument segmentation[C]//Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.259485Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:c6eb33e0e95d40145d0f604af0254d799c15319c436d6dd264f711f8c212e902","observation_id":"018c209a-2140-4506-8831-cbe35983d535","resolution":{"observed_at":"2026-08-14T04:17:55.259485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-14T06:28:26.689162Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02555","snapshot_observed_at":"2026-08-14T04:17:55.263356Z","title":"SurgVLM: A Large Vision-Language Model and Systematic EvaluationBenchmarkforSurgicalIntelligence[J].arXivpreprintarXiv:2506.02555,2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.263356Z"},"links":{"cited_paper":"/paper/2506.02555","citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:d77e54ff4043029202358398c1bea85ca7999a0ea633adf16dd1f0ba87294289","observation_id":"a9fdbc6e-c696-43f0-8ec1-94f2ff615bcc","resolution":{"observed_at":"2026-08-14T04:17:55.263356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.269840Z","title":"Med-VLM: Enhancing Medical Image Segmentation Accuracy through Vision-Language Model[C]//Proceedings of the IEEE/CVF International Conference on ComputerVision.2025:7283-7293","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.269840Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:42ceb3d57c3888695b3609cddfd8c72872de34c6b585418c0051ea12d02c9d2b","observation_id":"59f23405-4683-44c0-a009-7fa62b357b05","resolution":{"observed_at":"2026-08-14T04:17:55.269840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.273536Z","title":"Automated system for diagnosing endometrial cancer by adoptingdeep-learningtechnologyinhysteroscopy[J].PLoSOne,2021,16(3):e0248526","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.273536Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:b18d63b55671f62424ea9df6d601e636bcfa5b4ebb2e7ca9b48539ad871dfc66","observation_id":"3387818e-562a-474e-9dde-1194c08bd0f3","resolution":{"observed_at":"2026-08-14T04:17:55.273536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.286496Z","title":"Automated detection of endometrial polyps from hysteroscopic videosusingdeeplearning[J].Diagnostics,2023,13(8):1409","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.286496Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:2235112f0e7fe6b84b530d19b0ca0046843d751af950386b21bb615b2e40d64a","observation_id":"9fa538f3-ef36-4ff4-8a1f-70fcfddf3dc8","resolution":{"observed_at":"2026-08-14T04:17:55.286496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.314749Z","title":"Digital image analysis with fully connected convolutional neural network to facilitate hysteroscopic fibroid resection[J]","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.314749Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:be1039a0631abde32062d92216e7aa9362a41e64c43fc6865095fbfeb14570c9","observation_id":"2abb2c27-0111-4d5c-a5c3-bdec8744605d","resolution":{"observed_at":"2026-08-14T04:17:55.314749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.321644Z","title":"Exploring intra-and inter-video relation for surgical semantic scene segmentation.IEEETransactionsonMedicalImaging,2022,41(11):2991-3002","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.321644Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:a98285e027d073f5efbe89b0fc02b397a1829c5f3469580609d9e323c74740f1","observation_id":"391202e3-6e1d-49a5-8c7a-4d2a4bc1a084","resolution":{"observed_at":"2026-08-14T04:17:55.321644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.325433Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.325433Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:9ef0393e5eed7387d2ce3cd6830206fa78e72b6e46c783d607543862131f4c95","observation_id":"d892f6bb-8d5d-415d-a7e2-6d1ea97b484f","resolution":{"observed_at":"2026-08-14T04:17:55.325433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-14T04:17:55.328970Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.328970Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:f35f804a8bb599c82a8c325ea69eaa93d3fb8d8f1da27e9bb0b6a63f96a536c4","observation_id":"25edca74-0149-4bf6-be39-cad31a3442d7","resolution":{"observed_at":"2026-08-14T04:17:55.328970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.332700Z","title":"PMLR,2023: 19730-19742","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.332700Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:0db0517789a9ca5f0cf391e61dcd5ae7ceed46d1f54f7ca9f954285c6cafe13c","observation_id":"8d64728d-9c27-40ca-b2bc-f2343424673d","resolution":{"observed_at":"2026-08-14T04:17:55.332700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.335634Z","title":"Text promptable surgical instrument segmentation with vision- languagemodels[J].AdvancesinNeuralInformationProcessingSystems,2023,36:28611-28623","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.335634Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:47239238d896c017c94da873e66e8ec5c2d4be1f5a1ed7516b226daf2fd7248a","observation_id":"d54a8485-1450-40ab-b6a1-6cf72feb94cd","resolution":{"observed_at":"2026-08-14T04:17:55.335634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.340102Z","title":"Segment anything model for medical image segmentation: Current applicationsandfuturedirections[J].ComputersinBiologyandMedicine,2024,171:108238","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.340102Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:3405ed5a35e375a222313df3d64512b3912f4af3bdd69c79f7092c5982ff497d","observation_id":"82adbbe2-6426-4abc-821c-708801de31fb","resolution":{"observed_at":"2026-08-14T04:17:55.340102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.346238Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.346238Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:240886351c513ad4ddf194df3d2b1eb9aaedb3550acca4e1f62e4d2913491071","observation_id":"a57b7715-44a6-413c-b49d-1d9d97b9a989","resolution":{"observed_at":"2026-08-14T04:17:55.346238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.351245Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.351245Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:21859f82afd5cc085b17d290ffa40a1d8d0a2f4f493cc8055d35508ae64399f6","observation_id":"368e44b2-15fa-4640-9f65-706be3ab5367","resolution":{"observed_at":"2026-08-14T04:17:55.351245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-14T04:17:55.354407Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.354407Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:4ea5c342b7de4b1a14274d231be8657513bfa68668d7c44858472e34fd29abbc","observation_id":"e95a6300-0cd4-4543-bde2-60a82ba6e0f7","resolution":{"observed_at":"2026-08-14T04:17:55.354407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18977","last_updated":"2024-12-02T02:01:05Z","snapshot_observed_at":"2026-08-20T21:09:41.855490Z","submitted_at":"2024-11-28T07:58:30Z","title":"Det-SAM2:Technical Report on the Self-Prompting Segmentation Framework Based on Segment Anything Model 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18977","snapshot_observed_at":"2026-08-14T04:17:55.357859Z","title":"Det-SAM2: Technical Report on the Self-Prompting Segmentation FrameworkBasedonSegmentAnythingModel2.arXivpreprintarXiv:2411.18977,2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.357859Z"},"links":{"cited_paper":"/paper/2411.18977","citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:a97436a143f7046efa4f26974d9e0d9eea3e5fca18c31949111acef9a503ddab","observation_id":"946e1a74-3f3c-4075-aa6f-cef934f31929","resolution":{"observed_at":"2026-08-14T04:17:55.357859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.364025Z","title":"Ethical Considerations for Including Children in Clinical Research[J]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.364025Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:13793ec44937f46c7650353b8059c06b5aa28dd8f277d88c07605dfc86aa7ab4","observation_id":"983fc73b-8193-408a-9c73-ab7a92175f84","resolution":{"observed_at":"2026-08-14T04:17:55.364025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.367470Z","title":null,"venue":null,"work_id":null,"year":1945},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.367470Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:80704ac973e69c83e8154adcaf43540a8fc09e4eba2fad7f5494f2a6b283cbef","observation_id":"92fcc276-3d74-4ff3-a178-6dbc5c896eae","resolution":{"observed_at":"2026-08-14T04:17:55.367470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.371233Z","title":"Optimizing intersection-over-union in deep neural networks for image segmentation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.371233Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:ddb2d432f102e59bacc5487e293b9a17ad77c93572643d6702fe72473e372d30","observation_id":"73a9b3eb-3d5c-4582-a31e-7aa46dd869e5","resolution":{"observed_at":"2026-08-14T04:17:55.371233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.04306","last_updated":"2021-02-08T16:10:50Z","snapshot_observed_at":"2026-08-19T08:02:16.487223Z","submitted_at":"2021-02-08T16:10:50Z","title":"TransUNet: Transformers Make Strong Encoders for Medical Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.04306","snapshot_observed_at":"2026-08-14T04:17:55.374444Z","title":"Transunet: Transformers make strong encoders for medical image segmentation.arXivpreprintarXiv:2102.04306,2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.374444Z"},"links":{"cited_paper":"/paper/2102.04306","citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:55bd44885c68f0477146d7cf4af8be981b0fbbb81326eaa31dc87783a7a4f700","observation_id":"c48b4bf9-9868-4204-b4c3-220b2356579d","resolution":{"observed_at":"2026-08-14T04:17:55.374444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.378147Z","title":"Swin-unet: Unet-like pure transformer for medical image segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.378147Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:86f7f61ed6d1ac0c65002b8f55abab67056172d21e1c6352f5a2d975d326c6f7","observation_id":"7e3f215e-2eb5-479a-a25f-b5d286b33fba","resolution":{"observed_at":"2026-08-14T04:17:55.378147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.381061Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.381061Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:ed9970d6a452a39b3f05f14acb14d3abe3146bfeed034a9602ee7b8a67c18144","observation_id":"d3f1cb35-7629-43bf-bd77-2e2c095f2578","resolution":{"observed_at":"2026-08-14T04:17:55.381061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.384408Z","title":"Image segmentation using text and image prompts[C]//Proceedings of the IEEE/CVFconferenceoncomputervisionandpatternrecognition.2022:7086-7096","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.384408Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:f00f67cfe32011273b054532ca1348412d6e04ae6cca1868d6f2983e921876be","observation_id":"179d97d5-bc94-454d-8455-35e1a6e23ed1","resolution":{"observed_at":"2026-08-14T04:17:55.384408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.388966Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.388966Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:6356959227fd0c22d546e8ed84958887f943e4f7e4ce705108ba96d7be951c74","observation_id":"6501f51e-4bcd-4fe4-8a9f-5770ced52e7c","resolution":{"observed_at":"2026-08-14T04:17:55.388966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.392612Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.392612Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:bcdcf0ec7e98141f225491cb22e0bebe0739530d11d7db48900336a355207fac","observation_id":"d652ba8b-2c00-46ff-977c-3507cb90f83c","resolution":{"observed_at":"2026-08-14T04:17:55.392612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.395695Z","title":"Journal of Obstetrics andGynaecologyResearch,2014,40(7):1950-1954","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.395695Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:89cfae422a4996d6213f6bec51595d1cc94b19aadd4023b579842145dff685e8","observation_id":"14e39540-e282-4a2e-bd4e-a81496ebc6bb","resolution":{"observed_at":"2026-08-14T04:17:55.395695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.400121Z","title":"Comparative study of the methodologies used for subjective medicalimagequalityassessment.PhysicsinMedicine&Biology,2021,66(15):15TR02","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.400121Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:d9fea5252033b11a633fb8b2c3eadd33b285f449861a20106a766f3c4cfd3b20","observation_id":"e0324cef-d184-4ca0-bd26-d0e38ca528a0","resolution":{"observed_at":"2026-08-14T04:17:55.400121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.403256Z","title":"2025, 39(6):5649-5657","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.403256Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:a7b4d415d5c55c8ef7ff09272f3c0d7138d9bf3b0e8a181e40054455b1766fd4","observation_id":"f5dd13eb-853a-4abe-8ac7-11eee0158569","resolution":{"observed_at":"2026-08-14T04:17:55.403256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.406369Z","title":"Clearclip: Decomposing clip representations for dense vision- language inference[C]//European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.406369Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:ccd24272468eec248b2c50ab814642029fa75ccef1da031bcea0ac2f5d0e12a1","observation_id":"3ac47bb3-bfb6-447c-9fab-d76b1bacc77b","resolution":{"observed_at":"2026-08-14T04:17:55.406369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.414752Z","title":"Sigmoid loss for language image pre- training[C]//Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.414752Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:46ee2505c9b199c9c8b2a2c2bd249e2653cbe481f4a637cfd4539df48c16b747","observation_id":"aeb4909a-f01a-4ef1-b66e-e6af548f6131","resolution":{"observed_at":"2026-08-14T04:17:55.414752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.418571Z","title":"Pubmedclip: How much does clip benefit visual question answeringinthemedical domain?[C]//FindingsoftheAssociation forComputational Linguistics: EACL2023.2023:1181-1193","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.418571Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:6fb7b89e381c3f485120add1d19119566bde3a10ab50bf36281b99934201ef59","observation_id":"7c480ac0-ad7e-4c53-8bd0-3031e58a4f8f","resolution":{"observed_at":"2026-08-14T04:17:55.418571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.421980Z","title":"Emerging properties in self-supervised vision transformers[C]//ProceedingsoftheIEEE/CVFinternationalconferenceoncomputervision.2021: 9650-9660","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.421980Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:0332a6096105ff6394c13db5cbb639c113e66a20f353bc4a76e01b7fc5337dd7","observation_id":"8a8b535b-d750-4ad6-8647-238fa76d4902","resolution":{"observed_at":"2026-08-14T04:17:55.421980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:55.440061Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:55.440061Z"},"links":{"citing_paper":"/paper/2608.09302"},"observation_digest":"sha256:45a44b3ad51ddce5c151a950c02c069c73cb0dd5660a9f44eb60ac1ca9aa119a","observation_id":"cd84b66b-279f-4d48-810a-4b4c0c531933","resolution":{"observed_at":"2026-08-14T04:17:55.440061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09302","last_updated":"2026-08-11T02:33:50Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T08:56:31.394699Z","submitted_at":"2026-08-10T08:51:36Z","title":"Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2608.09302."}