{"as_of":"2026-08-21T11:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:70eefc0c592d6a57e16d88d7544d5c850cf64b7c2a66a4e3ccc354b9f5dcc3dc","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:45:56.691342Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04472/citation-record","integrity":"/paper/2608.04472/integrity","json":"/paper/2608.04472/citation-record.json","paper":"/paper/2608.04472"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-15T14:45:56.664842Z","title":"Representation learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04472","last_updated":"2026-08-05T05:56:41Z","snapshot_observed_at":"2026-08-18T14:47:29.182737Z","submitted_at":"2026-08-05T05:56:41Z","title":"EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T14:45:56.664842Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2608.04472"},"observation_digest":"sha256:d87b707a281261e21fa1e3555f7241c6c5c74071674d5fa31c7263af5326c5e0","observation_id":"3c7b839a-5f6a-46f7-926e-88ccdc5516a4","resolution":{"observed_at":"2026-08-15T14:45:56.664842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T14:45:56.687064Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04472","last_updated":"2026-08-05T05:56:41Z","snapshot_observed_at":"2026-08-18T14:47:29.182737Z","submitted_at":"2026-08-05T05:56:41Z","title":"EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T14:45:56.687064Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.04472"},"observation_digest":"sha256:dbd1b2dd8120b8b49eced2a340321f31ae2ab2b7f234c76797aa4066d9f1b794","observation_id":"ea2445f4-c9e6-4f0c-956c-8c79e69e8dd4","resolution":{"observed_at":"2026-08-15T14:45:56.687064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00915","last_updated":"2025-01-08T22:58:51Z","snapshot_observed_at":"2026-08-18T14:56:57.492279Z","submitted_at":"2023-03-02T02:20:04Z","title":"BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00915","snapshot_observed_at":"2026-08-15T14:45:56.691342Z","title":"Biomedclip: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs.arXiv preprint arXiv:2303.00915, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04472","last_updated":"2026-08-05T05:56:41Z","snapshot_observed_at":"2026-08-18T14:47:29.182737Z","submitted_at":"2026-08-05T05:56:41Z","title":"EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T14:45:56.691342Z"},"links":{"cited_paper":"/paper/2303.00915","citing_paper":"/paper/2608.04472"},"observation_digest":"sha256:7372d9e3c769238a33b693688ea1b050fb8e03f2beb0e7636de1001c4f365a73","observation_id":"9cb512ef-835b-42e4-8c5d-1012110b70cf","resolution":{"observed_at":"2026-08-15T14:45:56.691342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-08-18T01:07:23.737664Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-15T14:45:56.678372Z","title":"Dinov3.arXiv preprint arXiv:2508.10104,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04472","last_updated":"2026-08-05T05:56:41Z","snapshot_observed_at":"2026-08-18T14:47:29.182737Z","submitted_at":"2026-08-05T05:56:41Z","title":"EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-15T14:45:56.678372Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2608.04472"},"observation_digest":"sha256:6a2ae1b1e8489383cafc82d4dc7adf3a88a97992ff377c185b998f03ec35011c","observation_id":"64c8acf4-c212-4730-aaea-96e47a917db7","resolution":{"observed_at":"2026-08-15T14:45:56.678372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-15T14:45:56.639316Z","title":"On the opportunities and risks of foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04472","last_updated":"2026-08-05T05:56:41Z","snapshot_observed_at":"2026-08-18T14:47:29.182737Z","submitted_at":"2026-08-05T05:56:41Z","title":"EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-15T14:45:56.639316Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2608.04472"},"observation_digest":"sha256:2d515c0a542fe8de0d05fefe179a7b7129d1c45c1bd4204dfb8943262dfb759a","observation_id":"9ab9a584-4293-4151-9189-77e8358e8c17","resolution":{"observed_at":"2026-08-15T14:45:56.639316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-15T14:45:56.669203Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04472","last_updated":"2026-08-05T05:56:41Z","snapshot_observed_at":"2026-08-18T14:47:29.182737Z","submitted_at":"2026-08-05T05:56:41Z","title":"EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T14:45:56.669203Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2608.04472"},"observation_digest":"sha256:08b5de432c10724c42552892ac66c814fbdc0fe92e1f86585c66b98100019ea8","observation_id":"9a763d7e-a112-4b96-b613-4a89530f22cc","resolution":{"observed_at":"2026-08-15T14:45:56.669203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05488","last_updated":"2025-01-08T18:57:05Z","snapshot_observed_at":"2026-08-21T02:23:10.242485Z","submitted_at":"2025-01-08T18:57:05Z","title":"EndoDINO: A Foundation Model for GI Endoscopy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05488","snapshot_observed_at":"2026-08-15T14:45:56.646310Z","title":"Endodino: A foundation model for gi endoscopy.arXiv preprint arXiv:2501.05488,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04472","last_updated":"2026-08-05T05:56:41Z","snapshot_observed_at":"2026-08-18T14:47:29.182737Z","submitted_at":"2026-08-05T05:56:41Z","title":"EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T14:45:56.646310Z"},"links":{"cited_paper":"/paper/2501.05488","citing_paper":"/paper/2608.04472"},"observation_digest":"sha256:f5e2107f4155a33c2a81224d9b59fa19cb470a02e59002da9c648b75e5ab6bae","observation_id":"03ac2f40-6232-4ac3-9d10-5397d805875b","resolution":{"observed_at":"2026-08-15T14:45:56.646310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T14:45:56.656052Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.04472","last_updated":"2026-08-05T05:56:41Z","snapshot_observed_at":"2026-08-18T14:47:29.182737Z","submitted_at":"2026-08-05T05:56:41Z","title":"EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T14:45:56.656052Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.04472"},"observation_digest":"sha256:81274dfd0d8bbe16466801356981ea0c783c9b4a7a6854694d14adc1100937cd","observation_id":"c900c5eb-72cf-41cc-8856-d5c940aeb14f","resolution":{"observed_at":"2026-08-15T14:45:56.656052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:45:56.814039Z","title":"A benchmark for endoluminal scene segmentation of colonoscopy images","venue":null,"work_id":"5e6dbfdf-794e-4ae2-bd57-076d7a9fcdfb","year":2017},"citing_paper":{"arxiv_id":"2608.04472","last_updated":"2026-08-05T05:56:41Z","snapshot_observed_at":"2026-08-18T14:47:29.182737Z","submitted_at":"2026-08-05T05:56:41Z","title":"EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T14:45:56.682540Z"},"links":{"citing_paper":"/paper/2608.04472"},"observation_digest":"sha256:d7a5622a7d3167f1ce1c7f2df872c6d433ac6cb75d96446fce676f3316769fb3","observation_id":"f2959058-8677-4505-ba65-375a5f7d8584","resolution":{"observed_at":"2026-08-15T14:45:56.819851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:45:56.828045Z","title":"Tumorchain: Interleaved multimodal chain-of-thought reasoning for traceable clinical tumor analysis","venue":null,"work_id":"99a54094-8eec-4868-a671-e4f2bbe25c5c","year":2026},"citing_paper":{"arxiv_id":"2608.04472","last_updated":"2026-08-05T05:56:41Z","snapshot_observed_at":"2026-08-18T14:47:29.182737Z","submitted_at":"2026-08-05T05:56:41Z","title":"EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T14:45:56.660693Z"},"links":{"citing_paper":"/paper/2608.04472"},"observation_digest":"sha256:c6a16ec283ae4870c408df80ae40f4b726aa5a3d04c0493c0e6bc976a5e9b0e7","observation_id":"0763bb18-70fb-4868-b129-5e583f9242b4","resolution":{"observed_at":"2026-08-15T14:45:56.831698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14548","last_updated":"2025-01-24T14:50:48Z","snapshot_observed_at":"2026-08-18T14:46:56.986422Z","submitted_at":"2025-01-24T14:50:48Z","title":"Large-scale and Fine-grained Vision-language Pre-training for Enhanced CT Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14548","snapshot_observed_at":"2026-08-15T14:45:56.673709Z","title":"Large-scale and fine-grained vision-language pre-training for enhanced ct image understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04472","last_updated":"2026-08-05T05:56:41Z","snapshot_observed_at":"2026-08-18T14:47:29.182737Z","submitted_at":"2026-08-05T05:56:41Z","title":"EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T14:45:56.673709Z"},"links":{"cited_paper":"/paper/2501.14548","citing_paper":"/paper/2608.04472"},"observation_digest":"sha256:0ad79ffb063027c13c3876c1f10cb045b49ba0749bcdbb51933a2b88658b5280","observation_id":"7c653307-518c-40f0-9a8f-0fe6ee6cbba9","resolution":{"observed_at":"2026-08-15T14:45:56.673709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.06932","last_updated":"2024-02-19T13:02:26Z","snapshot_observed_at":"2026-08-18T04:59:52.688617Z","submitted_at":"2021-08-16T07:09:06Z","title":"Polyp-PVT: Polyp Segmentation with Pyramid Vision Transformers","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.06932","snapshot_observed_at":"2026-08-15T14:45:56.651117Z","title":"Polyp-pvt: Polyp segmentation with pyramid vision transformers.arXiv preprint arXiv:2108.06932,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04472","last_updated":"2026-08-05T05:56:41Z","snapshot_observed_at":"2026-08-18T14:47:29.182737Z","submitted_at":"2026-08-05T05:56:41Z","title":"EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T14:45:56.651117Z"},"links":{"cited_paper":"/paper/2108.06932","citing_paper":"/paper/2608.04472"},"observation_digest":"sha256:ba299828e2b2d45270724215a2d7cbd694025a3b35fa370d832794877a698a91","observation_id":"ca0a022a-e05b-4742-8c6c-d43052d58f91","resolution":{"observed_at":"2026-08-15T14:45:56.651117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04472","last_updated":"2026-08-05T05:56:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T14:47:29.182737Z","submitted_at":"2026-08-05T05:56:41Z","title":"EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2608.04472."}