{"as_of":"2026-08-19T02:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:256a06cb67461cc929583a9bccf17258d78cf70773dbb1e107fb386b26966252","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:40:24.500720Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.00976/citation-record","integrity":"/paper/2608.00976/integrity","json":"/paper/2608.00976/citation-record.json","paper":"/paper/2608.00976"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:24.465902Z","title":"Radvlm: A multitask conversational vision-language model for radiology.arXiv preprint arXiv:2502.03333,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00976","last_updated":"2026-08-02T03:59:07Z","snapshot_observed_at":"2026-08-17T22:54:41.537654Z","submitted_at":"2026-08-02T03:59:07Z","title":"Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:24.465902Z"},"links":{"citing_paper":"/paper/2608.00976"},"observation_digest":"sha256:87bae833f956cbe8e67c62b61cddd0813e453574485de0b0429e7dc35cebb491","observation_id":"8d5f67d1-81ce-4b05-bceb-37b6152d331a","resolution":{"observed_at":"2026-08-06T00:40:24.465902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14482","last_updated":"2026-06-11T10:07:56Z","snapshot_observed_at":"2026-08-16T02:46:49.800923Z","submitted_at":"2026-03-15T17:02:40Z","title":"V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.14482","snapshot_observed_at":"2026-08-06T00:40:24.469395Z","title":"V-jepa 2.1: Unlocking dense features in video self-supervised learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00976","last_updated":"2026-08-02T03:59:07Z","snapshot_observed_at":"2026-08-17T22:54:41.537654Z","submitted_at":"2026-08-02T03:59:07Z","title":"Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:24.469395Z"},"links":{"cited_paper":"/paper/2603.14482","citing_paper":"/paper/2608.00976"},"observation_digest":"sha256:9c758d872dfdfe4403380c62f7ad6980b8eb145019090d8ed465163a8e566bdc","observation_id":"a80f62fc-c0c2-4a8f-93d2-63dc92ff2a86","resolution":{"observed_at":"2026-08-06T00:40:24.469395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18416","last_updated":"2024-05-01T17:12:10Z","snapshot_observed_at":"2026-07-06T18:06:49.190172Z","submitted_at":"2024-04-29T04:11:28Z","title":"Capabilities of Gemini Models in Medicine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18416","snapshot_observed_at":"2026-08-06T00:40:24.473729Z","title":"Capabilities of gemini models in medicine.arXiv preprint arXiv:2404.18416,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00976","last_updated":"2026-08-02T03:59:07Z","snapshot_observed_at":"2026-08-17T22:54:41.537654Z","submitted_at":"2026-08-02T03:59:07Z","title":"Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:24.473729Z"},"links":{"cited_paper":"/paper/2404.18416","citing_paper":"/paper/2608.00976"},"observation_digest":"sha256:da6553b8a199cafee7eb0e14bf164248e1c408342dbcfd154ef03159b73524ba","observation_id":"21b53b96-addb-48a1-b0e9-a5374b211a69","resolution":{"observed_at":"2026-08-06T00:40:24.473729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:24.481101Z","title":"Fleming-vl: Towards universal medical visual reasoning with multimodal llms.arXiv preprint arXiv:2511.00916,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00976","last_updated":"2026-08-02T03:59:07Z","snapshot_observed_at":"2026-08-17T22:54:41.537654Z","submitted_at":"2026-08-02T03:59:07Z","title":"Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:24.481101Z"},"links":{"citing_paper":"/paper/2608.00976"},"observation_digest":"sha256:bf7c639f9b4ace7120b8d8ce86016201dcf287d8a331d5034fdc254804602104","observation_id":"da649b29-d4eb-4ebf-90db-635235af74bb","resolution":{"observed_at":"2026-08-06T00:40:24.481101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-08-18T01:07:23.737664Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-06T00:40:24.484809Z","title":"Dinov3.arXiv preprint arXiv:2508.10104,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00976","last_updated":"2026-08-02T03:59:07Z","snapshot_observed_at":"2026-08-17T22:54:41.537654Z","submitted_at":"2026-08-02T03:59:07Z","title":"Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:24.484809Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2608.00976"},"observation_digest":"sha256:fa61dcdf2ad7344fc5662ed29a1d11ea792a48fb48a46b07896c607e26e1ef05","observation_id":"3f7c9418-b800-466d-bfbf-02cdaeabc11e","resolution":{"observed_at":"2026-08-06T00:40:24.484809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T00:40:24.488181Z","title":"Gemma 3 technical report.arXiv preprint arXiv:2503.19786, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00976","last_updated":"2026-08-02T03:59:07Z","snapshot_observed_at":"2026-08-17T22:54:41.537654Z","submitted_at":"2026-08-02T03:59:07Z","title":"Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:24.488181Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2608.00976"},"observation_digest":"sha256:4505816a2b5267c7bb25416b1ddb45051d473c08adf6bb5bb65b8ee76217de08","observation_id":"d68ffc2d-0b80-4d46-8658-6d7da2a3f028","resolution":{"observed_at":"2026-08-06T00:40:24.488181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07044","last_updated":"2025-06-13T04:22:02Z","snapshot_observed_at":"2026-08-13T15:46:47.339256Z","submitted_at":"2025-06-08T08:47:30Z","title":"Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07044","snapshot_observed_at":"2026-08-06T00:40:24.492327Z","title":"Lingshu: A generalist foundation model for unified multimodal medical understanding and reasoning.arXiv preprint arXiv:2506.07044,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00976","last_updated":"2026-08-02T03:59:07Z","snapshot_observed_at":"2026-08-17T22:54:41.537654Z","submitted_at":"2026-08-02T03:59:07Z","title":"Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:24.492327Z"},"links":{"cited_paper":"/paper/2506.07044","citing_paper":"/paper/2608.00976"},"observation_digest":"sha256:fd1acbe57f1a1b94b76cbad2fdfcf144e4f24a41208db2b55983f8c9ad7ffa19","observation_id":"39247014-e734-4430-b32e-93b31e87ca27","resolution":{"observed_at":"2026-08-06T00:40:24.492327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11969","last_updated":"2023-11-20T17:59:03Z","snapshot_observed_at":"2026-08-16T16:32:09.624925Z","submitted_at":"2023-11-20T17:59:03Z","title":"SA-Med2D-20M Dataset: Segment Anything in 2D Medical Imaging with 20 Million masks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11969","snapshot_observed_at":"2026-08-06T00:40:24.496366Z","title":"Sa-med2d-20m dataset: Segment anything in 2d medical imaging with 20 million masks.arXiv preprint arXiv:2311.11969,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00976","last_updated":"2026-08-02T03:59:07Z","snapshot_observed_at":"2026-08-17T22:54:41.537654Z","submitted_at":"2026-08-02T03:59:07Z","title":"Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:24.496366Z"},"links":{"cited_paper":"/paper/2311.11969","citing_paper":"/paper/2608.00976"},"observation_digest":"sha256:301bf7ac4ec65a1ad7f6e4cc54f771486dac93327eca10fcc5676e28d8e9df25","observation_id":"371fd059-7488-4e7f-94be-3911a5d59320","resolution":{"observed_at":"2026-08-06T00:40:24.496366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:24.461873Z","title":"Chexagent: Towards a foundation model for chest x-ray interpretation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00976","last_updated":"2026-08-02T03:59:07Z","snapshot_observed_at":"2026-08-17T22:54:41.537654Z","submitted_at":"2026-08-02T03:59:07Z","title":"Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:24.461873Z"},"links":{"citing_paper":"/paper/2608.00976"},"observation_digest":"sha256:569110b1f5a0eb89e8aa1da5071ff6d5fdd72c04f947bea5e12ab76427b16ce5","observation_id":"553027f1-ba0b-4eab-85ad-4b0a68bc7b53","resolution":{"observed_at":"2026-08-06T00:40:24.461873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T00:40:24.500720Z","title":"Tn5000: An ultrasound image dataset for thyroid nodule detection and classification.Scientific data, 12(1):1437, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00976","last_updated":"2026-08-02T03:59:07Z","snapshot_observed_at":"2026-08-17T22:54:41.537654Z","submitted_at":"2026-08-02T03:59:07Z","title":"Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:24.500720Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.00976"},"observation_digest":"sha256:2b25195b8f48ca626934f4bc7443ce8c08f6e39020441c01be5eb00ceffa30a0","observation_id":"3005e101-f44d-4b62-b864-785f92b20018","resolution":{"observed_at":"2026-08-06T00:40:24.500720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05201","last_updated":"2026-04-06T19:50:20Z","snapshot_observed_at":"2026-08-16T01:32:15.677523Z","submitted_at":"2025-07-07T17:01:44Z","title":"MedGemma Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05201","snapshot_observed_at":"2026-08-06T00:40:24.477286Z","title":"Medgemma technical report.arXiv preprint arXiv:2507.05201,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00976","last_updated":"2026-08-02T03:59:07Z","snapshot_observed_at":"2026-08-17T22:54:41.537654Z","submitted_at":"2026-08-02T03:59:07Z","title":"Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:24.477286Z"},"links":{"cited_paper":"/paper/2507.05201","citing_paper":"/paper/2608.00976"},"observation_digest":"sha256:ef68997d7daa597570fdc61f6605fd0e2c422259ab2d0059b471ec1dae7d95f5","observation_id":"108d2e2d-be0e-498e-94f5-2175d8c48014","resolution":{"observed_at":"2026-08-06T00:40:24.477286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:24.454599Z","title":"Mirage: The illusion of visual understanding.arXiv preprint arXiv:2603.21687,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00976","last_updated":"2026-08-02T03:59:07Z","snapshot_observed_at":"2026-08-17T22:54:41.537654Z","submitted_at":"2026-08-02T03:59:07Z","title":"Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:24.454599Z"},"links":{"citing_paper":"/paper/2608.00976"},"observation_digest":"sha256:6ebd516a74195015ec492e9dc061cb5207368043dfe6bca0cdaf5fcc997aba14","observation_id":"6f989b60-66ea-4727-aa32-159957924208","resolution":{"observed_at":"2026-08-06T00:40:24.454599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04449","last_updated":"2024-09-20T17:17:43Z","snapshot_observed_at":"2026-08-16T13:45:22.852039Z","submitted_at":"2024-06-06T19:12:41Z","title":"MAIRA-2: Grounded Radiology Report Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04449","snapshot_observed_at":"2026-08-06T00:40:24.458377Z","title":"Maira-2: Grounded radiology report generation.arXiv preprint arXiv:2406.04449,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00976","last_updated":"2026-08-02T03:59:07Z","snapshot_observed_at":"2026-08-17T22:54:41.537654Z","submitted_at":"2026-08-02T03:59:07Z","title":"Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:24.458377Z"},"links":{"cited_paper":"/paper/2406.04449","citing_paper":"/paper/2608.00976"},"observation_digest":"sha256:cf5063955d88f68552c7edd2a11122875678d5c918cbc03b4329e8a86c67a798","observation_id":"58329fec-921d-4e35-876a-7cbff2e567cd","resolution":{"observed_at":"2026-08-06T00:40:24.458377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.00976","last_updated":"2026-08-02T03:59:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T22:54:41.537654Z","submitted_at":"2026-08-02T03:59:07Z","title":"Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2608.00976."}