{"as_of":"2026-08-10T00:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0aff3a16404d1f2f74552d6ea98cb2f6c08e30e75550da3f447aee35193b1cbe","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:18:46.209624Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.20188/citation-record","integrity":"/paper/2508.20188/integrity","json":"/paper/2508.20188/citation-record.json","paper":"/paper/2508.20188"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.06542","last_updated":"2024-10-09T04:36:47Z","snapshot_observed_at":"2026-08-07T23:02:58.579840Z","submitted_at":"2024-10-09T04:36:47Z","title":"MedImageInsight: An Open-Source Embedding Model for General Domain Medical Imaging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06542","snapshot_observed_at":"2026-08-05T15:18:44.377415Z","title":"Medimageinsight: An open-source embedding model for general domain medical imaging","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.377415Z"},"links":{"cited_paper":"/paper/2410.06542","citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:8ca25c5765fd70e8c84bac7e2969d1e0886ca1eb86911441c9714f57efe36824","observation_id":"c91005ca-6987-4f4c-9641-6d12bc93fcf0","resolution":{"observed_at":"2026-08-05T15:18:44.377415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:48.992046Z","title":"Validation of artificial intelligence prediction models for skin cancer diagnosis using dermoscopy images: the 2019 international skin imaging collaboration grand challenge","venue":null,"work_id":"10d1c122-f7a7-405e-9fbc-515ec1d4e3a9","year":2019},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.439846Z"},"links":{"citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:b7d7b8e0701b0f1df0c5cec46e21cdfb9bd599b1530c9d9183a88ed344fc1f06","observation_id":"b0b28e8d-3d76-440c-8f9e-27eeb4d521ec","resolution":{"observed_at":"2026-08-05T15:18:49.080855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:44.544462Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.544462Z"},"links":{"citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:17d51dea2ce5068f711333d9214eb4df9804a85f55d0c7d9718d6ae5166f8d7d","observation_id":"e79d4228-dae4-4244-9455-8673d2e8745c","resolution":{"observed_at":"2026-08-05T15:18:44.544462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:48.705954Z","title":"Analysis of trends in geographic distribution of us dermatology workforce density","venue":null,"work_id":"b508e641-eddd-430f-9706-0787ddcd0361","year":2017},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.610713Z"},"links":{"citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:65bc6a08c22ad3498d8e53f3aaf16b9c5fb5dad421307df4fc40481f80c3578c","observation_id":"5a16eecf-1504-447a-8fa7-1edfd031d9ce","resolution":{"observed_at":"2026-08-05T15:18:48.831526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:44.684834Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.684834Z"},"links":{"citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:8f41b7d3984ed0dafbb92031a77a628aa2316b36ddfb559da2f4b3cc3f915eaa","observation_id":"933d7108-5a32-45fa-a79d-ddecd706221b","resolution":{"observed_at":"2026-08-05T15:18:44.684834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:48.475968Z","title":"Transparent medical image ai via an image–text foundation model grounded in medical literature","venue":null,"work_id":"c38f0c42-2739-4a79-930b-d0c12aec85c9","year":2024},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.760942Z"},"links":{"citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:eed9ab7cea82dfb7d3202aad4fbe22841e3685b6244a947a78772d3f95b8d96f","observation_id":"1983dd57-45d5-400c-aedb-0c3c9b4f10e5","resolution":{"observed_at":"2026-08-05T15:18:48.588042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:48.351755Z","title":"Human-ai interaction in skin cancer diagnosis: a systematic review and meta-analysis","venue":null,"work_id":"6a1c5505-5a47-4a5f-9833-a9a362044cee","year":2024},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.831224Z"},"links":{"citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:08b77aa5009bbe67572dd20e8c52ce397e3d44bae6b94a5e4cf4af2e0c1f6c0a","observation_id":"27d36465-a168-496c-8511-8e2f48e32d3b","resolution":{"observed_at":"2026-08-05T15:18:48.428291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:48.099344Z","title":"The slice-3d dataset: 400,000 skin lesion image crops extracted from 3d tbp for skin cancer detection","venue":null,"work_id":"3df7f377-a549-4b49-93db-7374dd0dad7f","year":2024},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.937867Z"},"links":{"citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:9bb77132c24def1cb78ea90c6b92f5bde5ece20a3ad960527a2ceac3987907b6","observation_id":"a3fee907-6528-46d1-a91f-5d3aac03d17a","resolution":{"observed_at":"2026-08-05T15:18:48.172329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:45.014349Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.014349Z"},"links":{"citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:b6294e7fcaeba2fdb96bd364643d62d1e65cfde4f13fb2bdc2b22cafc8fcc269","observation_id":"c931a68e-0be6-483a-b49d-4896618de5bf","resolution":{"observed_at":"2026-08-05T15:18:45.014349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:47.965404Z","title":"3d whole-body skin imaging for automated melanoma detection","venue":null,"work_id":"1606c1cc-d6f2-4661-9650-4bb6b832b510","year":2023},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.098968Z"},"links":{"citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:8803ad92f9e4453d082208f9f0daa5c6799b207e4beb001af186ff2d02d17f93","observation_id":"8478ded3-3bee-4586-9f57-563c5a983952","resolution":{"observed_at":"2026-08-05T15:18:48.022744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:47.800057Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"b5669ae5-2460-4393-8f52-12783f50fb3d","year":2021},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.198250Z"},"links":{"citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:5dfb983d6243d14a82adfd18789a0ec764d372cbeb5d9ea4abef6cd5203c8e58","observation_id":"fb5e098f-c316-43cf-8753-15d5ed2c38b1","resolution":{"observed_at":"2026-08-05T15:18:47.894507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:47.637953Z","title":"Steering llama 2 via contrastive activation addition","venue":null,"work_id":"53c77108-1af4-4b26-b41e-dfcac603f41d","year":2024},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.305119Z"},"links":{"citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:d00a2774b92b3f8ef84d6cd8ea66474d38435cb0ecb6299d94bafbbc0f1e723c","observation_id":"e275ef87-4999-4481-954a-b740839a2537","resolution":{"observed_at":"2026-08-05T15:18:47.719743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:45.416054Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.416054Z"},"links":{"citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:03b4fdd410e886c65c92e79297cbbd5551bf951f7956d477b4b7f455a16edc33","observation_id":"17bb9f56-093f-4dcb-b880-cf22a6bfcc39","resolution":{"observed_at":"2026-08-05T15:18:45.416054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:47.435906Z","title":"Socioeconomic and geographic barriers to dermatology care in urban and rural us populations","venue":null,"work_id":"01457c52-9c98-4e61-b9ec-20af733b506c","year":2018},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.489390Z"},"links":{"citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:a9f666b9a23efdaf9f7533c25cbbe1ba54cf18d95e49c491a67c7702cacb5e69","observation_id":"d3e5c552-b236-4167-be21-716c29041771","resolution":{"observed_at":"2026-08-05T15:18:47.508759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:47.285371Z","title":"Composing text and image for image retrieval-an empirical odyssey","venue":null,"work_id":"8bb832b6-b225-423d-b234-464d85ae88f1","year":2019},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.558953Z"},"links":{"citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:078a40812425e01340eb6f61f8bade0b07ad21b696b77cd26501fa05d58d3997","observation_id":"b55f806f-f8ff-45cb-b12e-1bb749c356bc","resolution":{"observed_at":"2026-08-05T15:18:47.360891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T15:18:45.626372Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.626372Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:9ff82c0342f326f8db2aace0419b81cbb3ec618bf25c9c2f449813d1e1ac5028","observation_id":"83d6baf8-9c44-4186-b411-733ac619071d","resolution":{"observed_at":"2026-08-05T15:18:45.626372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14939","last_updated":"2025-07-31T09:21:08Z","snapshot_observed_at":"2026-08-07T16:52:58.896413Z","submitted_at":"2025-03-19T07:07:43Z","title":"VisNumBench: Evaluating Number Sense of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14939","snapshot_observed_at":"2026-08-05T15:18:45.699326Z","title":"Visnumbench: Evaluating number sense of multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.699326Z"},"links":{"cited_paper":"/paper/2503.14939","citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:b298ba8e9517c9f01f8e938711059bb1d8688caacc3194099c73a06fc5e628c5","observation_id":"49e3d848-5bca-4379-ba46-518088999649","resolution":{"observed_at":"2026-08-05T15:18:45.699326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14911","last_updated":"2025-04-13T05:27:33Z","snapshot_observed_at":"2026-08-07T16:53:05.453001Z","submitted_at":"2025-03-19T05:30:01Z","title":"Derm1M: A Million-scale Vision-Language Dataset Aligned with Clinical Ontology Knowledge for Dermatology","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14911","snapshot_observed_at":"2026-08-05T15:18:45.769309Z","title":"Derm1m: A million-scale vision-language dataset aligned with clinical ontology knowledge for dermatology","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.769309Z"},"links":{"cited_paper":"/paper/2503.14911","citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:7c7ea0946a5c40691f82d1acb18f8630693c0320d24318a5c3d7d24cef020c50","observation_id":"1b61aaa9-76cf-41ff-9db0-539acd98ffeb","resolution":{"observed_at":"2026-08-05T15:18:45.769309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:47.102189Z","title":"A multimodal vision foundation model for clinical dermatology","venue":null,"work_id":"c118c363-3d28-4f03-9e85-41a2c2da6c1e","year":2025},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.818436Z"},"links":{"citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:f0676d25d94857275884d8299b40df93eaeb9e8a24b2b4b8aedc362a1d838240","observation_id":"b776e1cc-ef69-4b29-8767-f9e37f939b3b","resolution":{"observed_at":"2026-08-05T15:18:47.196661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T15:18:45.884802Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.884802Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:4e64d6f0bc8119c3f5e4ca57f3b3c34817378f0887e33e30996b64854491ed89","observation_id":"6b2d822d-bf12-435f-bb7f-beb71bf363eb","resolution":{"observed_at":"2026-08-05T15:18:45.884802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:46.899262Z","title":"Visrag: Vision-based retrieval-augmented generation on multi-modality documents","venue":null,"work_id":"1400efcd-3662-4763-9e99-f9dd51b5e99b","year":2025},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.992780Z"},"links":{"citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:e57cf80d01959b93f908028f1e59a7e9b253618c6048d8758514af7ce104cf59","observation_id":"177cd5a3-b2db-4ad6-8b59-acf93633a55f","resolution":{"observed_at":"2026-08-05T15:18:46.973569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06152","last_updated":"2025-05-09T16:03:47Z","snapshot_observed_at":"2026-08-07T15:48:24.515873Z","submitted_at":"2025-05-09T16:03:47Z","title":"MM-Skin: Enhancing Dermatology Vision-Language Model with an Image-Text Dataset Derived from Textbooks","version":1},"cited_work":{"arxiv_id":"2505.06152","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.06152","snapshot_observed_at":"2026-08-05T15:18:46.313946Z","title":"MM-Skin: Enhancing Dermatology Vision-Language Model with an Image-Text Dataset Derived from Textbooks","venue":"cs.CV","work_id":"7d04cad3-cfb3-4188-8164-2fc156804d8c","year":2025},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.079905Z"},"links":{"cited_paper":"/paper/2505.06152","citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:890358d6fba2742d97d5b41bc74126ae35243fe2ee8c0d517c1406e513d6a326","observation_id":"49f59181-aba5-4486-86a5-4641af924ae8","resolution":{"observed_at":"2026-08-05T15:18:46.381344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:46.730737Z","title":"Revisiting the trustworthiness of saliency methods in radiology ai","venue":null,"work_id":"aa911efb-0a3f-4ee6-acf9-3f0e92138d10","year":2023},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.140687Z"},"links":{"citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:0a198f330e3644d50d40153fb6c5a3e3db90c8a79ea50f11067c93de93ef104e","observation_id":"2a98d987-e749-44ef-a093-65e209631c1c","resolution":{"observed_at":"2026-08-05T15:18:46.821178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:46.557508Z","title":"Pre-trained multimodal large language model enhances dermatological diagnosis using skingpt-4","venue":null,"work_id":"eedf13a8-6ee0-4932-b7c8-6173ef90a67d","year":2024},"citing_paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.209624Z"},"links":{"citing_paper":"/paper/2508.20188"},"observation_digest":"sha256:51f8f993e76394d95c250abdebea6173c669f70f0a77cdf897de22f316737603","observation_id":"a19ca186-d62a-46ee-b73c-647881d6bf97","resolution":{"observed_at":"2026-08-05T15:18:46.651647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.20188","last_updated":"2025-08-27T18:05:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T23:32:54.635819Z","submitted_at":"2025-08-27T18:05:05Z","title":"Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":14},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2508.20188."}