{"as_of":"2026-08-08T21:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6b46199fca20a62f528366f2b78902a946282eae09c1a0bc92223529fe5c737","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:55:42.909470Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.07006/citation-record","integrity":"/paper/2507.07006/integrity","json":"/paper/2507.07006/citation-record.json","paper":"/paper/2507.07006"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:42.712752Z","title":"Inference of captions from histopatho- logical patches,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.712752Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:a455c1512d874863d8e0a881b88091404d2c4efac87dbe2f946c22464a3f4a8e","observation_id":"d9932535-b6c4-47bc-a3f4-c420b54bb7be","resolution":{"observed_at":"2026-08-06T18:55:42.712752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:43.433729Z","title":"Artificial intelligence for digital and compu- tational pathology,","venue":null,"work_id":"7b0506d6-dc0e-43fb-9585-29531ebceeeb","year":2023},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.719966Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:0b73679d68c319e6b230b2dc07a59226d680ed22d8ac63739c244e4abe5c15bd","observation_id":"739cf3c5-fac6-455f-a33e-610924a0e4a3","resolution":{"observed_at":"2026-08-06T18:55:43.438872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19578","last_updated":"2024-06-27T23:43:36Z","snapshot_observed_at":"2026-07-06T18:38:13.900206Z","submitted_at":"2024-06-27T23:43:36Z","title":"PathAlign: A vision-language model for whole slide images in histopathology","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19578","snapshot_observed_at":"2026-08-06T18:55:42.731503Z","title":"Pathalign: A vision-language model for whole slide images in histopathology,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.731503Z"},"links":{"cited_paper":"/paper/2406.19578","citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:0580c9e5618572a6fd1680cad97c27e030a436a568349cdfeca5d465ed16b11a","observation_id":"2139d102-de3e-4115-acf9-04a56fdd76db","resolution":{"observed_at":"2026-08-06T18:55:42.731503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:43.417437Z","title":"Attention-based deep multiple instance learning,","venue":null,"work_id":"3f617f7a-c604-4de2-8a5c-53cbc3360815","year":2018},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.741430Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:2224a3eba01462b753db32775d8f85664cae773ecefbb57caaf02c93a0c7207c","observation_id":"7befc8a2-bffe-4772-b5eb-76a5584d584c","resolution":{"observed_at":"2026-08-06T18:55:43.422584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:43.397062Z","title":"Transmil: Transformer based correlated multiple instance learning for whole slide image classification,","venue":null,"work_id":"0a232732-7e3c-4bbb-9aae-b82ba628bc6b","year":2021},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.749496Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:75896d3eaee131e04978f51a99afd78886f245c6be5b31c0422589512928b07c","observation_id":"728e977a-1ac4-40dd-ad78-842a2b4fe611","resolution":{"observed_at":"2026-08-06T18:55:43.403249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:43.378678Z","title":"A survey on graph-based deep learning for computational histopathology,","venue":null,"work_id":"8b1c355b-5e4f-49f2-a800-9140716dad41","year":2022},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.757346Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:edeee73d25de5ef3ec3183c41dddf69e53c4e28f26764a7ffc6952d9e37fa72a","observation_id":"6f2a7822-8f9b-4d26-8dac-0a14827ebf07","resolution":{"observed_at":"2026-08-06T18:55:43.384796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:43.363231Z","title":"Enhanced descriptive captioning model for histopathological patches,","venue":null,"work_id":"15b37f91-dc99-44c9-b518-abba3c3185c7","year":2024},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.765499Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:9113e1b569ede27b4c2bcd8182169f90afc2443b42cfdfe502ec641578eaeb2b","observation_id":"cf583242-523d-4b31-a16a-a31f1ad19426","resolution":{"observed_at":"2026-08-06T18:55:43.368148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T18:55:42.773499Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.773499Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:9838f1b96dd12b257dd59de62664ed9731356a04de1acd3ffb79eb90f8154d9e","observation_id":"7b837ee8-7723-49bf-8f44-306d52212c12","resolution":{"observed_at":"2026-08-06T18:55:42.773499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:42.780443Z","title":"Clinicalt5: A generative language model for clinical text,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.780443Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:3e59605bb48df02e24e4d515f031886bf55ccc674926eefa73813e914af59f3d","observation_id":"02665d5e-0043-4810-b3c6-686424d71821","resolution":{"observed_at":"2026-08-06T18:55:42.780443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:42.787842Z","title":"Biogpt: generative pre-trained transformer for biomedical text genera- tion and mining,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.787842Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:09c5f2c104b87b290f95d4067bb93a03b265bd5d1baa3177f5116d6922fee932","observation_id":"b8c755d5-f623-452f-9812-c7db0bba8579","resolution":{"observed_at":"2026-08-06T18:55:42.787842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:43.320952Z","title":"A generalist vision–language foundation model for diverse biomedical tasks,","venue":null,"work_id":"79ec4c5c-9d2f-40e0-94b0-f895038cf138","year":2024},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.793771Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:8a3be4292053818c0c846727bfc3739ba7909d459b36cce3e366582e5a7d42a3","observation_id":"6efab8ef-5069-41e8-84b1-25c65161e0c8","resolution":{"observed_at":"2026-08-06T18:55:43.326042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:42.799479Z","title":"Imagenet large scale visual recognition challenge,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.799479Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:881b77a2f0ee1d651e53d9ddc4aee9ba066f8125fa300a3b96f42b480cb25f92","observation_id":"65261c9b-15de-480b-a638-794e88d896c9","resolution":{"observed_at":"2026-08-06T18:55:42.799479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:42.807114Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.807114Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:1abcfbe10ca4e23cb9f77f32698b894a9828a7df9b43fd931c1b6f907de1dc47","observation_id":"e266c0f8-8819-4563-a81e-561eb8c19ea5","resolution":{"observed_at":"2026-08-06T18:55:42.807114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:42.812086Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.812086Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:030777499928849fb92e9458fbb617b7c4e53f889bd48df8a405ece228d65d6c","observation_id":"48256ba8-a2cf-45c3-8012-278cf66882fb","resolution":{"observed_at":"2026-08-06T18:55:42.812086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08967","last_updated":"2024-07-23T20:14:17Z","snapshot_observed_at":"2026-08-07T15:33:05.914485Z","submitted_at":"2024-03-13T21:19:12Z","title":"PathM3: A Multimodal Multi-Task Multiple Instance Learning Framework for Whole Slide Image Classification and Captioning","version":2},"cited_work":{"arxiv_id":"2403.08967","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.08967","snapshot_observed_at":"2026-08-06T18:55:43.032493Z","title":"PathM3: A Multimodal Multi-Task Multiple Instance Learning Framework for Whole Slide Image Classification and Captioning","venue":"cs.CV","work_id":"bf3c26ee-e934-4ae2-98de-4188032e36bc","year":2024},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.817005Z"},"links":{"cited_paper":"/paper/2403.08967","citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:a624ac353195d37e93bf520ea10b7e33782c715bdac5f4f0724d5fb4ec453715","observation_id":"495defc2-7de4-4268-b6b0-fb972fd55273","resolution":{"observed_at":"2026-08-06T18:55:43.039262Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:42.827274Z","title":"Dual-stream multiple instance learn- ing network for whole slide image classification with self-supervised contrastive learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.827274Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:8a1c7a2b673f6c67e11ef0202d5c6b7cd02078b07322b0d26264ba5c38e5b2ff","observation_id":"f7dc63f0-fc8b-47cf-8f76-817d84553ec2","resolution":{"observed_at":"2026-08-06T18:55:42.827274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:42.833688Z","title":"Dtfd-mil: Double-tier feature distillation multiple instance learning for histopathology whole slide image classification,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.833688Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:a945ad36fbfb6bbbe4a39bd40c2878a30c2819b73cf61cca8bcf5fb2f424bc54","observation_id":"b4a3ca2f-297d-4129-bd08-f09cd1b4717c","resolution":{"observed_at":"2026-08-06T18:55:42.833688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:43.237690Z","title":"Visual language pretrained multiple instance zero-shot transfer for histopathology images,","venue":null,"work_id":"0777c413-819f-429d-a212-6d3c5b588643","year":2023},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.839603Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:0c76efb8196d64c5c69dc2cf28a5bf032c87502f34d72b847a35911a4c3a5090","observation_id":"97216124-38e4-4580-af9d-2cfcef796500","resolution":{"observed_at":"2026-08-06T18:55:43.244937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12077","last_updated":"2024-12-16T18:46:58Z","snapshot_observed_at":"2026-07-06T20:07:58.873037Z","submitted_at":"2024-12-16T18:46:58Z","title":"CPath-Omni: A Unified Multimodal Foundation Model for Patch and Whole Slide Image Analysis in Computational Pathology","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12077","snapshot_observed_at":"2026-08-06T18:55:42.848632Z","title":"Cpath-omni: A unified multimodal foundation model for patch and whole slide image analysis in computational pathology,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.848632Z"},"links":{"cited_paper":"/paper/2412.12077","citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:496e22176fa57691a3b5e79c65a6d63a4cd6bdf7efbb7fa4a4c9f925546313ce","observation_id":"5109a3e4-46d6-4c05-8712-f734fc9d1172","resolution":{"observed_at":"2026-08-06T18:55:42.848632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:43.214063Z","title":"Large language models in healthcare and medical domain: A review,","venue":null,"work_id":"69bb1861-23ca-4fb2-910e-f987e4636b11","year":2024},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.856878Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:3a72b6f8d023ea7a867fbbf3829548d4d68d6303cee5b9c9debb35986b202a84","observation_id":"2658958b-a776-418b-bdd7-870f4b9e42d3","resolution":{"observed_at":"2026-08-06T18:55:43.221309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20607","last_updated":"2023-10-31T16:43:03Z","snapshot_observed_at":"2026-07-06T16:41:15.446251Z","submitted_at":"2023-10-31T16:43:03Z","title":"What a Whole Slide Image Can Tell? Subtype-guided Masked Transformer for Pathological Image Captioning","version":1},"cited_work":{"arxiv_id":"2310.20607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.20607","snapshot_observed_at":"2026-08-06T18:55:42.984373Z","title":"What a Whole Slide Image Can Tell? Subtype-guided Masked Transformer for Pathological Image Captioning","venue":"cs.CV","work_id":"6054686d-8dae-416c-860e-2eec70271782","year":2023},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.863470Z"},"links":{"cited_paper":"/paper/2310.20607","citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:3ec797a40c9fa78dfacb09d55c1671c0a8b122b297e8339ba77abcbf96f54090","observation_id":"02e84621-ff0b-464c-b8bd-93d432a6204c","resolution":{"observed_at":"2026-08-06T18:55:42.992013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:43.188617Z","title":"Patch-based convolutional neural network for whole slide tissue image classification,","venue":null,"work_id":"927c4c36-1c48-4e68-be7a-342e9b06bea2","year":2016},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.869493Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:a8df1ffae36274b999bf58097dfbbbdbced685063fb816ee50613b4055b707e8","observation_id":"1de277b8-78c8-49df-8c52-4116cf10e648","resolution":{"observed_at":"2026-08-06T18:55:43.197120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:43.165707Z","title":"Unsupervised deep embedding for clustering analysis,","venue":null,"work_id":"3bed2f28-dee6-42a7-aa80-eee56bd6ddc5","year":2016},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.874812Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:4bc2848bcc65c86b33b492fa9674294c6f75a4d703ffa6b02df95f5cce473e7d","observation_id":"68dadbd5-0921-47af-b719-846e4ebc45d4","resolution":{"observed_at":"2026-08-06T18:55:43.173062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:42.879763Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.879763Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:6e742df361876df47cf5388a93723ce6d26d212658d885a865e6dd7752c33e6b","observation_id":"424ea3b9-5158-4c0b-b301-59e52794ab7d","resolution":{"observed_at":"2026-08-06T18:55:42.879763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01144","last_updated":"2017-08-05T22:45:19Z","snapshot_observed_at":"2026-08-01T18:34:23.156273Z","submitted_at":"2016-11-03T19:48:08Z","title":"Categorical Reparameterization with Gumbel-Softmax","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01144","snapshot_observed_at":"2026-08-06T18:55:42.885997Z","title":"Categorical reparameterization with gumbel-softmax,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.885997Z"},"links":{"cited_paper":"/paper/1611.01144","citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:f68d1eb5f700cf69a5836a20360750e4a84cf13c5ed7deee8ba012e22405b2cb","observation_id":"3b64879b-1ced-4796-877f-520141799fea","resolution":{"observed_at":"2026-08-06T18:55:42.885997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:42.893311Z","title":"Graph attention networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.893311Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:6d05bdcaab9d443b5af407a2cb9d85c430d11acc6cb8e5baabe6c7ceed6734d6","observation_id":"7e0bb6d2-6446-4a3e-9a87-5c3cbc466655","resolution":{"observed_at":"2026-08-06T18:55:42.893311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:42.898607Z","title":"Rectifier nonlinearities improve neural network acoustic models,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.898607Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:9efcc1ad604375aeef57b6ae59665880e4c9f6f6be2518b65b16a860952e6381","observation_id":"18ce9874-2ea8-4468-a38a-e9a3918433be","resolution":{"observed_at":"2026-08-06T18:55:42.898607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:43.116683Z","title":"A dataset for breast cancer histopathological image classification,","venue":null,"work_id":"9c174357-46db-446c-a0b9-a3e12ea54085","year":2015},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.904383Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:cb91f84f984b83f7ad422e554675f05d9e7593aa65dbae9b7e72f750762c3ab3","observation_id":"54c78102-d8bc-4517-8bc0-9e5faaa68d60","resolution":{"observed_at":"2026-08-06T18:55:43.122386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:43.092602Z","title":"A survey of evaluation metrics used for nlg systems,","venue":null,"work_id":"8d8bddbf-de18-45b3-a7f5-79a00e73feb4","year":2022},"citing_paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:42.909470Z"},"links":{"citing_paper":"/paper/2507.07006"},"observation_digest":"sha256:0ed8c3dcecea3233d177d931479f5bb553b2d7545ded7d7dce285708c4951ac8","observation_id":"be848d36-dd34-4587-b09c-cf81813c94c5","resolution":{"observed_at":"2026-08-06T18:55:43.099400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07006","last_updated":"2025-07-09T16:35:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T18:47:15.842734Z","submitted_at":"2025-07-09T16:35:21Z","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":2,"verified_fuzzy":12},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2507.07006."}