{"as_of":"2026-08-17T02:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9d131d3f3fff53df211afea48ad0a042d717f2f5351df89f4d704bb06675946","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:29:50.329921Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T06:26:15.397248Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:39:42.317139Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"cited_work":{"arxiv_id":"2509.01554","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01554","snapshot_observed_at":"2026-07-04T08:39:42.317139Z","title":"arXiv preprint arXiv:2509.01554 , year=","venue":null,"work_id":"00d31626-3fb8-4790-93a1-b9e42ee9c409","year":2025},"citing_paper":{"arxiv_id":"2606.05460","last_updated":"2026-06-03T21:37:05Z","snapshot_observed_at":"2026-08-14T19:46:30.214365Z","submitted_at":"2026-06-03T21:37:05Z","title":"ORACLE-CT: Anatomy-Aware Support Pooling for CT Classification","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T06:26:15.397248Z"},"links":{"cited_paper":"/paper/2509.01554","citing_paper":"/paper/2606.05460"},"observation_digest":"sha256:bb0081384a574a4e8df850970ac151dcbee826f6d03a1f19701cf16abc017fdb","observation_id":"a24af911-f5c3-4e11-b7b5-07beb8ea6617","resolution":{"observed_at":"2026-07-02T08:06:47.786921Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"cited_work":{"arxiv_id":"2509.01554","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01554","snapshot_observed_at":"2026-07-04T08:39:42.317139Z","title":"arXiv preprint arXiv:2509.01554 , year=","venue":null,"work_id":"00d31626-3fb8-4790-93a1-b9e42ee9c409","year":2025},"citing_paper":{"arxiv_id":"2606.22442","last_updated":"2026-06-21T11:18:06Z","snapshot_observed_at":"2026-08-10T06:20:37.383103Z","submitted_at":"2026-06-21T11:18:06Z","title":"Efficient Multimodal Clinical Question Answering for Pulmonary Embolism Risk Assessment","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-26T11:10:36.773518Z"},"links":{"cited_paper":"/paper/2509.01554","citing_paper":"/paper/2606.22442"},"observation_digest":"sha256:b03674ad7e252e9db2044cd08331954fadadb719ab953c1becd1d097ef479d11","observation_id":"ba1abf82-f8ab-48c0-b125-086ca049f069","resolution":{"observed_at":"2026-07-04T08:39:42.319066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.01554/citation-record","integrity":"/paper/2509.01554/integrity","json":"/paper/2509.01554/citation-record.json","paper":"/paper/2509.01554"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-16T14:04:54.843248Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-05T12:29:50.230776Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models.arXiv preprint arXiv:2404.00578, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.230776Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:53150ad0e025a8e7ed4fa9bdd77306160bc90be7aceb667a45eda70058253f3b","observation_id":"c9f01c67-46b2-4be2-8c81-5e915db4d451","resolution":{"observed_at":"2026-08-05T12:29:50.230776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.235053Z","title":"Merlin: A vision language foundation model for 3d computed tomography.arXiv preprint arXiv:2406.06512, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.235053Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:01aea71cbcb1642afb2565e73d3e48d7c5bbf312c72be12e6f37fe171b5655f7","observation_id":"98b114d0-d446-4962-a2eb-bd5bfa7d0c3c","resolution":{"observed_at":"2026-08-05T12:29:50.235053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19330","last_updated":"2024-09-28T12:31:07Z","snapshot_observed_at":"2026-08-16T13:14:32.674752Z","submitted_at":"2024-09-28T12:31:07Z","title":"3D-CT-GPT: Generating 3D Radiology Reports through Integration of Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19330","snapshot_observed_at":"2026-08-05T12:29:50.238266Z","title":"3d-ct-gpt: Generating 3d radiology reports through integration of large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.238266Z"},"links":{"cited_paper":"/paper/2409.19330","citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:4d1299fb9a63c55be7cab0da72af8e7f28fcb8b567fb3880ce887873ecc29c48","observation_id":"69ec7f8d-fe51-480c-a2bb-c0d9731a8b4b","resolution":{"observed_at":"2026-08-05T12:29:50.238266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.785944Z","title":"Machine-learning-based multiple abnormality prediction with large-scale chest computed tomography volumes.Medical image analysis, 67:101857, 2021","venue":null,"work_id":"6a308517-0381-44ba-a366-7ff9a03b0d33","year":2021},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.242250Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:62b195e73a2b5f583c636bc9934b642621e493d118a4a080e41c443a388568d7","observation_id":"ea931a47-c470-4eed-9395-81bc447e44e2","resolution":{"observed_at":"2026-08-05T12:29:50.789733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.777001Z","title":"Domain-specific language model pretraining for biomedical natural language processing.ACM Transactions on Computing for Healthcare (HEALTH), 3(1):1–23, 2021","venue":null,"work_id":"e8f00358-86d4-4dc4-a716-564727e6fc30","year":2021},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.246140Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:be6b018c65afa653bf2e09d753c40b04531010ef08ccdcae07907d89b91f97da","observation_id":"94c3b252-b63e-4617-a418-8ce704894d65","resolution":{"observed_at":"2026-08-05T12:29:50.780050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.251610Z","title":"Developing generalist foundation models from a multimodal dataset for 3d computed tomography.arXiv preprint arXiv:2403.17834, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.251610Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:ebdcd1aa05e420a258045b8320731c1c3f61424a6eed2895b60a5d37aa7b2a00","observation_id":"01fe50c5-36a2-4c28-adae-442454b4817c","resolution":{"observed_at":"2026-08-05T12:29:50.251610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.767759Z","title":"Joint segmentation and classification of skin lesions via a multi-task learning convolutional neural network","venue":null,"work_id":"a90528b7-e721-42ea-967f-7b739c69f7f3","year":2023},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.255181Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:87132f51e9489af09e0b6c52fc50774c141f1d3c4a9fd2fc21a3cb20b42c7c25","observation_id":"0447330e-d74f-44d1-a07c-882bbaa6efa5","resolution":{"observed_at":"2026-08-05T12:29:50.770947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.758146Z","title":"Gloria: A multimodal global-local representation learning framework for label-efficient medical image recognition","venue":null,"work_id":"a8018855-8934-4d63-a4a1-ac425341cb79","year":2021},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.258829Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:bd9d5bb3b6ae94d7738895c85cd0b072ebb28dd3ef34ea3b3a29b16ef27659b0","observation_id":"ca10f169-19f0-433f-9f0a-ba88f793140d","resolution":{"observed_at":"2026-08-05T12:29:50.761415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.748698Z","title":"Inspect: a multimodal dataset for patient outcome prediction of pulmonary embolisms.Advances in Neural Information Processing Systems, 36:17742–17772, 2023","venue":null,"work_id":"1e1d6b83-9eb4-4d3b-ab9b-40c5347f8637","year":2023},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.261962Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:a72d3151d7822811077e0eaca02ca36c9640052ba09e2ab674f50e071b5f74da","observation_id":"02d04536-5715-42ea-9c01-999e63e73731","resolution":{"observed_at":"2026-08-05T12:29:50.752409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.738963Z","title":"Chexpert: A large chest radiograph dataset with uncertainty labels and expert comparison","venue":null,"work_id":"60138a9a-da96-4f98-948d-c6925bf889ab","year":2019},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.265018Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:eb06dd04b49bf6fc56b231931094f404ccd5051823ac7922ae9a5e14bb58cd1b","observation_id":"55f9b411-c2c8-4990-986e-73a7c53fbed4","resolution":{"observed_at":"2026-08-05T12:29:50.742390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.14463","last_updated":"2021-08-29T23:19:33Z","snapshot_observed_at":"2026-08-16T18:14:04.811046Z","submitted_at":"2021-06-28T08:24:23Z","title":"RadGraph: Extracting Clinical Entities and Relations from Radiology Reports","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.14463","snapshot_observed_at":"2026-08-05T12:29:50.268161Z","title":"Radgraph: Extracting clinical entities and relations from radiology reports","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.268161Z"},"links":{"cited_paper":"/paper/2106.14463","citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:cb2c3fbfe3d9cc06580f0c3027ba13b89740d434c74d8009bf602ad49884cff0","observation_id":"f7aca68c-e8b6-4ac2-8fef-2ccf05d581bf","resolution":{"observed_at":"2026-08-05T12:29:50.268161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14200","last_updated":"2024-10-18T06:31:40Z","snapshot_observed_at":"2026-08-16T13:08:09.353750Z","submitted_at":"2024-10-18T06:31:40Z","title":"E3D-GPT: Enhanced 3D Visual Foundation for Medical Vision-Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14200","snapshot_observed_at":"2026-08-05T12:29:50.271724Z","title":"E3d-gpt: Enhanced 3d visual foundation for medical vision-language model.arXiv preprint arXiv:2410.14200, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.271724Z"},"links":{"cited_paper":"/paper/2410.14200","citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:b18716e5a6d49379ab135f648287c9ef049a86e23a16c141103ed7fecd519a1b","observation_id":"c722d88e-ced4-4541-b559-016081e4c178","resolution":{"observed_at":"2026-08-05T12:29:50.271724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06030","last_updated":"2025-03-08T03:02:57Z","snapshot_observed_at":"2026-08-16T12:52:00.938611Z","submitted_at":"2025-03-08T03:02:57Z","title":"Towards Universal Text-driven CT Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06030","snapshot_observed_at":"2026-08-05T12:29:50.275365Z","title":"T owards universal text-driven ct image segmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.275365Z"},"links":{"cited_paper":"/paper/2503.06030","citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:eaaffc6c981dd8c0364e406dcf2095b42c1cdef246207623bdd79b24d6853c7f","observation_id":"24d3a096-5b5f-465c-b573-9ce7c638ab7b","resolution":{"observed_at":"2026-08-05T12:29:50.275365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.729752Z","title":"Focal loss for dense object detection","venue":null,"work_id":"d8933401-b1e3-401e-bcf2-f3c27c9f6ed9","year":2017},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.278771Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:4a67d4331fe24abfb3a92e1402da55d4c4cf63d164c4c18870a3ce583e675182","observation_id":"34192098-1b77-46e5-8b25-1d7452938647","resolution":{"observed_at":"2026-08-05T12:29:50.732790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.720807Z","title":"Automatic joint segmentation and classification of breast ultrasound images via multi-task learning with object contextual attention.Frontiers in Oncology, 15:1567577, 2025","venue":null,"work_id":"85310ca9-d17d-42f8-b550-6d763acdb3bf","year":2025},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.281782Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:3de4f3df60c318b8ca3b3387ed27c87323ad3f857e20ee8b8d061172ad184df4","observation_id":"8e7fb4d6-73d8-4865-9021-7023ff9c2bca","resolution":{"observed_at":"2026-08-05T12:29:50.724032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.711300Z","title":"Y -net: joint segmentation and classification for diagnosis of breast biopsy images","venue":null,"work_id":"776872b8-32bc-4feb-b806-aff19b379ec8","year":2018},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.285216Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:603bcd4f2c5e9bc207c492a26dd9caa7e46fa5786fc32bf52551a2e4f880c567","observation_id":"6cbc207b-eb7e-4e31-9534-8fbab8239be4","resolution":{"observed_at":"2026-08-05T12:29:50.714848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.701759Z","title":"A large-scale evaluation of automatic pulmonary nodule detection in chest ct using local image features and k-nearest-neighbour classification","venue":null,"work_id":"19e04d4e-eee1-4884-acd7-76ab36d40a9e","year":2009},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.288060Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:f9fa14ad3975fb33bb37c80e6f12863bebd3669894683635847f24f56de9dc36","observation_id":"d701521b-c836-4eba-a352-ec26849ea807","resolution":{"observed_at":"2026-08-05T12:29:50.705392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.692196Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"3e051961-6d59-4efb-8b36-ad190927dbd7","year":2021},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.290896Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:6148918f61fbb484ef09fef98f45c9cdc47037019ffdb0647412f4a7ea8e5f01","observation_id":"456a51e6-c3c8-4ca9-ac6e-2006d1c600c2","resolution":{"observed_at":"2026-08-05T12:29:50.695468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.682605Z","title":"3d convolutional neural networks for stalled brain capillary detection","venue":null,"work_id":"3499e957-0dc4-4133-bc8c-1fba01af5338","year":2022},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.293650Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:e6cfb4773aaf152bd73583215805b5b8043c2ead8bf19ec1b7c9937f8ce5b673","observation_id":"997ed41e-74eb-4cc3-9148-311efbcffedf","resolution":{"observed_at":"2026-08-05T12:29:50.685983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.673259Z","title":"Efficientnet: Rethinking model scaling for convolutional neural networks","venue":null,"work_id":"60ae9846-69ff-4444-96da-dc75649706e1","year":2019},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.296693Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:0e6cb1b60b4f0e2c00872bcb3a498b64404ee59095323d495b1be3dcdc3e7dc9","observation_id":"51b1e985-1725-44b1-aaf1-b115ad478410","resolution":{"observed_at":"2026-08-05T12:29:50.676519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.663761Z","title":"Medclip: Contrastive learning from unpaired medical images and text","venue":null,"work_id":"ece8eba3-711c-4b90-ad04-08c961ec39c7","year":2022},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.299769Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:d357e12ae3083a427bed1802d0f727a6c303d7664d5f045a04beefe3e34d0e7d","observation_id":"5aac79e3-b27c-4b6a-b112-edcccfba90ab","resolution":{"observed_at":"2026-08-05T12:29:50.666994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.653897Z","title":"T otalseg- mentator: robust segmentation of 104 anatomic structures in ct images","venue":null,"work_id":"decc2e06-acb7-43e1-b264-f5f436a4b78c","year":2023},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.302634Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:084fc99c3641e50957b9838f444574222c8b7efae7c48ad129b246112afe1f18","observation_id":"7bf6170a-8f84-4551-8e79-dcd054d90bc3","resolution":{"observed_at":"2026-08-05T12:29:50.657128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.644291Z","title":"Navigating data scarcity using foundation models: A benchmark of few-shot and zero-shot learning approaches in medical imaging","venue":null,"work_id":"01bdf058-7cd8-4c4b-b9e3-0610024d5126","year":2024},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.305500Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:a53fee535c0fb13ca0fe59021316701c611d38d8d015a87aa6026b2c0a69ffa9","observation_id":"7e45f5ae-5c2b-414d-a2c7-0db942c22f00","resolution":{"observed_at":"2026-08-05T12:29:50.647534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02463","last_updated":"2023-11-16T12:38:46Z","snapshot_observed_at":"2026-08-16T15:10:43.905696Z","submitted_at":"2023-08-04T17:00:38Z","title":"Towards Generalist Foundation Model for Radiology by Leveraging Web-scale 2D&3D Medical Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02463","snapshot_observed_at":"2026-08-05T12:29:50.308443Z","title":"T owards generalist foundation model for radiology","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.308443Z"},"links":{"cited_paper":"/paper/2308.02463","citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:1981fe1675d0f5e4684c09abbec26385ec4e0a9c40f28185d0af2efefc86013c","observation_id":"4ccbc59d-e9f0-4cfa-9910-72b37cbd219e","resolution":{"observed_at":"2026-08-05T12:29:50.308443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01092","last_updated":"2024-03-04T04:28:11Z","snapshot_observed_at":"2026-08-16T14:46:37.050701Z","submitted_at":"2023-11-02T08:55:48Z","title":"Learning A Multi-Task Transformer Via Unified And Customized Instruction Tuning For Chest Radiograph Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01092","snapshot_observed_at":"2026-08-05T12:29:50.311969Z","title":"Learning a multi-task transformer via unified and customized instruction tuning for chest radiograph interpretation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.311969Z"},"links":{"cited_paper":"/paper/2311.01092","citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:104695249a3d93d4b7c405395d1abb8877ee2085331f71aa9f85251427ce03de","observation_id":"d90a29e5-f704-4083-8fe9-0db964224adc","resolution":{"observed_at":"2026-08-05T12:29:50.311969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.634405Z","title":"A large language model for electronic health records.NPJ digital medicine, 5(1): 194, 2022","venue":null,"work_id":"2edbd98f-e8ec-4882-a09b-37c9e75e1fd1","year":2022},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.314991Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:49e620248c71a85f41b84ab95a1d66b3bf4147a215cd7dd0f1cdfa1260990cc6","observation_id":"033b8a5d-d653-4fbe-9784-73181d7cc560","resolution":{"observed_at":"2026-08-05T12:29:50.637851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.624986Z","title":"Evaluating progress in automatic chest x-ray radiology report generation","venue":null,"work_id":"4d4829c3-e641-4612-ba80-65165ba56824","year":2023},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.317631Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:2ba659744ad6df9e1ad6fe57ec7e780519839aa6c9935357044eb2a96b9c2f3c","observation_id":"29c20ab6-013f-4e01-a00c-ddca87d198c5","resolution":{"observed_at":"2026-08-05T12:29:50.628249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15892","last_updated":"2025-03-20T06:43:36Z","snapshot_observed_at":"2026-08-16T12:48:23.187544Z","submitted_at":"2025-03-20T06:43:36Z","title":"UMIT: Unifying Medical Imaging Tasks via Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15892","snapshot_observed_at":"2026-08-05T12:29:50.320649Z","title":"Umit: Unifying medical imaging tasks via vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.320649Z"},"links":{"cited_paper":"/paper/2503.15892","citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:b9ac09ef564bfc4e52f2421e940c071b5c4ba8f1edb58d45f3df803129552064","observation_id":"8d69d8d3-8cb2-47f9-a58e-101024da15be","resolution":{"observed_at":"2026-08-05T12:29:50.320649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00915","last_updated":"2025-01-08T22:58:51Z","snapshot_observed_at":"2026-07-06T14:57:39.647497Z","submitted_at":"2023-03-02T02:20:04Z","title":"BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00915","snapshot_observed_at":"2026-08-05T12:29:50.323624Z","title":"Biomedclip: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.323624Z"},"links":{"cited_paper":"/paper/2303.00915","citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:165bc6ef7f07970b4c0959d54dc4b88ce770a09b65e0cb9a3ad89ec18c3cdb3b","observation_id":"e5ada4e5-c073-4483-b787-c5c5e95b426c","resolution":{"observed_at":"2026-08-05T12:29:50.323624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.615374Z","title":"Knowledge-enhanced visual-language pre-training on chest radiology images","venue":null,"work_id":"1a70c730-51d2-46c5-bb36-327bb8149d23","year":2023},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.327193Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:1596ce8e85aff1e9a1deadcfc8fb62239368dad65745a352b5c876fa5e9af437","observation_id":"9187d00c-e273-4219-bc57-f00f075d9705","resolution":{"observed_at":"2026-08-05T12:29:50.618386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:29:50.602840Z","title":"Mediclip: Adapting clip for few-shot medical image anomaly detection","venue":null,"work_id":"ba6b46d1-c8ab-4b70-acc4-6aa07a5fb4be","year":2024},"citing_paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T12:29:50.329921Z"},"links":{"citing_paper":"/paper/2509.01554"},"observation_digest":"sha256:5700f0f521922ea4caba72820cf4a691477bd7c0bb69d8956d031ef4701e20ee","observation_id":"d7cd701d-e306-4083-8cfb-8f7d4357212d","resolution":{"observed_at":"2026-08-05T12:29:50.608447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.01554","last_updated":"2025-09-01T15:30:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T07:27:40.022826Z","submitted_at":"2025-09-01T15:30:17Z","title":"Unified Supervision For Vision-Language Modeling in 3D Computed Tomography"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 2 inbound Pith citation observations for arXiv:2509.01554."}