{"as_of":"2026-08-04T00:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e20d4fc78a7747aac2b37fd30ac9ab0b81048143ced51f32273002a251fe4c27","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T18:20:38.720544Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.15997/citation-record","integrity":"/paper/2605.15997/integrity","json":"/paper/2605.15997/citation-record.json","paper":"/paper/2605.15997"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"e9c7eaf7-f6f5-454f-9142-e75e1d6b0c07","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:135a8d5af96d50ac9a521b8b0bbbc3f1f21ca2b8301e60696d522cbe51e93826","observation_id":"b6f33f5e-a91f-43eb-bf00-ebe1f33466fe","resolution":{"observed_at":"2026-05-20T18:23:37.975912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"2c3a7a19-3bc4-4d14-af3a-77595093f02a","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:bd235ff4b1c7a5d6981d2a97bd5693e9d02eb00bd62f2409e6e81d307d89fbde","observation_id":"d306c783-74b9-4d74-b984-148207d0c29b","resolution":{"observed_at":"2026-05-20T18:23:37.988161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23102","last_updated":"2026-07-06T06:04:13Z","snapshot_observed_at":"2026-07-09T23:17:37.565833Z","submitted_at":"2025-06-29T06:08:55Z","title":"Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation","version":3},"cited_work":{"arxiv_id":"2506.23102","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23102","snapshot_observed_at":"2026-07-01T19:16:00.889327Z","title":"Medregion-ct: Region-focused multi- modal llm for comprehensive 3d ct report generation","venue":"eess.IV","work_id":"29a6580d-f75d-4ae1-b1cd-eb344fb5e105","year":2025},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"cited_paper":"/paper/2506.23102","citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:78dedd221b048b166b8b2a47d5a4d1053809187837f48f7773876ca7d7fbec6d","observation_id":"411752e3-67f6-455c-b08d-85f2b65a8edb","resolution":{"observed_at":"2026-07-01T01:17:10.160901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A comprehensive review of performance metrics for computer- aided detection systems","venue":null,"work_id":"c1ebcf75-9652-4815-b953-e2b5d5101b2d","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:cfe6ff3f090540bf393d3a456a42997a0db7c01a06f31b3c757ded2c4ee3fd16","observation_id":"8fd9d9ca-aac9-4b7c-96a1-47313bae96f2","resolution":{"observed_at":"2026-05-20T18:23:37.969379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ai-powered object detection in radiology: Current models, challenges, and future direction","venue":null,"work_id":"05cf7afa-e826-4095-bf4a-5fb874fb661f","year":2025},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:6c14810fcc32258cc197dfef5e77d0c527580717c46aece474ada983cc1513a5","observation_id":"506e80c4-a807-47ab-880b-70acf930ec4d","resolution":{"observed_at":"2026-05-20T18:23:38.000499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A systematic review of yolo-based object detection in medical imaging: Advances, challenges, and future direc- tions","venue":null,"work_id":"af9fa28d-ae98-4ae0-b7b0-38de2e9c4581","year":2025},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:a6c13d45453482ae4b86dedecd7410aeeb083165b997e64861d15b8ea6f2f7bb","observation_id":"042e339f-73b2-409f-a8a3-561beed6f8e7","resolution":{"observed_at":"2026-05-20T18:23:37.983826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Focal loss for dense object detection","venue":null,"work_id":"f6338c46-0c0c-4996-b90a-980ddd816214","year":2017},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:bbb6f4f5f19e38d9955d9abb3046be364dd547e8834d76153362f4e2ab5be250","observation_id":"3eb79dd3-86ab-4135-b23e-8bc1680867b1","resolution":{"observed_at":"2026-05-20T18:23:38.040478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retina u-net: Embarrassingly simple exploitation of segmentation supervision for medical object detection","venue":null,"work_id":"78953774-b91c-4bc7-8271-153a0ca78537","year":2020},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:c1a58080e8394c563ea99857f952bb7b9ee446d2f7e2c75114ddcb10dacd72e7","observation_id":"ee7633a4-0995-48b3-9c1b-a658f3e4ef0f","resolution":{"observed_at":"2026-05-20T18:23:38.020655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards a holistic framework for multimodal llm in 3d brain ct radiology report generation","venue":null,"work_id":"686cddae-50ac-4858-8755-6b67d4675bc5","year":2025},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:f1cc60b71a85338191d67919d60ef7a20096f33ca7f73cd927a7b96d67785cd3","observation_id":"48c1eb9a-7ced-40b7-813b-a519dfc7f4b3","resolution":{"observed_at":"2026-05-20T18:23:38.022818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automatic medical report generation based on deep learning: A state of the art survey","venue":null,"work_id":"8e2432c4-f61c-41f4-910b-77da55545688","year":2025},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:05f66bc414a054e721c121a4ee234ed1c6d4d03ea845824cceb669e8cdcfc2b9","observation_id":"083d9297-c569-4a4c-847c-2f9c6c62fc2a","resolution":{"observed_at":"2026-05-20T18:23:38.025242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.19213","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ai in proton therapy treatment planning: A review","venue":null,"work_id":"5036b3ad-03d4-4a80-ab6a-75f1efd8f323","year":2025},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:8bfe2579fa74c3faf56e34f154d753844db51ec48658b9d96ebffff341e29eda","observation_id":"75c7b145-702c-4cff-95c6-ff1423177ffc","resolution":{"observed_at":"2026-05-20T18:23:37.681869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Computer-extracted global radiomic features can predict the radiolo- gists’ first impression about the abnormality of a screening mammo- gram","venue":null,"work_id":"fe7cc5f2-af10-4621-9288-3ea7720928d4","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:f9db2bdc827e7ab7b52b716ef05af4713d8e9f6efcd9f1ffc8dec39733899a54","observation_id":"90d604bd-5aa6-49fb-ac44-45578603bfe8","resolution":{"observed_at":"2026-05-20T18:23:38.014295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual search in breast imaging","venue":null,"work_id":"22ebf62f-dead-4fdb-af72-db35668aec87","year":2019},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:9f87e8505509868000d9ed708d2f3c90edf282bd78150481961a874de393fb03","observation_id":"52a26682-43e5-4b78-9133-c63ade713f58","resolution":{"observed_at":"2026-05-20T18:23:38.004082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Re- liability of radiologists’ first impression when interpreting a screening mammogram","venue":null,"work_id":"1f0ba6a6-666b-4616-ad8b-5225da5afe67","year":2023},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:5c5693deb9d874b3f4601867c5fbcfa7946d76d0612c6e5f01faaf05aa2cd127","observation_id":"47c62ccc-361a-485f-874e-0a15335561ba","resolution":{"observed_at":"2026-05-20T18:23:38.046886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interpreting chest radiographs without visual search","venue":null,"work_id":"93b16840-fbda-42a9-ab22-216e7ea8ab3a","year":1975},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:6eb6151e259f8f7add2f8b5a51af9e6c328dc07bf126bf8194357293a5668479","observation_id":"bfcee155-14b6-4bca-aa0c-b1edd47d973f","resolution":{"observed_at":"2026-05-20T18:23:37.946926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Holistic component of image perception in mammogram interpretation: gaze- tracking study","venue":null,"work_id":"a817bf89-1889-41c4-93bb-4f21299f0c2a","year":2007},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:0d2e30bf7ca2bfcb059a1606bea380606090ae1ebbc0a798495810a83c57eaee","observation_id":"af8652b1-8dc0-410e-871a-ea554757e550","resolution":{"observed_at":"2026-05-20T18:23:38.006160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Miccai multi-atlas labeling beyond the cranial vault–workshop and challenge","venue":null,"work_id":"cf0d3e2f-bed0-4fbc-a523-ffd8b8f789b3","year":2015},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:85a07184c797ed4e35b092607e873d391ade5323bce89f9470e33a0a528accb1","observation_id":"bda29d03-e445-46df-9362-9ca261c3660d","resolution":{"observed_at":"2026-05-20T18:23:38.012325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.06465","last_updated":"2020-05-13T13:04:37Z","snapshot_observed_at":"2026-07-06T09:20:03.423467Z","submitted_at":"2020-05-13T13:04:37Z","title":"MosMedData: Chest CT Scans With COVID-19 Related Findings Dataset","version":1},"cited_work":{"arxiv_id":"2005.06465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.06465","snapshot_observed_at":"2026-07-03T20:28:55.443271Z","title":"arXiv preprint arXiv:2005.06465 (2020)","venue":null,"work_id":"d0d9b224-bd07-41e8-86d8-464d19c2dbc0","year":2005},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"cited_paper":"/paper/2005.06465","citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:42348a3e01889fcd1d568b729dd961aa7f29151dc35f9000f622c5ca4dd50149","observation_id":"209fc70b-6edf-46be-8787-038f7a0beeac","resolution":{"observed_at":"2026-05-20T18:23:37.686143Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A comparison of pre-trained vision- and-language models for multimodal representation learning across medical images and reports","venue":null,"work_id":"410463a9-097c-4924-9e63-477459b52292","year":1999},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:e23253abcf234873c9669448f5c3feac4325bf722d2c233108acfc1141a182f5","observation_id":"477e8e5d-5704-467f-bd1f-dd0239c5a838","resolution":{"observed_at":"2026-05-20T18:23:38.018704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12195","last_updated":"2024-11-19T03:27:05Z","snapshot_observed_at":"2026-07-06T19:52:20.541067Z","submitted_at":"2024-11-19T03:27:05Z","title":"A Survey of Medical Vision-and-Language Applications and Their Techniques","version":1},"cited_work":{"arxiv_id":"2411.12195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.12195","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of medical vision-and-language applications and their techniques","venue":null,"work_id":"41cc5877-d221-4d86-b228-a466fe9c56e4","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"cited_paper":"/paper/2411.12195","citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:76db8a05332679584d7fe0c77c85bf2130bd2101e47022d9069fef30d560bc78","observation_id":"dee38c91-f420-42e6-b9ec-a603ac3c224c","resolution":{"observed_at":"2026-05-20T18:23:37.665916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridging the pathology domain gap: Efficiently adapting clip for pathology image analysis with limited labeled data","venue":null,"work_id":"9ce2840b-476a-4332-a6f4-edf89ce53673","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:e00258e5690c69114bc06545c3bd8655d31cc5df2cd5007a275271d2db80a8e0","observation_id":"0e271516-51b5-4932-8227-fd5551a02f08","resolution":{"observed_at":"2026-05-20T18:23:38.042527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Medi- clip: Adapting clip for few-shot medical image anomaly detection","venue":null,"work_id":"594f2cc6-d46d-43bd-8028-f617e36b8470","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:8e3b6aed1e4403ce51e94f73ed00378b1a3d386163b246cb17e3d3e2a32ab76a","observation_id":"fb11ad3c-df6a-41c1-a086-87315f068d10","resolution":{"observed_at":"2026-05-20T18:23:38.027147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip-driven universal model for organ segmentation and tumor detection","venue":null,"work_id":"c203c364-b991-4fc6-942e-11ee8d875342","year":2023},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:3bf8f81097e1b7745572e838af5277631aa9072820e16bc5e63c1b2bd68b57f1","observation_id":"d4f61ef6-531e-465c-b163-d4d48b5c0dd8","resolution":{"observed_at":"2026-05-20T18:23:38.035346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Medclip-sam: Bridging text and image towards universal medical image segmentation","venue":null,"work_id":"d9f7569d-5969-4a9d-8481-e2caadd61dac","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:61de9a7c5b7171fe99b4115f21de795238e6c70f4cd1a3e8905a7f9ef6aa4527","observation_id":"6db47c24-0692-4ab0-b836-02c1e53b55c3","resolution":{"observed_at":"2026-05-20T18:23:37.990251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cp-clip: Core-periphery feature alignment clip for zero-shot medical image analysis","venue":null,"work_id":"42453cbf-29c4-4980-8934-80b4f054353e","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:e8aaa56d89702039fc0d2546108bed3db2108b3d9f989b89d4fff4db7a38b021","observation_id":"5d6ad924-c316-468c-bdc1-dce6d9c317a8","resolution":{"observed_at":"2026-05-20T18:23:38.033274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Causalclipseg: Unlocking clip’s potential in referring medical image segmentation with causal intervention","venue":null,"work_id":"012f88d0-0c08-480c-9968-133deaa360de","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:08ae395424e1b8c93cff086cd6aec29ffefb2fadf5c0771320e2d5e5b533860f","observation_id":"26367381-2345-4e01-9f8e-846020158aa9","resolution":{"observed_at":"2026-05-20T18:23:38.038658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T08:47:02.454321Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"336ecd50-6d81-4575-8053-d0a1850d9043","year":2021},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:b9f94fd2a47e9f9e5f24e00f7596526c81328f17069077120be5dcea1e9a6136","observation_id":"da6c14eb-7aeb-4c47-8ac5-4ab18423b4e1","resolution":{"observed_at":"2026-05-20T18:23:38.016194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Align before fuse: Vision and language representation learning with momentum distillation","venue":null,"work_id":"ec145f3f-9103-401b-ba95-67504228526b","year":2021},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:229bc975bdc0e8f27210ecf3003ac1918e001582b0abc1c70962f1c8b77cc257","observation_id":"ffdd7125-7339-4f2a-a604-08c6d61f6018","resolution":{"observed_at":"2026-05-20T18:23:38.002301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mm- llms: Recent advances in multimodal large language models","venue":null,"work_id":"04a6fce6-d9b8-4a7f-9ad5-24f4ec7e0bc9","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:56852eadd585a892fa3c0e06220c1a71e8ecba46b5f910037dbda54938eb1969","observation_id":"74835a6c-0dbb-4b7a-8f1e-5df12c7f75af","resolution":{"observed_at":"2026-05-20T18:23:38.029371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gsva: Generalized segmentation via multimodal large language models","venue":null,"work_id":"dfcd797d-5bda-40c3-aeea-25df055e8970","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:f62267f4dfaab397ae01ffa2aa6cb79993cd4e820b797f90ca2849085c198cbd","observation_id":"093a6bb6-2bc5-4321-8d54-a68a5e6a10fb","resolution":{"observed_at":"2026-05-20T18:23:38.008102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:bce15c16239392db210ad851a47c9e354d215e08cc3e791a159901f1a586e01c","observation_id":"e7fe8012-2a0e-49c1-a754-0a91c54f80b6","resolution":{"observed_at":"2026-05-20T18:23:37.671578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segment anything","venue":null,"work_id":"6686ee2e-22b8-47ec-8a07-2458e35a2350","year":2023},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:05325f251e80874bc34c61adae97fc426072ad365e0ef58bab2682ee7e033841","observation_id":"8caa7d05-7ba3-453c-8269-5193e1074f32","resolution":{"observed_at":"2026-05-20T18:23:37.935536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08394","last_updated":"2024-12-31T05:35:05Z","snapshot_observed_at":"2026-07-06T18:29:44.841845Z","submitted_at":"2024-06-12T16:44:50Z","title":"VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks","version":3},"cited_work":{"arxiv_id":"2406.08394","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08394","snapshot_observed_at":"2026-07-03T10:48:03.080928Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model","venue":null,"work_id":"9f5a686c-3950-4ee0-b961-85f882649e32","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"cited_paper":"/paper/2406.08394","citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:c78e15ef7d8eb7576bd37f38e3feee7464e4baec39e45e10ee152c4d98b86818","observation_id":"8eb46f7e-5f49-4aef-9311-4c5ae542773f","resolution":{"observed_at":"2026-05-20T18:23:37.692557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14470","last_updated":"2024-11-01T18:00:14Z","snapshot_observed_at":"2026-07-06T16:36:51.110530Z","submitted_at":"2023-10-23T00:54:41Z","title":"Regularized Stokeslet Surfaces","version":2},"cited_work":{"arxiv_id":"2310.14470","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.14470","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-med: Training a large multimodal model for medical visual question answering","venue":null,"work_id":"39f0c133-5c06-492b-bce3-452694c44546","year":2023},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"cited_paper":"/paper/2310.14470","citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:c0f83d87f0d5b85e3334e2ae9abce24fc6a8424d7645e4fe8d99f45cc69ee220","observation_id":"261357bf-bda1-418d-a56f-e2b9ecbac014","resolution":{"observed_at":"2026-05-20T18:23:37.675445Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09368","last_updated":"2024-03-20T17:36:35Z","snapshot_observed_at":"2026-07-06T17:30:08.206972Z","submitted_at":"2024-02-14T18:13:51Z","title":"Magic-Me: Identity-Specific Video Customized Diffusion","version":2},"cited_work":{"arxiv_id":"2402.09368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09368","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pmc-llava: Towards multimodal vision-language foundation models for biomedical ai","venue":null,"work_id":"914eee21-b87c-4b55-83d7-61feed235831","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"cited_paper":"/paper/2402.09368","citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:b4fa35a060bb73e7ddc11bdb3a1fed4bedc638b5545d7fbbaddec61bf71d6373","observation_id":"731488ef-65ad-4fbd-bcd0-e7c287d69dda","resolution":{"observed_at":"2026-05-20T18:23:37.695727Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mimo: A medical vision language model with visual referring multimodal input and pixel grounding multimodal out- put","venue":null,"work_id":"c92b932a-9230-4080-87fa-ca43b5a9949d","year":2025},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:dc5e938a35a4c304cd746e1d3e4844899bea9757d006b9884560d103d24217d2","observation_id":"3a91140d-dcf7-44fd-9f5c-29f0a24cb0e5","resolution":{"observed_at":"2026-05-20T18:23:37.986449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-07-06T17:53:35.219482Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.00578","doi":"10.48550/arxiv.2404.00578","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":null,"work_id":"7bc29714-95ad-4249-a8ca-eabb142c8078","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:6bd8779d940a2699e98f471c632e52c19d42c5e3374d4f9f2d4d0795d572ebff","observation_id":"9d3c9cbb-ecde-4fb4-a6df-a3eaeb18f26f","resolution":{"observed_at":"2026-05-20T18:23:37.668034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ct2rep: Automated radiology report generation for 3d medical imaging","venue":null,"work_id":"7b0e6d94-d962-425c-b79b-d8194b8533a3","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:b1fba26f68ba0a851b46030246a6b747632e708bc9106c2ee6e259f9a30c7c0a","observation_id":"fe690395-08d1-4053-8aeb-e9c1045f7b77","resolution":{"observed_at":"2026-05-20T18:23:37.991279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Artificial intelligence in radiology","venue":null,"work_id":"9473c2a9-0c65-4e95-be2c-bf4e4ab812fe","year":2018},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:d9e86be9585d5491736eb6ca289019677052c112b4f76ff759cba9a4f59d03f4","observation_id":"b8426ea3-5aa1-459c-a96b-1fea29030d61","resolution":{"observed_at":"2026-05-20T18:23:37.998192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Explainable ai in medical imaging: An overview for clinical practitioners–beyond saliency-based xai ap- proaches","venue":null,"work_id":"0af74292-2ae4-4599-bdfd-bacbab59c476","year":2023},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:da61d14bd65c8592690493fa785acf658a244155eb30720b3209dca6ca320220","observation_id":"70e588c7-6138-4efe-a4f9-cebdd4e19afb","resolution":{"observed_at":"2026-05-20T18:23:38.010426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vip-llava: Making large multimodal models understand 10 IEEE TRANSACTIONS ON MEDICAL IMAGING","venue":null,"work_id":"88f6d86a-695a-4d55-ac48-b8c70c7cd43a","year":2025},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:540b5da7eab7bac3942bba0dc29664d4175cb37a2899b25a17076b0e1489e358","observation_id":"fe703f78-ca86-4d17-8136-8f51ca587026","resolution":{"observed_at":"2026-05-20T18:23:37.993351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:7c8b966ac77a0e1c72a579955e945a560bac46b5b172c9f8725072b234390f8e","observation_id":"6d2089e9-74ca-4f76-801f-e0c3b3565e8e","resolution":{"observed_at":"2026-05-20T18:23:37.672397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"nnu-net: a self-configuring method for deep learning-based biomedical image segmentation","venue":null,"work_id":"f2331308-8228-4a18-8d90-5275451c7332","year":2021},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:ef44e95b92143a78171228392acd03ba87f9e37a8bea0af8cc0435d0bd2b7464","observation_id":"489a09f3-9bb5-482a-b6b4-de8ce2865161","resolution":{"observed_at":"2026-05-20T18:23:37.996357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.04306","last_updated":"2021-02-08T16:10:50Z","snapshot_observed_at":"2026-07-06T10:39:29.945712Z","submitted_at":"2021-02-08T16:10:50Z","title":"TransUNet: Transformers Make Strong Encoders for Medical Image Segmentation","version":1},"cited_work":{"arxiv_id":"2102.04306","doi":"10.48550/arxiv.2102.04306","metadata_source":"pith","pith_arxiv_id":"2102.04306","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"TransUNet: Transformers Make Strong Encoders for Medical Image Segmentation","venue":"cs.CV","work_id":"ffa2ac60-2755-4390-9f66-07815aa6cb27","year":2021},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"cited_paper":"/paper/2102.04306","citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:625d5297b17013fa9d886423a0655a7f00da51105cdd5b6e817d294a9bf567c3","observation_id":"1e9a05b5-c80a-4215-a502-258fd2b7694b","resolution":{"observed_at":"2026-05-20T18:23:37.674713Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-12T23:19:36.546402+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T23:19:36.546402+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Encoder- decoder with atrous separable convolution for semantic image segmen- tation","venue":null,"work_id":"7e7d88d2-ab7f-44bc-acc5-d2a85f8e4f71","year":2018},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:a02cd4c12eda109c74fe1bd911cace82d8efa46cd5d46e47c7a62b2459bed354","observation_id":"8aecdb90-a06c-46e6-9cef-8de1d3c1ee80","resolution":{"observed_at":"2026-05-20T18:23:38.044497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lvit: language meets vision transformer in medical image segmentation","venue":null,"work_id":"391e7a40-0948-48eb-9222-09f2457066c7","year":2023},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:2dbc971f34d3082291d94ed00a0c39733a6cc03ae78a2583cebd731ede080f18","observation_id":"ff999e08-2972-4866-a862-824fa952bac1","resolution":{"observed_at":"2026-05-20T18:23:37.989300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"nnde- tection: a self-configuring method for medical object detection","venue":null,"work_id":"3b8e4833-db77-44ab-87e2-f16ada4a0988","year":2021},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:ec17acdb37bef9318ea06e2c1b8fdca111e2d1eeab5da508ee17158f6b585583","observation_id":"e6b47e71-7297-4403-825d-97152b4ab2e5","resolution":{"observed_at":"2026-05-20T18:23:37.962830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end object detection with transformers","venue":null,"work_id":"25ced090-724f-4864-8a93-559acd3b7d69","year":2020},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:3d4096d09b3c3148895dd9bcd1a36aa79b2798ddc48914e1c7338f720a1827b0","observation_id":"56085f53-49af-4bac-a224-d192977d7915","resolution":{"observed_at":"2026-05-20T18:23:37.981293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cotr: Efficiently bridging cnn and transformer for 3d medical image segmentation","venue":null,"work_id":"0fb276e7-9870-4ef3-9308-8871a3da4f90","year":2021},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:6a88068abb28730a6e79aabee29a56ea6c0bed4b174d8a1dd4519c5a3ba4a707","observation_id":"2b740a75-161b-49c1-8247-5d406be98206","resolution":{"observed_at":"2026-05-20T18:23:37.966299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.03201","last_updated":"2022-02-04T06:53:37Z","snapshot_observed_at":"2026-07-06T11:45:21.701110Z","submitted_at":"2021-09-07T17:08:24Z","title":"nnFormer: Interleaved Transformer for Volumetric Segmentation","version":6},"cited_work":{"arxiv_id":"2109.03201","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.03201","snapshot_observed_at":"2026-07-04T12:49:52.262722Z","title":"nnformer: Interleaved transformer for volumetric segmentation","venue":null,"work_id":"989e6cbb-7571-47ce-984a-67ca0c2f9d97","year":2021},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"cited_paper":"/paper/2109.03201","citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:2c5447bd8b50327b94c4698c73e242f5e29e4fd8b1414b498f2ce904219ee806","observation_id":"b2528234-ff8e-4086-a59c-3de3825d6724","resolution":{"observed_at":"2026-05-20T18:23:37.682200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unetr: Transformers for 3d medical image segmentation","venue":null,"work_id":"81c824f0-4e4e-4ab7-8d65-4657031a057f","year":2022},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:b15dc277098fb0495d5106978ea1d929fd24dd8e333076b086088c28a1d464cd","observation_id":"94ce57df-aca4-47ae-9755-7ae6cc89f539","resolution":{"observed_at":"2026-05-20T18:23:37.973465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Swinunetr-v2: Stronger swin transformers with stagewise convolu- tions for 3d medical image segmentation","venue":null,"work_id":"8055c1ea-3bdf-4881-b11e-e4da9e0e11c9","year":2023},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:4104cdf5c833c3061d7197f5044a7f870bdbbb190c7aa40e359fa47486a0bdb9","observation_id":"9e75fc8e-3af8-4783-8467-38979a407462","resolution":{"observed_at":"2026-05-20T18:23:37.952895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Contrastive learning of medical visual representations from paired images and text","venue":null,"work_id":"ada61877-6bc6-45aa-885c-cfffedcf8f58","year":2022},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:6f658614fc1ea848f5b192167ae592c6cdfc5470fd901957793dd0b3188f2115","observation_id":"19b2e8f8-a434-4d9d-b22c-859924d6a398","resolution":{"observed_at":"2026-05-20T18:23:37.955326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tganet: Text-guided attention for improved polyp segmentation","venue":null,"work_id":"1581bbcb-bd43-47c7-a952-df2a4c3787eb","year":2022},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:a01280738584924400122d26ccb25171c0fa017c6e936917a9b5011f97c61ed6","observation_id":"886b5920-c65b-4158-b2a7-cd43283d2052","resolution":{"observed_at":"2026-05-20T18:23:37.957496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gloria: A multimodal global-local representation learning framework for label- efficient medical image recognition","venue":null,"work_id":"8208639a-6c5d-435a-83d8-1d47e92cac81","year":2021},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:43cbbbdb216588f0ddebf7bd92f34b467ba7cd329d13b0988d7db5fa2844deb2","observation_id":"59241e38-7ca2-4047-8590-b8d6e98884de","resolution":{"observed_at":"2026-05-20T18:23:37.958771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision","venue":null,"work_id":"2a52695d-8777-43c7-9271-da20888ff302","year":2021},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:61b62d9bd004aaa8dfff83eb8c1d1dae6fdad6d31e55543fe8fdc17156e97e13","observation_id":"0676fb6d-1151-4319-8d00-62abd167e798","resolution":{"observed_at":"2026-05-20T18:23:37.942950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lavt: Language-aware vision transformer for referring image segmentation","venue":null,"work_id":"7095151a-37a6-4685-997d-61cad33728da","year":2022},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:1ee95196bf0b23a5acb1433378d08bababd3d8e262103d7dd5d587f6db2abb79","observation_id":"184cf932-976d-41b4-b50b-7c6c160896cc","resolution":{"observed_at":"2026-05-20T18:23:37.979164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":"2501.17811","doi":"10.48550/arxiv.2501.17811","metadata_source":"pith","pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","venue":"cs.AI","work_id":"67d9e391-26d1-459e-ab56-07e60511c886","year":2025},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:b81686976b37316947e259a19a922db1e30ca706be0cfa270665f58cc9686218","observation_id":"dae18cae-298c-4a18-882b-1454e6caa6f1","resolution":{"observed_at":"2026-05-20T18:23:37.689209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T01:17:45.013705Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:447fd2a2708791acb8ff884e760da9228163d782b201e33c504521d50af1c2f0","observation_id":"0d41a98e-c220-476d-a7c4-9a44b9a8358d","resolution":{"observed_at":"2026-05-20T18:23:37.662513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visionreasoner: Unifying vision-language reasoning and perception tasks with large multimodal models","venue":null,"work_id":"969f04d4-ca38-4f34-8628-71c31e2961b4","year":2024},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:0c6191397042a9359d7c0f8f8076096125be4de71e22d8e68aacd7880a3b0545","observation_id":"7c3a7024-6501-48dd-b01b-bdba9bb799ef","resolution":{"observed_at":"2026-05-20T18:23:38.031484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":13,"verified_fuzzy":46},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2605.15997."}