{"as_of":"2026-08-07T02:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5409b893c9a0245fb67277e6c43cb98e9af94072bf9a2a108fdf75911fe146a4","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T05:50:40.056376Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.18134/citation-record","integrity":"/paper/2604.18134/integrity","json":"/paper/2604.18134/citation-record.json","paper":"/paper/2604.18134"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning.arXiv","venue":null,"work_id":"0fe7312d-32b1-48ff-ac93-40ae1ce0b922","year":2025},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:59478eb0228900e2e064df701528cbb72dfa946cb02ce55567645662115d893b","observation_id":"b7f0d21a-f965-4b5e-b9e3-83b9bf4d7c4c","resolution":{"observed_at":"2026-05-21T18:45:29.186477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EndoViT: pretraining vision transformers on a large collection of endoscopic images.International Journal of Computer Assisted Radiology and Surgery, 19(6): 1085–1091","venue":null,"work_id":"e4c6106d-1ede-4d46-9d19-3d82c5a6ce37","year":2024},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:f7a3364588b90bc4fd96a0248bd8da8b38e01b01bf968c8b01bbe057072a606d","observation_id":"eb9d6db4-31ee-4116-87ee-1b18518ada9f","resolution":{"observed_at":"2026-05-21T18:45:29.183631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised learning of visual features by contrasting cluster assignments","venue":null,"work_id":"6ecde9be-f8df-485c-ab6e-a6f3ae279101","year":2020},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:72ed776aae6a36a43ad900d8209d409731e018e36e95d542692a68d4be4923da","observation_id":"0eb4b824-f695-4f34-be9c-f24ead5cf0cc","resolution":{"observed_at":"2026-05-21T18:45:29.233533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emerg- ing Properties in Self-Supervised Vision Transformers","venue":null,"work_id":"8931a21c-a1bb-4363-a020-5e835921be7b","year":2021},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:9c3c56249cd476cfa270f9ae1f76058a5328563ae35a9075bce0cc53772ede8c","observation_id":"afc4ee06-ada0-4ec5-82f8-5d83b7684252","resolution":{"observed_at":"2026-05-21T18:45:29.209436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Garcia-Peraza-Herrera","venue":null,"work_id":"292f8825-15f6-47f0-a93a-702b4069a745","year":2025},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:4cbd4171d77160dc3434a4f7ac45fa17a64d43a9bc60ee884709b4107a8361bd","observation_id":"cf18a84f-5590-4f52-ad08-2f2e55c73f8f","resolution":{"observed_at":"2026-05-21T18:45:29.272388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Garcia-Peraza-Herrera","venue":null,"work_id":"5ba37570-e214-42e6-b5df-93864c5e9dbd","year":2025},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:cb050c159cc1c51446c86520dd677f7d0c5cfb434134d5902b2ae54c9c05ad1e","observation_id":"98f648b4-9f88-438a-afb1-1d12c9059e19","resolution":{"observed_at":"2026-05-21T18:45:29.196142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"3323792d-76c7-4cf7-a1b8-0e526e20f8cc","year":2020},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:d3972c3449851fc5d08a10c9027584873c4c2033f6271e7c383718f8e11b37dd","observation_id":"1913f95a-34ef-472a-98ed-548408ff9818","resolution":{"observed_at":"2026-05-21T18:45:29.265405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved Baselines with Momentum Contrastive Learning","venue":null,"work_id":"ba97caf6-80df-422c-baa3-b7b568ac2f31","year":2020},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:b2591764fe50f9c8a1173ed64eb02cad8157fe2780868807da4c2897abcdce12","observation_id":"cdea6b76-9097-40cc-9655-f6789d4baf5c","resolution":{"observed_at":"2026-05-21T18:45:29.211512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised Hyper- spectral Image Super-Resolution via Self-Supervised Modal- ity Decoupling.International Journal of Computer Vision","venue":null,"work_id":"de744abd-a4d6-4162-9333-877fdd805266","year":null},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:975eb8665935834e56d61c9d70f2a2c935ad65828d1e2ece57936b1d52c88104","observation_id":"7b8ec03c-6238-40ad-9d15-d0d170a67c93","resolution":{"observed_at":"2026-05-21T18:45:29.241496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multi- modal Reasoning.arXiv","venue":null,"work_id":"c7f47507-0581-4d82-bbbb-e4f49992281e","year":2025},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:f9087676569c3ebc96f9c408663de52552cb25db6810d0ea02992b732f0c593c","observation_id":"10e846fa-174d-495c-9980-26a6a734eb98","resolution":{"observed_at":"2026-05-21T18:45:29.199041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Domain-Specific Language Model Pre- training for Biomedical Natural Language Processing.ACM Trans","venue":null,"work_id":"1bbebc70-dc68-4633-9274-0f2470540a76","year":2021},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:abc3a64a97713fd18e6be947aa677f27f0555d0a5a8dc1e1d76b4b2eda82e453","observation_id":"de9d3590-c5ef-445b-b9d0-d58eb1df448b","resolution":{"observed_at":"2026-05-21T18:45:29.204622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked Autoencoders Are Scalable Vision Learners","venue":null,"work_id":"01ef8327-1526-4f52-8286-3640c72b65d6","year":2022},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:f58cbc019977d0f8f886a628f2e8f833d5b8a25e0100090490d047c061c0820a","observation_id":"ca5d9f0e-510f-411a-91a9-ab1a8c83b80e","resolution":{"observed_at":"2026-05-21T18:45:29.256536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:fc67da116f64e16ba11ccec95543f0d5869f89dc7bd32137fc958182e5aa883d","observation_id":"5f389e16-7219-4158-9638-4b73abb90d44","resolution":{"observed_at":"2026-05-10T05:51:09.750117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jaspers, Ronald L.P.D","venue":null,"work_id":"1fa351bc-431e-472f-9e46-059444a30f7f","year":2026},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:64e447ea5e72d7cc3aa4a41e2f154b217ac7ae759524e2cb8a348ff00c8aaa75","observation_id":"75433114-e759-4f05-8e9e-022c259bea0f","resolution":{"observed_at":"2026-05-21T18:45:29.193850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Survey of hallucination in natural language generation.ACM Comput","venue":null,"work_id":"2a1fd28f-5742-46eb-a667-fa7bd6aae7cc","year":2023},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:76ec35c89bab160a093d8f4f88a73ca81b64084fb5ddf44f9c7406ef6658f697","observation_id":"541c6cd0-6380-45a4-a418-d620049f2a6c","resolution":{"observed_at":"2026-05-21T18:45:29.274783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling Up Visual and Vision-Language Representa- tion Learning With Noisy Text Supervision","venue":null,"work_id":"72812dee-8e60-4561-9a4a-a32ca4f54998","year":2021},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:4e6ac3d01a414e068d5706d1e8885c872203ac5b70f9f84e677c72321bf8a09a","observation_id":"1709b0b8-b947-4de1-a619-c03d21ed31df","resolution":{"observed_at":"2026-05-21T18:45:29.244190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Align before Fuse: Vision and Language Representation Learning with Momentum Distillation","venue":null,"work_id":"102f1e50-865c-4907-aaab-8ab396a4e064","year":2021},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:53d5df34fef0d853f257fd29286ef5c130c4c1003f19d33398e1406a93c9622a","observation_id":"877cf544-f528-4deb-969a-afb16d7894fe","resolution":{"observed_at":"2026-05-21T18:45:29.201763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Uni- fied Vision-Language Understanding and Generation","venue":null,"work_id":"d6cf79a3-7859-4033-a5f9-18c2b0b4089b","year":2022},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:49c2757a06b00e51ba539b6dd64b2edde9e3f1cbb780cd2698f3e627fc95f241","observation_id":"e91a39ef-05a4-4d88-961c-4c261e2c9181","resolution":{"observed_at":"2026-05-21T18:45:29.219075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meireles, Guy Rosman, Maria S","venue":null,"work_id":"4dc09d2d-82c8-4ce3-8c3d-468fe5df9ae7","year":2021},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:1d5144c74b1310890a1b01508a0234eaa566c9f5cf864e8e0b0447cb99a891af","observation_id":"1ef1d810-821d-4cae-9a1e-cffa32104835","resolution":{"observed_at":"2026-05-21T18:45:29.251834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A systematic review of annotation for surgical pro- cess model analysis in minimally invasive surgery based on video.Surgical Endoscopy, 37(6):4298–4314","venue":null,"work_id":"1ff5dbb4-2811-4317-8d85-fa246faa0a81","year":2023},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:dd552d524ab679b1673d034d113ae33e239cb6cfa22c6eed8d5d0223c7dc9e86","observation_id":"7d5f0969-218d-4291-aee5-2e24498482fb","resolution":{"observed_at":"2026-05-21T18:45:29.228556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sur- gLaVi: Large-scale hierarchical dataset for surgical vision- language representation learning.Medical Image Analysis, 110:103982","venue":null,"work_id":"e4f78fde-2877-46a0-bf16-72440becdb67","year":2026},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:c72598886397f1e864d72c82e0c0e85682b1cfee139deb3ccb0fcad632445878","observation_id":"b0186eec-df22-4b63-a242-42dfac215d3b","resolution":{"observed_at":"2026-05-21T18:45:29.262050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":null,"work_id":"844d1afb-f103-46fd-9bc2-516da9478132","year":2021},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:f2217a3ed50dd331f0a08f60f240238cbf22c1ac27f5be55009913911eec1a2f","observation_id":"9db65e0d-a197-4d60-aaa2-32acba388688","resolution":{"observed_at":"2026-05-21T18:45:29.249738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LAION-5B: an open large-scale dataset for training next generation image-text models","venue":null,"work_id":"9e98d85d-0285-40cf-9739-9aa66c742591","year":2022},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:f55e9f53e568e3427e967b5bfbdb042a41c4ebe94ce74088354601584f9a3826","observation_id":"7d43969e-6a10-416c-87aa-771ded0e530d","resolution":{"observed_at":"2026-05-21T18:45:29.247180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptual Captions: A Cleaned, Hypernymed, Im- age Alt-text Dataset For Automatic Image Captioning","venue":null,"work_id":"515070bb-c4fd-42f4-a3c2-43964d3d425c","year":2018},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:9709f0d6c63f35a87bdaa690a0419468314c03ad7100ecc453629f0e50365646","observation_id":"603281e6-f751-49f3-a645-cea8b99297b8","resolution":{"observed_at":"2026-05-21T18:45:29.276964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transnet v2: An effective deep network architecture for fast shot transition detection","venue":null,"work_id":"632c74a1-fdc8-462e-a144-0136af1beb01","year":2024},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:e52a471f4d1294ec43590dbc8f059dff3958dc5c9d38b04d16689d935ad5a6a2","observation_id":"319c6820-bd52-47ca-83bd-a1f29179d3b3","resolution":{"observed_at":"2026-05-21T18:45:29.230809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Regionaligner: Bridging ego-exo views for object correspondence via unified text- visual learning","venue":null,"work_id":"608e434b-dea5-40e6-a2bc-0cbf5e207439","year":2026},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:a7a34da05c58917401698fc3c07d263170500ef9ac26f0d2282a3ad918247e2d","observation_id":"36fa8543-bfbc-4e94-99d1-fa2f4b472c73","resolution":{"observed_at":"2026-05-21T18:45:29.190558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.06581","last_updated":"2026-04-08T16:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-06T22:27:59Z","title":"MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding","version":4},"cited_work":{"arxiv_id":"2512.06581","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.06581","snapshot_observed_at":"2026-06-29T23:24:01.724884Z","title":"MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding","venue":"cs.CV","work_id":"369e9872-9603-4303-9d0e-579ce2204120","year":2025},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"cited_paper":"/paper/2512.06581","citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:a0d387803f191b27afca8a90877ff52ddd5bbf0d6bba1b8d5076963c4015d974","observation_id":"4068f84f-b9fc-4e44-88fd-4cf6e9ced7f3","resolution":{"observed_at":"2026-05-10T05:51:09.755366Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parwani, and Muhammad Khalid Khan Niazi","venue":null,"work_id":"a57f9792-d59b-4b0c-98e1-e7ca3dc01e46","year":2025},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:3e9e3abe01d0d7c844fb6b1626a4dc4eb9cad885d20544536e99ab096b1f3d10","observation_id":"59998f53-caed-4f4c-b7be-3a9d1b319120","resolution":{"observed_at":"2026-05-21T18:45:29.216558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:f98dc42f67a72c7dd0aa6d1e043f3679394a1fcc2f74ccba693078232d05655c","observation_id":"325258b3-530d-4aa5-9970-d94ae1cc2704","resolution":{"observed_at":"2026-05-10T05:51:09.752692Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Twinanda, Sherif Shehata, Didier Mutter, Jacques Marescaux, Michel de Mathelin, and Nicolas Padoy","venue":null,"work_id":"a85b83c0-e594-4cbd-84bc-22095eea5c4d","year":2017},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:11792d4a4bd1c937f3dd961e7e676132053a88c8983c1369e9ac8ae713ded7dc","observation_id":"24c125e9-5c23-4de8-8e5e-81558f2b61e6","resolution":{"observed_at":"2026-05-21T18:45:29.226019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:58fb8522529bf4815f32ee96492dc38c6d298a6d02ccea62dac7e4c0fa66e54d","observation_id":"829e8f0e-8067-4477-a914-25a1a60b455b","resolution":{"observed_at":"2026-05-10T05:51:09.758046Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking","venue":null,"work_id":"4274bb83-1097-4ac9-8bb6-9d9198b3cd42","year":2023},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:3e55d8f471ff59cffbb105cb165dd4d83bfa7d0f9a071e9d27d68517b330afe0","observation_id":"660ab2d5-d2f8-4f9e-ba7c-e6735183a1f4","resolution":{"observed_at":"2026-05-21T18:45:29.238699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AutoLaparo: A New Dataset of Integrated Multi-tasks for Image-guided Sur- gical Automation in Laparoscopic Hysterectomy","venue":null,"work_id":"ea4f996e-905a-4c13-8f99-d28f051638ac","year":2022},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:eca9297e486b32f8993ca58ac250c07afca3d0446a1d032ead4c4c99c62b897f","observation_id":"eea168c9-3f95-48e0-97d6-6d33d8b2000a","resolution":{"observed_at":"2026-05-21T18:45:29.267802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Foun- dation Model for Endoscopy Video Analysis via Large-Scale Self-supervised Pre-train","venue":null,"work_id":"9d92ea0b-7fbb-4b5a-bd8c-59a16ddfa4a7","year":2023},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:7281529d8f8b3471aac5b4034abe9d94d24407bdfea02773e0797036b1f47bf8","observation_id":"8939082c-6987-4233-9051-eb36b0592c0f","resolution":{"observed_at":"2026-05-21T18:45:29.206854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Challenges in surgical video annotation.Computer Assisted Surgery, 26 (1):58–68","venue":null,"work_id":"5c9e4b4a-e6c8-4f9c-a130-79e6675bfdf8","year":2021},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:801e4884be6570a53381666e51c0a21619e21875420e0903591848285ff5bef1","observation_id":"0825d2ff-0285-4f72-99d7-c4977d647622","resolution":{"observed_at":"2026-05-21T18:45:29.254297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models.arXiv","venue":null,"work_id":"c9704a5f-b915-44a1-bd66-b03fb6f9fe91","year":2026},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:a9e3a181545caceb5cab2ebe941dd4eb10ea688773004afaf5a67adeb24c6cab","observation_id":"1da81fec-5a34-4430-9f55-129142904ef9","resolution":{"observed_at":"2026-05-21T18:45:29.221464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lavanchy, Jacques Marescaux, Pietro Mascagni, Nassir Navab, and Nicolas Padoy","venue":null,"work_id":"781cf321-02fa-4dd6-8f17-09be513bcfe3","year":2025},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:e892c29f4c0bed5a5f60be3eec15cca3e1e645f2d17a498922ea9df8b2770f2b","observation_id":"540dac1e-036a-4dff-8805-34781650609b","resolution":{"observed_at":"2026-05-21T18:45:29.223914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring.arXiv","venue":null,"work_id":"c279de19-9d78-4be4-960b-036ddbdd9d16","year":null},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:c01799089a51c891dfc3a279d951b20d35aea48e4f53982d44520f386f1f6949","observation_id":"4a04d59e-b710-4640-b6d5-c4f35d4e4ced","resolution":{"observed_at":"2026-05-21T18:45:29.259586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Not All Errors Are Created Equal: ASCoT Addresses Late-Stage Fragility in Efficient LLM Reasoning.arXiv","venue":null,"work_id":"7679a269-aed1-40aa-a8b4-d46d2a91934f","year":2026},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:7dd35ec05ee7ea273178b287d72fbda4006d5a962f9f702eb4961877fd592ce8","observation_id":"56f9caa7-f108-49cd-929f-e279ab4fd2c3","resolution":{"observed_at":"2026-05-21T18:45:29.236073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"iBOT: Image BERT Pre- Training with Online Tokenizer.International Conference on Learning Representations (ICLR)","venue":null,"work_id":"1fb6be00-c05d-45ba-967b-887a3259527c","year":2022},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:5efabd07865d0d625387dd7d76db6932592e21ba6ca153db3bd5698103cc4bb5","observation_id":"5f773138-3c4f-4f06-b07b-8a3d22f8aa1b","resolution":{"observed_at":"2026-05-21T18:45:29.270347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can we trust AI doctors? a survey of medical hallucination in large language and large vision- language models","venue":null,"work_id":"42641d2c-e653-45ca-af49-88f063121d32","year":2025},"citing_paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:40.056376Z"},"links":{"citing_paper":"/paper/2604.18134"},"observation_digest":"sha256:5b01c211f086a9805d64ab762334c7e9a44b9234ea8169619fd2d46b98331d1d","observation_id":"496ddb58-0d99-4c9a-8033-29bdae276a34","resolution":{"observed_at":"2026-05-21T18:45:29.214178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.18134","last_updated":"2026-05-03T19:50:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:01:51Z","title":"Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":4,"verified_fuzzy":37},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2604.18134."}