{"as_of":"2026-08-07T21:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cdffb57a49bf5dee265062b90652c28714719f50e7d14c58347c6de892c07e7a","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:52:37.501612Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T19:30:30.517564Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07106","snapshot_observed_at":"2026-08-03T19:30:30.517564Z","title":"arXiv preprint arXiv:2507.07106 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.00470","last_updated":"2026-06-01T03:04:59Z","snapshot_observed_at":"2026-08-07T03:33:17.596365Z","submitted_at":"2025-11-29T12:45:05Z","title":"LAP: Fast LAtent Diffusion Planner for Autonomous Driving","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T19:30:30.517564Z"},"links":{"cited_paper":"/paper/2507.07106","citing_paper":"/paper/2512.00470"},"observation_digest":"sha256:ca6f8f25c4eb214e0f33d3fceac236c94af2a3d714a98ac0d026efa4336755c8","observation_id":"92a96c14-d83f-43c4-b8d8-62cbd1f2168b","resolution":{"observed_at":"2026-08-03T19:30:30.517564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07106/citation-record","integrity":"/paper/2507.07106/integrity","json":"/paper/2507.07106/citation-record.json","paper":"/paper/2507.07106"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.204146Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms,","venue":null,"work_id":"dd938538-1890-4e21-973c-af8b0d6b5e16","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.474283Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:7e1d2f62aa4116e047188f50ddc19c297be83f1fdb8c76ea09284bfdbb714efa","observation_id":"e8b87fd0-240e-418d-b6cf-8ec87ed4eb41","resolution":{"observed_at":"2026-08-06T18:52:39.207480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.194077Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"23db079d-b713-4c49-9837-cbea41e496e9","year":2021},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.523702Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:7a3174b3100d39d4f3dfb9a6854a4e8e168bd68da56c925a2ee20f469e857022","observation_id":"a12d77e5-20f2-4573-90e9-81ca44e1ab33","resolution":{"observed_at":"2026-08-06T18:52:39.197431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06809","last_updated":"2025-03-31T21:53:36Z","snapshot_observed_at":"2026-07-06T19:13:24.690465Z","submitted_at":"2024-09-10T18:27:36Z","title":"DetailCLIP: Detail-Oriented CLIP for Fine-Grained Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06809","snapshot_observed_at":"2026-08-06T18:52:31.581690Z","title":"Detailclip: Detail-oriented clip for fine-grained tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.581690Z"},"links":{"cited_paper":"/paper/2409.06809","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:6c996cf67b5857c691488ecdf63bb1fa26faad2c1998a76365df2860226836d1","observation_id":"b602ef68-7beb-436a-b7af-92b84f6a69a2","resolution":{"observed_at":"2026-08-06T18:52:31.581690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.184072Z","title":"Is clip the main roadblock for fine-grained open-world perception?,","venue":null,"work_id":"56f4c8b1-9f41-4c63-8b89-9729cb19b6bd","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.646858Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:33b261b620457b461ddb69b21227cad42eaef6b1731261ac2838f0b845b8610a","observation_id":"b3734393-a69e-4769-a1e9-4e7e7c1d021c","resolution":{"observed_at":"2026-08-06T18:52:39.187174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10722","last_updated":"2024-04-24T23:10:17Z","snapshot_observed_at":"2026-08-07T12:10:53.099835Z","submitted_at":"2023-05-18T05:41:36Z","title":"Discffusion: Discriminative Diffusion Models as Few-shot Vision and Language Learners","version":3},"cited_work":{"arxiv_id":"2305.10722","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.10722","snapshot_observed_at":"2026-08-06T18:52:38.138566Z","title":"Discffusion: Discriminative Diffusion Models as Few-shot Vision and Language Learners","venue":"cs.CV","work_id":"8ba75875-2d50-4808-9ee6-29a17ad7620b","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.697090Z"},"links":{"cited_paper":"/paper/2305.10722","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:2fcc2fc2a107e201eed6df7548a8dc87577fe30f42b5992188283a328d896d0a","observation_id":"625bdc2b-6844-4ae1-ac8f-0e68ed309af3","resolution":{"observed_at":"2026-08-06T18:52:38.207894Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07204","last_updated":"2024-04-10T17:59:45Z","snapshot_observed_at":"2026-07-06T17:58:25.894552Z","submitted_at":"2024-04-10T17:59:45Z","title":"BRAVE: Broadening the visual encoding of vision-language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07204","snapshot_observed_at":"2026-08-06T18:52:31.767820Z","title":"Brave: Broadening the visual encoding of vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.767820Z"},"links":{"cited_paper":"/paper/2404.07204","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:39060ac8b6ee9bd4ecdbc67c935b5656fc5ab4a51ee88596f4bbb596d882622a","observation_id":"bf309773-992a-4ce3-a6c3-4332c53bc974","resolution":{"observed_at":"2026-08-06T18:52:31.767820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-06T18:52:31.825326Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.825326Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:551288773829d908278a823860284469ff0f7dc3d9f5ada42b5bd06a9650e441","observation_id":"67cf8678-d817-4b9f-bb5c-00e6edf6170c","resolution":{"observed_at":"2026-08-06T18:52:31.825326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-06T19:26:27.412366Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-06T18:52:31.897432Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.897432Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:5fea67f92b548e9366b5ef0e3d299efbea99f1c3c75a996352b016b9991975e3","observation_id":"ea4cd2ef-2034-4a1b-8b7a-f9b908f0b8ea","resolution":{"observed_at":"2026-08-06T18:52:31.897432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.173034Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models,","venue":null,"work_id":"262bd918-21d8-4389-9fcd-91c16a03d312","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.974928Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:56da89c3a22da43588669b9621c0cd7bf8595e106b542e31c5425965fae6fe1b","observation_id":"a6fd8af5-b0b1-4324-8852-e6e4af2443fc","resolution":{"observed_at":"2026-08-06T18:52:39.176426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02506","last_updated":"2024-01-18T22:09:40Z","snapshot_observed_at":"2026-08-06T04:09:30.056285Z","submitted_at":"2023-03-04T21:22:47Z","title":"Prismer: A Vision-Language Model with Multi-Task Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02506","snapshot_observed_at":"2026-08-06T18:52:32.060515Z","title":"Prismer: A vision-language model with multi-task experts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.060515Z"},"links":{"cited_paper":"/paper/2303.02506","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:8ee735390968e46bd26a1c93283d748ab6541ad6e6e1faa2e0bb2b3ca45454c6","observation_id":"e9b9b89d-4508-462d-80ed-2c3b2ab5c80e","resolution":{"observed_at":"2026-08-06T18:52:32.060515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.163255Z","title":"Vcoder: Versatile vision encoders for multimodal large language models,","venue":null,"work_id":"48234a14-a049-4848-86d0-ba655a6b8e90","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.175329Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:f3fbb17a2fa0b9decf75d01239fd9173bbcddc0286999399f9b4c53b372ced13","observation_id":"7cb52f24-dbbb-4ab1-81ec-a3d5c5cbafc0","resolution":{"observed_at":"2026-08-06T18:52:39.166549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.153345Z","title":"Question aware vision transformer for multimodal reasoning,","venue":null,"work_id":"c469e94e-4b7c-4a25-9b56-4ddd401f6c93","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.267593Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:e14e6c6c2b89f4ccb1ec16d19218e178bb36b0b7ae240fd3efc31715b409c151","observation_id":"b7103154-94f7-4435-bfa8-ac2c332fb38a","resolution":{"observed_at":"2026-08-06T18:52:39.156651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.142335Z","title":"Api: Attention prompting on image for large vision-language models,","venue":null,"work_id":"27b957c5-6e68-4d94-ac5b-8d2fc92a64c8","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.368424Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:7377e0662cd12f024a949fa35bfa94d0c87f411b8f48fd9fc2c430e7c6fc1345","observation_id":"7283de56-cd47-43d2-a110-a861513486d7","resolution":{"observed_at":"2026-08-06T18:52:39.146498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:32.475667Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.475667Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:20513408290e8c1426d31c78467462c80ca8e48f1971118485d459e38cec1cf9","observation_id":"cefb533f-5313-443f-b4f5-cca3a74cf1db","resolution":{"observed_at":"2026-08-06T18:52:32.475667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:32.491396Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.491396Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:980804b2e6e86b6578c886133a078c15d1ef2aa067845d4a3ee4e33679685f23","observation_id":"51279896-4373-4237-84bd-1fdf372892e6","resolution":{"observed_at":"2026-08-06T18:52:32.491396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:32.533667Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.533667Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:323b999013fdd7388594f04ad8ba30320f3c64b71c680657b80ae7103358d48d","observation_id":"df85e6de-4f47-4c97-afdc-2213358707fb","resolution":{"observed_at":"2026-08-06T18:52:32.533667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.112261Z","title":"Photorealistic text-to-image diffusion models with deep language understanding,","venue":null,"work_id":"cc9e66d5-aa2b-4d48-9cd8-ebfb5272a1af","year":2022},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.611237Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:615f4e0ac7799393a1088745a29a5bd8a7181e5d46f20bf647d2b39d152755d9","observation_id":"bbcd5294-5e78-4b1c-bd97-3c5db57e9a4a","resolution":{"observed_at":"2026-08-06T18:52:39.116420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:32.727639Z","title":"Hierarchical text-conditional image generation with clip latents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.727639Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:a48525312d7c18ad4f99992508932a7271eee4e7af832351816b28bc43d19f62","observation_id":"296a3972-4983-498b-ad94-39a6c8bc9d1a","resolution":{"observed_at":"2026-08-06T18:52:32.727639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.093276Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis,","venue":null,"work_id":"677af1e4-e940-425a-b12a-ec80c817f587","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.845664Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:f99c1c624fa63f4378d401368a989a94ca5ccf8b84ac6a0cb29c9cf1ea00139f","observation_id":"c0901327-ae10-4002-9c21-bba7c7ce2154","resolution":{"observed_at":"2026-08-06T18:52:39.097243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.083024Z","title":"Prompt-to-prompt image editing with cross attention control,","venue":null,"work_id":"d6740902-a9e6-4076-a5cf-e8d4a5c28b21","year":2022},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.958030Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:d70e3a2b55168313bfa24a1ccca6fb8306b347b3ad589f87cea7c618f254e213","observation_id":"55412a86-d16b-48bd-a6f9-528b92f8f1d8","resolution":{"observed_at":"2026-08-06T18:52:39.086788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.073739Z","title":"What the daam: Interpreting stable diffusion using cross attention,","venue":null,"work_id":"a256543a-b9c2-420d-9250-9cb12fc0ee4f","year":2022},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.072184Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:00cdae231283bf981077387a360db5d9cfbbef9fa3ba0fdc08d67227a88d4fb2","observation_id":"b99865be-9966-49d5-ae52-cd4fc760b7dc","resolution":{"observed_at":"2026-08-06T18:52:39.077053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.064357Z","title":"Towards understanding cross and self-attention in stable diffusion for text-guided image editing,","venue":null,"work_id":"1e71818c-bee6-4183-b526-6c02ad423466","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.171759Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:77a614239f5aa29f75749a915770480bf41c88afe824dd2c1f7323d9e9060551","observation_id":"5715627b-f108-4911-a7ea-6493cff780c5","resolution":{"observed_at":"2026-08-06T18:52:39.067728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.054419Z","title":"Plug-and-play diffusion features for text-driven image- to-image translation,","venue":null,"work_id":"fd1f4650-781f-4e5a-9a9f-dcfd253067d2","year":1921},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.269016Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:c1c3e1c93de24f3be0cf008c070a15a15dcefc4f2672b3a17d05b28493094ada","observation_id":"f68a552d-440a-4c04-83f3-8c6fe427aa1e","resolution":{"observed_at":"2026-08-06T18:52:39.058139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02773","last_updated":"2024-01-22T07:18:55Z","snapshot_observed_at":"2026-07-06T16:15:04.496291Z","submitted_at":"2023-09-06T06:31:08Z","title":"Diffusion Model is Secretly a Training-free Open Vocabulary Semantic Segmenter","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02773","snapshot_observed_at":"2026-08-06T18:52:33.421637Z","title":"Diffusion model is secretly a training-free open vocabulary semantic segmenter,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.421637Z"},"links":{"cited_paper":"/paper/2309.02773","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:dc3c18b2f6163547d1df5eec4b7ed4177cd25ad636af51e58c9f6f09fa68de8c","observation_id":"3de6ec26-b7fb-41ef-9c92-b1afb1298272","resolution":{"observed_at":"2026-08-06T18:52:33.421637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.044837Z","title":"Repurposing diffusion-based image generators for monocular depth estimation,","venue":null,"work_id":"4c20c52e-54ed-4ad7-853c-7866d8f1d129","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.537106Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:fa1338f351b1e5b882192cc30493474ebb5682d988ccb13b2b0938e9c8ec67a8","observation_id":"8e32935a-f2fa-4f14-879f-b4239b68da79","resolution":{"observed_at":"2026-08-06T18:52:39.048007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17921","last_updated":"2024-09-24T17:59:50Z","snapshot_observed_at":"2026-07-31T08:36:12.896702Z","submitted_at":"2023-11-29T18:59:59Z","title":"Do text-free diffusion models learn discriminative visual representations?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17921","snapshot_observed_at":"2026-08-06T18:52:33.646987Z","title":"Do text-free diffusion models learn discriminative visual representations?,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.646987Z"},"links":{"cited_paper":"/paper/2311.17921","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:bc1e289ea69ac949a0db352bd13bb2054386718b78d37b75f895e12d33874bd4","observation_id":"4c4dce4f-505e-4580-bd26-cbd6e386ba1f","resolution":{"observed_at":"2026-08-06T18:52:33.646987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.035268Z","title":"Deconstructing denoising diffusion models for self-supervised learning,","venue":null,"work_id":"13b75ba3-96eb-4420-bab2-f2b6c5f612c5","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.726982Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:b7affa7c7a1461a9060c35aae4192967d297ee3ecdd9cf1b681cc56addc65851","observation_id":"44a895a7-2e78-42cf-bce6-5f52c4eb49a3","resolution":{"observed_at":"2026-08-06T18:52:39.038820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.024503Z","title":"Coca: Contrastive captioners are image-text foundation models,","venue":null,"work_id":"4df33bce-f5fc-43bc-a697-9774477976ad","year":2022},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.824328Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:304128e03612a66e67b2931a4bc8923063ff09afa16dd01f49a0c70eca1f087f","observation_id":"98a009da-c65d-4f22-9c99-2857b6e2c9a8","resolution":{"observed_at":"2026-08-06T18:52:39.028681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.014213Z","title":"Multimodal few-shot learning with frozen language models,","venue":null,"work_id":"9bf96f03-0eee-4003-b9a6-257ec67a5881","year":2021},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.897344Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:e93f851453a9c47748607f7e85d6718f9cfb90a55f93c9957998530a8b475d8e","observation_id":"790d6f1e-5c0d-4a5c-9047-606095c7cbd9","resolution":{"observed_at":"2026-08-06T18:52:39.017462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.003859Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":"546ff14b-e2f5-4746-aca7-34b916773209","year":2022},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.976289Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:c0908c58083f018760c56883b01e13570c7bc32e683dac1190ff4fadf379ff4b","observation_id":"e5a0be6c-107b-4935-9338-c4a9398dd94c","resolution":{"observed_at":"2026-08-06T18:52:39.007156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.992950Z","title":"Visual instruction tuning,","venue":null,"work_id":"129d63f5-0f3d-4d03-8b59-a0b2c28ab1b3","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.146798Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:a1f50502b3219532a8020908392a03cf938e2a3e51de681f79f9ebe5ebefe46b","observation_id":"f20a7514-0702-4d53-ad7d-f58aaafc9dfa","resolution":{"observed_at":"2026-08-06T18:52:38.996235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T18:52:34.227206Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.227206Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:3b45b2d33923faa0a390a2050196a7188be7b3368abb500f67e76c82bb047690","observation_id":"d0517812-1c5b-4029-9d48-4d901626aca3","resolution":{"observed_at":"2026-08-06T18:52:34.227206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-06T18:52:34.315551Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.315551Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:6e22594d8166b7148ec0a8bd2f64c3f8f2a8feb872763ccfa01b57debbbe14f6","observation_id":"5cc71a27-f8e9-43c7-b0f5-e29d26238011","resolution":{"observed_at":"2026-08-06T18:52:34.315551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-06T18:52:34.409335Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.409335Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:bd35951ce8b460a4123f84b6e24471a2d0b0b73ff3e60abf219ec9c677845031","observation_id":"556d3ef5-1f4b-4c51-aee0-77d103f946d8","resolution":{"observed_at":"2026-08-06T18:52:34.409335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-06T18:52:34.500395Z","title":"Evaluating object hallucination in large vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.500395Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:8a12a9d489afc653851500247881958f38f2d53c046b91ecbbca5af5ae2e5f02","observation_id":"848a5aaa-b4e9-4115-82e6-decb4d529af6","resolution":{"observed_at":"2026-08-06T18:52:34.500395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.982781Z","title":"Multi-modal hallucination control by visual information grounding,","venue":null,"work_id":"585233db-3144-40f4-a06a-6fec6924cd00","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.591011Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:6b9f2eebdceab9c16efe98b182c3619798bcbbd445e714ec9abd4c1190ba9dcd","observation_id":"54725c8f-4675-4ac8-abfb-c2e9f1e25b01","resolution":{"observed_at":"2026-08-06T18:52:38.986332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.972714Z","title":"Detecting and preventing hallucinations in large vision language models,","venue":null,"work_id":"0655b186-ffb6-40e9-b983-14560d943484","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.723073Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:066f07ead6d5e8db704d539ba2ec56f3ba0d29a19f90997e23d89181e83df0c0","observation_id":"5f489965-c74f-4fb8-aa60-306084b23fae","resolution":{"observed_at":"2026-08-06T18:52:38.976233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-06T18:52:34.830166Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.830166Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:fc1ed24d90610dea3155b72fb2b4fd7f195e2abc38f560a2506191f74553ee8a","observation_id":"5b55157d-f698-4213-833c-1e1eefac95f1","resolution":{"observed_at":"2026-08-06T18:52:34.830166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01779","last_updated":"2024-03-28T22:27:12Z","snapshot_observed_at":"2026-08-07T20:31:41.793088Z","submitted_at":"2023-10-03T04:01:27Z","title":"HallE-Control: Controlling Object Hallucination in Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01779","snapshot_observed_at":"2026-08-06T18:52:34.896934Z","title":"Halle-switch: Rethinking and controlling object existence hallucinations in large vision language models for detailed caption,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.896934Z"},"links":{"cited_paper":"/paper/2310.01779","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:0c0a4e5070b2394811058bc4ca7c1cf16641289b1809ed2a98f11b08b827cb55","observation_id":"36fe1c95-1620-4561-a3cd-5e6037917e1a","resolution":{"observed_at":"2026-08-06T18:52:34.896934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-06T18:52:34.983806Z","title":"Aligning large multimodal models with factually augmented rlhf,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.983806Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:fcf4930fb367cd97212e083fa8c590fd0762bbbca58ca4c7ad47a6fcf8bd3d10","observation_id":"f9bcfcae-e0d3-4335-bc9a-5553952852ae","resolution":{"observed_at":"2026-08-06T18:52:34.983806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-06T18:52:35.095890Z","title":"Blink: Multimodal large language models can see but not perceive,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.095890Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:3bdc660fcb44ce34649eb70bf276dc06194c3c482bdfbe496e8f29e292871de2","observation_id":"ab5b5abd-9b09-4f0f-bccc-629838e11b29","resolution":{"observed_at":"2026-08-06T18:52:35.095890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:35.206253Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.206253Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:ce960fe94e82ba8d41d9c64b0f296e431824252d1f079eb31df7eb7604375184","observation_id":"201ad2db-d2af-4eb2-b99f-c19dc5e6cf4f","resolution":{"observed_at":"2026-08-06T18:52:35.206253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-06T18:52:35.255074Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.255074Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:2ba0b04e1649e7ee204b4f0b6d7b862775eb1e59f59f13571d8623df96c9ef8f","observation_id":"26b9cebe-850f-4bff-b75f-82e4460c81a5","resolution":{"observed_at":"2026-08-06T18:52:35.255074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:35.415756Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.415756Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:c9009bb26938a4ce2022a749bc9e2153dabc9e5b70f0a659f358c23810d6f6fd","observation_id":"1a775c40-908f-4be4-97fc-d183c552ff0e","resolution":{"observed_at":"2026-08-06T18:52:35.415756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.948392Z","title":"4m: Massively multimodal masked modeling,","venue":null,"work_id":"cf39b15c-fac8-47c7-af94-117a3c81c574","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.541595Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:b7212e6b171f12652e1702498f7b8872f674e82ab720658755d89a499699c73c","observation_id":"4aa7ebc1-2d2f-4923-9cc2-1c696551b0bf","resolution":{"observed_at":"2026-08-06T18:52:38.952048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09406","last_updated":"2024-06-14T14:43:26Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:42Z","title":"4M-21: An Any-to-Any Vision Model for Tens of Tasks and Modalities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09406","snapshot_observed_at":"2026-08-06T18:52:35.658391Z","title":"4m-21: An any-to-any vision model for tens of tasks and modalities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.658391Z"},"links":{"cited_paper":"/paper/2406.09406","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:d7a70ec322237fb6047d96b5e767042bf07ce8e9a925b4df7229d2f694fa2783","observation_id":"e08a5649-69ea-45a7-8806-6160ae111cfd","resolution":{"observed_at":"2026-08-06T18:52:35.658391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.938161Z","title":"Llava-plus: Learning to use tools for creating multimodal agents,","venue":null,"work_id":"84bd0605-1c6b-4e56-bc5f-4b8bcb57da9e","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.742782Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:c2652e9b467b52ead8afc2eab6a6de57ffe64af18fb6621096787a6be7b2129c","observation_id":"958be85f-58a5-495e-b952-93836b10ad0a","resolution":{"observed_at":"2026-08-06T18:52:38.941704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.928290Z","title":"Visual programming: Compositional visual reasoning without training,","venue":null,"work_id":"585b9a4d-ed8c-495f-aa99-4b3d0843ee1b","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.829893Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:249c5ecd903022785762ebde2afa1e5039c4a3a69588bbc5110dcf10ce200a3c","observation_id":"524a1413-4b8c-4d16-94c5-8e3364a96190","resolution":{"observed_at":"2026-08-06T18:52:38.931881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.917811Z","title":"Spatialbot: Precise spatial understanding with vision language models,","venue":null,"work_id":"351cb5e7-1011-4853-b4b1-883991fbaa48","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.917707Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:35e69a985917d6149c38b790dec9c30abec05f648f9b8b444cfd597bfb4070a0","observation_id":"cd605569-c973-412d-a5ba-9693f9cea517","resolution":{"observed_at":"2026-08-06T18:52:38.921200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.907906Z","title":"Your diffusion model is secretly a zero- shot classifier,","venue":null,"work_id":"c4671d48-694d-49e1-a01d-43e581178c07","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.983026Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:3b6587071ae7319f59d67bc2002700dd11762d5e2fb2c28bce6bc618bf1f6661","observation_id":"adba8552-2fb7-450e-9f5f-74e68331758f","resolution":{"observed_at":"2026-08-06T18:52:38.911539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08702","last_updated":"2023-07-17T17:59:40Z","snapshot_observed_at":"2026-07-06T15:54:58.589775Z","submitted_at":"2023-07-17T17:59:40Z","title":"Diffusion Models Beat GANs on Image Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08702","snapshot_observed_at":"2026-08-06T18:52:36.050247Z","title":"Diffusion models beat gans on image classification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.050247Z"},"links":{"cited_paper":"/paper/2307.08702","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:a6a30d91ab504687679df406a0aee74ad39d304a9d36c535d2b158b5a1111b29","observation_id":"6958a577-10b3-40c1-bfe4-a581be05c5bb","resolution":{"observed_at":"2026-08-06T18:52:36.050247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04803","last_updated":"2023-04-05T17:40:38Z","snapshot_observed_at":"2026-08-01T14:45:18.398017Z","submitted_at":"2023-03-08T18:58:26Z","title":"Open-Vocabulary Panoptic Segmentation with Text-to-Image Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04803","snapshot_observed_at":"2026-08-06T18:52:36.136857Z","title":"Open-V ocabulary Panoptic Segmentation with Text-to-Image Diffusion Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.136857Z"},"links":{"cited_paper":"/paper/2303.04803","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:f7019606058d5ffcd9171e27c6f95272892e0ff5f8ba45323ee29d50c9c375f1","observation_id":"396ca2fd-a5fa-4ad7-9dc9-4f33babf60e7","resolution":{"observed_at":"2026-08-06T18:52:36.136857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09316","last_updated":"2024-09-30T03:17:39Z","snapshot_observed_at":"2026-08-03T22:40:26.380236Z","submitted_at":"2023-06-15T17:51:28Z","title":"Diffusion Models for Open-Vocabulary Segmentation","version":2},"cited_work":{"arxiv_id":"2306.09316","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.09316","snapshot_observed_at":"2026-08-06T18:52:37.851206Z","title":"Diffusion Models for Open-Vocabulary Segmentation","venue":"cs.CV","work_id":"f31444fd-6bd3-42c8-971c-0081ae932bc6","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.201294Z"},"links":{"cited_paper":"/paper/2306.09316","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:5ec033b5f7bf9c996a2304edd8d2778480ec6b5da4a2654967336cf364cdba45","observation_id":"57b935b2-94bf-41df-af2b-48c18dd48d23","resolution":{"observed_at":"2026-08-06T18:52:37.892673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.897317Z","title":"Not all diffusion model activations have been evaluated as discriminative features,","venue":null,"work_id":"0bb9e5ee-41c8-430f-b63f-0d2c2a8b09f5","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.301593Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:6a395e7ca7f4287a2698e91a16a2408f007007ace297099de80279fd07cb446a","observation_id":"2801e47e-4379-472f-b257-71088ab13e4b","resolution":{"observed_at":"2026-08-06T18:52:38.901068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:36.377242Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.377242Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:93dca6844c03173b4f5431c4a259415e902fe191f28848f4beff00db8e94ee65","observation_id":"7d74e8ff-50e6-4bf4-b698-08dacdd59fbb","resolution":{"observed_at":"2026-08-06T18:52:36.377242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.880345Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":"caa70816-66eb-44ea-a92f-9122f86a5a19","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.434918Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:3dbf869ac5173f60361df63755ef16d38fe63bdff2f992352eae8ef7fcf3fb5e","observation_id":"00a9423d-718c-4cc2-8596-7644d85d2322","resolution":{"observed_at":"2026-08-06T18:52:38.883626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.870351Z","title":"Naturalbench: Evaluating vision-language models on natural adversarial samples,","venue":null,"work_id":"8f8572d8-5448-490a-adfa-94d0ec768c86","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.531122Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:31b663786681809a92f17ebd5fdd64823ed827046f56b0e4092ab01da8c9f2b3","observation_id":"3ea49173-02b8-4e6d-9f24-224ee2b21304","resolution":{"observed_at":"2026-08-06T18:52:38.873717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.860058Z","title":"Openclip,","venue":null,"work_id":"fd3347f2-3af8-4b72-b742-8344c5bbc0c5","year":2021},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.592231Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:47062143d8d6a80647eb3a97666effb8a9cfba59d05ca3701beab00e9b801595","observation_id":"2f3f7607-0885-427b-932b-be059f4fe581","resolution":{"observed_at":"2026-08-06T18:52:38.863477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.849831Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":"d6678f3c-87de-4b12-bbdc-1c7dc9c21312","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.661149Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:6f9d05e48c1b89f5be0897677e7a2f585169598397f378522531c299e0cdaa97","observation_id":"6ffaac83-c65c-4172-b043-419a46750ca0","resolution":{"observed_at":"2026-08-06T18:52:38.853467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.839862Z","title":"Data filtering networks,","venue":null,"work_id":"4c46ab39-5fd4-4f64-bf9c-e4e78255a5af","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.753898Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:4b585214b06c110479d4891f4b4b3bc09ab1a38b522d188bd529aa72a102fc76","observation_id":"7e2d64dd-5c70-499f-b96d-4a57f5104283","resolution":{"observed_at":"2026-08-06T18:52:38.843141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.830780Z","title":"Demystifying clip data,","venue":null,"work_id":"1de764f2-0c2c-4453-b238-14842303e23f","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.822538Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:060de17837fda8cb0f668c7bd1f0bdb007b8737bb6e8a7b04c4527da73d8c21d","observation_id":"298bcc47-91a2-48c3-a73b-f196b9054cd7","resolution":{"observed_at":"2026-08-06T18:52:38.833840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:36.885560Z","title":"Eva-clip: Improved training techniques for clip at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.885560Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:a668e016ed499ad5477bdee012967772f563337ab159564f459222d8e05237b6","observation_id":"f2e55f68-91ff-47ae-b704-e53d070df640","resolution":{"observed_at":"2026-08-06T18:52:36.885560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T18:52:36.954496Z","title":"Microsoft COCO captions: Data collection and evaluation server,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.954496Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:e2ebf8fdaf34d3fa774beb53bedfb91382a990777d5af6cff4fa979303fa462d","observation_id":"e10e12ee-90e0-4599-8d23-15f3ac9f1acf","resolution":{"observed_at":"2026-08-06T18:52:36.954496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.813429Z","title":"Accurate computation of the log-sum-exp and softmax functions,","venue":null,"work_id":"9be1fc6c-7640-4842-be7f-fb947a62ad0e","year":2019},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:37.033529Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:1fc04314a1f9e03e0484af138fd7f599b645b1c2cdef4b594b10332810bc903a","observation_id":"7d47a46a-4416-4d94-b899-9dc929b9eccc","resolution":{"observed_at":"2026-08-06T18:52:38.817386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.803002Z","title":"Winoground: Probing vision and language models for visio-linguistic compositionality,","venue":null,"work_id":"c41c8708-0137-429b-9098-854de9e8db05","year":2022},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:37.111149Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:2910863163c5587a623ecdd508b89bdab82124cbe873bc096b53bd6c191203d7","observation_id":"f2f69d76-9387-498b-b3cd-f189c898635f","resolution":{"observed_at":"2026-08-06T18:52:38.806943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.791337Z","title":"Similarity of neural network representations revisited,","venue":null,"work_id":"64eb0eb7-4d6c-4c2f-808a-a23c5e37172d","year":2019},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:37.189998Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:62e87dd3b2c54fa96bfc4bbecef3ea32029e1dd28879f78bbb8f9f3fd516dba7","observation_id":"e1eba4e4-6e52-40d7-b4ef-7a107f9ca734","resolution":{"observed_at":"2026-08-06T18:52:38.796071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:37.250094Z","title":"Cider: Consensus-based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:37.250094Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:9fe615f0b6ec9a263bd37084b11fa81dd94ec4da63e21094d43c926b233c0da7","observation_id":"a693805c-afd9-4fbe-825d-cd9103233a47","resolution":{"observed_at":"2026-08-06T18:52:37.250094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.627274Z","title":"Spice: Semantic propositional image caption evaluation,","venue":null,"work_id":"6b6941e9-5992-428f-ac5c-d4d5d4b7a41b","year":2016},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:37.333853Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:93ff5d190ab6ab36686c725fdfcfa62289fc32e9b551f11d6d56480938e16946","observation_id":"9c03cdc7-06dd-4d99-8b0c-27ce0bf0c6ab","resolution":{"observed_at":"2026-08-06T18:52:38.741941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6740.0020","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:37.691072Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"7d5847f3-688d-4cf4-89f4-804ba06849b4","year":2019},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:37.421346Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:c4f9407e1d69ce9231b0b157f6b3b969889a8cce64bb499add4f959ab208196a","observation_id":"95b8348a-10c1-416b-a666-9ee0fe2a9ff0","resolution":{"observed_at":"2026-08-06T18:52:37.725447Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.347335Z","title":"Frisbees","venue":null,"work_id":"75b81217-2f88-45b0-9522-cf6445b97860","year":null},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:37.501612Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:b75760f51ebc2deebfa8bd9dba7e499b5a0a7eb9d70c777f126791dfada49386","observation_id":"fdb9678a-2a92-4434-9134-38e0b3a60d74","resolution":{"observed_at":"2026-08-06T18:52:38.503754Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T04:41:53.313582Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":37},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 1 inbound Pith citation observation for arXiv:2507.07106."}