{"as_of":"2026-08-11T13:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a3d1cc320561b03abc54f6c6d53dbfd2d6bad3efe51fed69981b0164bf799007","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T02:51:39.142437Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:43:23.733753Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T11:43:28.407453Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"cited_work":{"arxiv_id":"2605.14448","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.14448","snapshot_observed_at":"2026-08-05T11:43:28.407453Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","venue":"cs.CV","work_id":"baee3ddf-d75d-4dc4-af36-d9804f066392","year":2026},"citing_paper":{"arxiv_id":"2608.03826","last_updated":"2026-08-04T15:36:17Z","snapshot_observed_at":"2026-08-09T17:07:39.724064Z","submitted_at":"2026-08-04T15:36:17Z","title":"Geo-Embed: Towards Unified Multimodal Embeddings for Urban Understanding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T11:43:23.733753Z"},"links":{"cited_paper":"/paper/2605.14448","citing_paper":"/paper/2608.03826"},"observation_digest":"sha256:f6b928186f89e666eb1b6c5da50daea764f3acfc559a35b80698978060ad4b9f","observation_id":"c1fef859-a397-4ace-b531-59308763c5da","resolution":{"observed_at":"2026-08-05T11:43:28.454660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.14448/citation-record","integrity":"/paper/2605.14448/integrity","json":"/paper/2605.14448/citation-record.json","paper":"/paper/2605.14448"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:1073959691332323b6f8f6f10ef62fa6e643c5ed13ebe51779c51accd38238bf","observation_id":"94adbe60-0729-4d73-8a99-83e7efbbafc4","resolution":{"observed_at":"2026-05-15T02:53:33.620043Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05961","last_updated":"2024-08-21T22:46:05Z","snapshot_observed_at":"2026-08-10T10:36:42.293144Z","submitted_at":"2024-04-09T02:51:05Z","title":"LLM2Vec: Large Language Models Are Secretly Powerful Text Encoders","version":2},"cited_work":{"arxiv_id":"2404.05961","doi":"10.48550/arxiv.2404.05961","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05961","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM2Vec: Large language models are secretly powerful text encoders","venue":"arXiv (Cornell University)","work_id":"156e1320-54cd-416f-af15-d9da54374957","year":2024},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"cited_paper":"/paper/2404.05961","citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:a300730ea43d435210b82dcb9ef26b71047d4157ec1dc2e9025d74be3899f79b","observation_id":"d3eb9b61-dd0a-413b-b66d-f29fe0365f3b","resolution":{"observed_at":"2026-05-15T02:53:33.616969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"75a0de0b-0e1f-4038-aad8-a85626ae5442","year":2024},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:c7aa8fbf4e35b2bfa0d30f3ef3fb4990fb418bcc18856a3672948dd1874aca26","observation_id":"42fd8a27-34c3-4abc-9e9a-53c10427595e","resolution":{"observed_at":"2026-05-15T03:59:48.298030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.05014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T13:48:21.005891Z","title":"arXiv preprint arXiv:2510.05014 , year=","venue":null,"work_id":"2a83d4ce-5ef7-4aac-bff2-d4fa50e611d9","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:fc1a0d111be0388623d8785c464bca279551f2e5404ac6681196137c7604606a","observation_id":"25ce55d7-42cb-4c1f-848d-445effd6ea1d","resolution":{"observed_at":"2026-05-15T02:53:33.574647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":"0f89dfdc-a347-49f7-87ff-cec69596f875","year":2024},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:0264303fe70c2ecefa18a4e720e148a2fd16f485225f4b45cd3a104678d99964","observation_id":"40922353-9b79-4575-8926-64edb62500c5","resolution":{"observed_at":"2026-05-15T03:59:48.274547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:0862ca6b16c73e286d50f4007832a6f2886c0f0fedb590f1b97960c357b6b258","observation_id":"f90352f8-3ccd-499d-a2cd-d0e67a4075f8","resolution":{"observed_at":"2026-05-15T02:53:33.607157Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T09:46:12.977838Z","title":"Colpali: Efficient document retrieval with vision language models","venue":null,"work_id":"101c0260-59e3-4304-bd2e-d19b57659f73","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:ab0cc644f65c7b92c47fc961ed83a45f1250250791571ddceb74e633cc04329e","observation_id":"7b41eda3-caf2-4586-bef9-e41f5f07707f","resolution":{"observed_at":"2026-05-15T03:59:48.278740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling deep contrastive learning batch size under memory limited setup","venue":null,"work_id":"7a230fa1-293b-485f-af5d-db8c3c733c65","year":2021},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:686b69a6c3ba12ca17508ba24031e95b742cb116202daa57c56bb2890b7e5053","observation_id":"3af8c85c-284f-4954-9b19-3eddcf13b494","resolution":{"observed_at":"2026-05-15T03:59:48.288208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Breaking the modality barrier: Universal embedding learning with multimodal llms","venue":null,"work_id":"06d44ff9-cc74-45e4-a9cd-9e09ccca1027","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:0478de2107d16673822cef324033f7a09aa0b01cd7010704e891cbcc46432a93","observation_id":"2206bcc1-fde0-43e8-aab8-39fefd06315b","resolution":{"observed_at":"2026-05-15T03:59:47.644603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:02.239431Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"062e8d93-5855-4995-abdb-8c79e2312784","year":2022},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:021507422b64e6c555b960e01053c6bfa5db88fdb9ebab0bd9cd20d38fa45428","observation_id":"77ac9636-68f6-4152-aa96-d27a2844eb3f","resolution":{"observed_at":"2026-05-15T03:59:47.625790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cumulated gain-based evaluation of IR techniques","venue":null,"work_id":"2d09589c-bcbb-4de4-8d44-a6853b99eeaa","year":2002},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:8b0bf3974df4243bb42fe490dd7eea04a0c09f3fb44b27d3a61907b9545180bf","observation_id":"726c1a68-4710-4e0f-8e58-62d996a9e19c","resolution":{"observed_at":"2026-05-15T03:59:47.632221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Le, Yun- Hsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":"43550805-a10a-404a-91b8-3433ccd140ae","year":2021},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:14ef62fac82465a1786fa5135eb0df3cd38625dafa52b0dd36286e8508deb753","observation_id":"eea7682d-c7ae-40c2-afb1-4ad1dc97be29","resolution":{"observed_at":"2026-05-15T03:59:47.638328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-05T07:40:31.916436Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2407.12580","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.12580","snapshot_observed_at":"2026-07-08T20:35:34.387006Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","venue":"cs.CL","work_id":"df2e178e-bd96-48f4-8431-51c61fbc63fd","year":2024},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"cited_paper":"/paper/2407.12580","citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:fc756e95d884022c1fa0f8587ef6dd06e0dc08de5ea15104a09cb2a30f253b28","observation_id":"f298b2ba-57b1-4556-9b70-3f0eb4cef87a","resolution":{"observed_at":"2026-05-16T22:52:21.013841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks","venue":null,"work_id":"6ccede0b-718c-493f-b5d0-cf8eac6f97b4","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:9003126c76cbdb800b3bb8dd66a34fe0e13d78ca86b46eaab2716d16425867a0","observation_id":"8b067369-f4a1-41b0-8240-1d9f39b73375","resolution":{"observed_at":"2026-05-15T03:59:47.650503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:04:01.362787Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":"59f0aeab-27fb-4d5b-a0d3-ddbd0bbd92d8","year":2022},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:52a314c26643f78ed7a9bdfdf3e27ac2b5481726cf01e490cf37f8e9c1a4a7cb","observation_id":"53ea582e-0153-4b8c-ad25-f86a72722762","resolution":{"observed_at":"2026-05-15T03:59:47.598543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llave: Large language and vision embedding models with hardness-weighted contrastive learning","venue":null,"work_id":"86c31ce8-b851-43b6-8930-5e0f05017bfc","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:f0a1b5a0e37c2c3088cfe2188447dbe12027843afe209e1cdd50a57d8f9ddc3e","observation_id":"172de98b-cec0-4fb6-a8ab-e5474d3aaed5","resolution":{"observed_at":"2026-05-15T03:59:47.564439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00405","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2511.00405 , year=","venue":null,"work_id":"f5b544f0-5c22-440f-a8f4-115d0414a51e","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:3b58522456748ffd09487c8a890efaefb7088a56490aaa2311e7fcab4830987d","observation_id":"2d20370a-6f3c-4ca1-b10f-0a4df1dc1923","resolution":{"observed_at":"2026-05-15T02:53:33.610275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nv-embed: Improved techniques for training llms as generalist embedding models","venue":null,"work_id":"6a4942c5-d7fc-4a89-862e-ae17205f49f8","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:7e51e1e1c4a95c990965c30376186332373e0065c1e2d9d8589697919c7477ad","observation_id":"27772d70-64f0-4b92-b333-4f37453b81e0","resolution":{"observed_at":"2026-05-15T03:59:47.570183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":"ddf03a68-4544-4e2a-86dd-aba153e47813","year":2020},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:7bd1f5824b67605d822e89fe9ad57b3582499392931f9cf45fa0adefd9105187","observation_id":"7c55fd41-6d7d-4067-b70b-f541a8ba9599","resolution":{"observed_at":"2026-05-15T03:59:47.663216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"9d31c32b-3bb4-4c84-bc7b-8fd34bcc91e4","year":2023},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:1c44b9b30154da787f06f0ea30bb845afdc241e5d69405a2bd040d839ad7ad7d","observation_id":"b8ec17a7-4ed5-45de-8d2d-951bcfe8d1ef","resolution":{"observed_at":"2026-05-15T03:59:47.656404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mm-embed: Universal multimodal retrieval with multimodal llms","venue":null,"work_id":"da668463-5cc6-45cf-afaf-901b2028b379","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:30b194f4e7033973ed17f02fcd89b756557e8bc25ebdbf9d7223e4928b029eae","observation_id":"7820e316-f812-4cb0-af06-1b8e88d78800","resolution":{"observed_at":"2026-05-15T03:59:48.293336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.16150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reasoning guided embeddings: Leveraging mllm reasoning for improved multimodal retrieval.arXiv preprint arXiv:2511.16150, 2025a","venue":null,"work_id":"08f8b4b5-a452-4a53-8736-f24ab600d442","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:b0b6d11cf06a8353c6369eb51e5929323702817696a8a1baee9a0cd0d55683e1","observation_id":"90618f00-1002-4306-8f97-d57f97f28423","resolution":{"observed_at":"2026-05-15T02:53:33.613684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"ec0a9bdd-8553-4dd1-8dba-ea817865b765","year":2023},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:eb71a411562a2c2dd56e19ca47cc96e59c6b3ff78e9c39e9d701a7705c06670c","observation_id":"22cc78b9-ade5-430f-8089-07b9cd8217b0","resolution":{"observed_at":"2026-05-15T03:59:47.521297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:13:35.700428Z","title":"Lamra: Large multimodal model as your advanced retrieval assistant","venue":null,"work_id":"7a5762f9-bec8-4b4f-a9b0-63134b505522","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:412e5ea8253bab67b295a53033f369f553262b0898e64dea511092a2e4e1ca9a","observation_id":"f2b3302f-c83e-4bb9-9bb9-e1470ed0f58d","resolution":{"observed_at":"2026-05-15T03:59:47.546804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlm2vec-v2: Advancing multimodal embedding for videos, images, and visual documents.Transactions on Machine Learning Research","venue":null,"work_id":"8df38adf-318f-471e-a5e1-2b77d59c1fa0","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:4f5a78d32231f4d2189825719eb805427636930837efc68587e1165ade92b698","observation_id":"bf140399-66ac-4dd8-b1e3-dc555b67bee1","resolution":{"observed_at":"2026-05-15T03:59:47.533510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mteb: Massive text embedding benchmark","venue":null,"work_id":"85010eb6-63df-4d61-a935-a4615e0dda0a","year":2023},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:bd37f005bd6a0d74c5c613a12f2ac3300a6be02d04a523666c50297b159df18f","observation_id":"7dec594e-9711-436f-9a7a-fc61c71f2de6","resolution":{"observed_at":"2026-05-15T03:59:47.488914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vladva: Discriminative fine-tuning of lvlms","venue":null,"work_id":"961dd334-4632-49ba-93a0-b691787fb71c","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:ed86fc0177b87d0ee3fba4e3937a6f63b6f103567d528a01b0a4501ec5b8eda0","observation_id":"f775eba8-d4f0-4432-a150-44943d056710","resolution":{"observed_at":"2026-05-15T03:59:47.494114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"794cd6c3-c2d3-4f4a-a518-fb41eb4aafcf","year":2021},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:ec1189be86b1d7afda36bf41239a3a9a5891e2db7abe1869ce1868f9eae5eeb3","observation_id":"bb206138-b18b-4a66-8360-34b9b6206aea","resolution":{"observed_at":"2026-05-15T03:59:47.529126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":"87ddbe51-9fe4-4b65-a398-37f2d2a897f1","year":2020},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:a593bacac8d001f18f9cf0d78292192e1402cf47cef99008566edcc3e2a00e90","observation_id":"3d8133bb-2658-49a1-b1a8-686d3b852be5","resolution":{"observed_at":"2026-05-15T03:59:47.479475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:6f2129aaac57b9824ebe295ad421b31979b6b73e7b886bd507b68dc1464901b2","observation_id":"757f8968-967f-4c29-a2a3-252cf2bd40c1","resolution":{"observed_at":"2026-05-15T02:53:33.603874Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smith, Luke Zettlemoyer, and Tao Yu","venue":null,"work_id":"d612b465-1b94-429b-b63f-af89670e6211","year":2023},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:170e6911702e82a52dc310241f7f312b89b62ca583845a8f978d56e354b15fb2","observation_id":"85f17632-76b2-4724-93ea-09451092bffc","resolution":{"observed_at":"2026-05-15T03:59:48.282994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:e3c5efdf2147817dd152af336a95f0dfa16fbf7d6d2db3057557809b4fbb9d8a","observation_id":"8bc26bd1-8c86-4ce7-b1a9-0b05849ae7f8","resolution":{"observed_at":"2026-05-15T02:53:33.580487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":"2212.03533","doi":"10.48550/arxiv.2212.03533","metadata_source":"pith","pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","venue":"cs.CL","work_id":"789cc674-467e-4f23-bb50-05c79fe8c4c2","year":2022},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:7ca065bd4aa6f9c529a30f283bf30d55e0722537d90959b1966f76e6b785ab1e","observation_id":"a06c2e40-b8e6-41f8-934d-a382f565b79a","resolution":{"observed_at":"2026-05-15T02:53:33.600217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-01T10:08:09.486841+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T10:08:09.486841+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving text embeddings with large language models","venue":null,"work_id":"42b1efe9-fb71-4d5f-9b1c-c482e009e921","year":2024},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:aba927937bf8652b27deed6c70406e9f6b4bceb3b168c38d0c7b25fc739e62d8","observation_id":"3e391284-0470-486c-bc79-a579880df57c","resolution":{"observed_at":"2026-05-15T03:59:48.266541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:fa4d770c69e150387500ad10604bce7d7b12ac05e8f31fdbd5837715b1849504","observation_id":"ebe631c6-5aa0-40e7-afea-907fc4ea5f7d","resolution":{"observed_at":"2026-05-15T02:53:33.577662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chi, Fei Xia, Quoc Le, and Denny Zhou","venue":null,"work_id":"a9a06bfe-7500-40df-ba89-4256669a3854","year":2022},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:0a1eff48df7c27fcbf034184664734a2c1f40723991a0912bbb4bc59cb3b116d","observation_id":"34e63aaa-94ee-4414-a698-afd43ccfc5ed","resolution":{"observed_at":"2026-05-15T03:59:48.270504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cafe: Unifying representation and generation with contrastive-autoregressive finetuning","venue":null,"work_id":"24e9f37b-870f-4f8a-b7fb-966634c3c514","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:51754324f55c635504e7f646dbacfb779010297fd6e3f3e66fa5a6ca198ef189","observation_id":"e7129446-75d7-4c23-9a26-1a6bb699f922","resolution":{"observed_at":"2026-05-15T03:59:47.461203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visrag: Vision-based retrieval-augmented generation on multi-modality documents","venue":null,"work_id":"0332f896-db21-4a85-aed2-33a55061ab99","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:283b5e3863c95ddc333b7e471538022c2d998baed6044f4f2533d9c9bc239bbe","observation_id":"4f3b7b09-ed5a-4b8d-af1f-4f3417d2b966","resolution":{"observed_at":"2026-05-15T03:59:47.466795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradient surgery for multi-task learning","venue":null,"work_id":"31e6197d-8313-409a-96f7-a1d5a67cf701","year":2020},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:39b78c75ebc95e6c44f7ad5761f21204c0acbdaf94c94016c0dad12d314ef6a9","observation_id":"637e55fb-c38b-4171-9d01-648dc1e5cd25","resolution":{"observed_at":"2026-05-15T03:59:47.473299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"d67d2c11-585b-4793-b856-c5d327677d84","year":2023},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:ba23a0eb10b87015fc5d16be02c587621917be5ea7702f47bf793b02b5fe19ce","observation_id":"33c1b78a-bf01-4b73-9cc9-8f5f9d76b865","resolution":{"observed_at":"2026-05-15T03:59:47.809767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hauptmann, Yonatan Bisk, and Yiming Yang","venue":null,"work_id":"a8521278-e2a8-4f5d-a78d-21c9a84d4f38","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:fe93fa4a941ee6daa50fafeb8bc2d958575dada07f0fcb8e8a9b00520a0d80a3","observation_id":"1c230e21-1155-4bc8-99b6-5a18b2dfed93","resolution":{"observed_at":"2026-05-15T03:59:47.483846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridging modalities: Improving universal multimodal retrieval by multimodal large language models","venue":null,"work_id":"b4e9cef0-c44f-49d2-b5a4-49cfa27545d0","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:9293e5afc4746ef3a8500f1144dc7cc6326b5c01c9b6ec457b3fa9b5edee84b8","observation_id":"4ed72dd8-0c61-4dbe-9ffd-e1f44cc25ef9","resolution":{"observed_at":"2026-05-15T03:59:47.551142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"think\" field completely empty (","venue":null,"work_id":"db3f7a04-fbf8-4925-a4b2-fea892bffdf1","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:c22c6d0912d8bdfb9b61c6b9b493e29c30d481de7151c1f6c4636bead8f36355","observation_id":"56230514-a7eb-4d62-9193-f769326d580a","resolution":{"observed_at":"2026-05-15T03:59:47.455293Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":11,"verified_fuzzy":31},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2605.14448."}