{"as_of":"2026-08-04T19:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af365775cc08751668c421239fbd73a8eafbfda730dafa4d0a18ed58b80ec13c","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T21:48:40.722921Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:35:21.372512Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-20T18:03:36.933948Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"cited_work":{"arxiv_id":"2604.02073","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.02073","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","venue":"cs.CV","work_id":"4e4965e7-133f-45c5-9bc4-37bd9b0816ce","year":2026},"citing_paper":{"arxiv_id":"2605.11301","last_updated":"2026-05-11T22:42:12Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-11T22:42:12Z","title":"LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T01:42:54.802658Z"},"links":{"cited_paper":"/paper/2604.02073","citing_paper":"/paper/2605.11301"},"observation_digest":"sha256:c3d904dca3128a6acaca215d13cea5730923a2e7c7fd977466a76d4939d8081f","observation_id":"2ebf4763-57f7-40cb-87b9-1abda9c2abb7","resolution":{"observed_at":"2026-05-13T01:47:04.370388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"cited_work":{"arxiv_id":"2604.02073","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.02073","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","venue":"cs.CV","work_id":"4e4965e7-133f-45c5-9bc4-37bd9b0816ce","year":2026},"citing_paper":{"arxiv_id":"2605.16638","last_updated":"2026-05-15T21:10:56Z","snapshot_observed_at":"2026-08-03T04:32:55.741433Z","submitted_at":"2026-05-15T21:10:56Z","title":"TTE-Flash: Accelerating Reasoning-based Multimodal Representations via Think-Then-Embed Tokens","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-20T18:00:18.315737Z"},"links":{"cited_paper":"/paper/2604.02073","citing_paper":"/paper/2605.16638"},"observation_digest":"sha256:ee1f333cdaa532312ec9b0de8c84de2467cde245b39950b394f1abe45327d498","observation_id":"dc1ef913-e2cb-41a7-933c-4f1ebe1bad2f","resolution":{"observed_at":"2026-05-20T18:03:36.935342Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.02073","snapshot_observed_at":"2026-08-03T00:35:21.372512Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28751","last_updated":"2026-07-30T18:18:03Z","snapshot_observed_at":"2026-08-04T19:12:13.607568Z","submitted_at":"2026-07-30T18:18:03Z","title":"ReLoop-UME: Recurrent Depth with Learnable Retrieval Registers for Universal Multimodal Embedding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T00:35:21.372512Z"},"links":{"cited_paper":"/paper/2604.02073","citing_paper":"/paper/2607.28751"},"observation_digest":"sha256:585ecd85ecdd6fe263e2b78710a199c2c55e6ddb477263cec2dfce9df3de169e","observation_id":"cf4d0f5b-d526-4072-afe1-b2879d7b72e1","resolution":{"observed_at":"2026-08-03T00:35:21.372512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.02073/citation-record","integrity":"/paper/2604.02073/integrity","json":"/paper/2604.02073/citation-record.json","paper":"/paper/2604.02073"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T01:17:45.013705Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:bd7bfe1de6aba560128f9ff64559d089792c4b2e23291d33d324d6c6159a4225","observation_id":"027c6af3-c73b-4517-b32d-bf11d5ae2e4d","resolution":{"observed_at":"2026-05-13T21:53:20.018342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Curriculum learning","venue":null,"work_id":"31758cb9-7502-4700-9a5f-84493ca17639","year":2009},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:3da4d482b0221f389574097b22c8649feb7981a893b9d5dbad3f9c0974a85df9","observation_id":"461f082c-7575-4ae2-890b-803131c07d9e","resolution":{"observed_at":"2026-05-13T23:13:25.153236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-07-06T21:49:13.509342Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"cited_work":{"arxiv_id":"2506.23115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23115","snapshot_observed_at":"2026-07-02T07:26:45.637665Z","title":"Moca: Modality-aware continual pre-training makes better bidirectional multimodal embeddings","venue":null,"work_id":"c2a43a86-8991-44c1-9661-5f79becb3fc2","year":2025},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2506.23115","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:1e99426d9335b2947e790f5c239844666a86ab8fa48ff02354dcd639d9ef0e68","observation_id":"2346178e-b092-41c7-a44a-ce6802d66eb7","resolution":{"observed_at":"2026-05-13T21:53:19.962706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.16782","doi":"10.48550/arxiv.2505.16782","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:37:43.304826Z","title":"Reasoning beyond language: A comprehensive survey on latent chain-of-thought reasoning.arXiv preprint arXiv:2505.16782, 2025a","venue":null,"work_id":"3f6875b5-ba98-4d07-aaa0-c1ac8726244b","year":2025},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:5c45a7b41c8156bc8c28922952b66d0ac2eaf2f92538e07983fd0adaf6cf744e","observation_id":"badc0a05-4088-4815-9d78-5fb4439f7e6d","resolution":{"observed_at":"2026-05-13T21:53:20.013498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T13:38:11.467762+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T13:38:11.467762+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.05014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T13:48:21.005891Z","title":"arXiv preprint arXiv:2510.05014 , year=","venue":null,"work_id":"2a83d4ce-5ef7-4aac-bff2-d4fa50e611d9","year":2025},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:afb06de46b67d19b4e27997b63fbb7a8b419394f3c14b887365b7b325df9fcda","observation_id":"6b92bb5f-be49-41bb-96d6-f23ce6f2d9ab","resolution":{"observed_at":"2026-05-13T21:53:20.034261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01449","last_updated":"2025-02-28T08:51:57Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-06-27T15:45:29Z","title":"ColPali: Efficient Document Retrieval with Vision Language Models","version":6},"cited_work":{"arxiv_id":"2407.01449","doi":"10.48550/arxiv.2407.01449","metadata_source":"pith","pith_arxiv_id":"2407.01449","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"ColPali: Efficient Document Retrieval with Vision Language Models","venue":"cs.IR","work_id":"d2468d08-90dc-4690-887a-9b10a6d3574e","year":2024},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2407.01449","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:5d6d4bcd03b6d7ee66ac843abedb610bba9e024dbe63d90bc640bead8f08fc7a","observation_id":"d1329f7f-cdc7-4682-8bdd-f69b80cb800f","resolution":{"observed_at":"2026-05-15T02:35:41.289440Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":"2101.03961","doi":"10.1214/18-ejs1395","metadata_source":"pith","pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","venue":"cs.LG","work_id":"f43c4955-a965-4897-a11b-c4b25d2aeaa8","year":2021},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:cfbd1864a1af860af99ee883009340dca6d36cc27f8545e5e0e8f4d1dabebc96","observation_id":"6f5c6208-db78-4bb5-a047-88c8e29a820a","resolution":{"observed_at":"2026-05-13T21:53:19.965479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Think before you speak: Training language models with pause tokens","venue":null,"work_id":"039d7e94-15e3-470c-91e3-a8c345d2e158","year":null},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:7670b8bcffcabf66ef0825238d575f8926513b5baaa81c57af6ef817b44405af","observation_id":"11d34cdd-0d3b-4a67-9fcb-9d87f1ea196b","resolution":{"observed_at":"2026-05-13T23:08:26.975640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:70dadd8a22504bbedcbe39abdd72ec77e7750cec4354b604db9832bb63a6d15b","observation_id":"da4e3547-a919-4072-bd7f-2672385a0c53","resolution":{"observed_at":"2026-05-13T21:53:20.005863Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.17432","doi":"10.48550/arxiv.2504.17432","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Breaking the modality barrier: Universal embedding learning with multimodal llms","venue":null,"work_id":"12d56cf5-f745-4f81-8bd1-7ff9a5ff65ad","year":2025},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:5419cab2cdf52601f6c7d7777886b1004fc129e7528d586c8db5d7a5599cffa9","observation_id":"be72931d-abf2-427c-8c25-2e00efb2ca3b","resolution":{"observed_at":"2026-05-13T21:53:19.978870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:018f855ce9444cdede9da0158cf1eb17572b344299644df27b50fdee79549398","observation_id":"5f274357-1d70-4366-a59e-914aa6d48500","resolution":{"observed_at":"2026-05-13T21:53:20.029063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":"2412.06769","doi":"10.48550/arxiv.2412.06769","metadata_source":"pith","pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-07-11T00:37:42.845448Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","venue":"cs.CL","work_id":"3ddd0fd2-c176-408f-9b58-0666c2707f2d","year":2024},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:024986b9a5063ad93060a84e7561eaa445dbe2836569c629f2248b07674240c7","observation_id":"7d433eff-2e84-47db-bd70-d835ff7855cf","resolution":{"observed_at":"2026-05-13T21:53:19.991578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trace: Task-adaptive rea- soning and representation learning for universal multimodal retrieval","venue":null,"work_id":"b8916c2c-e529-4cae-8e4e-3e1dc6be2403","year":2026},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:ffb065bf43602e09b1ea7bef8e9a890d1992baa501dccb5ba4088cc384c285e8","observation_id":"bc4003e2-f3be-4ac7-9fb1-0897c9becd2b","resolution":{"observed_at":"2026-05-13T23:08:27.029287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gaussian error linear units (gelus).arXiv: Learning","venue":null,"work_id":"05b8f457-f391-4a82-8509-3be404ebd811","year":2016},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:eac4da400efe1ba3c05b1f9d35c87b7abdd848d3a22ea0a258f0cdeb30c371d2","observation_id":"01334dc6-7c3e-47c8-b4cb-0a71141a0ef7","resolution":{"observed_at":"2026-05-13T23:08:27.017891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised dense information retrieval with con- trastive learning.Trans","venue":null,"work_id":"7bfcb55e-bdf0-47ed-956d-633c5aac8bbc","year":2022},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:2f05f3c727a4202f11834753e9d0fd2952e37245a190cf8d0456d376f912ef73","observation_id":"d2208a64-fef1-408b-a043-349785fa0c5e","resolution":{"observed_at":"2026-05-13T23:08:27.003060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cumulated gain- based evaluation of ir techniques.ACM Transactions on In- formation Systems (TOIS), 20(4):422–446","venue":null,"work_id":"2ebc0a59-3bf4-4acd-8ec1-19fdcaf173e3","year":2002},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:bd0328e231857f2e0bf134d86d8e7f552839281cc57f010eaef5c0b2c8f0e334","observation_id":"94535ed8-055f-41d5-9f02-69dee1b07f38","resolution":{"observed_at":"2026-05-13T23:13:25.161916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:05:49.708085Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":"72e089a4-0c48-4028-b321-b1ea9b305c2b","year":null},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:d3cc81323c303240518b6af4bdd0aaf2a27412a6c360cff9f203528042595447","observation_id":"7eab02af-d4fb-432b-ac93-dcb59c52d2ba","resolution":{"observed_at":"2026-05-13T23:08:26.994968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.13823","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:49:30.458055Z","title":"Embed- rl: Reinforcement learning for reasoning-driven multimodal embeddings","venue":null,"work_id":"93de6cc3-f8cd-4b6b-ab0b-be86cd333b02","year":2026},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:74bdb1876844d25ea14579ac309bdaa06bffdbb2aa9e86717d64c1558c367e2d","observation_id":"f2d9fa5f-eebd-470e-befa-e22263348b26","resolution":{"observed_at":"2026-05-13T21:53:20.008281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-07-30T13:41:02.661104Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2407.12580","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.12580","snapshot_observed_at":"2026-07-08T20:35:34.387006Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","venue":"cs.CL","work_id":"df2e178e-bd96-48f4-8431-51c61fbc63fd","year":2024},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2407.12580","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:a015b4a798f2f09811eb5d5213e86ddb8ef292aea18bc23676094782b093f84e","observation_id":"5e6b8e40-9c2e-4d3d-b3cb-d30bf3819630","resolution":{"observed_at":"2026-05-16T22:52:21.013841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05160","last_updated":"2025-01-02T05:26:47Z","snapshot_observed_at":"2026-07-06T19:29:05.492290Z","submitted_at":"2024-10-07T16:14:05Z","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","version":3},"cited_work":{"arxiv_id":"2410.05160","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.05160","snapshot_observed_at":"2026-07-04T15:49:57.677234Z","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","venue":"cs.CV","work_id":"ec376227-cc62-4775-9e03-bed3862151d0","year":2024},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2410.05160","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:7b9d36aa2d7304467bd1c1062adaa8242278239006c1aa564f4810dc5227377f","observation_id":"2cea8a44-9ef6-40d3-b0bd-81c2db8ba60c","resolution":{"observed_at":"2026-05-17T21:19:44.112009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laser: Internal- izing explicit reasoning into latent space for dense retrieval","venue":null,"work_id":"d9d3e424-cb42-44ce-8be2-fbc32a38f9a4","year":null},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:e0bb84956430d437ae6c4f29bd4687118a719b61d6c5f692cf2cda14458f4895","observation_id":"e11658cd-707b-4a21-b7c9-75a16ef72353","resolution":{"observed_at":"2026-05-13T23:08:26.990190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"611bf9ca-ba79-4f1d-8cb7-1b88462f2087","year":2023},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:679c90b983df9ddd2e35391ba2bd4dc85f37ef4b1dce47f45935945463f798d2","observation_id":"cd622f0b-be9e-4732-aaf8-3d66fc25472b","resolution":{"observed_at":"2026-05-13T23:08:27.010643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.04812","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T05:49:36.510623Z","title":"Llave: Large language and vision embedding models with hardness-weighted contrastive learning","venue":null,"work_id":"b55f0bfb-4a90-4d1b-aa05-3f79fed11c4f","year":2025},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:693f8cfeec744bde780e880d3e3e3c7f7170640d3fa2055c6cc4498189abe4e5","observation_id":"19d27ce0-432e-4653-bc68-7d16213f1e9e","resolution":{"observed_at":"2026-05-13T21:53:19.959643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00405","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2511.00405 , year=","venue":null,"work_id":"f5b544f0-5c22-440f-a8f4-115d0414a51e","year":2025},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:82f1c484e227a16b1bfd4824126ffdb69263ef4cb974a2387e92010e424d084f","observation_id":"e2c51b19-46bf-4d5d-87cc-1a8a8cd0105c","resolution":{"observed_at":"2026-05-13T21:53:19.971113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nv- embed: Improved techniques for training llms as generalist embedding models","venue":null,"work_id":"e9b40a1d-fe78-4102-a6c7-2ff7ce60caeb","year":2025},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:8d031e08e1a0355eab01c0e71411d903b757228de580315dc5c2934ad715e969","observation_id":"86d43a64-3273-4782-aa5e-0deb8234e33c","resolution":{"observed_at":"2026-05-13T23:08:26.972017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-10T13:27:05.574543Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:60e8631bb4f8d4b440c026133624c45f59de10e40f915b47da90dca313a61fa8","observation_id":"b17b24d4-f844-4c54-b861-5183de808c80","resolution":{"observed_at":"2026-05-13T21:53:19.998828Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:54:34.279710Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"63a1bea7-e189-4b7b-858f-13e198b48188","year":2023},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:3a0bd77537877e12b6a7801b07d856b423a4ed58d9104451d05a9640c3c7f9e0","observation_id":"40444dc4-293a-46fe-8067-b6bc3e284249","resolution":{"observed_at":"2026-05-13T23:08:26.967900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02571","last_updated":"2025-02-22T05:33:26Z","snapshot_observed_at":"2026-07-06T19:45:08.566279Z","submitted_at":"2024-11-04T20:06:34Z","title":"MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2411.02571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02571","snapshot_observed_at":"2026-07-04T15:49:57.631122Z","title":"arXiv preprint arXiv:2411.02571 , year=","venue":null,"work_id":"da61907d-fb9d-4f7b-a9bc-4750420fb05e","year":2024},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2411.02571","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:be42987c0f9e4903d67f1c51713b44a2248eefa69b58e207e627bccd01f548ee","observation_id":"bdbc48e4-9afb-4b04-b7c2-854017371b57","resolution":{"observed_at":"2026-05-13T21:53:19.976365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916","venue":null,"work_id":"80df3d4a-379c-485b-991a-704ad587d79c","year":2023},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:37babba2815d05b4a1d044003158ccab523a50917cbe8876747c20f6465c943f","observation_id":"1d54ffc9-2123-44d5-bd4c-c384c449e324","resolution":{"observed_at":"2026-05-13T23:13:25.155843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lamra: Large multimodal model as your advanced retrieval assistant","venue":null,"work_id":"40061948-2544-4d3f-a629-89f74f8e9337","year":2025},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:ce65b9e39f211f7abc057026556a4253c6d2d7c343259e8210db3d4995dba305","observation_id":"aa58d8bf-3d54-4b85-8766-aeaebbb968cf","resolution":{"observed_at":"2026-05-13T23:13:25.170958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04590","last_updated":"2025-07-07T00:51:57Z","snapshot_observed_at":"2026-08-02T08:05:44.477432Z","submitted_at":"2025-07-07T00:51:57Z","title":"VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents","version":1},"cited_work":{"arxiv_id":"2507.04590","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.04590","snapshot_observed_at":"2026-07-04T20:20:07.233056Z","title":"VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents","venue":"cs.CV","work_id":"645b5239-8642-4bd5-a661-7ff075ceb306","year":2025},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2507.04590","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:3fad35b25502952b2f9faf061601d737867d3922779dad60fa8b748921c9817e","observation_id":"9bd35991-65a9-421c-a6b2-b0fc6ee7ec3b","resolution":{"observed_at":"2026-05-18T14:10:15.258990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:fd3e19df5679f0160f4eec34f6f84328817573689b7d9de25a02c7bffe44eb9d","observation_id":"b32160fd-d626-4731-9e46-3cca74647fe2","resolution":{"observed_at":"2026-05-13T21:53:20.026513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15758","last_updated":"2024-04-24T09:30:00Z","snapshot_observed_at":"2026-07-06T18:04:54.726338Z","submitted_at":"2024-04-24T09:30:00Z","title":"Let's Think Dot by Dot: Hidden Computation in Transformer Language Models","version":1},"cited_work":{"arxiv_id":"2404.15758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.15758","snapshot_observed_at":"2026-07-03T20:58:58.552877Z","title":"Let’s think dot by dot: Hidden computation in transformer language models.arXiv preprint arXiv:2404.15758","venue":null,"work_id":"745f12c5-dbd0-4b89-a2aa-e78d08e61bf1","year":2024},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2404.15758","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:959b584546eb7e26294cf27a057cde11a3e162dccb7edf0d591bb79d8a587da8","observation_id":"40a95346-5555-4576-ad42-fa5c1ddb6c42","resolution":{"observed_at":"2026-05-13T21:53:20.031713Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:17:33.931222Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"05644b85-8aaa-4cb3-8f21-4ce50a3822a5","year":2021},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:5ba2b09dcd50a03f6024a5d9d343ceb39535898e557982d5acfe844ba47e9de5","observation_id":"e9afa19c-b5b2-4b05-b7ee-471e604c67ac","resolution":{"observed_at":"2026-05-13T23:13:25.164788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Outra- geously large neural networks: The sparsely-gated mixture- of-experts layer","venue":null,"work_id":"64e6dc07-9bb3-4b39-beea-3e2707624efd","year":2017},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:4abaf65f1f793e00831ce5445b987de5e6ecd42c423da47255661689a5c8feeb","observation_id":"6111300e-d583-4b53-a2c6-2b00dc9f8001","resolution":{"observed_at":"2026-05-13T23:13:25.167944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21074","last_updated":"2025-09-23T08:16:08Z","snapshot_observed_at":"2026-08-02T19:02:30.418876Z","submitted_at":"2025-02-28T14:07:48Z","title":"CODI: Compressing Chain-of-Thought into Continuous Space via Self-Distillation","version":3},"cited_work":{"arxiv_id":"2502.21074","doi":"10.48550/arxiv.2502.21074","metadata_source":"pith","pith_arxiv_id":"2502.21074","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CODI: Compressing Chain-of-Thought into Continuous Space via Self-Distillation","venue":"cs.CL","work_id":"c538c1a5-0662-4de7-ac6f-29061c2c9686","year":2025},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2502.21074","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:96da2eee292794d70f597293a99d6ce3871a466ec1a81c1e7dd7c9a52eadc193","observation_id":"cd332ca2-3c3e-45b2-a30e-08d422e79fef","resolution":{"observed_at":"2026-05-17T23:14:57.978007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"a9ceeb65-0c21-4411-ac7c-8664afa022b6","year":2017},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:70b604afafa13a70346eedf423b945b536ce2faa01560027a232e9185e87c4cd","observation_id":"77212cd5-ae69-4cb0-9a01-6a7d2a844b71","resolution":{"observed_at":"2026-05-13T23:13:25.159072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":"2212.03533","doi":"10.48550/arxiv.2212.03533","metadata_source":"pith","pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-07-11T02:27:48.637909Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","venue":"cs.CL","work_id":"789cc674-467e-4f23-bb50-05c79fe8c4c2","year":2022},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:b607b265c428123d6fe50611d59b24a33826396e09ce48f2cd15a5e5c262c6db","observation_id":"5a9fb2b3-d68f-4582-9f6e-32c418029bf0","resolution":{"observed_at":"2026-05-13T21:53:20.003704Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T10:08:09.486841+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T10:08:09.486841+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving text embeddings with large language models","venue":null,"work_id":"2e5fa7f4-22b8-44cb-affd-8012d3da4e87","year":2024},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:9df110e61062edb8decc9b88d30555b5027f2578dcd9eb8d6a38ff5f3bf3fa3c","observation_id":"86b69184-0572-4f49-8617-1c6017aae286","resolution":{"observed_at":"2026-05-13T23:08:26.998957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-11T01:17:42.597062Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:28d4fd4cc9dc1b5e92078743d5aa2ed60419d192dd77074e7fa37ff1218f6722","observation_id":"2d867f4c-e269-4853-acf3-3280717a0efa","resolution":{"observed_at":"2026-05-13T21:53:20.010512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:823c2deb59dbc1b5b93458e97c24c781af0c8f2c4b9a9e8af63e2d90ba296ce6","observation_id":"9f6a6085-fbab-4bbb-9f40-a1a8d5d6bdc1","resolution":{"observed_at":"2026-05-13T21:53:19.973440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uniir: Train- ing and benchmarking universal multimodal information re- trievers","venue":null,"work_id":"3b402a93-2973-4686-a9bc-e20add7411aa","year":2024},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:a3851bd364bdc4c7cb693e5741b19960fa6487863741cb80ee73dd268846ec0e","observation_id":"452ed2c9-4662-4d7f-8a6d-01b28701feac","resolution":{"observed_at":"2026-05-13T23:08:26.979084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models.Advances in neural information processing systems, 35:24824–24837","venue":null,"work_id":"aa0b0925-14cc-4784-90d9-7cd92b1fb7da","year":2022},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:b62d8d6bf8456983812593dbf41786d6905c5510a9b6b402ee675611bed9bcee","observation_id":"7b94c3f6-c6a6-4154-8353-24563eb8f58e","resolution":{"observed_at":"2026-05-13T23:08:27.021582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"C-pack: Packed resources for general chinese embeddings","venue":null,"work_id":"c357c53f-49e3-4ffe-9342-58e3a75784be","year":2024},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:3414aaee5bd75890811bfbe9f092cbed608066be67e36985979a168b414b467e","observation_id":"985941c3-3489-431a-a2b2-aff6f97d0890","resolution":{"observed_at":"2026-05-13T23:08:27.006690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-cot: Let vision language models reason step-by-step","venue":null,"work_id":"f7e8c81d-4627-4c76-86c7-841039d7dffc","year":2087},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:43e2e905a48c29a8fece1b5a87d535e3b855e8e2e876fc7adb6f7a9ff2bd9d4a","observation_id":"138efd70-7aac-470f-a770-a1d132aa6eb0","resolution":{"observed_at":"2026-05-13T23:08:27.037610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.01639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recall: Recalibrating capability degradation for mllm-based composed image retrieval","venue":null,"work_id":"8a2801ea-2907-4fc9-a1e4-cde95eee279c","year":2026},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:8349bfe7e3188ff231e2401ea0bc66d0eb587fd3405b656e38ad40baa16e5c48","observation_id":"25e8e9b0-f326-4f07-9957-616063eba2f1","resolution":{"observed_at":"2026-05-13T21:53:20.036789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recall: Recalibrating capability degradation for mllm-based composed image retrieval","venue":null,"work_id":"b6b43c23-99bd-4c2c-9eed-35bdbe4c1ab3","year":2026},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:d6379df9f1b2998d7b18293e27006728a96e2932b998e53bd913dd1d196d766f","observation_id":"c688f3f5-316d-4691-92e5-8e7f4ffb708e","resolution":{"observed_at":"2026-05-13T23:08:27.014233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19900","last_updated":"2025-03-25T17:57:17Z","snapshot_observed_at":"2026-07-06T20:58:36.895584Z","submitted_at":"2025-03-25T17:57:17Z","title":"CAFe: Unifying Representation and Generation with Contrastive-Autoregressive Finetuning","version":1},"cited_work":{"arxiv_id":"2503.19900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cafe: Unifying representation and generation with contrastive-autoregressive finetuning.arXiv preprint arXiv:2503.19900","venue":null,"work_id":"1d6d7788-bb38-481e-aba9-0602b8b4e115","year":2022},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2503.19900","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:6b5b06bb7b32440e535f5ce5ae8ade2618d3e8d37cd5371681b1e00727d4d07a","observation_id":"9d2a5160-8c06-406c-8ca9-295e6b704ad0","resolution":{"observed_at":"2026-05-13T21:53:20.015992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-02T13:24:00.339129Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"cited_work":{"arxiv_id":"2410.10594","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10594","snapshot_observed_at":"2026-07-03T05:57:41.459329Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","venue":"cs.IR","work_id":"91acd90a-d182-4502-a92c-390a77f29b81","year":2024},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2410.10594","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:3a334e0ac9d7fd53c5814d2fb6cbbcfa68b062644be3532460c8f720050da1ba","observation_id":"1cca916c-89f8-47da-92af-6b7aeef10780","resolution":{"observed_at":"2026-05-16T15:37:25.955223Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09629","last_updated":"2024-03-18T07:56:48Z","snapshot_observed_at":"2026-07-31T09:25:34.205362Z","submitted_at":"2024-03-14T17:58:16Z","title":"Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking","version":2},"cited_work":{"arxiv_id":"2403.09629","doi":"10.48550/arxiv.2403.09629","metadata_source":"pith","pith_arxiv_id":"2403.09629","snapshot_observed_at":"2026-07-10T11:37:03.291962Z","title":"Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking","venue":"cs.CL","work_id":"cd82874a-9e9d-46cb-9716-a06d454a9c7e","year":2024},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2403.09629","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:87897a74c1f925e1dcb3a3741f590ad80bbc8e51b67f3f00c1fde3834be6460c","observation_id":"e8e0c4f7-d7c0-46f7-acb2-5b266bafbf33","resolution":{"observed_at":"2026-05-16T05:45:05.263509Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"f6fdf158-0bc7-490c-a8a1-cc8df4675fd3","year":2023},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:db34e62d4f80f25074487bbf25703e5a5b3e3ee3c1758419e3ee467846fc7c83","observation_id":"d64212e5-1af5-4a74-9017-ff7f63611ef9","resolution":{"observed_at":"2026-05-13T23:08:26.982538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19651","last_updated":"2024-06-24T23:41:29Z","snapshot_observed_at":"2026-08-04T07:44:45.555675Z","submitted_at":"2024-03-28T17:59:20Z","title":"MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions","version":2},"cited_work":{"arxiv_id":"2403.19651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.19651","snapshot_observed_at":"2026-07-04T00:49:19.246582Z","title":"Magiclens: Self-supervised image retrieval with open-ended instructions","venue":null,"work_id":"c942d433-c67a-4aa0-9bd6-7a407f890918","year":2024},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2403.19651","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:244f844a934d5a0e85bc0e66d4e33a499d55c43e139be0c1c25b3c048c8f4ff2","observation_id":"b799b7ee-9621-48ef-802b-1c468197ca96","resolution":{"observed_at":"2026-05-13T21:53:19.981605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain of preference optimization: Improving chain-of-thought reasoning in llms.Advances in Neural In- formation Processing Systems, 37:333–356","venue":null,"work_id":"a67182e3-f1ff-46af-a370-a4ba28fb8d2a","year":2024},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:301d1bc4f8c1e72f93c2b225f76896028dd49c007f2c086ba64e74cbedc51bde","observation_id":"a9a6f59f-192a-4e7b-a711-4202275ec05e","resolution":{"observed_at":"2026-05-13T23:08:27.033448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16855","last_updated":"2025-04-01T08:48:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-22T04:40:24Z","title":"GME: Improving Universal Multimodal Retrieval by Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2412.16855","doi":"10.48550/arxiv.2412.16855","metadata_source":"pith","pith_arxiv_id":"2412.16855","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"GME: Improving Universal Multimodal Retrieval by Multimodal LLMs","venue":"cs.CL","work_id":"15e62726-10dc-4baa-8bfc-a278a4529f75","year":2024},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2412.16855","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:d43a9f71b194597ec2171ca5b863269e34ed6eff8d4cdbcd3bfd6f2f55e6e662","observation_id":"05cbe39e-e60d-454f-a13c-600656786bb5","resolution":{"observed_at":"2026-05-15T06:35:22.964550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridging modalities: Improving universal mul- timodal retrieval by multimodal large language models","venue":null,"work_id":"1f37e118-a635-4eef-b68b-1ee6f43de15a","year":2025},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:d4dd2ade77ea30637dbe3e58e09b969cf4a8c6b1dc91537aba45a35bf00d94c8","observation_id":"b788fd08-06a3-4eb5-8cf1-a9e2bca17276","resolution":{"observed_at":"2026-05-13T23:08:26.986324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14475","last_updated":"2024-12-19T02:49:55Z","snapshot_observed_at":"2026-08-04T00:38:47.583846Z","submitted_at":"2024-12-19T02:49:55Z","title":"MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval","version":1},"cited_work":{"arxiv_id":"2412.14475","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14475","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Megapairs: Massive data synthesis for universal multimodal retrieval.arXiv preprint arXiv:2412.14475","venue":null,"work_id":"2118950d-109f-4e9d-8578-e4669b9c12a2","year":2024},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2412.14475","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:1396377a0c9abe25f827af10e9cb13f01b74e29d4f52471b273636570eb46618","observation_id":"4b2daacc-64ab-4298-8848-2183d22a76d8","resolution":{"observed_at":"2026-05-13T21:53:20.023927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ARMYJUNK","venue":null,"work_id":"efe5cfc5-99d8-45fd-99f5-0e1d70275ea2","year":2025},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:4e411fe2b7126765d53b0cf9932dfe375419c0497c6527292e42612ed1691e5a","observation_id":"e55ba35f-04fb-4fec-85c2-97846305af55","resolution":{"observed_at":"2026-05-13T23:08:27.025345Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":30,"verified_fuzzy":25},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 3 inbound Pith citation observations for arXiv:2604.02073."}