{"as_of":"2026-08-08T15:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:15fc2fcc847275c140271d0bd140edda9f9db509f55617ccc7f3b3db9eab5d6b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T05:54:16.090827Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T00:04:06.385968Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.17136","last_updated":"2023-11-28T18:55:52Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T18:55:52Z","title":"UniIR: Training and Benchmarking Universal Multimodal Information Retrievers","version":1},"cited_work":{"arxiv_id":"2311.17136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17136","snapshot_observed_at":"2026-06-30T00:04:06.385968Z","title":"Simvlm: Sim- ple visual language model pretraining with weak supervision","venue":null,"work_id":"c5725438-a0a7-4c04-8032-b6b6d6d9f26e","year":2023},"citing_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-05T07:40:31.916436Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T22:52:20.935555Z"},"links":{"cited_paper":"/paper/2311.17136","citing_paper":"/paper/2407.12580"},"observation_digest":"sha256:0b848fedb1de7a00868f0ec601bda445ff20b13d541af0b19367ac4e832544d0","observation_id":"9eb37c1f-49d8-428c-843f-d5913ca6a3ba","resolution":{"observed_at":"2026-05-16T22:52:20.997627Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17136","last_updated":"2023-11-28T18:55:52Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T18:55:52Z","title":"UniIR: Training and Benchmarking Universal Multimodal Information Retrievers","version":1},"cited_work":{"arxiv_id":"2311.17136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17136","snapshot_observed_at":"2026-06-30T00:04:06.385968Z","title":"Simvlm: Sim- ple visual language model pretraining with weak supervision","venue":null,"work_id":"c5725438-a0a7-4c04-8032-b6b6d6d9f26e","year":2023},"citing_paper":{"arxiv_id":"2410.05160","last_updated":"2025-01-02T05:26:47Z","snapshot_observed_at":"2026-07-06T19:29:05.492290Z","submitted_at":"2024-10-07T16:14:05Z","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T21:19:43.882232Z"},"links":{"cited_paper":"/paper/2311.17136","citing_paper":"/paper/2410.05160"},"observation_digest":"sha256:48caaf84e76afcc87edb250268b22550d752ae022de5dfdb32c595aa4b1a1af7","observation_id":"9a252475-68c3-434d-8555-4eb5a7fa0e70","resolution":{"observed_at":"2026-05-17T21:19:44.036122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17136","last_updated":"2023-11-28T18:55:52Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T18:55:52Z","title":"UniIR: Training and Benchmarking Universal Multimodal Information Retrievers","version":1},"cited_work":{"arxiv_id":"2311.17136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17136","snapshot_observed_at":"2026-06-30T00:04:06.385968Z","title":"Simvlm: Sim- ple visual language model pretraining with weak supervision","venue":null,"work_id":"c5725438-a0a7-4c04-8032-b6b6d6d9f26e","year":2023},"citing_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-02T13:24:00.339129Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T15:37:25.781240Z"},"links":{"cited_paper":"/paper/2311.17136","citing_paper":"/paper/2410.10594"},"observation_digest":"sha256:6a67a2a8e9233a7d8a606731d50db855ac10a32b9c00b1e75df0956fdd11c926","observation_id":"5a2bb418-0967-4d9a-bec7-4de635afd9ff","resolution":{"observed_at":"2026-05-16T15:37:25.844287Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17136","last_updated":"2023-11-28T18:55:52Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T18:55:52Z","title":"UniIR: Training and Benchmarking Universal Multimodal Information Retrievers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17136","snapshot_observed_at":"2026-08-08T05:54:16.090827Z","title":"Uniir: Training and benchmarking universal multimodal information retriev- ers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.090827Z"},"links":{"cited_paper":"/paper/2311.17136","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:f652ab52ede725cca5f4c44488610446e8f6c0e80b44fc2da9bd65ea1b8f18af","observation_id":"8462c595-82f9-4c73-9e8a-f598044ab3da","resolution":{"observed_at":"2026-08-08T05:54:16.090827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17136","last_updated":"2023-11-28T18:55:52Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T18:55:52Z","title":"UniIR: Training and Benchmarking Universal Multimodal Information Retrievers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17136","snapshot_observed_at":"2026-08-07T05:50:00.148561Z","title":"Uniir: Training and benchmarking universal multimodal information retrievers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.148561Z"},"links":{"cited_paper":"/paper/2311.17136","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:addcecbb39606f642ba7a9317b76422483e047004ec0a904b86936dea05e4e53","observation_id":"7eab1213-4d83-4397-8543-039fc4d01fd5","resolution":{"observed_at":"2026-08-07T05:50:00.148561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17136","last_updated":"2023-11-28T18:55:52Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T18:55:52Z","title":"UniIR: Training and Benchmarking Universal Multimodal Information Retrievers","version":1},"cited_work":{"arxiv_id":"2311.17136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17136","snapshot_observed_at":"2026-06-30T00:04:06.385968Z","title":"Simvlm: Sim- ple visual language model pretraining with weak supervision","venue":null,"work_id":"c5725438-a0a7-4c04-8032-b6b6d6d9f26e","year":2023},"citing_paper":{"arxiv_id":"2602.00104","last_updated":"2026-06-03T13:13:52Z","snapshot_observed_at":"2026-08-03T08:13:50.606822Z","submitted_at":"2026-01-25T12:12:12Z","title":"R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T10:46:17.411843Z"},"links":{"cited_paper":"/paper/2311.17136","citing_paper":"/paper/2602.00104"},"observation_digest":"sha256:3752163764b163b37c0445742248d290fd25437dc2ecbfa17bdd3bbd6053bc11","observation_id":"8696f738-641d-4342-a4b3-33eb79be61ff","resolution":{"observed_at":"2026-05-16T10:47:45.494104Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17136","last_updated":"2023-11-28T18:55:52Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T18:55:52Z","title":"UniIR: Training and Benchmarking Universal Multimodal Information Retrievers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17136","snapshot_observed_at":"2026-08-03T08:13:53.847063Z","title":"Uniir: Training and benchmarking universal multimodal information retrievers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.00104","last_updated":"2026-06-03T13:13:52Z","snapshot_observed_at":"2026-08-03T08:13:50.606822Z","submitted_at":"2026-01-25T12:12:12Z","title":"R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:53.847063Z"},"links":{"cited_paper":"/paper/2311.17136","citing_paper":"/paper/2602.00104"},"observation_digest":"sha256:b12be89992f43e6a603e6409eeede8e7af692e4d302d7dbd27c32d59ef33ad6f","observation_id":"87e3b76b-4bd3-41f8-99fb-fb22c8d85407","resolution":{"observed_at":"2026-08-03T08:13:53.847063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17136","last_updated":"2023-11-28T18:55:52Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T18:55:52Z","title":"UniIR: Training and Benchmarking Universal Multimodal Information Retrievers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17136","snapshot_observed_at":"2026-08-02T19:41:34.908876Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.01471","last_updated":"2026-06-02T03:52:48Z","snapshot_observed_at":"2026-08-08T12:47:40.189675Z","submitted_at":"2026-03-02T05:34:45Z","title":"Reconstructing Content with Collaborative Attention for Universal Multimodal Representation Learning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T19:41:34.908876Z"},"links":{"cited_paper":"/paper/2311.17136","citing_paper":"/paper/2603.01471"},"observation_digest":"sha256:9a0fc8a7d4e5465db1a69f9985d6854ffa9f8b609a7fdf77faa2f8cd0bed3b8b","observation_id":"83670997-1aa3-4083-a225-5d69b7a5fe9e","resolution":{"observed_at":"2026-08-02T19:41:34.908876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17136","last_updated":"2023-11-28T18:55:52Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T18:55:52Z","title":"UniIR: Training and Benchmarking Universal Multimodal Information Retrievers","version":1},"cited_work":{"arxiv_id":"2311.17136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17136","snapshot_observed_at":"2026-06-30T00:04:06.385968Z","title":"Simvlm: Sim- ple visual language model pretraining with weak supervision","venue":null,"work_id":"c5725438-a0a7-4c04-8032-b6b6d6d9f26e","year":2023},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-02T15:37:56.825812Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-08T07:28:09.725591Z"},"links":{"cited_paper":"/paper/2311.17136","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:1f5ff1158649f961563f238e446b7a73131f4c400e127c3a11dff44d0fd347fd","observation_id":"e29d1da9-7f30-4099-ad6b-c2878695ddf2","resolution":{"observed_at":"2026-05-11T21:01:11.493357Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17136","last_updated":"2023-11-28T18:55:52Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T18:55:52Z","title":"UniIR: Training and Benchmarking Universal Multimodal Information Retrievers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17136","snapshot_observed_at":"2026-08-02T15:38:00.354435Z","title":"Uniir: Training and benchmarking universal multimodal information retrievers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-02T15:37:56.825812Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.354435Z"},"links":{"cited_paper":"/paper/2311.17136","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:a9f2ca60e5093b9147bcc9222bff409524e278b04904d3d4cf742e0a90366103","observation_id":"c2568888-543b-4bd7-84e6-0b4341796ece","resolution":{"observed_at":"2026-08-02T15:38:00.354435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17136","last_updated":"2023-11-28T18:55:52Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T18:55:52Z","title":"UniIR: Training and Benchmarking Universal Multimodal Information Retrievers","version":1},"cited_work":{"arxiv_id":"2311.17136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17136","snapshot_observed_at":"2026-06-30T00:04:06.385968Z","title":"Simvlm: Sim- ple visual language model pretraining with weak supervision","venue":null,"work_id":"c5725438-a0a7-4c04-8032-b6b6d6d9f26e","year":2023},"citing_paper":{"arxiv_id":"2605.24938","last_updated":"2026-05-24T08:36:34Z","snapshot_observed_at":"2026-07-06T23:34:57.148983Z","submitted_at":"2026-05-24T08:36:34Z","title":"Your Embedding Model is SMARTer Than You Think","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T23:56:28.774601Z"},"links":{"cited_paper":"/paper/2311.17136","citing_paper":"/paper/2605.24938"},"observation_digest":"sha256:ece2603dc1bef8467b8e660c439f69d844c9977ee1ad91a5b41a40d462c48cbd","observation_id":"d49a46f1-034c-44f3-949b-271018d67f4f","resolution":{"observed_at":"2026-06-30T00:04:06.387716Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2311.17136/citation-record","integrity":"/paper/2311.17136/integrity","json":"/paper/2311.17136/citation-record.json","paper":"/paper/2311.17136"},"outbound":[],"paper":{"arxiv_id":"2311.17136","last_updated":"2023-11-28T18:55:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T18:55:52Z","title":"UniIR: Training and Benchmarking Universal Multimodal Information Retrievers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2311.17136."}