{"as_of":"2026-08-07T18:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9fbd495af5a0e4e9d04941c5b715842e6036237dfcf18f09dfc933f1cd05027","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:20:24.896064Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.00751/citation-record","integrity":"/paper/2509.00751/integrity","json":"/paper/2509.00751/citation-record.json","paper":"/paper/2509.00751"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T13:20:24.709706Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.709706Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:9392769a6ca8dad1880c6ba6a7a41ff0b0b6cd79159a1ffe91904b34df81b0d1","observation_id":"ba4f3700-da5a-443b-be8f-67a95ac75714","resolution":{"observed_at":"2026-08-05T13:20:24.709706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T13:20:24.715569Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.715569Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:b865158f335be7402c13ba9e84d512479aca5f0e276ec7ccc451f83693f1edcf","observation_id":"4c8ddba1-894f-4cdb-b83f-cb46280c5fbb","resolution":{"observed_at":"2026-08-05T13:20:24.715569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T13:20:24.720808Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.720808Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:f050aef1386ee797f36a5b5579789ade93052fe5b3039507e1afd534ee0ec437","observation_id":"00c44219-fffe-4300-81b4-c357adb6f98a","resolution":{"observed_at":"2026-08-05T13:20:24.720808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T13:20:24.726116Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.726116Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:88400301c41def7b1c2209e0c0bd4ff8f5609a356049859b6822171548fecfe7","observation_id":"7ec55484-8016-45d4-b828-f017c78e9fa2","resolution":{"observed_at":"2026-08-05T13:20:24.726116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03216","last_updated":"2025-12-12T11:26:32Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T17:26:49Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03216","snapshot_observed_at":"2026-08-05T13:20:24.731637Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.731637Z"},"links":{"cited_paper":"/paper/2402.03216","citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:57e5f34957e72efc543ae7defdeb4fb6a72d9223831cd8ee28e0b9c11487764e","observation_id":"7cc956e6-2303-4476-b310-98e542ca8871","resolution":{"observed_at":"2026-08-05T13:20:24.731637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:24.736862Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.736862Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:82b2afa701838cd576d871c4dca0d463f3669983c2975b92b07a8f060195de9f","observation_id":"a0015b86-082d-4abd-aa84-8c23e411c6e7","resolution":{"observed_at":"2026-08-05T13:20:24.736862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:25.436077Z","title":null,"venue":null,"work_id":"f0b47dab-02ad-47f2-a47f-a0bee2d4f2b2","year":2020},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.748207Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:7a1ec77a1a5f1f0308d6c6d6cb6bb825bab93135be8c8039569846c7334fc9d0","observation_id":"bfdb86a6-e6ae-4226-be67-4f1beaefac75","resolution":{"observed_at":"2026-08-05T13:20:25.441161Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:25.418820Z","title":null,"venue":null,"work_id":"e2e7d332-7771-41a7-a693-48d0bf968fa9","year":2024},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.753666Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:904861ca263665b404de176aa8ea0cfc016d1cfd803addff5d44f334b3d6ecc2","observation_id":"a2c70b80-c51e-43e2-8eae-91a63200fa83","resolution":{"observed_at":"2026-08-05T13:20:25.424421Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:24.758596Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.758596Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:da191bf38d98a4a2328b634447997d180bb1e45f30b642b4f611bb49f7b70a65","observation_id":"9fbd77a6-6124-4157-916c-38864d57c959","resolution":{"observed_at":"2026-08-05T13:20:24.758596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:25.392207Z","title":null,"venue":null,"work_id":"3b539fb6-ccb5-4968-ae90-c9e46718745e","year":2023},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.763008Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:1bb457b2fc7da4665a8eb5004ab2e0e7f059dc1532e0517c026dabc2d58e48b6","observation_id":"c7e4ef69-4685-4e0f-ac87-ea8759d9a93d","resolution":{"observed_at":"2026-08-05T13:20:25.397287Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:25.376698Z","title":null,"venue":null,"work_id":"4ca32ea3-c1ac-411a-a9d4-18c03a4aca44","year":1995},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.767568Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:402970bf642c4f7caca4dc9a3eac2babc8e47142550af8c73e557565e9460a3a","observation_id":"e8f5eb5d-cfb3-43a3-ac70-44bdcf4230a0","resolution":{"observed_at":"2026-08-05T13:20:25.381813Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:24.772203Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.772203Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:0abca54470184d7b4ee4bcaed63698652ce30462c43c5e6fe58b87db14d1d1cd","observation_id":"e951aef7-879e-4e95-a3a0-911bbeb6de14","resolution":{"observed_at":"2026-08-05T13:20:24.772203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:24.777042Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.777042Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:f5de73035fb87061a97e4721e219d869e8c78ad1a87343a4f3e16cf6e6605ccf","observation_id":"56d93e48-6ffd-4046-bb70-a50f7977209d","resolution":{"observed_at":"2026-08-05T13:20:24.777042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:25.338208Z","title":null,"venue":null,"work_id":"1e31919d-dad5-49f8-9588-c890866bf95f","year":2022},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.781474Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:405a553a5727dda5ba547281516746d36f3f2c623014fe41b5c7c0bfa6b1b0a0","observation_id":"b5c08939-8160-4d98-b19f-c243fabbf6b9","resolution":{"observed_at":"2026-08-05T13:20:25.344445Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:25.322527Z","title":null,"venue":null,"work_id":"71b67c35-fa4d-4fcb-b55d-1b408cd224c8","year":2021},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.785889Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:3a69f0ca3df5644e5c3c28a1a496b00cb863dcc3a61d619d931123dfb5d41438","observation_id":"ea792e56-18eb-4e0d-8078-8e2d406c8085","resolution":{"observed_at":"2026-08-05T13:20:25.327406Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:24.790557Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.790557Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:85c5e2ee052815028f225ac48c497e8701df4a5b5016c5347c17f6bafa4e556a","observation_id":"4185c4c7-6cff-48d0-aa35-3dc1956adda3","resolution":{"observed_at":"2026-08-05T13:20:24.790557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:24.795037Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.795037Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:45504bb8048bac0764e2b5ee853c5913b992bb351359c6dab7ae3911d1f62b1f","observation_id":"aac23549-64b2-46af-890b-3583c0a9767b","resolution":{"observed_at":"2026-08-05T13:20:24.795037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:24.799524Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.799524Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:4a35f72b7699add6a855bd11eb374bbb475db1acf19c4de2a7b592821be57bbe","observation_id":"05cf2555-a81f-4009-8b2d-2afaa45de3e5","resolution":{"observed_at":"2026-08-05T13:20:24.799524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:24.804385Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.804385Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:c96a9f520723b08f9de80828795bd8ea3660672756e491b9e8fdd287ed9ec3c9","observation_id":"6aa82e7d-4977-4e4c-9179-f94eb9b0030c","resolution":{"observed_at":"2026-08-05T13:20:24.804385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:25.266213Z","title":null,"venue":null,"work_id":"a6281b16-78d2-4148-b7c2-6eae77b07d53","year":2022},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.809287Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:05c2a223418fbad3f27b4983509294a24fd174b73574d45b7a9760001dbbcef1","observation_id":"96863ff1-e20c-42e3-926d-f7c326fcb44f","resolution":{"observed_at":"2026-08-05T13:20:25.271631Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:24.814778Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.814778Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:035de361e6c55cf8261a3fa21b0810e552e037756a585b56ec72c699231575e4","observation_id":"8f156436-d3f6-4883-bcfc-0ac05adb6bf0","resolution":{"observed_at":"2026-08-05T13:20:24.814778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:24.824069Z","title":"Nguyen, Minh-Triet Tran, and Trung-Nghia Le","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.824069Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:0c945dec7912c5cf4aa88f714afcfbb6c1dc79cb6d93eebc37c007c5d701bdf7","observation_id":"d04a9651-37a2-4e98-bcff-ac224fbf6a05","resolution":{"observed_at":"2026-08-05T13:20:24.824069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:25.211405Z","title":null,"venue":null,"work_id":"f796741a-71d5-4376-98e0-a9169aaada2a","year":2015},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.829139Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:1a726d62313ee869cc003d3800554148e6f08ad70129af2e373f3a02760b42ee","observation_id":"6d8eaf1e-ce3a-44c2-9ea5-c0a604b6f33b","resolution":{"observed_at":"2026-08-05T13:20:25.216797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:24.833673Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.833673Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:f9b8dcbdf9f9cef5936a81ea3b828c384524aa287766cb4a25e183cbf983e848","observation_id":"d982d7de-d05f-417d-87a1-6c1657889964","resolution":{"observed_at":"2026-08-05T13:20:24.833673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-06T03:44:36.669916Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07490","snapshot_observed_at":"2026-08-05T13:20:24.838309Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.838309Z"},"links":{"cited_paper":"/paper/1908.07490","citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:9dfe65bd32a6a22b6623beebc044de834143c5e1ad691e51000adb831bf6d250","observation_id":"aa4d9f69-cad2-444b-ba9f-b2c912d277e4","resolution":{"observed_at":"2026-08-05T13:20:24.838309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:25.184776Z","title":"Nguyen, Trong- Le Do, Duy-Nam Ly, Viet-Tham Huynh, Khanh-Duy Le, Mai-Khiem Tran, and Trung-Nghia Le","venue":null,"work_id":"2462ab4a-51b3-4aa5-bce7-1ae6f1b513f4","year":2025},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.844117Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:21916f7cbb11e253e7ca886cf651e63fe3ab91e2adc7166bc59a7ebd0a1f4685","observation_id":"4aa2f11b-a752-4c08-b4ea-ef4838dbae55","resolution":{"observed_at":"2026-08-05T13:20:25.190293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-05T13:20:24.848929Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.848929Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:9abaed71c9a6f2d86e3b9f3e511934f81b5ccc17965c46ff42706b60c4e75782","observation_id":"417bc4fd-969b-4d09-83bd-a8cdb20423d9","resolution":{"observed_at":"2026-08-05T13:20:24.848929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05672","last_updated":"2024-02-08T13:47:50Z","snapshot_observed_at":"2026-07-30T09:46:51.062184Z","submitted_at":"2024-02-08T13:47:50Z","title":"Multilingual E5 Text Embeddings: A Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05672","snapshot_observed_at":"2026-08-05T13:20:24.853800Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.853800Z"},"links":{"cited_paper":"/paper/2402.05672","citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:f1978fa0748364e0643960024a3712d3829a5c375251e5f3d108e8cb1c2c5646","observation_id":"5f0cfd9b-cf5b-470a-92d6-ea12235f635e","resolution":{"observed_at":"2026-08-05T13:20:24.853800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T13:20:24.858768Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.858768Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:56929f180bf66c258a1df76a4be45c9d9cb0db5d2e9754970c72aaa44d281ced","observation_id":"3dae9e67-49a4-4eea-81fc-c0e8f6f1024f","resolution":{"observed_at":"2026-08-05T13:20:24.858768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T13:20:24.864067Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.864067Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:81d0c25ac99c707350ecef0d98232ea339e5e1dfb674d8cc9ed67e191142d8e8","observation_id":"2b39345d-4fff-4a83-8689-324fee66e422","resolution":{"observed_at":"2026-08-05T13:20:24.864067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-05T13:20:24.869428Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.869428Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:307edb2979d7e4e2ce727c41d10aee488ebb207e0363ab783c514960b5db376a","observation_id":"33d80dff-854f-4b65-838d-a848743dee45","resolution":{"observed_at":"2026-08-05T13:20:24.869428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:25.168701Z","title":null,"venue":null,"work_id":"30a4ab5b-1f07-4cff-96d1-d3a182c83eed","year":2023},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.874758Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:fe382cd9534e3b39c37aaac6dc3b402218327a566193057088d74e0de0cc8343","observation_id":"4b52d4c6-27be-4866-9beb-b16c03b92dcf","resolution":{"observed_at":"2026-08-05T13:20:25.173552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16855","last_updated":"2025-04-01T08:48:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-22T04:40:24Z","title":"GME: Improving Universal Multimodal Retrieval by Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16855","snapshot_observed_at":"2026-08-05T13:20:24.879760Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.879760Z"},"links":{"cited_paper":"/paper/2412.16855","citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:bdcab7482adbd4299aadb4e5babf1a21d69826860e07c8b3f7acfc5ac4cb4f3b","observation_id":"c352b64c-c27c-44b7-9363-6b4196fd20b0","resolution":{"observed_at":"2026-08-05T13:20:24.879760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:25.152111Z","title":null,"venue":null,"work_id":"42bee823-628f-448a-9f68-9df0c34d61ea","year":2025},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.885446Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:2cabd911f1a2e422174d5e9f9cba5f142476ec41ed415f5767290d7c2e9a017b","observation_id":"26b16b14-6ad6-49bf-96fc-29303c84cdb9","resolution":{"observed_at":"2026-08-05T13:20:25.157665Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-08-05T13:20:24.890387Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.890387Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:d1a979a31516bf2d57312c8ab2690cf0d20f624eee4f72c5a4e3f9c5f2495c40","observation_id":"9ed0bc8b-7428-4ca4-b74f-bbcf8d513aee","resolution":{"observed_at":"2026-08-05T13:20:24.890387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:25.133823Z","title":null,"venue":null,"work_id":"e74c08f0-0042-4d84-80e0-ecc2636d406d","year":2022},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.896064Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:94cf2a9a859f760fc50232c84b23592f8f32c6c4dc2039d165e5026111923275","observation_id":"08767cdc-8871-4222-8265-bfe0e6f1d334","resolution":{"observed_at":"2026-08-05T13:20:25.140830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:25.237982Z","title":"In Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"ae31a3a5-e010-48ff-8747-98f08e4d1043","year":null},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.819378Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:78d5b4bb30d9133b05038ab43e6ec481432ccf6674c50a5d4e4807e6c76508a2","observation_id":"cb710c61-b1b1-48c8-a2ed-bff1a8322676","resolution":{"observed_at":"2026-08-05T13:20:25.243616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:20:25.452235Z","title":null,"venue":null,"work_id":"05957599-725c-4d68-ab86-43c52149922c","year":2024},"citing_paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T13:20:24.741769Z"},"links":{"citing_paper":"/paper/2509.00751"},"observation_digest":"sha256:21a4ddd8754b2f65acde1b27985ad4bb476608bc7fe9fd6d9ad0c83260ce3710","observation_id":"4baca615-15be-420b-89a2-1b004cc556fa","resolution":{"observed_at":"2026-08-05T13:20:25.457995Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.00751","last_updated":"2025-08-31T09:03:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T03:45:10.548595Z","submitted_at":"2025-08-31T09:03:25Z","title":"EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2509.00751."}