{"as_of":"2026-08-09T13:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6dbbaeb55b698549dd6d027cb98a8bda7026bde9b2cf9f1234640c020881abc","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:25:54.587472Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-07T14:25:54.587472Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.587472Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:7488698f1fda525b0b91ed313fcf7cd27572aa24dceddcd97384ed6f6ed13970","observation_id":"27933465-9277-4982-a242-568cca4b7967","resolution":{"observed_at":"2026-08-07T14:25:54.587472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-07T05:18:24.201734Z","title":"K., Martínez, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08354","last_updated":"2026-05-28T08:13:47Z","snapshot_observed_at":"2026-08-07T05:10:51.150588Z","submitted_at":"2025-06-10T02:11:42Z","title":"Position: Text Embeddings Should Capture Implicit Semantics, Not Just Surface Meaning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:24.201734Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2506.08354"},"observation_digest":"sha256:1594f4470c1961578ee32709a23b78fd33388c4a182c7f587388ac49f275565d","observation_id":"8f096dad-c98c-4e6c-b3e8-2e41080854c1","resolution":{"observed_at":"2026-08-07T05:18:24.201734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-07T00:57:02.482363Z","title":"K.; Mart \\' nez, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12364","last_updated":"2025-06-22T13:42:54Z","snapshot_observed_at":"2026-08-07T00:49:22.617336Z","submitted_at":"2025-06-14T05:55:00Z","title":"MM-R5: MultiModal Reasoning-Enhanced ReRanker via Reinforcement Learning for Document Retrieval","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:02.482363Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2506.12364"},"observation_digest":"sha256:af94b32d89ec0a10aafabbbda2ea59a29e57554ff2d4ba4336c3c1540823fa51","observation_id":"a17f97fd-89cf-4b74-9030-2c605e030027","resolution":{"observed_at":"2026-08-07T00:57:02.482363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-05T22:09:15.681915Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 13700–13710","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.07470","last_updated":"2025-08-21T16:39:49Z","snapshot_observed_at":"2026-08-07T09:50:14.288346Z","submitted_at":"2025-08-10T20:06:42Z","title":"AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T22:09:15.681915Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2508.07470"},"observation_digest":"sha256:cf6f8bfd4285179fefec63f7e1d9c26459ef8d6673554b323af202be81ce8c95","observation_id":"2b12457c-5b01-447d-ac71-1375b9ea22f4","resolution":{"observed_at":"2026-08-05T22:09:15.681915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":"2405.20204","doi":"10.48550/arxiv.2405.20204","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jina clip: Your clip model is also your text retriever","venue":"arXiv (Cornell University)","work_id":"74c4e5a2-b605-4aa1-9dc1-c6545249bcde","year":2024},"citing_paper":{"arxiv_id":"2604.07079","last_updated":"2026-04-08T13:35:09Z","snapshot_observed_at":"2026-07-06T22:55:24.459130Z","submitted_at":"2026-04-08T13:35:09Z","title":"MARVEL: Multimodal Adaptive Reasoning-intensiVe Expand-rerank and retrievaL","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T17:51:16.675856Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2604.07079"},"observation_digest":"sha256:68a24f18c4c2ff40f0342bcbd2863c44cf2873c25b5510c711a0a63d6fc9d430","observation_id":"34f2df9d-6b4b-40db-baf5-a60c3f7a1609","resolution":{"observed_at":"2026-05-11T06:00:58.367741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":"2405.20204","doi":"10.48550/arxiv.2405.20204","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jina clip: Your clip model is also your text retriever","venue":"arXiv (Cornell University)","work_id":"74c4e5a2-b605-4aa1-9dc1-c6545249bcde","year":2024},"citing_paper":{"arxiv_id":"2604.07201","last_updated":"2026-04-08T15:28:21Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T15:28:21Z","title":"BRIDGE: Multimodal-to-Text Retrieval via Reinforcement-Learned Query Alignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T17:28:59.838565Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2604.07201"},"observation_digest":"sha256:14ce084a8746cb9eed6ef3313016afda683172324331de7948f94debaa0d504d","observation_id":"7272083d-76f2-4baa-a4ee-b92f93047d00","resolution":{"observed_at":"2026-05-11T06:41:58.336606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":"2405.20204","doi":"10.48550/arxiv.2405.20204","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jina clip: Your clip model is also your text retriever","venue":"arXiv (Cornell University)","work_id":"74c4e5a2-b605-4aa1-9dc1-c6545249bcde","year":2024},"citing_paper":{"arxiv_id":"2604.12371","last_updated":"2026-04-15T02:42:08Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T06:59:27Z","title":"Reading Between the Pixels: Linking Text-Image Embedding Alignment to Typographic Attack Success on Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:19.310821Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2604.12371"},"observation_digest":"sha256:182bc9af48b92afc2d98c1707929de36bded0399fef66a863cff7f4a1b5d0e94","observation_id":"d4ea2ad9-f244-488b-a5b1-93850ff9909e","resolution":{"observed_at":"2026-05-11T08:30:56.685664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":"2405.20204","doi":"10.48550/arxiv.2405.20204","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jina clip: Your clip model is also your text retriever","venue":"arXiv (Cornell University)","work_id":"74c4e5a2-b605-4aa1-9dc1-c6545249bcde","year":2024},"citing_paper":{"arxiv_id":"2604.25102","last_updated":"2026-04-28T01:21:47Z","snapshot_observed_at":"2026-07-06T23:11:02.043135Z","submitted_at":"2026-04-28T01:21:47Z","title":"One Perturbation, Two Failure Modes: Probing VLM Safety via Embedding-Guided Typographic Perturbations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T17:24:05.847988Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2604.25102"},"observation_digest":"sha256:bf2c1949ffa6c54b219ee6f73334101d219d114e9eb6ae45e5c7c0ffa0e0097f","observation_id":"99934a97-6fed-4880-9dca-26f56211ef13","resolution":{"observed_at":"2026-05-11T23:21:15.071233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":"2405.20204","doi":"10.48550/arxiv.2405.20204","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jina clip: Your clip model is also your text retriever","venue":"arXiv (Cornell University)","work_id":"74c4e5a2-b605-4aa1-9dc1-c6545249bcde","year":2024},"citing_paper":{"arxiv_id":"2605.03045","last_updated":"2026-05-04T18:12:33Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:12:33Z","title":"TCD-Arena: Assessing Robustness of Time Series Causal Discovery Methods Against Assumption Violations","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-08T19:04:40.817413Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2605.03045"},"observation_digest":"sha256:d7312d23acf1743a1754524cf0ecbc84f071da4a4323847cd73ff76b93f333db","observation_id":"0704295e-41db-4e75-98ba-6c0ec752b223","resolution":{"observed_at":"2026-05-08T19:09:02.722999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":"2405.20204","doi":"10.48550/arxiv.2405.20204","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jina clip: Your clip model is also your text retriever","venue":"arXiv (Cornell University)","work_id":"74c4e5a2-b605-4aa1-9dc1-c6545249bcde","year":2024},"citing_paper":{"arxiv_id":"2605.08384","last_updated":"2026-06-05T21:57:48Z","snapshot_observed_at":"2026-08-02T16:50:30.597437Z","submitted_at":"2026-05-08T18:45:15Z","title":"jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T01:28:48.722301Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2605.08384"},"observation_digest":"sha256:5da8c29c745ef763079cf8a8ddb43f691dba6d74e6aeaca9072ec0d139fcf8f4","observation_id":"5c59e35f-0378-40f6-96f4-751a7f31a020","resolution":{"observed_at":"2026-05-12T07:56:28.867871Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":"2405.20204","doi":"10.48550/arxiv.2405.20204","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jina clip: Your clip model is also your text retriever","venue":"arXiv (Cornell University)","work_id":"74c4e5a2-b605-4aa1-9dc1-c6545249bcde","year":2024},"citing_paper":{"arxiv_id":"2605.08384","last_updated":"2026-06-05T21:57:48Z","snapshot_observed_at":"2026-08-02T16:50:30.597437Z","submitted_at":"2026-05-08T18:45:15Z","title":"jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T06:57:25.015358Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2605.08384"},"observation_digest":"sha256:1f4ce9b0534bfdadf1df4c7be73a62d3a3f3f4fe73b13dced2b73a324e04e3e2","observation_id":"041fe031-0521-4a9b-9763-085fada59064","resolution":{"observed_at":"2026-05-13T07:02:27.816288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":"2405.20204","doi":"10.48550/arxiv.2405.20204","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jina clip: Your clip model is also your text retriever","venue":"arXiv (Cornell University)","work_id":"74c4e5a2-b605-4aa1-9dc1-c6545249bcde","year":2024},"citing_paper":{"arxiv_id":"2605.08384","last_updated":"2026-06-05T21:57:48Z","snapshot_observed_at":"2026-08-02T16:50:30.597437Z","submitted_at":"2026-05-08T18:45:15Z","title":"jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T22:56:43.298141Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2605.08384"},"observation_digest":"sha256:c2c2acb75a3f7fcb9450c0e2d2602f5839daf29f80ce261d8084328cc8bbe7aa","observation_id":"55ed93fa-6ac9-4c67-b0a2-a885ab380a75","resolution":{"observed_at":"2026-07-01T13:35:46.700545Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":"2405.20204","doi":"10.48550/arxiv.2405.20204","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jina clip: Your clip model is also your text retriever","venue":"arXiv (Cornell University)","work_id":"74c4e5a2-b605-4aa1-9dc1-c6545249bcde","year":2024},"citing_paper":{"arxiv_id":"2606.13288","last_updated":"2026-06-11T12:45:25Z","snapshot_observed_at":"2026-07-06T23:52:04.574604Z","submitted_at":"2026-06-11T12:45:25Z","title":"Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-27T07:03:50.311891Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2606.13288"},"observation_digest":"sha256:9dda8f41d90537b7930cab7d974fda68ef17fc94430aa89cc7aeae873a629113","observation_id":"3b2932d2-1ebd-4140-9973-cb608e17bd23","resolution":{"observed_at":"2026-07-03T14:28:31.462858Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":"2405.20204","doi":"10.48550/arxiv.2405.20204","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jina clip: Your clip model is also your text retriever","venue":"arXiv (Cornell University)","work_id":"74c4e5a2-b605-4aa1-9dc1-c6545249bcde","year":2024},"citing_paper":{"arxiv_id":"2606.26794","last_updated":"2026-06-25T09:27:54Z","snapshot_observed_at":"2026-08-03T16:40:37.506200Z","submitted_at":"2026-06-25T09:27:54Z","title":"ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T05:03:15.044146Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2606.26794"},"observation_digest":"sha256:1ea7c2030a6aad41a8c87e5c0251e018eecfbc0b3cb830ccf1208d5ca2d49233","observation_id":"af075db8-671f-4551-9335-c014c5432b89","resolution":{"observed_at":"2026-07-04T13:39:50.782048Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2405.20204/citation-record","integrity":"/paper/2405.20204/integrity","json":"/paper/2405.20204/citation-record.json","paper":"/paper/2405.20204"},"outbound":[],"paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2405.20204."}