{"as_of":"2026-08-08T11:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a8f7618a0bed65ba2869145eb56956e9082978cec0742af99aea0bc7b2ea052f","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:47:58.308176Z","state":"measured"},{"denominator":95,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":95,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:48:58.248509Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T05:48:59.054054Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"cited_work":{"arxiv_id":"2507.10095","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.10095","snapshot_observed_at":"2026-08-06T05:48:59.054054Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","venue":"cs.CV","work_id":"708a7c9d-4ffa-48f2-8191-d0d3a0d9db7e","year":2025},"citing_paper":{"arxiv_id":"2508.01219","last_updated":"2025-08-02T06:33:58Z","snapshot_observed_at":"2026-08-07T12:32:05.228293Z","submitted_at":"2025-08-02T06:33:58Z","title":"Eigen Neural Network: Unlocking Generalizable Vision with Eigenbasis","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T05:48:58.248509Z"},"links":{"cited_paper":"/paper/2507.10095","citing_paper":"/paper/2508.01219"},"observation_digest":"sha256:55da73cd9ab99e4e188efcfa36b5e4f8fceb5946d8e7e3b3a6d98e09b84ca8f2","observation_id":"660bdf26-2245-4bdf-8e7e-b8d0ad692313","resolution":{"observed_at":"2026-08-06T05:48:59.127431Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.10095/citation-record","integrity":"/paper/2507.10095/integrity","json":"/paper/2507.10095/citation-record.json","paper":"/paper/2507.10095"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.08206","last_updated":"2024-09-12T16:46:41Z","snapshot_observed_at":"2026-08-08T02:35:40.473765Z","submitted_at":"2024-09-12T16:46:41Z","title":"ComAlign: Compositional Alignment in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2409.08206","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.08206","snapshot_observed_at":"2026-08-06T17:47:58.810777Z","title":"ComAlign: Compositional Alignment in Vision-Language Models","venue":"cs.CV","work_id":"7f2d01aa-18d3-4bb2-a765-1b00f2db4678","year":2024},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:50.844567Z"},"links":{"cited_paper":"/paper/2409.08206","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:051f498a7425e5107293322c40b9ca0f0b7c25ae97dda50d29e34c9bf5df0216","observation_id":"85b82364-f8a0-4410-8018-94e29995b356","resolution":{"observed_at":"2026-08-06T17:47:58.985842Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T17:47:50.931195Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:50.931195Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:9ba1e9942d1fb44c1dff4f72b9d89817b58587d4fec626bacc269fb45541e50c","observation_id":"5eb06bef-2fc3-4f30-9434-d7eee1608165","resolution":{"observed_at":"2026-08-06T17:47:50.931195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-06T17:47:51.023553Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:51.023553Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:cf92bb00d15e25e9bfc0554423c47c13e93593092bc145a6a238cff590900108","observation_id":"afd3135c-ea32-4aeb-bf47-f167dbe7863a","resolution":{"observed_at":"2026-08-06T17:47:51.023553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-06T17:47:51.123031Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:51.123031Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:749bcde078d8acf25f235d9ece8f3b1794d1ab2b9b68e6218cf9347d5704a436","observation_id":"a0393b45-96bd-4029-b95a-7c94ffa108bf","resolution":{"observed_at":"2026-08-06T17:47:51.123031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22523","last_updated":"2025-05-28T16:09:33Z","snapshot_observed_at":"2026-08-07T22:14:12.118216Z","submitted_at":"2025-05-28T16:09:33Z","title":"PrismLayers: Open Data for High-Quality Multi-Layer Transparent Image Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22523","snapshot_observed_at":"2026-08-06T17:47:51.190600Z","title":"Prism- layers: Open data for high-quality multi-layer transparent image generative models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:51.190600Z"},"links":{"cited_paper":"/paper/2505.22523","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:0edaba478f6f357b80b28af9375a923af3cba8c845c6a25c639b25716b1c19bf","observation_id":"70c2c9f4-f23b-4a93-8bef-33bfa0a088ba","resolution":{"observed_at":"2026-08-06T17:47:51.190600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-06T17:47:51.300206Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:51.300206Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:981af4861a7d37552875687dd9d6ad22134c227a5faa9e4cf879cc2856acdbe3","observation_id":"ed9adfa0-7708-43dd-8730-9ff4da8f548a","resolution":{"observed_at":"2026-08-06T17:47:51.300206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-06T17:47:51.375599Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:51.375599Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:9e582ba3b41ec314b020c014875974209daa25663be72734e4b124f43f7b3f5c","observation_id":"28858f04-a530-40a7-a1b3-995cb6c67809","resolution":{"observed_at":"2026-08-06T17:47:51.375599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T17:47:51.456033Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:51.456033Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:5dcfac4970a255acdae55a206cca7fc353ee9caebe0dc8bc473f1a5daefdacdc","observation_id":"938540eb-a592-4be7-8f5a-1fcd2866819a","resolution":{"observed_at":"2026-08-06T17:47:51.456033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:51.529823Z","title":"Reproducible scal- ing laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:51.529823Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:08ba60a525d1e4e6b1c6fbf8ec5ebd274d9ca1e24b37909cb1bb06949eb52482","observation_id":"7d540b81-e646-4792-a26d-645d458057f3","resolution":{"observed_at":"2026-08-06T17:47:51.529823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:51.616122Z","title":"Instructblip: Towards general-purpose vision- language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:51.616122Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:5d1ff100c5bb5e393a0d0d3f6d357ca5a455e53c27142ea556ed0102cd7b20e2","observation_id":"ade1a9c4-2ce5-4298-96df-6fdf3230edad","resolution":{"observed_at":"2026-08-06T17:47:51.616122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:51.691092Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:51.691092Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:d6b4d7078bf9ad69425c0566fc2e62298cb84e79e4db4ceb3f4ccef8534140e0","observation_id":"4faabd50-9abd-4a31-b138-b46392c1996c","resolution":{"observed_at":"2026-08-06T17:47:51.691092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:51.757234Z","title":"Maskclip: Masked self-distillation advances contrastive language-image pretraining","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:51.757234Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:9a2a8ff77c44514f745aba43a00fcf3a056b8de5cbc5ca3338f74fecfbbef0f8","observation_id":"f8e15959-695a-42b4-bd32-9668e0d48eb0","resolution":{"observed_at":"2026-08-06T17:47:51.757234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07095","last_updated":"2025-07-09T17:52:04Z","snapshot_observed_at":"2026-08-06T18:45:14.871573Z","submitted_at":"2025-07-09T17:52:04Z","title":"Go to Zero: Towards Zero-shot Motion Generation with Million-scale Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07095","snapshot_observed_at":"2026-08-06T17:47:51.836489Z","title":"Go to zero: Towards zero-shot motion generation with million-scale data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:51.836489Z"},"links":{"cited_paper":"/paper/2507.07095","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:de0ee3aa203c53ea314f952388ad5905279b1a275a8d96f15a280f75d86d454f","observation_id":"899646ea-d9f0-42c5-b499-564324a4c96f","resolution":{"observed_at":"2026-08-06T17:47:51.836489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:51.895009Z","title":"Improving clip training with language rewrites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:51.895009Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:19f4ed3a2956414399d1f95e50eae06c2dd25ff014ff4fb1c89c3fc6dfe7fd2f","observation_id":"a088e4c0-c9d3-4ddb-ac43-352e9f520b67","resolution":{"observed_at":"2026-08-06T17:47:51.895009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02793","last_updated":"2024-10-28T21:15:36Z","snapshot_observed_at":"2026-08-02T05:25:18.174400Z","submitted_at":"2024-05-05T02:15:11Z","title":"ImageInWords: Unlocking Hyper-Detailed Image Descriptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02793","snapshot_observed_at":"2026-08-06T17:47:51.976190Z","title":"Im- ageinwords: Unlocking hyper-detailed image descriptions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:51.976190Z"},"links":{"cited_paper":"/paper/2405.02793","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:de19f8404a3057ec5edf05889086d494d57d9d9393091ca1a82298df68847e15","observation_id":"dea49971-4fc1-4e00-81e8-0d2aecc88b25","resolution":{"observed_at":"2026-08-06T17:47:51.976190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-08T10:08:57.896975Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-06T17:47:52.096635Z","title":"Open- vocabulary object detection via vision and language knowl- edge distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:52.096635Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:00a81100826644fcfd1d01654e6e9f159649acda450104975a3c7f9d1323027f","observation_id":"c0fb7b0c-7aae-4444-9522-df10b1fbf046","resolution":{"observed_at":"2026-08-06T17:47:52.096635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01832","last_updated":"2024-07-18T10:21:29Z","snapshot_observed_at":"2026-08-04T15:45:57.991866Z","submitted_at":"2024-02-02T18:59:58Z","title":"SynthCLIP: Are We Ready for a Fully Synthetic CLIP Training?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01832","snapshot_observed_at":"2026-08-06T17:47:52.167649Z","title":"Synthclip: Are we ready for a fully synthetic clip training? arXiv preprint arXiv:2402.01832, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:52.167649Z"},"links":{"cited_paper":"/paper/2402.01832","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:a79ad4eba0db8e552b0621fadad3880044fca61b8a0d009d86656705820955d1","observation_id":"f37346fa-c5ac-44bc-a306-54ab2c5f6b8a","resolution":{"observed_at":"2026-08-06T17:47:52.167649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:52.241373Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:52.241373Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:4144b3ba8019215bc63693c1d1aec2003a6da4e7ad7be38f46e9982382363184","observation_id":"56d02a32-66c5-4526-996d-8626deded757","resolution":{"observed_at":"2026-08-06T17:47:52.241373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:52.301323Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:52.301323Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:6227a262d1ea7ebd9dd6a78bb818fd3f00ec06e3bd1cdb408a09f35ae44d7667","observation_id":"3bd88bcf-110d-4fe7-a18b-43e7ba3f1b94","resolution":{"observed_at":"2026-08-06T17:47:52.301323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:52.382258Z","title":"Natural adversarial examples","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:52.382258Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:f498cc468bed2c3309cecf39eb87e3ef845f22089956169ea27b9ceb96728a73","observation_id":"0993e728-622f-42ee-8eff-7ab51f8dbd05","resolution":{"observed_at":"2026-08-06T17:47:52.382258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:52.468856Z","title":"Dynamicid: Zero-shot multi-id image personalization with flexible facial editability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:52.468856Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:599e132d5957b3e56dadcb9a8f92ceb9dd0e248c43fe804f6ad27c8147e71c00","observation_id":"175916ac-0f86-4e73-a6b0-5db895b865da","resolution":{"observed_at":"2026-08-06T17:47:52.468856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:52.522994Z","title":"Vcoder: Ver- satile vision encoders for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:52.522994Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:e5d16e4f1df61df5ba383db16075d9ba37f0cb8e551eb55e0e1b85722132dcc1","observation_id":"eb2da0f2-6969-471f-a46e-15dc5b7c6095","resolution":{"observed_at":"2026-08-06T17:47:52.522994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:52.606217Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:52.606217Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:01d943a9991dcc5be6b338f7015f81aca5fad71e064f7045a2d8ac5466ba85a4","observation_id":"f184e6ab-a845-4049-ba47-7fba77f79468","resolution":{"observed_at":"2026-08-06T17:47:52.606217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:52.671434Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:52.671434Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:69acb040d45d755fd74fc19eac56817bd21c823bb4871aee007acc597d734c37","observation_id":"ea6a9366-3a8d-4047-b5c8-45ebcf0c6d39","resolution":{"observed_at":"2026-08-06T17:47:52.671434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:52.755130Z","title":"Krizhevsky and G","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:52.755130Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:6e7442446c8761889e55c73482ebabe1d83fbca681bf56fe67834212ab1f3b6f","observation_id":"f8bbd309-d12f-4dfc-8d96-8c87a5b26b65","resolution":{"observed_at":"2026-08-06T17:47:52.755130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:52.863818Z","title":"Veclip: Improving clip training via visual-enriched captions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:52.863818Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:382a5069f63689292c4f50a26fee1f64798a984d01bf59e61262c0abc9134c4e","observation_id":"d5a3b105-2cab-43fb-9598-5497516bbd4a","resolution":{"observed_at":"2026-08-06T17:47:52.863818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04883","last_updated":"2024-08-09T06:17:00Z","snapshot_observed_at":"2026-08-06T04:42:43.823313Z","submitted_at":"2024-08-09T06:17:00Z","title":"ProxyCLIP: Proxy Attention Improves CLIP for Open-Vocabulary Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04883","snapshot_observed_at":"2026-08-06T17:47:52.943918Z","title":"Proxyclip: Proxy atten- tion improves clip for open-vocabulary segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:52.943918Z"},"links":{"cited_paper":"/paper/2408.04883","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:c7a7f1725c03edcf5a8303e5aa687f6d5bf4b43c8a4c78a4941a5a0a71ece853","observation_id":"9707efd1-86d7-446f-9c2d-266ad069bae7","resolution":{"observed_at":"2026-08-06T17:47:52.943918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03546","last_updated":"2022-04-03T03:33:43Z","snapshot_observed_at":"2026-08-01T06:14:31.660540Z","submitted_at":"2022-01-10T18:59:10Z","title":"Language-driven Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03546","snapshot_observed_at":"2026-08-06T17:47:53.066777Z","title":"Language-driven semantic seg- mentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:53.066777Z"},"links":{"cited_paper":"/paper/2201.03546","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:dc93e29b21cf4f3258a2281cb94b5926aca40807f2d13007f721259d86c61450","observation_id":"1bf5e39d-976d-4250-895c-595d092070c6","resolution":{"observed_at":"2026-08-06T17:47:53.066777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:53.169799Z","title":"Blip: Bootstrapping language-image pre-training for unified vision- language understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:53.169799Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:18d1d836308b0bbab9c927a47452875e59236e3aa0f867cd9d29caaf3adac566","observation_id":"df3ab08e-13fe-4c2e-9915-ff13b3447768","resolution":{"observed_at":"2026-08-06T17:47:53.169799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:53.279551Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:53.279551Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:d36ce683c4bb445a35d03354b8f9643e50319d3b28308f020835ef77656dac87","observation_id":"38902c7f-4cd6-4b7a-88ad-60d35621164e","resolution":{"observed_at":"2026-08-06T17:47:53.279551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.312814Z","title":"Grounded language- image pre-training","venue":null,"work_id":"78b62f15-eb0b-4514-ba53-5d996a6a2ae7","year":2022},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:53.358274Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:7628c672ba762d5aa434f230fc308e788c644cdd047db37a6131f54953bae2e7","observation_id":"689f7079-8927-4709-ae38-99d07585b202","resolution":{"observed_at":"2026-08-06T17:48:01.318476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.298546Z","title":"Scaling language-image pre-training via masking","venue":null,"work_id":"527a4871-d4d4-4a3a-a2f4-05928099833d","year":2023},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:53.439117Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:76f7c62cb10485111e6282f6863059dac1dd236fded8e8d392b597f203762eb6","observation_id":"8b5e591e-c7e2-422f-be41-a434ecd1d60a","resolution":{"observed_at":"2026-08-06T17:48:01.302907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00670","last_updated":"2024-06-06T13:46:15Z","snapshot_observed_at":"2026-07-06T18:23:57.071938Z","submitted_at":"2024-06-02T08:32:51Z","title":"Cascade-CLIP: Cascaded Vision-Language Embeddings Alignment for Zero-Shot Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00670","snapshot_observed_at":"2026-08-06T17:47:53.532210Z","title":"Cascade-clip: Cascaded vision-language embeddings alignment for zero-shot semantic segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:53.532210Z"},"links":{"cited_paper":"/paper/2406.00670","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:e39b1e31d3907f3c1b2bac6a5d0b237ee2f959826868993ab882edb6a77f2ac9","observation_id":"f75d187f-ca3b-4a50-bb8d-30094aacadc0","resolution":{"observed_at":"2026-08-06T17:47:53.532210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:53.632235Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:53.632235Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:6e8bef6586ce4f4e500296da69f53c539f02059f2517c2f0d35989da56d8507c","observation_id":"bd69c4e9-a10d-4040-9c09-556be97cd576","resolution":{"observed_at":"2026-08-06T17:47:53.632235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.271431Z","title":"Llava-next: Improved reason- ing, ocr, and world knowledge, 2024","venue":null,"work_id":"d42bb61b-04dd-4458-b293-83ea4a2094a6","year":2024},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:53.688289Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:0542c3ee7af71faca6d7660011c0fa8905cfc67d06934187eb9e1bfa77b5abf8","observation_id":"ce4e1047-352d-4c57-baa3-160ebe7909a5","resolution":{"observed_at":"2026-08-06T17:48:01.276811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T17:47:53.754810Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:53.754810Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:9ad6157221f785fe579195974613b8b27ccb2226e4d4513ac6c1d69a1e6bb520","observation_id":"87c2de30-0b79-43e9-b44a-1e6ae5637304","resolution":{"observed_at":"2026-08-06T17:47:53.754810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.256814Z","title":"Open vocabulary semantic segmentation with patch aligned con- trastive learning","venue":null,"work_id":"a5d34dd1-01a2-47bd-a806-a271ea5c54ea","year":2023},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:53.837321Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:72c60e004539bd952a4c2067b03e8fcbb5b4cf6e70f7760ce760e478de520494","observation_id":"dfe63ba5-7b7c-4215-a763-0e7e4f8ec317","resolution":{"observed_at":"2026-08-06T17:48:01.261207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10034","last_updated":"2025-03-28T16:47:25Z","snapshot_observed_at":"2026-07-06T19:32:42.378146Z","submitted_at":"2024-10-13T22:34:15Z","title":"TULIP: Token-length Upgraded CLIP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10034","snapshot_observed_at":"2026-08-06T17:47:53.923146Z","title":"Tulip: Token-length upgraded clip","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:53.923146Z"},"links":{"cited_paper":"/paper/2410.10034","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:0921c28445372a7cc807ee3fa095d859142113c49c4b485a6101634104a6b3f8","observation_id":"c1f8caa5-333f-45ba-b831-33fdf3fa9b2c","resolution":{"observed_at":"2026-08-06T17:47:53.923146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.241253Z","title":"Wonderturbo: Generating interac- tive 3d world in 0.72 seconds, 2025","venue":null,"work_id":"4eb1f973-c6aa-4d34-8ae4-a9343ddfb4fd","year":2025},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:54.028385Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:05a5d8e318379be4a97ca7a03cd932771f6d8fa27f14843b1daadcd4d80705d4","observation_id":"029cca05-7d20-4c51-87fd-21dbe3b0d59a","resolution":{"observed_at":"2026-08-06T17:48:01.246042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.224587Z","title":"Im2text: Describing images using 1 million captioned photographs","venue":null,"work_id":"861ec08a-f5b3-4bac-89ee-762a61d04464","year":2011},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:54.123427Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:2cd6fe3600f34ea17efe47f11c4be8a5ba73681db8e0b59b2ec5b12d75e38d16","observation_id":"dc291d73-dc63-47b4-ade4-79c070d4be35","resolution":{"observed_at":"2026-08-06T17:48:01.230216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:54.242148Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:54.242148Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:b94da56801d995b2cdae331225b26b497a74fdac61e8340a3a0f4475677afbd6","observation_id":"6f0d734b-6310-4ce9-90ef-036f7181759c","resolution":{"observed_at":"2026-08-06T17:47:54.242148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.195556Z","title":"Bizgen: Advancing article-level visual text rendering for info- graphics generation","venue":null,"work_id":"0382b59c-3784-4d22-a6f6-dce51b5334b7","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:54.384756Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:821e9fc7eb4bf634958edc45e7b1a840c68ba39229a0a17981e78d2e23fecee4","observation_id":"cbb2f623-2e56-4221-8d1b-a3ef970c5bf9","resolution":{"observed_at":"2026-08-06T17:48:01.200175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.180459Z","title":"Flickr30k entities: Collecting region-to-phrase correspon- dences for richer image-to-sentence models","venue":null,"work_id":"0d023fa9-991f-492b-b519-52a8aebc7405","year":2015},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:54.522718Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:b3da62a0135f834f65b55ff03e14c816839e42ac1d5e18285842bb278f95fe1f","observation_id":"c7914707-cbcc-420d-9889-39d67cf425e5","resolution":{"observed_at":"2026-08-06T17:48:01.185478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.166327Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"43a7d860-e73f-494e-b6fc-61e7110cc7d1","year":2021},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:54.645406Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:e3f0f34e56e2e3a3c57fe0e466584f9d84fb826ccc3b244f267e545afe1beaea","observation_id":"28f7ae4a-c9b4-4fb9-8716-61328c3dfd68","resolution":{"observed_at":"2026-08-06T17:48:01.171011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.151402Z","title":"Do imagenet classifiers generalize to im- agenet? In International conference on machine learning , pages 5389–5400","venue":null,"work_id":"70991b93-8b7d-4f1e-83d1-a4422e2afe2d","year":2019},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:54.728047Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:2bc293707e1f36e976e1f2096f8ca4b7dd596092f84a757780da1bac8f96fa94","observation_id":"bab91242-e00e-4b59-90fb-3b242f9cda8a","resolution":{"observed_at":"2026-08-06T17:48:01.155853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.136387Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"b73939af-d5a2-4e5b-9d27-b4eb034d36c1","year":2022},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:54.847562Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:9490952f5181cbe0030140a63972596922d0525d56fc92c00e324d63ec33ee9f","observation_id":"727ad07b-659c-488b-9d1e-ec414cfc7994","resolution":{"observed_at":"2026-08-06T17:48:01.141043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.120065Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":"46362909-7859-4fb3-816f-aa6026c42f8d","year":2018},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:54.951984Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:e5d7968c0e217492df8b3b64ee4312d63cbdb255f7d383ec39967635b83f1889","observation_id":"0ff8bf5a-e4fa-4a0c-a26d-8c423df35567","resolution":{"observed_at":"2026-08-06T17:48:01.124884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.105514Z","title":"Umg-clip: A unified multi-granularity vision generalist for open-world understanding","venue":null,"work_id":"bed3c974-5118-47f1-8705-579b99e7fee0","year":2025},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:55.094107Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:25759d0e853938fc1b7c01b27d8ef35a0c590cbcec423ff2f4d8c6ad013c4d51","observation_id":"245d499d-fe53-48d0-bb61-499da5580eb4","resolution":{"observed_at":"2026-08-06T17:48:01.110017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14279","last_updated":"2021-09-29T09:01:07Z","snapshot_observed_at":"2026-08-07T17:37:50.854585Z","submitted_at":"2021-09-29T09:01:07Z","title":"Localizing Objects with Self-Supervised Transformers and no Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14279","snapshot_observed_at":"2026-08-06T17:47:55.183779Z","title":"Localizing objects with self-supervised trans- formers and no labels","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:55.183779Z"},"links":{"cited_paper":"/paper/2109.14279","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:65a05e7c7878b747b9ba8c0d7d26babe7e86b6f7fce004ba299de96a78fd0b4b","observation_id":"3d6d531e-fd2d-4f98-a773-afb55277d8dd","resolution":{"observed_at":"2026-08-06T17:47:55.183779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T17:47:55.324952Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:55.324952Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:44c6aca039eddebbf80a98003a9f531adf02a9c4be3b4aabb7a08e459a5255ef","observation_id":"bc494d9b-2f1e-44c9-b2e0-76e80a0af7f5","resolution":{"observed_at":"2026-08-06T17:47:55.324952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.091555Z","title":"Yfcc100m: The new data in multimedia research","venue":null,"work_id":"535a28b6-783c-4f85-b9c8-ddc84810b2af","year":2016},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:55.486925Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:706521e983ecde978d9ee82d74d96af7e231b2fcff70544e68336d751c53cc1c","observation_id":"4e448dc6-6881-4b5d-a333-17c921c4b40e","resolution":{"observed_at":"2026-08-06T17:48:01.095838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.073689Z","title":"A picture is worth more than 77 text tokens: Evaluating clip-style models on dense captions","venue":null,"work_id":"23d07deb-7541-4367-ab56-7455b052ed70","year":2024},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:55.616713Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:9cede2124a1119c385c86cd248eb41b7c6d3780ac1d2514d8169f0c9aed170f0","observation_id":"65efc709-fe4d-4d36-9117-1bc24eb43b2e","resolution":{"observed_at":"2026-08-06T17:48:01.080064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.056166Z","title":"Position-guided text prompt for vision-language pre- training","venue":null,"work_id":"0300821e-1c92-4b26-a7e7-c5a72cdf1a81","year":2023},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:55.737623Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:26e89d507dbd1836c35f6afb59d35ecac96f6bf79d1c773766fc4eb37ad60d43","observation_id":"b3c68827-f803-439e-90b3-2966eeb41bdd","resolution":{"observed_at":"2026-08-06T17:48:01.061108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.039356Z","title":"Image as a foreign lan- guage: Beit pretraining for vision and vision-language tasks","venue":null,"work_id":"0310389c-aca8-4e5a-a71f-ca9b2a200565","year":2023},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:55.855959Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:34b1bd2d08539afab024f2013c356f0106de86e2dceb6a3bfff0eaff5543baa9","observation_id":"7e086497-050a-4e97-acf6-b36067dc6e10","resolution":{"observed_at":"2026-08-06T17:48:01.044173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05249","last_updated":"2024-11-12T19:59:51Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:52:56Z","title":"LoTLIP: Improving Language-Image Pre-training for Long Text Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05249","snapshot_observed_at":"2026-08-06T17:47:55.987654Z","title":"Lotlip: Improving language-image pre-training for long text understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:55.987654Z"},"links":{"cited_paper":"/paper/2410.05249","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:dbead63e8f14caa719c49fa64bba3375acc6abeb07106508c4da7b43dcb20500","observation_id":"0a439027-8353-4b1c-981a-0ec2b4a4eb96","resolution":{"observed_at":"2026-08-06T17:47:55.987654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03561","last_updated":"2024-12-04T18:56:04Z","snapshot_observed_at":"2026-08-02T11:20:23.474029Z","submitted_at":"2024-12-04T18:56:04Z","title":"FLAIR: VLM with Fine-grained Language-informed Image Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03561","snapshot_observed_at":"2026-08-06T17:47:56.051883Z","title":"Flair: Vlm with fine- grained language-informed image representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:56.051883Z"},"links":{"cited_paper":"/paper/2412.03561","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:6c3c9c19e4820790b3c041d8df36b3843e630e02e82520adbf75a7095a1995c3","observation_id":"e3c8eee6-d1a6-4c8e-8fae-a6925cb17173","resolution":{"observed_at":"2026-08-06T17:47:56.051883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-08-06T17:47:56.114498Z","title":"Demystifying clip data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:56.114498Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:bfbde29f40a3703f7486a663e45261d0746cc10616607b81e91f03d66bc49fa6","observation_id":"ab5e76e4-5cb3-4201-8efd-22c5c53a1fb7","resolution":{"observed_at":"2026-08-06T17:47:56.114498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-06T17:47:56.156463Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:56.156463Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:702f10124ea4a0a0ea140ad520591f9fb88c818ce4b5c7e5850ceef31dffa0c0","observation_id":"bc37e39e-0277-4cf0-8044-0384f944813d","resolution":{"observed_at":"2026-08-06T17:47:56.156463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.022359Z","title":"Fb-diff: Fourier basis-guided diffusion for temporal interpolation of 4d medical imaging,","venue":null,"work_id":"b01b262b-7eaf-416d-aabb-e154b39a218a","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:56.218338Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:e42ad817d64b7474c38bad08674fa3abdbc506226d5004df932ea3c03a33d097","observation_id":"f1bee241-eed6-4c4f-a81d-9147de762f80","resolution":{"observed_at":"2026-08-06T17:48:01.027925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:01.004106Z","title":"Temporal differential fields for 4d motion modeling via image-to-video synthesis, 2025","venue":null,"work_id":"aa1546bd-adf5-4638-bd73-639149c211f1","year":2025},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:56.315764Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:c0685bf13b92ebb135e24cc1567451dad55ec3413b406c8d86549df165118934","observation_id":"5ddd13ad-b507-4f8b-a92e-e35421b82a72","resolution":{"observed_at":"2026-08-06T17:48:01.009948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.986393Z","title":"Capsfu- sion: Rethinking image-text data at scale","venue":null,"work_id":"724489ad-4cc0-4222-8f92-2f5066847324","year":2024},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:56.396155Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:119dceec119b7432bd23dd47a5671aede6cf7f1c0a6822258322dc32a79c7785","observation_id":"ca00cd65-efd2-4abd-a442-23a2eee6796e","resolution":{"observed_at":"2026-08-06T17:48:00.992184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.966791Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"1c92e49e-b4c2-47c2-ac8d-a17f52ad5de1","year":2023},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:56.438155Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:d091bd7cccbb2398a85e80a23f85c261caf50b8c9f2c634be6f940a29e4e5785","observation_id":"b7b5ceb2-96e7-4128-9bb4-28c5d0c7d0ec","resolution":{"observed_at":"2026-08-06T17:48:00.972522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-08-06T17:47:56.501373Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:56.501373Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:3a64916703f0511d92c713bb532cc0e3678c1161e296e9c8b05fe01bde96c622","observation_id":"d91d90a1-acd1-4d8e-ad0a-ea4de23d1568","resolution":{"observed_at":"2026-08-06T17:47:56.501373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:56.618386Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:56.618386Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:0d9d0d99d8379ea93e7242d51a504dd19f7c1fd48c6dc38a925c2de2d0e954d8","observation_id":"9735214e-b1a4-4d5f-ab04-97a552d3d2be","resolution":{"observed_at":"2026-08-06T17:47:56.618386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.929532Z","title":"Exploring regional clues in clip for zero-shot semantic seg- mentation","venue":null,"work_id":"d3dce3e0-be7c-42dd-a068-4b3919738c0e","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:56.706784Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:8586a036a090a196efb5ec501481800296565ebb392cc335f502b4b3beef45a5","observation_id":"21800da7-651c-4c08-bc12-c727d5b80f70","resolution":{"observed_at":"2026-08-06T17:48:00.936071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.910071Z","title":"Dreamlip: Language- image pre-training with long captions","venue":null,"work_id":"2bcb7c63-b693-4dbc-abc8-3432bf543a06","year":2025},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:56.791346Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:bf0eae63f7c4fabd0d68e90f91abc855831120199cf639f9c86e48981ed648ad","observation_id":"5421ac72-bac2-442c-a643-c9411cda6979","resolution":{"observed_at":"2026-08-06T17:48:00.914531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.894243Z","title":"Zegclip: Towards adapting clip for zero-shot semantic segmentation","venue":null,"work_id":"a0aaaae6-a2b2-4024-8dd3-0ebbe95875f5","year":2023},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:56.860708Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:afcef0575b7f87c29de7b472a1b8a6a2e8d84686f2f4b8bad2f1c2a970ae4e09","observation_id":"462a7847-6e62-4390-99db-6e3b41da792b","resolution":{"observed_at":"2026-08-06T17:48:00.899086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.875686Z","title":"During the re-caption process, samples are randomly taken from the following 20 prompts","venue":null,"work_id":"f0a8abba-7b25-4f1e-8520-0d73f247ce66","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:56.940555Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:6362c4cd85159b666e954b0f68b84b388448769705115e6aaf35945986a2e716","observation_id":"3f7bd7fd-85a6-43f1-882a-8fb7ae5d882a","resolution":{"observed_at":"2026-08-06T17:48:00.880236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.860371Z","title":null,"venue":null,"work_id":"380fed6f-fb05-4c23-82c4-3f963c4a94d7","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:57.004886Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:285891a785a6941e26126772a1ab712e8e2e220d49092b70980d3cf2ded16192","observation_id":"b27e8572-25d7-417c-a600-bee0d405dda4","resolution":{"observed_at":"2026-08-06T17:48:00.864988Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.844384Z","title":null,"venue":null,"work_id":"21a07611-1b52-4acc-bfb0-fa2159713a40","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:57.072569Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:36994466aec9eac3ee4e725f6f0a94501aac0db8aea430cffce07ede130281af","observation_id":"2979e6db-0f6c-4255-b2db-473a56218dc8","resolution":{"observed_at":"2026-08-06T17:48:00.849510Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.830544Z","title":null,"venue":null,"work_id":"bb280bc6-7eaf-471d-8f95-371b19af1f89","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:57.135153Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:ba60b647f62cfb07dd35bc66858187816f6d9db11388a9219017e60e1ece586c","observation_id":"630a3f3a-739a-479c-b434-737331f99d67","resolution":{"observed_at":"2026-08-06T17:48:00.834782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.809531Z","title":null,"venue":null,"work_id":"efa3fe1f-a3fe-4056-a350-daa2e0221610","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:57.256816Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:d2a908b498afd1ed70cdadd35c36e6577fb5e1d62b6cf2def861e821d6f03492","observation_id":"292b5fe0-9da0-450f-a811-30b2b2ae16f9","resolution":{"observed_at":"2026-08-06T17:48:00.815510Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.793693Z","title":null,"venue":null,"work_id":"fa4b5d2d-8477-4944-be02-46ae89574526","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:57.327849Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:98120fa03886e9daae0c8077c47e7a4c552875535d03f588793936a8e21eac07","observation_id":"4399dc0f-e3cb-4c85-9f93-31825f001afe","resolution":{"observed_at":"2026-08-06T17:48:00.798569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.775071Z","title":null,"venue":null,"work_id":"69e48fe9-aa54-40df-a351-e98fcf0509c6","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:57.390660Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:656ed70d575ef78ad813c1876493f0fb665b68930292fc2da1f4aadc8caef7b6","observation_id":"5fb6db72-521d-4eea-ba5d-8d15d5f7b6f5","resolution":{"observed_at":"2026-08-06T17:48:00.779688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.754149Z","title":null,"venue":null,"work_id":"fee3d43f-f514-4d42-9824-620059706311","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:57.496477Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:e0edb370010fd0f7efad266edd3e9fa0c096c77b25cd76964f5c266898460983","observation_id":"16ced39f-51fd-4ba1-bc08-1f1ec6ad927e","resolution":{"observed_at":"2026-08-06T17:48:00.763152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.731322Z","title":null,"venue":null,"work_id":"4161d225-2299-458f-b9fd-2cd3a10bb348","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:57.556587Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:bda0d4516f41ede5f8fb0664d90086b49cfccf45fa02fd76ac0c3bd50df1b1fe","observation_id":"a5479ea5-f9f6-4c66-8327-1e0cbdf7ad6b","resolution":{"observed_at":"2026-08-06T17:48:00.736635Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.707594Z","title":null,"venue":null,"work_id":"2feb1713-573a-43df-9702-96fe44a5bf03","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:57.621546Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:65aedad864adefb958ab84ebf9b53901de157bc2ca26ac84788c1d4ec6377bcc","observation_id":"334b0f3c-161e-4fa7-9fd9-51f853f72bb5","resolution":{"observed_at":"2026-08-06T17:48:00.712612Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.686267Z","title":null,"venue":null,"work_id":"d4a4ad89-3d8d-4f51-a03e-fda626351fb1","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:57.723436Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:c97d8455931f0cff5cacd04aee45194ca7ff50b69a01a77d7007008ca2d35a5f","observation_id":"2abaedfc-af62-469a-8c19-7697cfaef980","resolution":{"observed_at":"2026-08-06T17:48:00.691201Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.667738Z","title":null,"venue":null,"work_id":"97d0fe0a-b756-4b12-9519-3b8e3cd71342","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:57.764626Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:8119cffa016cb89166890ad03736c844a99a3cd856a606fa58c4a3dd096a50f5","observation_id":"8510c5d8-f4c5-495d-bbdf-be6ca6436edb","resolution":{"observed_at":"2026-08-06T17:48:00.673643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.645823Z","title":null,"venue":null,"work_id":"a88444b1-8dd0-4a62-973f-abe80af34980","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:57.828019Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:3e2fbd80057f089c0e7489daaa50e69ee66ecad06180db786d61f1ebbd1ea0b8","observation_id":"fd9f8879-87e2-4a54-84b5-59f3da917bf5","resolution":{"observed_at":"2026-08-06T17:48:00.652297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.620012Z","title":null,"venue":null,"work_id":"71e5ab92-b028-426c-9857-763a9aeb9142","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:57.895073Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:f5e9bafcf372f7c9e834115abbee947121c3ea468893412252c33e5eb8bf9fba","observation_id":"22ced992-f3c1-4445-9f28-1447279b278e","resolution":{"observed_at":"2026-08-06T17:48:00.629924Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.591569Z","title":null,"venue":null,"work_id":"71f402f5-dfdb-47da-b28b-b5af8b75350e","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:57.960361Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:23d8662ae2f19b365693c993f74ee7826a97aca8149ed38c5ba1867fea1739cb","observation_id":"9818ae67-df68-4042-a7d5-562a803eab9d","resolution":{"observed_at":"2026-08-06T17:48:00.600287Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.573119Z","title":null,"venue":null,"work_id":"b6ddabc5-48bd-4282-8192-b9302eb64991","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:58.024087Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:512be851571b10cdada8576ce01ac09348e326f67b0c2767e2ea744133837990","observation_id":"ac6ce2f1-36ab-44f4-808a-f4d137033c05","resolution":{"observed_at":"2026-08-06T17:48:00.578432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.551584Z","title":null,"venue":null,"work_id":"adb71364-ffdb-4bee-841f-f99716d7fefc","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:58.065219Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:bd5ca31aa9c87f0e1ae03d28dcd58902884c2f043bd9fad395504937102e5bd6","observation_id":"d9984249-4631-4ce7-813a-f1ef90a0a32f","resolution":{"observed_at":"2026-08-06T17:48:00.556838Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.532220Z","title":null,"venue":null,"work_id":"262d5132-67e1-4cd9-b350-ddd89ba527d5","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:58.176510Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:f7767dbbb24a5ff7e845f96cc260e31c770db4061a180b37641bb4924c0fcdea","observation_id":"9a450b0f-a173-4834-a6fb-61b3e8b55c1d","resolution":{"observed_at":"2026-08-06T17:48:00.536723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.515692Z","title":null,"venue":null,"work_id":"6fcffcac-3ab8-478d-9abc-9f87df1be060","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:58.244879Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:b864924a59812adba7559aa9fa84337d9a89e54cdfee66297660efd711cd4e74","observation_id":"dd41036f-1848-4dae-97e2-edb3d32b46d5","resolution":{"observed_at":"2026-08-06T17:48:00.521128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.500249Z","title":null,"venue":null,"work_id":"70bd7d0d-2f5f-4e94-8ebe-01d01ae39718","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:58.274042Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:21c183bc804ae1c810e30183dd2dec25a24476b15ae9e7c0c9644578c645c692","observation_id":"cc697d6f-033e-4ba5-b1f3-f299809ead8c","resolution":{"observed_at":"2026-08-06T17:48:00.505202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.482610Z","title":null,"venue":null,"work_id":"d2a5de77-21fd-4e2a-bf82-5c277be8a753","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:58.279069Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:3c6b06ebc5befb6b003d6570fab6f96c57a68284add90d0887345aa0996843b4","observation_id":"c6a95066-2bf9-4323-96c3-827cc939b0a7","resolution":{"observed_at":"2026-08-06T17:48:00.487803Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.381327Z","title":"We apply a simple filtering method on captions to reduce repeated words, meaningless sentences, and short results","venue":null,"work_id":"717bcaf6-8f99-4369-9c90-362c66805223","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:58.284468Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:6129efa5bb24d137202794929d9723de5e0344b0f59ec6bfc850b6f115b61e7c","observation_id":"7318b5a6-9db1-4156-a524-9e236f79ca00","resolution":{"observed_at":"2026-08-06T17:48:00.469236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:00.144090Z","title":"5th of October, there’s a significant event highlighted in blue - the launch","venue":null,"work_id":"e28f56bc-ace3-4ab6-bec5-fd50b5016218","year":2012},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:58.289503Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:8e7434b0eb6e49d1712eeaed45641c17189d7024fb23c7fe4a5a10d77b30facc","observation_id":"dd714861-6b4d-4d9c-b50a-12f83254acce","resolution":{"observed_at":"2026-08-06T17:48:00.250320Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:59.860932Z","title":"Shared Prompts","venue":null,"work_id":"adbd88eb-30ee-4c77-80c7-7659f84b3181","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:58.294865Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:ceca0665b54f7a80ec5d936a7084eed55d19ef75cdf4cb54cca889d9dad97295","observation_id":"f0a4420a-820d-4fcf-864c-64efaf7c91f2","resolution":{"observed_at":"2026-08-06T17:47:59.972954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:59.582583Z","title":"8, the regional prompts obtain stronger responses in the corresponding local patches","venue":null,"work_id":"500393f2-916d-4f0f-833b-f3b0d1e2d6d0","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:58.298832Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:710567089693dce780f09ce6b1f8ed5a415a24702fd5f48cc69b91d977746ea1","observation_id":"a91ca14b-6d26-4954-9d66-065ab404ec9f","resolution":{"observed_at":"2026-08-06T17:47:59.679889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:59.348910Z","title":null,"venue":null,"work_id":"f27f13e7-6f4f-4b05-8f2e-8dd9cfab8726","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:58.302953Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:5cf97bcc2d2feb367a54d7065cdea5d443d6d403a35fca1e767aba1e44984e28","observation_id":"b917b074-82b1-4f5e-9acf-087729fe5ba7","resolution":{"observed_at":"2026-08-06T17:47:59.460818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:59.107037Z","title":"We replace the original text encoder in the stable-diffusion model with that in Long- CLIP [63] or ours","venue":null,"work_id":"4cacbc32-525f-427a-8046-717e691b1755","year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:58.308176Z"},"links":{"citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:9864f21a55ed0a4ccb1d696a3c1aae523b36c24f5a1540f6ac747425524a7149","observation_id":"a663cbe5-11fc-4b8c-be9f-c887bd864bbe","resolution":{"observed_at":"2026-08-06T17:47:59.238484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:28:59.534016Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 1 inbound Pith citation observation for arXiv:2507.10095."}