{"as_of":"2026-08-05T23:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:58e97fdd53d9d401e271694047846265c0161699ce7f18eb1b20bd9b48533b7e","coverage":[{"denominator":126,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T15:43:04.068454Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:43:26.613972Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T11:43:27.703168Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"cited_work":{"arxiv_id":"2607.18237","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.18237","snapshot_observed_at":"2026-08-05T11:43:27.703168Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","venue":"cs.CV","work_id":"ba75f5da-326f-4c2a-acef-64f7b8f2d3ed","year":2026},"citing_paper":{"arxiv_id":"2608.03826","last_updated":"2026-08-04T15:36:17Z","snapshot_observed_at":"2026-08-05T23:37:58.468181Z","submitted_at":"2026-08-04T15:36:17Z","title":"Geo-Embed: Towards Unified Multimodal Embeddings for Urban Understanding","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T11:43:26.613972Z"},"links":{"cited_paper":"/paper/2607.18237","citing_paper":"/paper/2608.03826"},"observation_digest":"sha256:583a4000ae75e5e4ba0c5203119aa4ad6163d40531f987478f45deb9122f5768","observation_id":"238a3b00-e386-4bbc-acf0-02289829a3c9","resolution":{"observed_at":"2026-08-05T11:43:27.836119Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.18237/citation-record","integrity":"/paper/2607.18237/integrity","json":"/paper/2607.18237/citation-record.json","paper":"/paper/2607.18237"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:53.320824Z","title":"Image quality assessment: from error visibility to structural similarity.IEEE Transactions on Image Processing, 13(4):600–612, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:53.320824Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:88c1fefe48336ef0dcd87046c7f1b47a850073eb9ce86ebf498236c08d593953","observation_id":"8dc5014c-b66e-4ec7-84ef-5f1398f139f8","resolution":{"observed_at":"2026-08-01T15:42:53.320824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:53.395626Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:53.395626Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:bdf7bdcd9497782dfc2bb07b48c5814f52748c6e9eafa11e6128129b531ad6ca","observation_id":"ad0ac39b-0119-4ba1-9639-d0581e83955c","resolution":{"observed_at":"2026-08-01T15:42:53.395626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:53.489385Z","title":"DreamSim: Learning new dimensions of human visual similarity using synthetic data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:53.489385Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:6bc3244f3531fde40706fc5a7813a4e02a633d2bdeed96355bfa6847f2ebc20e","observation_id":"d72e7b48-1f23-48ed-a4e0-9ef9d235f3cc","resolution":{"observed_at":"2026-08-01T15:42:53.489385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:53.580404Z","title":"Features of similarity.Psychological Review, 84(4):327–352, 1977","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:53.580404Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:c88215340d355fc68110cf6d169c0d375d2b3dd3c05aee18f0592cf22c4174c8","observation_id":"081c99c3-7c97-430b-b06d-db048ae83c39","resolution":{"observed_at":"2026-08-01T15:42:53.580404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:53.674454Z","title":"Respects for similarity.Psychological Review, 100(2):254–278, 1993","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:53.674454Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:30e8467ff6bd86a36e12d626f825ce91b1174b11c3713f9533e4edd4ab201850","observation_id":"5abb6494-328a-4871-9049-26b3aa513d8b","resolution":{"observed_at":"2026-08-01T15:42:53.674454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:53.761841Z","title":"FSIM: A feature similarity index for image quality assessment.IEEE Transactions on Image Processing, 20(8):2378–2386, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:53.761841Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:346530be08d42924072ebd4e7470373f5f28f41a880e3d9657921b10db44ecfd","observation_id":"18564c58-40bc-4e3e-96b1-14576272c6aa","resolution":{"observed_at":"2026-08-01T15:42:53.761841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:53.826536Z","title":"HDR-VDP-2: A calibrated visual metric for visibility and quality predictions in all luminance conditions.ACM Transactions on Graphics (Proc","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:53.826536Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:a24cbf0941a25f1efa2fbdcb5128b89a0ffc2534e4508fab548c1c4bc77d7add","observation_id":"7aafc947-5ca6-44a0-b060-eca9fa8bec2e","resolution":{"observed_at":"2026-08-01T15:42:53.826536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:53.896997Z","title":"GeneCIS: A benchmark for general conditional image similarity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:53.896997Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:61c4fecffa172f6090c15aa625e3e03db9069351ad9c13ecdc2ca8148badc742","observation_id":"0fdbb787-7bd3-4a29-a8d0-789fac99db71","resolution":{"observed_at":"2026-08-01T15:42:53.896997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08368","last_updated":"2025-04-11T09:07:05Z","snapshot_observed_at":"2026-08-04T12:40:50.933295Z","submitted_at":"2025-04-11T09:07:05Z","title":"FocalLens: Instruction Tuning Enables Zero-Shot Conditional Image Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08368","snapshot_observed_at":"2026-08-01T15:42:53.983507Z","title":"Focallens: Instruction tuning enables zero-shot conditional image representations.arXiv preprint arXiv:2504.08368, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:53.983507Z"},"links":{"cited_paper":"/paper/2504.08368","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:f67c6ad04cdd882db2145fd3022ca7aeebf9a793dad64821243c277bde15d8e2","observation_id":"e866951c-e765-4f68-be28-5bb3b0ca250f","resolution":{"observed_at":"2026-08-01T15:42:53.983507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.10955","last_updated":"2026-04-30T17:59:43Z","snapshot_observed_at":"2026-08-04T18:59:53.204146Z","submitted_at":"2025-12-11T18:59:56Z","title":"Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.10955","snapshot_observed_at":"2026-08-01T15:42:54.057921Z","title":"Omni-attribute: Open-vocabulary attribute encoder for visual concept personalization.arXiv preprint arXiv:2512.10955, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:54.057921Z"},"links":{"cited_paper":"/paper/2512.10955","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:339729f86eae1da03a47c5509ff98dea579ef0ca3ddab5c1a7061b8065b9df13","observation_id":"084f9d75-3c5e-4095-bc25-415c17a4a686","resolution":{"observed_at":"2026-08-01T15:42:54.057921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:54.136636Z","title":"THINGS: A database of 1,854 object concepts and more than 26,000 naturalistic object images.PLOS ONE, 14(10):e0223792, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:54.136636Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:a85e8c521f2330da2ee8f9265a541becb674873bf365347842b3e9ffb9310f8f","observation_id":"b4cdf446-56b8-47eb-b3a9-c415239d2327","resolution":{"observed_at":"2026-08-01T15:42:54.136636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:54.241360Z","title":"GPT-4V(ision) system card.OpenAI Technical Report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:54.241360Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:01097b70a5f3a1197d1ac0a929fa006d6ddc8203de3064fe45732403b678c609","observation_id":"4f2682db-d7db-47f9-8042-768ef358c7dc","resolution":{"observed_at":"2026-08-01T15:42:54.241360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-01T15:42:54.321607Z","title":"Gemini: A family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:54.321607Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:2ae6f1369bb135b117edc0f222d7054f5da466f49303f9066877d592a0565c5a","observation_id":"6891513a-4177-4ddc-86a7-ae453f3c3854","resolution":{"observed_at":"2026-08-01T15:42:54.321607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-01T15:42:54.413463Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:54.413463Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:1609579c85d370b2984db2c5e6e6d5d4d29bb0be8e47d5ca201db2ea9bacb926","observation_id":"5c98f41c-fa32-4afa-84c8-f293784391f2","resolution":{"observed_at":"2026-08-01T15:42:54.413463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:54.466808Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:54.466808Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:22fa63f8561700a8b2117fb3e5fba22b12e2a6c5b73c3ddc25bd13736f1162ad","observation_id":"5cf9da9e-3365-4a08-89bb-7f733632d7b9","resolution":{"observed_at":"2026-08-01T15:42:54.466808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:54.607195Z","title":"Qwen3-VL-Embedding and Qwen3-VL- Reranker: A unified framework for state-of-the-art multimodal retrieval and ranking.arXiv preprint, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:54.607195Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:594df5164ea96a778cf63335a0d0d5909cf4d53f203bf0faf92132302e8e4ea7","observation_id":"b05a11f6-5641-463a-bd23-f00f2b95190d","resolution":{"observed_at":"2026-08-01T15:42:54.607195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:54.664255Z","title":"ImageNet classification with deep convolutional neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:54.664255Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:56478e85c0fd0f027736bae466affc509fc6c15eb22ded1835f2cfcb8596c16b","observation_id":"c8655d58-0f1c-4d42-a28e-85b30032bd61","resolution":{"observed_at":"2026-08-01T15:42:54.664255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:54.754588Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:54.754588Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:134d2cc277c8278ace591f4f7847fba359551404be9a59f6882d58bd3a8e8f8a","observation_id":"0a9ea458-a14f-454a-a445-a4755c8f0bc8","resolution":{"observed_at":"2026-08-01T15:42:54.754588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:54.836815Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:54.836815Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:3d8aaf68f14316937441a7270cc3129dbfa4e020d6b838b7c01bd0e42678a676","observation_id":"488b3466-ecb6-4dad-b85a-b7cca1dd9ccd","resolution":{"observed_at":"2026-08-01T15:42:54.836815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:54.955281Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:54.955281Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:1f45d1e370c4b30c6ee93ec9dad044c6a8842a6c7d73516f3e6cadf7be6779ab","observation_id":"72f09c5f-f7b1-413c-9818-cff1cb957a83","resolution":{"observed_at":"2026-08-01T15:42:54.955281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:55.033336Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:55.033336Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:489b8a5c6114f8092f378a4a53f7ac9cb115f2adf16487bf6c9fff04a0d5e2d2","observation_id":"3f1a9ec6-4828-4f7b-8152-fd132c2b5c08","resolution":{"observed_at":"2026-08-01T15:42:55.033336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:55.112667Z","title":"DINOv2: Learning robust visual features without supervision.Transactions on Machine Learning Research (TMLR), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:55.112667Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:157ed87f9fa31ec5d0284ff74775da305c576e9bdc7a78830e9b3f9536ce2ce4","observation_id":"f8129422-0d3c-4289-a6c5-e758dcd89b3e","resolution":{"observed_at":"2026-08-01T15:42:55.112667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:55.194507Z","title":"Perceptual losses for real-time style transfer and super-resolution","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:55.194507Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:a04d8bebba3179506303f27525d4ed61c00af48ff336a5c0cb8bc53c070fb1fe","observation_id":"0454be89-7089-4b22-8986-e390403c852b","resolution":{"observed_at":"2026-08-01T15:42:55.194507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:55.280869Z","title":"Image style transfer using convolutional neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:55.280869Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:96ca97ef36841c7d760742d0040ce135b8c1b5943aee9a68e1d9605cf861c699","observation_id":"c12744ba-0c50-4dc2-a2c2-c9a6ea4c9f46","resolution":{"observed_at":"2026-08-01T15:42:55.280869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:55.371081Z","title":"Understanding and simplifying perceptual distances","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:55.371081Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:1c2b1e94cfb1ebe05c879eea736b99c1492fbc5dada107f4932ff4de6c6b84e5","observation_id":"927175c8-bfa4-46d8-bc0d-e899ddfa27b4","resolution":{"observed_at":"2026-08-01T15:42:55.371081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:55.432729Z","title":"Vlic: Vision-language models as perceptual judges for human-aligned image compression","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:55.432729Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:9c17732f0a42e0f3bf6e5c71a871b392fbd89eb07e05f0435eaeed475fa58036","observation_id":"b7080aab-72e5-4d32-9bf5-77b40d7207b1","resolution":{"observed_at":"2026-08-01T15:42:55.432729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:55.530735Z","title":"PieAPP: Perceptual image-error assess- ment through pairwise preference","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:55.530735Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:3fc818d58cca9edcdd80935578cf31f4872823e76132289a87a6ecc259110fc9","observation_id":"50476618-fc88-4635-a2fd-8c2a3785a941","resolution":{"observed_at":"2026-08-01T15:42:55.530735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:55.618632Z","title":"Image quality assessment: Unifying structure and texture similarity.IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 44(5):2567–2581, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:55.618632Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:2e1fa3a8c52951faf982762268811015c128ec4eb9f84a18a0ebf70c0d87d393","observation_id":"00ea3663-c251-4015-92cd-526226f9f6c8","resolution":{"observed_at":"2026-08-01T15:42:55.618632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:55.687313Z","title":"Human alignment of neural network representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:55.687313Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:ee06d5dfe13f51338788519c06d910c918fa00f588b0bbe57af98252e3812ee4","observation_id":"2a4614ee-9868-497f-aa44-2b752b15fe5d","resolution":{"observed_at":"2026-08-01T15:42:55.687313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:55.765243Z","title":"Shift-tolerant perceptual similarity metric","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:55.765243Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:3bd69216c96f4e27eaec1db7ce69efcb3e6631329f213905f42b69d1e65a8191","observation_id":"9019f240-3579-4fe4-b9a5-c7f6068175bc","resolution":{"observed_at":"2026-08-01T15:42:55.765243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:55.829960Z","title":"LipSim: A provably robust perceptual similarity metric","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:55.829960Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:52d19c8e3c6105fe9a1769de671f9a2c69ff102049404e07073dee960f44dec8","observation_id":"39420102-73cd-4fc0-9f0c-dc59a7e41211","resolution":{"observed_at":"2026-08-01T15:42:55.829960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.03973","last_updated":"2019-06-11T08:58:35Z","snapshot_observed_at":"2026-07-06T07:59:11.939682Z","submitted_at":"2019-06-10T13:40:37Z","title":"E-LPIPS: Robust Perceptual Image Similarity via Random Transformation Ensembles","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.03973","snapshot_observed_at":"2026-08-01T15:42:55.882093Z","title":"E-LPIPS: Robust perceptual image similarity via random transformation ensembles.arXiv preprint arXiv:1906.03973, 2019","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:55.882093Z"},"links":{"cited_paper":"/paper/1906.03973","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:31a2de82e5841fc7e8b57bfee6f00a4eaef9e25b48d385eea4209508f8dc11f1","observation_id":"f2b8669c-d59c-4bf6-82fd-2460308c231e","resolution":{"observed_at":"2026-08-01T15:42:55.882093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:55.995922Z","title":"A similarity measure for illustration style","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:55.995922Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:788be8c16f8f123c6827d86b82077c46d625e09bfae30d99ef6be4d6ed6cf045","observation_id":"3686a8d0-369f-4379-bcbb-85588218ae04","resolution":{"observed_at":"2026-08-01T15:42:55.995922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:56.057269Z","title":"Measuring style similarity in diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:56.057269Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:f926ed941d6d42fb35933f7dddbbb944a97f056c5cd4ec48400added4e8c37b4","observation_id":"d1375da2-170e-4127-aecc-7b8d15144729","resolution":{"observed_at":"2026-08-01T15:42:56.057269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:56.120843Z","title":"Relational visual similarity","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:56.120843Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:71853acf7da92980fae1c226a692d8425bbcfa40fd74e7fa9619d40f361e22da","observation_id":"c659abb5-99d6-407f-8caa-c1c2a9de8087","resolution":{"observed_at":"2026-08-01T15:42:56.120843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05977","last_updated":"2023-12-28T14:13:35Z","snapshot_observed_at":"2026-07-06T15:14:55.628493Z","submitted_at":"2023-04-12T16:58:13Z","title":"ImageReward: Learning and Evaluating Human Preferences for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05977","snapshot_observed_at":"2026-08-01T15:42:56.203684Z","title":"ImageReward: Learning and evaluating human preferences for text-to-image generation.arXiv preprint arXiv:2304.05977, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:56.203684Z"},"links":{"cited_paper":"/paper/2304.05977","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:077552b730bcabc1f92a5cdc57a9a50e7e4daf20102e0cb1b9eec6462a2250fc","observation_id":"f08eb537-a75e-4a2e-9991-5f319e2cbc72","resolution":{"observed_at":"2026-08-01T15:42:56.203684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:56.326331Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:56.326331Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:bc45ec6d3c4041e27ed5d3782539e9d3c4b217ba7a6f59ed8dfb4b5e408c1e34","observation_id":"6e10fb11-c540-4bfe-918c-a6513c5907d8","resolution":{"observed_at":"2026-08-01T15:42:56.326331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-01T15:42:56.376202Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:56.376202Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:6de778ce3c0d95304c5f424cc8afb09307bdcbdef169992c9029e6142c86b2ad","observation_id":"70d65d67-80fe-487c-90d4-79b5dd8b1399","resolution":{"observed_at":"2026-08-01T15:42:56.376202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:56.466663Z","title":"Editreward: A human- aligned reward model for instruction-guided image editing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:56.466663Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:4507e9677b270d4d3bf042f9bba8b99defa610fdcefb901c0c7d4b5a45403e93","observation_id":"02c44e49-5639-40eb-99e0-e3299155a138","resolution":{"observed_at":"2026-08-01T15:42:56.466663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:56.540947Z","title":"Multiview triplet embedding: Learning attributes in multiple maps","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:56.540947Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:3bcd02ce5f3a296804f760c73840626af27396396246d0e83b455958299dd88d","observation_id":"966961fc-d656-4e71-abe2-7cbe178bb2d8","resolution":{"observed_at":"2026-08-01T15:42:56.540947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:56.591116Z","title":"Conditional similarity networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:56.591116Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:ea55f89f36b6b683d5a1279b536b78498a3841aa9e86022b1c26e961639da69c","observation_id":"28652472-8002-4b0c-926b-860ef16ea6a1","resolution":{"observed_at":"2026-08-01T15:42:56.591116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:56.677880Z","title":"Learning type-aware embeddings for fashion compatibility","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:56.677880Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:894a4aaf5e389c8c71ebcc0d1ec4e13c59578fe1c2c90dd7a1b687c68da57b4d","observation_id":"4ec6f53f-8218-486d-814c-3799c4dcffb2","resolution":{"observed_at":"2026-08-01T15:42:56.677880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01421","last_updated":"2019-04-02T13:55:47Z","snapshot_observed_at":"2026-08-04T23:05:20.472701Z","submitted_at":"2019-04-02T13:55:47Z","title":"Cooperative Embeddings for Instance, Attribute and Category Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01421","snapshot_observed_at":"2026-08-01T15:42:56.761219Z","title":"Cooperative embeddings for instance, attribute and category retrieval.arXiv preprint arXiv:1904.01421, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:56.761219Z"},"links":{"cited_paper":"/paper/1904.01421","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:020841105ab3410a2c485b53778408ce519c57dc8b859cd24c8346524433e2ed","observation_id":"da2aa78c-e5d1-4181-84be-12321b230a37","resolution":{"observed_at":"2026-08-01T15:42:56.761219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:56.850230Z","title":"Learning similarity conditions without explicit supervision","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:56.850230Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:739ee8b1c6e4ba7df4c557b8a3d07af055cf4d54b396d98d3e7f7bd2c24af206","observation_id":"5955305d-87a7-4a6d-bf8c-11cb0c48222e","resolution":{"observed_at":"2026-08-01T15:42:56.850230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:56.894850Z","title":"Training-free conditional image embedding framework leveraging large vision language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:56.894850Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:cee94038ddbe3b07dc8105e18feb86e3f54b2d16cd8dd63fe9a165488f603ec6","observation_id":"f5b7c9ac-320b-4247-b533-eaa5bba7d40f","resolution":{"observed_at":"2026-08-01T15:42:56.894850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:56.970914Z","title":"Highlighting what matters: Promptable embeddings for attribute-focused image retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:56.970914Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:0d0ff5e096f06ca10bdd1d61b75b5ae65ac87d18ca714e36e0d9ff7488882984","observation_id":"175e6537-4256-43e6-84ce-89cb91fa9897","resolution":{"observed_at":"2026-08-01T15:42:56.970914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:57.031424Z","title":"Towards text-guided attribute-disentangled multimodal representation learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:57.031424Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:857c615f3c534c51ae61c03dd71a235eda80a05ba118fd07ca5168c83352c7ea","observation_id":"67a2f29a-81f2-4212-b6d8-f6b768e4d95d","resolution":{"observed_at":"2026-08-01T15:42:57.031424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:57.093953Z","title":"Open ad-hoc categorization with contextualized feature learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:57.093953Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:45e25809f509f12202ccc76189f40c09570a223478e327b0511d37a4fc0ef5d9","observation_id":"93473ce5-bf2c-437c-b3e5-42d6ff96e2dd","resolution":{"observed_at":"2026-08-01T15:42:57.093953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:57.156811Z","title":"Image clustering conditioned on text criteria","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:57.156811Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:5ebbff87e8814605ff5cdc2bdfcb88cb15ae1822cc57c3ccde7787d464ecdf25","observation_id":"d6926112-2b70-4479-92d8-7e048ad99725","resolution":{"observed_at":"2026-08-01T15:42:57.156811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:57.224751Z","title":"Composing text and image for image retrieval-an empirical odyssey","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:57.224751Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:c0428a04d188fbace1044e672c9f01ccbf95a750f61909d6b5108f5a92f98d89","observation_id":"130a5a0b-d2bd-4229-865d-2a881a330d78","resolution":{"observed_at":"2026-08-01T15:42:57.224751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:57.332809Z","title":"Image retrieval on real-life images with pre-trained vision-and-language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:57.332809Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:2eb24d84d84e16cabf3b272107f884c4e1a3550e30467429c7ca98005deac01e","observation_id":"b7cc5668-677c-4f67-afa0-ab77d3d62934","resolution":{"observed_at":"2026-08-01T15:42:57.332809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:57.412517Z","title":"Pic2Word: Mapping pictures to words for zero-shot composed image retrieval","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:57.412517Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:7af7e5a19dbb07503a2baf848c9c8b6b5cc3d0466adf90d715c9cc0d9443d2ee","observation_id":"f45de66c-8d84-4d19-9ae8-2fa0f6b1d1d4","resolution":{"observed_at":"2026-08-01T15:42:57.412517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:57.461199Z","title":"Zero-shot composed image retrieval with textual inversion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:57.461199Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:70b7dd29edd6075297392d897f23e1c95ebdfd3f9e19c299c76a8941a2ec48f2","observation_id":"8dd60f0c-aef9-4e79-ac9c-c4639a2a3369","resolution":{"observed_at":"2026-08-01T15:42:57.461199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:57.539094Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:57.539094Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:aebeacb49c61eddabe9da20c7c7019c5e4fcdedf4cd2d53f3282395ef4e0a4e9","observation_id":"645ea2f7-b214-46c8-bef3-fa3e07a14d00","resolution":{"observed_at":"2026-08-01T15:42:57.539094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:57.631959Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:57.631959Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:49b564e44dd87e96732cfe325e1ac48f892df559d119f6a06173a55fecd73218","observation_id":"5c3d6f6c-7e32-46ca-bc03-c6c96396347b","resolution":{"observed_at":"2026-08-01T15:42:57.631959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:57.732384Z","title":"BLIP: Bootstrapping language-image pre- training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:57.732384Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:ebd6f369ee28525e9c5147c4adc0a87ee126acecbba3604c0f6c5f23e5c9ce29","observation_id":"d8c60eae-40d8-4ef1-ad02-d7f9515680ed","resolution":{"observed_at":"2026-08-01T15:42:57.732384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:57.897656Z","title":"BLIP-2: Bootstrapping language-image pre- training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:57.897656Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:d8032bfa8bb9f1d6bc4863940e92e901e6eb9d0489b111a115917138938aad83","observation_id":"89bd14d8-46e9-4e7f-af89-cf5fc56195e7","resolution":{"observed_at":"2026-08-01T15:42:57.897656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-01T15:42:58.057377Z","title":"Qwen-VL: A versatile vision-language model for understanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:58.057377Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:cb2ea73ca4e23301b1e29f059676fac7795b7ff0f20f30803541aaa1ae921b54","observation_id":"4c686426-99a3-43a8-a642-b30810092525","resolution":{"observed_at":"2026-08-01T15:42:58.057377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-01T15:42:58.186290Z","title":"Qwen2-VL: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:58.186290Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:e2843e4eb1c13e82a8a08d3a2cdd2a3c803446ac1aeda46b97f5997c489a881c","observation_id":"71bf44e3-ebfe-4de4-bcd4-c4898bacf59d","resolution":{"observed_at":"2026-08-01T15:42:58.186290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:58.285881Z","title":"Qwen3.5: Unified vision-language foundation with early-fusion multimodal training","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:58.285881Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:2005603622750182267d548e285ea2ee000f3fe23267b4fd91ccca3ca0f381da","observation_id":"13734fc6-08d5-4800-a500-2f100b266e64","resolution":{"observed_at":"2026-08-01T15:42:58.285881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:58.438877Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:58.438877Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:4484fa2962ab5cd86f133069527e798a28d64440ea7c6a845f3b91a277674a40","observation_id":"3c70b9e1-c968-4ffa-81db-0bcc6a859743","resolution":{"observed_at":"2026-08-01T15:42:58.438877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-01T15:42:58.563681Z","title":"LLaV A-OneVision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:58.563681Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:4d13789b15e89d791b1a35fd92a5ca5f8c992a471839ebd47a1a7e33eeb8d6f5","observation_id":"9f34bec9-4b25-4d99-b062-34e97db517f6","resolution":{"observed_at":"2026-08-01T15:42:58.563681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:58.667495Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:58.667495Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:5b44377aab4da5de446fed76bd8141b4376743d925272c4c02165b87f05eab1c","observation_id":"743802ab-1fcd-41c9-9484-12253816ced1","resolution":{"observed_at":"2026-08-01T15:42:58.667495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04590","last_updated":"2025-07-07T00:51:57Z","snapshot_observed_at":"2026-08-02T08:05:44.477432Z","submitted_at":"2025-07-07T00:51:57Z","title":"VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04590","snapshot_observed_at":"2026-08-01T15:42:58.671408Z","title":"VLM2Vec-V2: Advancing multimodal embedding for videos, images, and visual documents.arXiv preprint arXiv:2507.04590, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:58.671408Z"},"links":{"cited_paper":"/paper/2507.04590","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:8953ba890c19292585fefce090d6e4c5fa2518b62d4e31fc208ca8d1932aa10a","observation_id":"3180a520-1559-4d03-a37b-b98783286db5","resolution":{"observed_at":"2026-08-01T15:42:58.671408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09680","snapshot_observed_at":"2026-08-01T15:42:58.828756Z","title":"Flux-reason-6m & prism-bench: A million-scale text-to-image reasoning dataset and comprehensive benchmark.arXiv preprint arXiv:2509.09680, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:58.828756Z"},"links":{"cited_paper":"/paper/2509.09680","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:be5bc18c383edc276fb53297dd339aa17ce6a1f11eb4612c7e0052f670373f14","observation_id":"0b8bbb34-8a38-4ddd-9730-8cd48d5abea2","resolution":{"observed_at":"2026-08-01T15:42:58.828756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:58.938966Z","title":"VLM2Vec: Training vision-language models for massive multimodal embedding tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:58.938966Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:8b17c62da47d962de4fb8c3ad5ac9353d065d74c9241c164e8317c4c36fa3bd3","observation_id":"a4694518-7b44-4ec7-b880-719ef5e9723f","resolution":{"observed_at":"2026-08-01T15:42:58.938966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:59.105369Z","title":"NV-Embed: Improved techniques for training LLMs as generalist embedding models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:59.105369Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:bd91c99014a61f19d6f580375db8703217c50316745a7cd1e7fa6c6fe3a7bfd7","observation_id":"ea80c254-ea72-43b4-95a6-c857450105ae","resolution":{"observed_at":"2026-08-01T15:42:59.105369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:59.207367Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:59.207367Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:54df6ffb5398e0f1ab00257b739a8d61040a44d07a55ee9a89881dda36136aee","observation_id":"db527fbe-bb7d-4ae7-af44-b75c6666e6a8","resolution":{"observed_at":"2026-08-01T15:42:59.207367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02327","last_updated":"2026-06-29T08:02:49Z","snapshot_observed_at":"2026-07-29T22:55:11.358117Z","submitted_at":"2026-04-02T17:59:49Z","title":"Steerable Visual Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.02327","snapshot_observed_at":"2026-08-01T15:42:59.298378Z","title":"Steerable visual representations.arXiv preprint arXiv:2604.02327, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:59.298378Z"},"links":{"cited_paper":"/paper/2604.02327","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:a38f8e17767057f7f6073f25e8ed48f74b4557e6b21b443cac949a20a50c8b77","observation_id":"947b6cfd-089b-43c7-b31f-6e8a2d5d0a7e","resolution":{"observed_at":"2026-08-01T15:42:59.298378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-01T15:42:59.364828Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:59.364828Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:768135deb8459144cd03bd05c3bebc0069cd089993ce512cc4894bfe30ef784a","observation_id":"19dd8d8b-3b74-4101-943d-a3da6aba1b99","resolution":{"observed_at":"2026-08-01T15:42:59.364828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:59.562745Z","title":"The Open Images Dataset V4: Unified image classification, object detection, and visual relationship detection at scale.International Journal of Computer Vision (IJCV), 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:59.562745Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:5919fff8e2c841b172dd2fe085c569a80310a03c1e3f09a825c24989ed4d9a51","observation_id":"3567e077-226a-4a3a-8331-cd30ac8f02a9","resolution":{"observed_at":"2026-08-01T15:42:59.562745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:59.674854Z","title":"Improved artgan for conditional synthesis of natural image and artwork.IEEE Transactions on Image Processing, 28(1):394–409, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:59.674854Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:1ab3b884d523525a6398700d10d5feafd07da2e3abd2fd4651b1afcb760109f1","observation_id":"cd6e6005-888e-4c53-b337-1664986ccb7c","resolution":{"observed_at":"2026-08-01T15:42:59.674854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:59.819099Z","title":"Learning an image editing model without image editing pairs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:59.819099Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:d202f10d7cfab9cc5e9508916add2fc622a254cbf8c6998a94d6c4c98db93b9d","observation_id":"75bca747-fe7a-400a-a5bc-689eae9b51a4","resolution":{"observed_at":"2026-08-01T15:42:59.819099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01955","last_updated":"2025-06-02T17:59:56Z","snapshot_observed_at":"2026-07-06T21:35:12.872021Z","submitted_at":"2025-06-02T17:59:56Z","title":"Dual-Process Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01955","snapshot_observed_at":"2026-08-01T15:42:59.951743Z","title":"Dual-process image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:59.951743Z"},"links":{"cited_paper":"/paper/2506.01955","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:3954ead24fdca92e1aa5db1b26abc505eb8a5741e8b9ca88f18d3b1a5e4275e9","observation_id":"9e6d918a-5813-46c7-a62a-746d850e083e","resolution":{"observed_at":"2026-08-01T15:42:59.951743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-07-31T14:51:03.625964Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-08-01T15:43:00.107495Z","title":"DanceGRPO: Unleashing GRPO on visual generation.arXiv preprint arXiv:2505.07818, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:00.107495Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:b3e90c1a904f3cec048fb13dcc47bc38839af36ef595a19aae91133973b599f5","observation_id":"5f9655e1-a833-4d0a-be80-56c9e3e76e42","resolution":{"observed_at":"2026-08-01T15:43:00.107495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:43:00.237857Z","title":"A multimodal automated interpretability agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:00.237857Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:7a530ff0963aa43c65d4163f8bfb06d731611f15bb5a9f1bfdf4ca954ea1b8c2","observation_id":"38b2b3c5-4fb6-4b48-a020-01d129659a8c","resolution":{"observed_at":"2026-08-01T15:43:00.237857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:43:00.387859Z","title":"One-step is enough: Sparse autoencoders for text-to-image diffusion models.arXiv preprint arXiv:2410.22366, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:00.387859Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:c537c48d3a2f246ce410093e3386fff39c0d62d51c65c35ae490368091427331","observation_id":"9ad88404-ad64-4330-9c1f-d457c0dac327","resolution":{"observed_at":"2026-08-01T15:43:00.387859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T15:43:00.512691Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:00.512691Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:2e11df3c5b8d9d2b86db48744e7088f5641941b20a8f02cacecd9eb5deaf8492","observation_id":"9a23a057-9712-4d2b-a529-25e2000c94f6","resolution":{"observed_at":"2026-08-01T15:43:00.512691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:43:00.643897Z","title":"FLUX.1: Open-weight rectified flow transformers for text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:00.643897Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:002010bcaf6213a23cd6fa65c70518d3e6284b5f68e2d0a2d74020d52e560ce8","observation_id":"fc5fad79-19ee-4883-813b-335d1925ca3b","resolution":{"observed_at":"2026-08-01T15:43:00.643897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:43:00.768585Z","title":"Geditbench v2: A human-aligned benchmark for general image editing.arXiv preprint arXiv:2603.28547, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:00.768585Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:58ba64ba6fd9b0eeda791495bffbe899cc085987b937b369a21e966415d6b93c","observation_id":"615b92af-591a-4b71-ac93-08b6b01c1bfe","resolution":{"observed_at":"2026-08-01T15:43:00.768585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-01T15:43:00.920862Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:00.920862Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:ec5196830d54652f4403dd067d038f4cce499d376d4cc16fec3435bb96ff2386","observation_id":"c99bb2f7-a827-43fe-9832-1738a2878612","resolution":{"observed_at":"2026-08-01T15:43:00.920862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:43:01.050501Z","title":"FLUX.2: Frontier visual intelligence.https://bfl.ai/blog/flux-2, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:01.050501Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:11d2af2971e5fb815ed2715027a90cf580525fbb13b95b49a656f9de1a7a79c6","observation_id":"3977a8ec-ae3a-49bc-b9b0-9e896efa33aa","resolution":{"observed_at":"2026-08-01T15:43:01.050501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-08-01T15:43:01.150238Z","title":"LongCat-Image technical report.arXiv preprint arXiv:2512.07584, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:01.150238Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:af50bc7122a25c93f39ff78f5ff0fe336171db9e62b2c801a2c8c80577ddae4c","observation_id":"27429766-5990-48f7-bd3e-34c7de2fc427","resolution":{"observed_at":"2026-08-01T15:43:01.150238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-01T15:43:01.255956Z","title":"OmniGen2: Towards instruction-aligned multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:01.255956Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:0ae2de1ed033ce02e9eddb0f88a3f9e257feb8087c42efef612218dadc8da7de","observation_id":"66bee9c5-1416-434d-a659-7201fa5b692c","resolution":{"observed_at":"2026-08-01T15:43:01.255956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:43:01.464881Z","title":"Qwen-Image-Edit: Image editing with higher quality and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:01.464881Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:f527199689b7ab5ffff6c7524dfec0b1d9c857bc9de92ab569c43b2c06156133","observation_id":"b2530244-0200-437d-9e6b-fbcb7ee407a4","resolution":{"observed_at":"2026-08-01T15:43:01.464881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-01T15:43:01.644727Z","title":"Step1X-Edit: A practical framework for general image editing.arXiv preprint arXiv:2504.17761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:01.644727Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:8435a8bed222672c49f36f6cf5ab1dfb220a266c49959b7ff595e98dafcaeaed","observation_id":"bd1f7265-f2af-492f-a7be-dbf4c13d24f8","resolution":{"observed_at":"2026-08-01T15:43:01.644727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:43:01.832622Z","title":"Scaling in-the-wild training for diffusion-based illumination harmonization and editing by imposing consistent light transport","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:01.832622Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:d0ee8b554886ed15b66bbd33c849a92cb0e2459d39f4c970fbee2850c7cfdf7b","observation_id":"91551bca-1c00-40ac-b442-2b8fc73ae516","resolution":{"observed_at":"2026-08-01T15:43:01.832622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14549","last_updated":"2025-06-17T14:05:24Z","snapshot_observed_at":"2026-07-06T21:43:36.310549Z","submitted_at":"2025-06-17T14:05:24Z","title":"DreamLight: Towards Harmonious and Consistent Image Relighting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14549","snapshot_observed_at":"2026-08-01T15:43:02.009119Z","title":"DreamLight: Towards harmonious and consistent image relighting.arXiv preprint arXiv:2506.14549, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:02.009119Z"},"links":{"cited_paper":"/paper/2506.14549","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:8534dad212204f0c2c4c184ccd6a986ab674eff2ed6ba7b9be37e3c8b39fc6f3","observation_id":"70f8c7a1-191d-4bd2-8379-a26d68c1e3fb","resolution":{"observed_at":"2026-08-01T15:43:02.009119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:43:02.217492Z","title":"Zero-shot image harmonization with generative model prior.IEEE Transactions on Multimedia, 27:4494–4507, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:02.217492Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:c23f7ee1fa5f47eab82e4e3373bad17f6a989878795b7beab83c46b1c959b19b","observation_id":"6b88b385-05f8-467a-ba60-67e3d5e6c0ee","resolution":{"observed_at":"2026-08-01T15:43:02.217492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:43:02.394086Z","title":"Barron, Ben Mildenhall, Dor Verbin, Pratul P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:02.394086Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:de8528841a1ab7276a13e2d5efdc6d70e6c74dafce3efc38e467663019e241a6","observation_id":"a1eb2549-78f4-42cd-8c3a-5490f1660109","resolution":{"observed_at":"2026-08-01T15:43:02.394086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:43:02.560968Z","title":"Nerfstudio: A modular framework for neural radiance field development","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:02.560968Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:e0997fc05042084c21e21ae264a618b742a933f79ab037c61690785f9cf03123","observation_id":"adfb0d9b-d01f-4611-9d71-cdf930efffca","resolution":{"observed_at":"2026-08-01T15:43:02.560968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:43:02.736965Z","title":"3D Gaussian splatting for real-time radiance field rendering.ACM Transactions on Graphics (SIGGRAPH), 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:02.736965Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:62a33fbab522903020ab9814fd3e61afa80f57627016a6755659eb7be60f69c9","observation_id":"1fc8058e-9be4-4b0a-bc9e-4681cfbfdd9f","resolution":{"observed_at":"2026-08-01T15:43:02.736965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:43:02.983115Z","title":"Srinivasan, Matthew Tancik, Jonathan T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:02.983115Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:6ba670b6840e7259cacd15f083d86268330f8f6aff4fa232e9a8dffc64e1ade0","observation_id":"c8ed9b99-2309-408a-ac73-96130c155ee7","resolution":{"observed_at":"2026-08-01T15:43:02.983115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:43:03.038997Z","title":"Instant neural graphics primitives with a multiresolution hash encoding.ACM Transactions on Graphics (SIGGRAPH), 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:03.038997Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:b3b0f6cf4ae2ace20535057f372abd86a92dd86d369d14fcfdfda6b08d22a1a2","observation_id":"b1a45cd3-60f6-4210-b20c-e8347c3c10a0","resolution":{"observed_at":"2026-08-01T15:43:03.038997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:43:03.160260Z","title":"Structured 3d latents for scalable and versatile 3d generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:03.160260Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:bbaa50f77df0c0cd3143e968b5695cb548f18fa73c993a0404cace2dec4f001c","observation_id":"e1e6b582-aac2-4fc3-bccb-ff299a674edc","resolution":{"observed_at":"2026-08-01T15:43:03.160260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07191","last_updated":"2024-04-14T16:54:24Z","snapshot_observed_at":"2026-07-06T17:58:25.894552Z","submitted_at":"2024-04-10T17:48:37Z","title":"InstantMesh: Efficient 3D Mesh Generation from a Single Image with Sparse-view Large Reconstruction Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07191","snapshot_observed_at":"2026-08-01T15:43:03.349347Z","title":"InstantMesh: Efficient 3D mesh generation from a single image with sparse-view large reconstruction models.arXiv preprint arXiv:2404.07191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:03.349347Z"},"links":{"cited_paper":"/paper/2404.07191","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:50b884644f5522b8975a5cae11c9c5747609bba856fc2f417709a3290a208e97","observation_id":"348631fb-d56d-48f2-9c55-9e47e5dce619","resolution":{"observed_at":"2026-08-01T15:43:03.349347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15442","last_updated":"2025-06-18T13:14:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T13:14:46Z","title":"Hunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR Material","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15442","snapshot_observed_at":"2026-08-01T15:43:03.512451Z","title":"Hunyuan3D 2.1: From images to high-fidelity 3D assets with production- ready PBR material.arXiv preprint arXiv:2506.15442, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:03.512451Z"},"links":{"cited_paper":"/paper/2506.15442","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:cf475cacb148bd648652d1f787bfe089f07fd7c96e49eab5e528b47b6fa04e49","observation_id":"58ec7312-8065-4802-84d5-5e8d46d42aa0","resolution":{"observed_at":"2026-08-01T15:43:03.512451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07747","last_updated":"2025-05-12T16:56:30Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T16:56:30Z","title":"Step1X-3D: Towards High-Fidelity and Controllable Generation of Textured 3D Assets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07747","snapshot_observed_at":"2026-08-01T15:43:03.699857Z","title":"Step1X-3D: Towards high-fidelity and controllable generation of textured 3D assets.arXiv preprint arXiv:2505.07747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:03.699857Z"},"links":{"cited_paper":"/paper/2505.07747","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:e586487452b8762b96073d4cbef40a58ed674586a38a7f085bc452e7940873f5","observation_id":"42a0420c-1712-44b8-a191-a156af54112c","resolution":{"observed_at":"2026-08-01T15:43:03.699857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:43:03.894149Z","title":"SGDR: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:03.894149Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:d0e3b643f9deda7bdf58e8e0c8dc403ed1e258d9c6d53e4831a905d93b920cc6","observation_id":"1c3cfe0f-49e4-46fb-8eac-a26ef5225502","resolution":{"observed_at":"2026-08-01T15:43:03.894149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:43:04.068454Z","title":"Calibrate before use: Improving few-shot performance of language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:04.068454Z"},"links":{"citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:8320484964bd03a3792ade509df8de42f13a88882ce78dbdc576c7872f825b58","observation_id":"ee9e58bf-ba7c-4d0a-a677-e5c9ce041507","resolution":{"observed_at":"2026-08-01T15:43:04.068454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T17:04:51.029207Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":126},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 126 outbound references and 1 inbound Pith citation observation for arXiv:2607.18237."}