{"as_of":"2026-08-08T15:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:46033d20acff32be65f55bdc2ae7184614fc0d40da83aaff2dc8da66b240ecf1","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:02:08.473719Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.17080/citation-record","integrity":"/paper/2507.17080/integrity","json":"/paper/2507.17080/citation-record.json","paper":"/paper/2507.17080"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.355576Z","title":"Henning, Karun Singh, Omkar Parkhi, and Fedor Borisyuk","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.355576Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:78c62b855032d9c0e37b7d4c264fa67b8750c3c857d26fefea1c88e5f135af79","observation_id":"2e587879-ef23-4ec9-8f4a-c8eb9b7fd05e","resolution":{"observed_at":"2026-08-06T15:02:08.355576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.359638Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.359638Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:d87c8ddf1cb4e7cf1b8459e2fa049671d9331422cd1c181cf3d82319f9f1a137","observation_id":"844a9230-2331-4399-9665-0d3e25fdbdbc","resolution":{"observed_at":"2026-08-06T15:02:08.359638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.267895Z","title":null,"venue":null,"work_id":"e2f7e9dc-f006-482d-9b4a-400953168604","year":2020},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.362782Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:26db67131b86940c0d242bb3c4fb75102b0e7305efda194de100c239a6c5c611","observation_id":"b64296a2-9663-44ac-b72f-94da67100eeb","resolution":{"observed_at":"2026-08-06T15:02:09.270659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.365468Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.365468Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:17ffb7e0b1eac6de9f03221afc15d23663dee84f94b81564631a959f0e01c9c5","observation_id":"765a8da2-d7fe-4482-8385-60761a367c32","resolution":{"observed_at":"2026-08-06T15:02:08.365468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41598-022-23052-9","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.530462Z","title":null,"venue":null,"work_id":"af56fa07-dcb9-4b40-8ea6-8ef73107a232","year":2022},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.370948Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:7b844e21680f5a92d0cc2ed8b6fbd99a7bad76d2c52dc3c5c3e5f9dcc73f1b04","observation_id":"1ee02fa7-f74e-4583-9dc4-81bf246a1003","resolution":{"observed_at":"2026-08-06T15:02:08.533236Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[{"edge_observation":{"observed_at":"2026-08-06T18:20:19.888698+00:00","source":"paper_reference_links","state":"open"},"event_date":"2023-01-23","event_type":"correction","notice_doi":"10.1038/s41598-022-26364-y","provenance":{"observed_at":"2026-07-11T02:56:50.008426+00:00","source":"crossref","source_record_id":"10.1038/s41598-022-26364-y->10.1038/s41598-022-23052-9:correction"}}],"reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.255178Z","title":null,"venue":null,"work_id":"6662049e-d321-4935-af45-4a06e1f7656c","year":2025},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.373920Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:04c523f3b461812a164c26c3e91f99b9a58477b13fe403a684e60ef85095e0c2","observation_id":"341e46de-466d-49aa-9570-6f8171eb28c6","resolution":{"observed_at":"2026-08-06T15:02:09.257971Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.247338Z","title":null,"venue":null,"work_id":"5759821e-c853-4ef2-9c46-55b72e6df026","year":2023},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.376798Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:771106b0e1e87f28245ee5e53c170435e84a7252553ed7b641fd874746b4414a","observation_id":"4175c460-0d17-4b84-8575-ef52509497aa","resolution":{"observed_at":"2026-08-06T15:02:09.250094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.379262Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.379262Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:759b6a39f32ac659da4a798ac29ffd2559ce374a20f1c016c85f6e1376262743","observation_id":"4e72cf30-9b17-4545-9688-aa8411e055e6","resolution":{"observed_at":"2026-08-06T15:02:08.379262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.382220Z","title":"Huang, O","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.382220Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:a62313bc5741a66e0529d7200a892a4bba6b343f01401ff20f99c4b7ec759385","observation_id":"cfb65044-be84-4fd5-b734-8c814278eb4f","resolution":{"observed_at":"2026-08-06T15:02:08.382220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.239222Z","title":null,"venue":null,"work_id":"018f46c0-d111-4841-a147-d5568a67543e","year":2023},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.385017Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:e491cc8d7e09306b8eabfac16e49652edf7ffbe0fca22946708ed64c104e04d1","observation_id":"1af7e53b-4716-4a9a-9792-d2c52d23a835","resolution":{"observed_at":"2026-08-06T15:02:09.242063Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.acl-main.469","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.517760Z","title":null,"venue":null,"work_id":"6afc90c7-faea-4871-81ef-c2d6b7f544d4","year":2020},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.387425Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:0703611c786a73dbdb98f4e068a096d45baf480f661d28312c45749b9373790c","observation_id":"d9f035e0-1131-4977-b355-036e288f4267","resolution":{"observed_at":"2026-08-06T15:02:08.520558Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.390026Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.390026Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:ca4a3d9a0ec11a71d9af89f1ea7c0a5501a06c6f794d93f3221cbbe0f716c90f","observation_id":"b4de798c-beb0-442a-9c44-1641e34bf37c","resolution":{"observed_at":"2026-08-06T15:02:08.390026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.392478Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.392478Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:f6ec42fe8a9c0eb74fe9f18fe6b745601f20ce313d6914c32aecee296fa0598f","observation_id":"70bd7a1a-276a-4ecb-8c2e-a43001c407c1","resolution":{"observed_at":"2026-08-06T15:02:08.392478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.397586Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.397586Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:d586ec6c3e58b0f4dabf2b52d85b74ff572e4e74fe99d6e725db9c8c8a715e66","observation_id":"49576e56-9fbd-43d9-bbda-b0a145568ab5","resolution":{"observed_at":"2026-08-06T15:02:08.397586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.399985Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.399985Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:f874ba7ea7484494d45d264f302961e25843024c7c1da0a43563577c30ada434","observation_id":"4fbaae12-5680-4736-944d-c35b78eba9a0","resolution":{"observed_at":"2026-08-06T15:02:08.399985Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.226041Z","title":null,"venue":null,"work_id":"857bee87-6ddb-404d-97b5-51a857696b23","year":2019},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.402508Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:08d7afd594e122f2278f17db9ac0178aa13ed32dc5af7532d34a84d94851c552","observation_id":"82a568d5-e24d-470e-b562-a08f7a9e6716","resolution":{"observed_at":"2026-08-06T15:02:09.228856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12228","last_updated":"2025-02-16T09:41:32Z","snapshot_observed_at":"2026-08-07T23:46:27.609660Z","submitted_at":"2024-10-16T04:44:15Z","title":"Triple Modality Fusion: Aligning Visual, Textual, and Graph Data with Large Language Models for Multi-Behavior Recommendations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12228","snapshot_observed_at":"2026-08-06T15:02:08.404945Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.404945Z"},"links":{"cited_paper":"/paper/2410.12228","citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:3375b9449a384177207d5da99e8f3aab07d35481b6207576d29cb762ffec53b1","observation_id":"8e825e7e-e9be-487c-92f5-f6d93eb75f15","resolution":{"observed_at":"2026-08-06T15:02:08.404945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.407832Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.407832Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:237f418f9f4fe767b41aadfe7c42a3e9e1d1118977f6322d1ab35ce01cc53346","observation_id":"5a95845c-8c68-49ca-a391-8a7b8dd4a6de","resolution":{"observed_at":"2026-08-06T15:02:08.407832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.217669Z","title":null,"venue":null,"work_id":"1eb0b3c4-268d-46ff-91b6-e20ab3ed45b0","year":2018},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.410338Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:c1056c1e22120b162913aa7cfc3899d973104009f4ffc5e6e989f98cd8dbe240","observation_id":"7adb5744-9b3f-41e3-a39b-a56e4afdee7a","resolution":{"observed_at":"2026-08-06T15:02:09.220388Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2196/52865","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.498999Z","title":null,"venue":null,"work_id":"fd0c1cbe-324c-4ed8-808f-99c39b50196f","year":2023},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.413385Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:b49314c7383e6ab4bee382332f9531066c21e1cf9c084bb2d2ba42ed38be8e4a","observation_id":"a2297b6e-6811-4110-abb9-1e3cbb392dbe","resolution":{"observed_at":"2026-08-06T15:02:08.503053Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T15:02:08.416252Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.416252Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:12a94da8d2e95d704036c7cc7dac0d0fa5bda84ec3c19238b83ddedd6957813f","observation_id":"31ab0b8a-1df3-43a3-a031-d3671c0d56f2","resolution":{"observed_at":"2026-08-06T15:02:08.416252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.209813Z","title":null,"venue":null,"work_id":"34704c0c-7802-40d5-9480-a839c7e12aeb","year":2020},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.418876Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:2a81c50494811fc5eaafd2a73f27aafe49b59c3d5d3b402caccad35f7accdec6","observation_id":"cd3a511c-8b4b-47d9-928a-3b31db4b6010","resolution":{"observed_at":"2026-08-06T15:02:09.212382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.201663Z","title":null,"venue":null,"work_id":"c4c4153f-6754-4647-9b89-e8b90aed79f0","year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.421246Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:ef1614dd99900919ae405c57968cb4418cd977d5010ef103893b6b2432264d8f","observation_id":"8e350083-1d36-423e-8eb6-1849e69de9ba","resolution":{"observed_at":"2026-08-06T15:02:09.204366Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.185182Z","title":null,"venue":null,"work_id":"15016441-b90e-4249-9dc5-3fd95a709385","year":2022},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.426399Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:d2029f4d78d3c1bd76662c4fb91c4bcf3a2669c25adeadb1d2e3302bcce84166","observation_id":"ca3c161f-50b8-44e6-994b-182804d4f47f","resolution":{"observed_at":"2026-08-06T15:02:09.188234Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.428768Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.428768Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:fd423cc6b13e2db526ac02e98388ac35a821a96d94302a90cd74061471788fe2","observation_id":"5760ac08-3b64-4215-9748-1f32df6eacae","resolution":{"observed_at":"2026-08-06T15:02:08.428768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.172584Z","title":null,"venue":null,"work_id":"6d15b4d7-9f1a-4e27-a0b9-b64480aafc94","year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.434446Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:23713496bf91dcb55b7c9ec0eabf258ca2ed6cdc0bf32ccbb4ddc78c05a5bb1d","observation_id":"ea5801f0-b793-425e-969d-ea6e774de381","resolution":{"observed_at":"2026-08-06T15:02:09.175328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.439848Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.439848Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:91a83b4883ca5dc19707ec4822e55e92c67685a12a1277b7304a9b5fe74b17da","observation_id":"ba62af85-ecad-41aa-bcef-c6615d55a0c3","resolution":{"observed_at":"2026-08-06T15:02:08.439848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.442379Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.442379Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:86a678762b228ed0f13f2b2a0fc06e1cde8917df0eb933dd48001ead6eed1d9c","observation_id":"e8d1cd1c-7c72-4d48-84e8-2597df66a409","resolution":{"observed_at":"2026-08-06T15:02:08.442379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-06T15:02:08.431508Z","title":"arXiv preprint arXiv:2111.02114 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.431508Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:aef26bebbf37fde9fb1dd826cb89a020d4a962e6f8ee2bf4e3fccf469a1290e1","observation_id":"6b1aadf8-f6dd-4c60-8df0-cd4e244780d1","resolution":{"observed_at":"2026-08-06T15:02:08.431508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.143122Z","title":null,"venue":null,"work_id":"3a1ce95d-0281-4827-afd6-9a98eeb07e7c","year":2010},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.447332Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:344e94b80eeed58b2adbd742608b06097de824319461dd7b50d79beada4f4746","observation_id":"9be1fbc0-3c67-4fb0-8c39-4cc115fd06f4","resolution":{"observed_at":"2026-08-06T15:02:09.146325Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.164430Z","title":"In International Conference on Learning Representations (ICLR)","venue":null,"work_id":"fa4484b7-f42c-4d1b-ac90-1e98d3c70c0b","year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.437303Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:26a13e66f31b7b987c6b61db3e54f156147eba6210745afed97319ff7e98dc20","observation_id":"370b74f3-5ec6-4060-b0d2-3e56cbd5c5f5","resolution":{"observed_at":"2026-08-06T15:02:09.167393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.117354Z","title":null,"venue":null,"work_id":"532e69f4-2b4b-428d-a288-4cc54ed82ddd","year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.455153Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:cc17d6af864f6a4b91474c9b9db52ab53a9993b9187c8ac94116c9be36015f1f","observation_id":"a4c89211-4d1f-4078-bad7-72f1e5f6ec08","resolution":{"observed_at":"2026-08-06T15:02:09.120199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.460518Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.460518Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:ae22ff8d465621bf582758b6922203bb6afed052be07649de5da338058c3bfa4","observation_id":"41811caa-1aeb-4ed8-8b28-cb1af4b46947","resolution":{"observed_at":"2026-08-06T15:02:08.460518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.151485Z","title":null,"venue":null,"work_id":"9f19d4ac-ae49-4ae2-be9d-914d6acd73b4","year":2022},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.444911Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:76ddfeaa9813aa6eafe840f3d8cb2d8ab1cad2ee8ba5ab09e80b99557456b1e8","observation_id":"2534c8d2-e230-4d2b-9205-58838d3efa83","resolution":{"observed_at":"2026-08-06T15:02:09.154214Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.134643Z","title":null,"venue":null,"work_id":"3993b442-27b4-4a22-9ae9-4ebfab1620df","year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.449944Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:726babbe9cf551b4095ad482253d0a5008929d5096e5d3648e3cd83a2b158172","observation_id":"7e2841af-aa2e-4edd-88fb-cbf5fe245d5d","resolution":{"observed_at":"2026-08-06T15:02:09.137817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.109222Z","title":"dress”, “rug","venue":null,"work_id":"edd62109-df46-46e6-80a3-4f7a9ebe1dd4","year":2024},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.463065Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:60152b39d70214f1f8803ff72c04c99e84463d7d1bc06fe73688866776f08db6","observation_id":"54d10b83-08ad-4ff7-956d-39b7ff5e0e32","resolution":{"observed_at":"2026-08-06T15:02:09.111978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.101106Z","title":"productName","venue":null,"work_id":"9388f779-b678-4035-93dc-5f0d2431aa90","year":2025},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.465918Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:b0244d30aca2f3d7e2fcdfdb7931c2319d6a3197362bd857969295f4214e9a23","observation_id":"f20a7962-97a1-4ced-b2de-5bf712666180","resolution":{"observed_at":"2026-08-06T15:02:09.103924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.093008Z","title":null,"venue":null,"work_id":"0ad282ab-141c-4fbb-9519-43bffac519e0","year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.468567Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:65e99ac82ea1a13ff7b00a420c217d56875b175d72e44c95a88596a8ee4fe05c","observation_id":"64f47fb2-427a-4ace-ba29-acfca3407879","resolution":{"observed_at":"2026-08-06T15:02:09.095624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.084473Z","title":null,"venue":null,"work_id":"9c65910c-c625-445f-a6dc-c42beabdab74","year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.471120Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:4228ee6a323511194b8bb29a1a026d333c55a8876b5a2b0c2e26505eee476de4","observation_id":"643ea409-02d1-4c2e-9ab1-c1961ef3f94b","resolution":{"observed_at":"2026-08-06T15:02:09.087403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.075782Z","title":"color”) and𝑣𝑖 is its value (e.g., “ blue","venue":null,"work_id":"90015598-673a-4f83-a810-ad13d6bd2aa3","year":2025},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.473719Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:a744f9bb89e3accc4a56ee140fd54a7ad5e7459562ebfa8380ed64ef5e7f48ab","observation_id":"89797b0e-cd56-42ec-9c02-a4aa148e0361","resolution":{"observed_at":"2026-08-06T15:02:09.078869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.125829Z","title":"InProceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining","venue":null,"work_id":"207a2ea4-03cb-46ac-aefa-6bb499d35c20","year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.452541Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:9662be5a6dd62c74bdd179a63ab1416466ecebbf40b4d6dd99c11ff210bdd954","observation_id":"67156b5c-067f-4e09-ac3d-33812b283b3b","resolution":{"observed_at":"2026-08-06T15:02:09.129394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.395019Z","title":"In Computer Vision – ECCV 2020: 16th European Conference, Glasgow, UK, August 23–28, 2020, Proceedings, Part XXX (Glasgow, United Kingdom)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.395019Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:b0cd3ff114c98bcc21830d5758e9cd2174a56e1beac9cba3200d40c57a1db49d","observation_id":"96eca364-7576-4559-95fa-b653762da436","resolution":{"observed_at":"2026-08-06T15:02:08.395019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.193427Z","title":"In Proceedings of the International Conference on Machine Learning","venue":null,"work_id":"c5b86116-be21-41bc-b7a2-07fb46677106","year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.423824Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:63aca6a68c9756568a8e13eedca0fdd771308770feb899ad3ab09ce0154d2bd6","observation_id":"43983f7f-f4e4-418c-a760-9863f596fdc4","resolution":{"observed_at":"2026-08-06T15:02:09.196435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.458000Z","title":"In 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.458000Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:1b848e076487516b2614cdd7da23859420c47502163a656c40276c394547edf7","observation_id":"707ce20f-18e7-4cd0-8081-ec627485e9b9","resolution":{"observed_at":"2026-08-06T15:02:08.458000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.368225Z","title":"In 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.368225Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:45a9d35140c92f86618069262c251ede48aeb7776ae845c75c1c68235bb320f9","observation_id":"98986562-b5ec-4066-a8e5-78309200ceca","resolution":{"observed_at":"2026-08-06T15:02:08.368225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2507.17080."}