{"as_of":"2026-08-11T14:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9a2c7a379033da66c914d74852702dc84ff66b1ee7a76bcbb2707bdb0df3991","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:46:16.272642Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.07365/citation-record","integrity":"/paper/2501.07365/integrity","json":"/paper/2501.07365/citation-record.json","paper":"/paper/2501.07365"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:16.194963Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.194963Z"},"links":{"citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:a623a9301e52594d54af4996a71615b864caa1eaf13a43a1b75095dc4cd41623","observation_id":"87bd7a2d-ef47-455e-9fc5-68ddf573c684","resolution":{"observed_at":"2026-08-10T20:46:16.194963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:16.507304Z","title":"Extreme multi-label learning for semantic matching in product search","venue":null,"work_id":"55bb31c9-c78b-4994-9e2a-24dcaf6f8ce3","year":2021},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.199473Z"},"links":{"citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:290e5bdb3cd2b3c0fd3dcd8028e750ace4097e772922c2cba19ddf317f9dc649","observation_id":"da9b08f8-d38e-4620-96de-4dcbeec87b2a","resolution":{"observed_at":"2026-08-10T20:46:16.511983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:16.494968Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"1ba07eba-9662-43ab-b79a-c6b5a29eee09","year":2020},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.203389Z"},"links":{"citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:cee95a7e2186cfb92a6017c13d1ef31aae1e7e3d72b6006e3610fffc6b4aa066","observation_id":"c1b8c70d-fc11-4223-83ac-440b211ee79e","resolution":{"observed_at":"2026-08-10T20:46:16.499154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T20:46:16.207475Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.207475Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:71a671c48ed832a01e42446c26b64db6b658dd53c247e0583c23e8536f3003d1","observation_id":"13307cb4-405f-4ee6-8cba-cb22cba548da","resolution":{"observed_at":"2026-08-10T20:46:16.207475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-08-10T20:46:16.211886Z","title":"Data filtering networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.211886Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:979b4ec9bf355c7bcaadf2025d56e5ab3bcbb58672e60bb44598fd5d7b0d5d63","observation_id":"25d3bf16-cb26-4bc2-824e-d762ec0dab1e","resolution":{"observed_at":"2026-08-10T20:46:16.211886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:16.481988Z","title":"Learning deep structured semantic models for web search using clickthrough data","venue":null,"work_id":"95303e3f-4b36-457c-8fc9-40ab736c20f2","year":2013},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.216147Z"},"links":{"citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:a82bf2370f6c49ce8e1145c8702493523db73da38ad6095a52a879190c31bcc0","observation_id":"1aae9dbf-a023-4c7a-b1e0-c3db88923259","resolution":{"observed_at":"2026-08-10T20:46:16.486530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:16.469156Z","title":"Bert: Pre- training of deep bidirectional transformers for language understanding","venue":null,"work_id":"6a188465-6d19-4d8f-aea1-b2434246fde3","year":2019},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.220141Z"},"links":{"citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:243e4c21e872d3a29498f9b3f0e52c9750c9f652c48837ee54726d77a9b8e77d","observation_id":"a6a95a11-f280-42de-8ed1-84701725b540","resolution":{"observed_at":"2026-08-10T20:46:16.473588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:16.455899Z","title":"Relevance-guided supervi- sion for openqa with colbert","venue":null,"work_id":"e4a84ac0-6e86-4624-b705-9d1e37dbbf6b","year":2021},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.223612Z"},"links":{"citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:222e2cdd11182e0cf8e496e9574aee420fafdb15a470405b6eba57e27002c6e6","observation_id":"083b94a2-312b-4c4d-808e-d54034a2d0df","resolution":{"observed_at":"2026-08-10T20:46:16.461330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:16.227144Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.227144Z"},"links":{"citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:1466560532b665265d927600a1b7c8795e5dd142f0b1f1da0af61c96418f51f9","observation_id":"f25b13c2-3197-4bb3-819d-70570b8545df","resolution":{"observed_at":"2026-08-10T20:46:16.227144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06125","last_updated":"2021-10-12T16:14:13Z","snapshot_observed_at":"2026-07-06T11:57:03.833110Z","submitted_at":"2021-10-12T16:14:13Z","title":"Embracing Structure in Data for Billion-Scale Semantic Product Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06125","snapshot_observed_at":"2026-08-10T20:46:16.230595Z","title":"Embracing structure in data for billion-scale semantic product search","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.230595Z"},"links":{"cited_paper":"/paper/2110.06125","citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:9946af8ef266f091ce34f19bcafc147a5cc0ed8714250702308898f10332a1b8","observation_id":"ebe36528-50ff-495e-94c7-8dbab2fbd069","resolution":{"observed_at":"2026-08-10T20:46:16.230595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:16.437139Z","title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and gen- eration","venue":null,"work_id":"6ba837c1-d50e-4f8b-871f-4e5990299f3d","year":2022},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.234744Z"},"links":{"citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:0193f0a275686bd6bb59db2a1476ffcc1632256643aeaa1654b5dda19026caad","observation_id":"86850806-4794-49fc-9955-0b4b98ea031d","resolution":{"observed_at":"2026-08-10T20:46:16.441106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:16.426990Z","title":"Embedding-based product retrieval in taobao search","venue":null,"work_id":"0636c6f3-e44c-48fd-9bd1-efee929196d4","year":2021},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.238434Z"},"links":{"citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:f52c455bb84304418e36538fc674e537613299e10315b1503ddce3cddf6912a9","observation_id":"8001befc-39be-49df-b6c9-b9a088a1e7af","resolution":{"observed_at":"2026-08-10T20:46:16.430600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:16.415597Z","title":"Deep self-adaptive hashing for image retrieval","venue":null,"work_id":"29375120-038b-468a-b600-0bda5b54e6f8","year":2021},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.242178Z"},"links":{"citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:32122afcff4e3d8f0ee15e143e076932d6f323b556203a9747585973b6e22bb0","observation_id":"a2f4c79a-eda3-4a11-8c59-2521b90486fd","resolution":{"observed_at":"2026-08-10T20:46:16.419771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:16.403157Z","title":"One picture is worth a thousand words? the pricing power of images in e-commerce","venue":null,"work_id":"517c63b0-080e-42be-bb1e-1f3a52947cad","year":2020},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.245939Z"},"links":{"citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:6c07d2d11ff51d290fbb53f363d77b2142ed19645986449e68e29d9b7f81daa3","observation_id":"02e29bcf-64c3-4a95-ab97-dd2103fbad97","resolution":{"observed_at":"2026-08-10T20:46:16.407681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:16.390758Z","title":"Dc-bert: Decoupling question and document for efficient contextual encoding","venue":null,"work_id":"883f0db2-4492-4327-810c-b7352806a34c","year":2020},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.249501Z"},"links":{"citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:d776d138c8d5a033e7d5dafdd25285e1e397caeb7804ff2ab43a11e7a6649798","observation_id":"79336b39-1048-4115-be30-0bbf3813f663","resolution":{"observed_at":"2026-08-10T20:46:16.395179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:16.253172Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.253172Z"},"links":{"citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:e2bba63235909f6a6b496db5683bc508876ca88485478857f31de95d288a6b8c","observation_id":"0bc18342-8fe9-4e35-abde-c93e351e474a","resolution":{"observed_at":"2026-08-10T20:46:16.253172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:16.256947Z","title":"Introduction to information retrieval, volume 39","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.256947Z"},"links":{"citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:e40815fe6cecec9e83eb4c25fdb86d488a59d3f5812ba00037b5dd3b4321aded","observation_id":"17e39bd2-40ae-4e50-96fc-609d8e7e6dc5","resolution":{"observed_at":"2026-08-10T20:46:16.256947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15498","last_updated":"2020-07-20T12:51:00Z","snapshot_observed_at":"2026-08-11T11:28:42.654604Z","submitted_at":"2020-06-28T03:46:32Z","title":"RepBERT: Contextualized Text Embeddings for First-Stage Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15498","snapshot_observed_at":"2026-08-10T20:46:16.260174Z","title":"Rep- bert: Contextualized text embeddings for first-stage retrieval","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.260174Z"},"links":{"cited_paper":"/paper/2006.15498","citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:bce7ebf93208f89964e95bfbf2d5a8942cf6905cb535f51ceaf3cd544ceb2b03","observation_id":"0047cd88-5228-4bd7-83ab-c9c093c0b4d8","resolution":{"observed_at":"2026-08-10T20:46:16.260174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:16.364847Z","title":"Binary neural network hashing for image retrieval","venue":null,"work_id":"8b99fcfa-7ebc-4457-b3c2-5b4b2d8000c4","year":2021},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.263965Z"},"links":{"citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:09c3246076ea0f4f74bb0cfd0be484ebba415f9f25586ea82838099f0a73a910","observation_id":"fcce507d-7469-486a-99cc-532d1796031f","resolution":{"observed_at":"2026-08-10T20:46:16.368497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:16.353779Z","title":"Bringing multimodality to amazon visual search system","venue":null,"work_id":"9d24d209-8e05-4c56-8697-8c9ee0e6f1d7","year":2024},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.268023Z"},"links":{"citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:a652b49425adfbee28b296a3f0e38a54c002f961328294e9ad421301bf181d92","observation_id":"3ae9d517-66e5-4be6-93ed-e85810624113","resolution":{"observed_at":"2026-08-10T20:46:16.357561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:16.339872Z","title":"Uni-perceiver: Pre-training unified architecture for generic perception for zero-shot and few-shot tasks","venue":null,"work_id":"bf9df748-256f-4058-84ca-98bb667f4652","year":2022},"citing_paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:16.272642Z"},"links":{"citing_paper":"/paper/2501.07365"},"observation_digest":"sha256:12d115f8551b8c5d38259da056db4cd4bead35762de8e9b06544f71ac5ba0fd5","observation_id":"cb9e5e22-5576-40eb-9b4d-dc6446244ec3","resolution":{"observed_at":"2026-08-10T20:46:16.346018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.07365","last_updated":"2025-02-17T08:40:10Z","latest_version":3,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-10T20:41:37.400021Z","submitted_at":"2025-01-13T14:34:26Z","title":"Multimodal semantic retrieval for product search"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2501.07365."}