{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:AJOUU5FA5VD3OWJF4S46S4OX5S","short_pith_number":"pith:AJOUU5FA","schema_version":"1.0","canonical_sha256":"025d4a74a0ed47b75925e4b9e971d7ecaf969c211f3d48e3496e28bb05d369b1","source":{"kind":"arxiv","id":"2206.06588","version":1},"attestation_state":"computed","paper":{"title":"Shopping Queries Dataset: A Large-Scale ESCI Benchmark for Improving Product Search","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.IR","authors_text":"Anlu Xing, Arnab Biswas, Chandan K. Reddy, Fran Valero, Hugo Zaragoza, Karthik Subbian, Llu\\'is M\\`arquez, Nikhil Rao, Sambaran Bandyopadhyay","submitted_at":"2022-06-14T04:25:26Z","abstract_excerpt":"Improving the quality of search results can significantly enhance users experience and engagement with search engines. In spite of several recent advancements in the fields of machine learning and data mining, correctly classifying items for a particular user search query has been a long-standing challenge, which still has a large room for improvement. This paper introduces the \"Shopping Queries Dataset\", a large dataset of difficult Amazon search queries and results, publicly released with the aim of fostering research in improving the quality of search results. The dataset contains around 13"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2206.06588","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.IR","submitted_at":"2022-06-14T04:25:26Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"115e0d4f843c53bf9eb72044246bd8e9f6b8b9e1809ff4495df7cdea69b49c3d","abstract_canon_sha256":"5bfd9a789698f4e7669467ec259e671d550b45403f7617627ee1fc1a32b9c15e"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T04:31:43.695234Z","signature_b64":"iS9PP5xsRD++3AaiHfGSlMW3a5LNxwJGkSN7O59js2msU+M65k6iC1jj3WhFoT/OVIL7nIwaWHhFlJ0g4R2yCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"025d4a74a0ed47b75925e4b9e971d7ecaf969c211f3d48e3496e28bb05d369b1","last_reissued_at":"2026-07-05T04:31:43.694734Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T04:31:43.694734Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Shopping Queries Dataset: A Large-Scale ESCI Benchmark for Improving Product Search","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.IR","authors_text":"Anlu Xing, Arnab Biswas, Chandan K. Reddy, Fran Valero, Hugo Zaragoza, Karthik Subbian, Llu\\'is M\\`arquez, Nikhil Rao, Sambaran Bandyopadhyay","submitted_at":"2022-06-14T04:25:26Z","abstract_excerpt":"Improving the quality of search results can significantly enhance users experience and engagement with search engines. In spite of several recent advancements in the fields of machine learning and data mining, correctly classifying items for a particular user search query has been a long-standing challenge, which still has a large room for improvement. This paper introduces the \"Shopping Queries Dataset\", a large dataset of difficult Amazon search queries and results, publicly released with the aim of fostering research in improving the quality of search results. The dataset contains around 13"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2206.06588","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2206.06588/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2206.06588","created_at":"2026-07-05T04:31:43.694798+00:00"},{"alias_kind":"arxiv_version","alias_value":"2206.06588v1","created_at":"2026-07-05T04:31:43.694798+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2206.06588","created_at":"2026-07-05T04:31:43.694798+00:00"},{"alias_kind":"pith_short_12","alias_value":"AJOUU5FA5VD3","created_at":"2026-07-05T04:31:43.694798+00:00"},{"alias_kind":"pith_short_16","alias_value":"AJOUU5FA5VD3OWJF","created_at":"2026-07-05T04:31:43.694798+00:00"},{"alias_kind":"pith_short_8","alias_value":"AJOUU5FA","created_at":"2026-07-05T04:31:43.694798+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":13,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.22807","citing_title":"KaLM-Reranker-V1: Fast but Not Late Interaction for Compressed Document Reranking","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2606.17698","citing_title":"EComAgentBench: Benchmarking Shopping Agents on Long-Horizon Tasks with Distributed Hidden Intent","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07995","citing_title":"Customer-Agent: Overcoming Context Limitations in Ultra-Long Shopping Trajectories via Tool-Augmented Agents and RLVR","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07075","citing_title":"Beyond Matching: Category-Guided Latent Intent Reasoning for Generative Retrieval in E-Commerce","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28017","citing_title":"Can It Reach the Generator? Investigating the Survival of Prompt-Injection Attacks in Realistic RAG Settings","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29107","citing_title":"GEO-Bench: Benchmarking Ranking Manipulation in Generative Engine Optimization","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27810","citing_title":"LRanker: LLM Ranker for Massive Candidates","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2403.03952","citing_title":"Bridging Language and Items for Retrieval and Recommendation: Benchmarking LLMs as Semantic Encoders","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2505.13360","citing_title":"What Prompts Don't Say: Understanding and Managing Underspecification in LLM Prompts","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07364","citing_title":"Improving Search Suggestions for Alphanumeric Queries","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27790","citing_title":"How Generative AI Disrupts Search: An Empirical Study of Google Search, Gemini, and AI Overviews","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27410","citing_title":"From Unstructured to Structured: LLM-Guided Attribute Graphs for Entity Search and Ranking","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10109","citing_title":"NumColBERT: Non-Intrusive Numeracy Injection for Late-Interaction Retrieval Models","ref_index":31,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/AJOUU5FA5VD3OWJF4S46S4OX5S","json":"https://pith.science/pith/AJOUU5FA5VD3OWJF4S46S4OX5S.json","graph_json":"https://pith.science/api/pith-number/AJOUU5FA5VD3OWJF4S46S4OX5S/graph.json","events_json":"https://pith.science/api/pith-number/AJOUU5FA5VD3OWJF4S46S4OX5S/events.json","paper":"https://pith.science/paper/AJOUU5FA"},"agent_actions":{"view_html":"https://pith.science/pith/AJOUU5FA5VD3OWJF4S46S4OX5S","download_json":"https://pith.science/pith/AJOUU5FA5VD3OWJF4S46S4OX5S.json","view_paper":"https://pith.science/paper/AJOUU5FA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2206.06588&json=true","fetch_graph":"https://pith.science/api/pith-number/AJOUU5FA5VD3OWJF4S46S4OX5S/graph.json","fetch_events":"https://pith.science/api/pith-number/AJOUU5FA5VD3OWJF4S46S4OX5S/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/AJOUU5FA5VD3OWJF4S46S4OX5S/action/timestamp_anchor","attest_storage":"https://pith.science/pith/AJOUU5FA5VD3OWJF4S46S4OX5S/action/storage_attestation","attest_author":"https://pith.science/pith/AJOUU5FA5VD3OWJF4S46S4OX5S/action/author_attestation","sign_citation":"https://pith.science/pith/AJOUU5FA5VD3OWJF4S46S4OX5S/action/citation_signature","submit_replication":"https://pith.science/pith/AJOUU5FA5VD3OWJF4S46S4OX5S/action/replication_record"}},"created_at":"2026-07-05T04:31:43.694798+00:00","updated_at":"2026-07-05T04:31:43.694798+00:00"}