{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2020:KHSYUOVUHZV4AUMZGYFCW2JPMM","short_pith_number":"pith:KHSYUOVU","schema_version":"1.0","canonical_sha256":"51e58a3ab43e6bc05199360a2b692f6329aefddb94cc8642ea1cd4c6472e886d","source":{"kind":"arxiv","id":"2010.02573","version":1},"attestation_state":"computed","paper":{"title":"The Multilingual Amazon Reviews Corpus","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.IR","cs.LG"],"primary_cat":"cs.CL","authors_text":"Gy\\\"orgy Szarvas, Noah A. Smith, Phillip Keung, Yichao Lu","submitted_at":"2020-10-06T09:34:01Z","abstract_excerpt":"We present the Multilingual Amazon Reviews Corpus (MARC), a large-scale collection of Amazon reviews for multilingual text classification. The corpus contains reviews in English, Japanese, German, French, Spanish, and Chinese, which were collected between 2015 and 2019. Each record in the dataset contains the review text, the review title, the star rating, an anonymized reviewer ID, an anonymized product ID, and the coarse-grained product category (e.g., 'books', 'appliances', etc.) The corpus is balanced across the 5 possible star ratings, so each rating constitutes 20% of the reviews in each"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2010.02573","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2020-10-06T09:34:01Z","cross_cats_sorted":["cs.IR","cs.LG"],"title_canon_sha256":"d3b21d5f42ea4f8334713eda0e970042587769ce7becabfdb2fc22b1f6fa941e","abstract_canon_sha256":"faf2e05c16809d601b73f75b0dfe8e814242cca9e614c17850559b1cb7b0cfd4"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T01:40:51.652032Z","signature_b64":"DEzUcDq+OyMPdHuDwVxIDUygIbBRaFZ5y4ZgdHSgNpu5uZmRxl650Aqw/eO+GtaXfDgVfykkgixWLbMiYkRoBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"51e58a3ab43e6bc05199360a2b692f6329aefddb94cc8642ea1cd4c6472e886d","last_reissued_at":"2026-07-05T01:40:51.651535Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T01:40:51.651535Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"The Multilingual Amazon Reviews Corpus","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.IR","cs.LG"],"primary_cat":"cs.CL","authors_text":"Gy\\\"orgy Szarvas, Noah A. Smith, Phillip Keung, Yichao Lu","submitted_at":"2020-10-06T09:34:01Z","abstract_excerpt":"We present the Multilingual Amazon Reviews Corpus (MARC), a large-scale collection of Amazon reviews for multilingual text classification. The corpus contains reviews in English, Japanese, German, French, Spanish, and Chinese, which were collected between 2015 and 2019. Each record in the dataset contains the review text, the review title, the star rating, an anonymized reviewer ID, an anonymized product ID, and the coarse-grained product category (e.g., 'books', 'appliances', etc.) The corpus is balanced across the 5 possible star ratings, so each rating constitutes 20% of the reviews in each"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2010.02573","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2010.02573/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2010.02573","created_at":"2026-07-05T01:40:51.651595+00:00"},{"alias_kind":"arxiv_version","alias_value":"2010.02573v1","created_at":"2026-07-05T01:40:51.651595+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2010.02573","created_at":"2026-07-05T01:40:51.651595+00:00"},{"alias_kind":"pith_short_12","alias_value":"KHSYUOVUHZV4","created_at":"2026-07-05T01:40:51.651595+00:00"},{"alias_kind":"pith_short_16","alias_value":"KHSYUOVUHZV4AUMZ","created_at":"2026-07-05T01:40:51.651595+00:00"},{"alias_kind":"pith_short_8","alias_value":"KHSYUOVU","created_at":"2026-07-05T01:40:51.651595+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.30596","citing_title":"Improving Relative Representations with Learned Anchors and Whitened Inner Products","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2606.22745","citing_title":"Language-Specific Sentiment Polarity Biases in Encoder and Large Language Model Classification of Product Reviews","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2603.28052","citing_title":"Meta-Harness: End-to-End Optimization of Model Harnesses","ref_index":24,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/KHSYUOVUHZV4AUMZGYFCW2JPMM","json":"https://pith.science/pith/KHSYUOVUHZV4AUMZGYFCW2JPMM.json","graph_json":"https://pith.science/api/pith-number/KHSYUOVUHZV4AUMZGYFCW2JPMM/graph.json","events_json":"https://pith.science/api/pith-number/KHSYUOVUHZV4AUMZGYFCW2JPMM/events.json","paper":"https://pith.science/paper/KHSYUOVU"},"agent_actions":{"view_html":"https://pith.science/pith/KHSYUOVUHZV4AUMZGYFCW2JPMM","download_json":"https://pith.science/pith/KHSYUOVUHZV4AUMZGYFCW2JPMM.json","view_paper":"https://pith.science/paper/KHSYUOVU","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2010.02573&json=true","fetch_graph":"https://pith.science/api/pith-number/KHSYUOVUHZV4AUMZGYFCW2JPMM/graph.json","fetch_events":"https://pith.science/api/pith-number/KHSYUOVUHZV4AUMZGYFCW2JPMM/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/KHSYUOVUHZV4AUMZGYFCW2JPMM/action/timestamp_anchor","attest_storage":"https://pith.science/pith/KHSYUOVUHZV4AUMZGYFCW2JPMM/action/storage_attestation","attest_author":"https://pith.science/pith/KHSYUOVUHZV4AUMZGYFCW2JPMM/action/author_attestation","sign_citation":"https://pith.science/pith/KHSYUOVUHZV4AUMZGYFCW2JPMM/action/citation_signature","submit_replication":"https://pith.science/pith/KHSYUOVUHZV4AUMZGYFCW2JPMM/action/replication_record"}},"created_at":"2026-07-05T01:40:51.651595+00:00","updated_at":"2026-07-05T01:40:51.651595+00:00"}