{"as_of":"2026-08-17T10:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af99ec2caa8ce2cb8e4e96f4705c6601523ae703332b22525f7f0cdcbae0e110","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:22:35.455720Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.02858/citation-record","integrity":"/paper/2505.02858/integrity","json":"/paper/2505.02858/citation-record.json","paper":"/paper/2505.02858"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.03194","last_updated":"2024-10-03T00:32:22Z","snapshot_observed_at":"2026-08-17T02:05:29.324350Z","submitted_at":"2024-03-05T18:31:28Z","title":"MAGID: An Automated Pipeline for Generating Synthetic Multi-modal Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03194","snapshot_observed_at":"2026-08-16T04:22:35.244577Z","title":"Magid: An automated pipeline for generating synthetic multi-modal datasets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.244577Z"},"links":{"cited_paper":"/paper/2403.03194","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:9c693136b496d995425381c657724d87f48508470306eef0f6caac93338f2b14","observation_id":"4fc7c5a0-1b2f-4459-b7de-4bf5f8d2ee71","resolution":{"observed_at":"2026-08-16T04:22:35.244577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.249630Z","title":"Using large language models to simulate multiple humans and replicate human subject studies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.249630Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:36356630ce2255ee838c7552f0541f925ad2efd1a5c982077a235b66773a13ce","observation_id":"5e4b7867-e481-4e89-9f88-a82cbff84499","resolution":{"observed_at":"2026-08-16T04:22:35.249630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:36.069452Z","title":null,"venue":null,"work_id":"db111252-237e-48ad-9a18-a110c4637a5f","year":2022},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.253077Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:b6f7f4ba1cd35808ce4576a3420f4176560e76b8b6d14978ec775ae948e4b5e8","observation_id":"054c840f-be69-4fc8-8ccf-7aa6f87bcfec","resolution":{"observed_at":"2026-08-16T04:22:36.072812Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.256646Z","title":"Out of one, many: Using language models to simulate human samples","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.256646Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:043e7ff1b688d2191105f4cb1f6fa3f29b32b12b26086eb0ce51f07d9cec3472","observation_id":"eea1f544-53ba-405a-8c22-11cd67f982cc","resolution":{"observed_at":"2026-08-16T04:22:35.256646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:36.052568Z","title":"Multi-modal embeddings for isolating cross-platform coordinated information campaigns on social media","venue":null,"work_id":"2d01383d-a8ca-4224-9418-e8d46c2b4f2e","year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.260861Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:7d5446977fecac2bcb041f6fe35fff690d2f269be0265946693306c46f970464","observation_id":"1e62898e-69b8-495b-bda7-3b0d021534e8","resolution":{"observed_at":"2026-08-16T04:22:36.055998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.12421","last_updated":"2020-10-26T09:14:54Z","snapshot_observed_at":"2026-08-16T19:11:09.547679Z","submitted_at":"2020-10-23T14:11:04Z","title":"TweetEval: Unified Benchmark and Comparative Evaluation for Tweet Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.12421","snapshot_observed_at":"2026-08-16T04:22:35.264830Z","title":"Tweet- eval: Unified benchmark and comparative evaluation for tweet classification","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.264830Z"},"links":{"cited_paper":"/paper/2010.12421","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:89f9e48f657c8aba71da8f5145e86e050f51144ff90e10709bab50da2bdb5bc4","observation_id":"3c4bc4dc-f5f6-435a-a417-a26766862ed3","resolution":{"observed_at":"2026-08-16T04:22:35.264830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15214","last_updated":"2024-03-22T13:58:42Z","snapshot_observed_at":"2026-08-17T04:35:02.301388Z","submitted_at":"2024-03-22T13:58:42Z","title":"InstaSynth: Opportunities and Challenges in Generating Synthetic Instagram Data with ChatGPT for Sponsored Content Detection","version":1},"cited_work":{"arxiv_id":"2403.15214","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.15214","snapshot_observed_at":"2026-08-16T04:22:35.704569Z","title":"InstaSynth: Opportunities and Challenges in Generating Synthetic Instagram Data with ChatGPT for Sponsored Content Detection","venue":"cs.CY","work_id":"4bef62db-afa3-43bc-9200-cfa294443ea2","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.270587Z"},"links":{"cited_paper":"/paper/2403.15214","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:973b62b08b3dd552ba83cfbd6e45fc1dc30eb447366332e14600b2aa68fb6476","observation_id":"768249a7-258c-4d02-84a9-ad4b45755774","resolution":{"observed_at":"2026-08-16T04:22:35.709115Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:36.041823Z","title":"Leveraging llm-generated data for detecting depression symptoms on social media","venue":null,"work_id":"fe980bdf-334d-4d63-9753-729b79518b72","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.274968Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:c85f6647963658386507f009d75485aeac04d915df2ecf5920c51272ce6e30cc","observation_id":"a263d66a-92dd-46d3-bcf5-a5cfdf84b6fe","resolution":{"observed_at":"2026-08-16T04:22:36.045479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13007","last_updated":"2023-03-20T11:39:47Z","snapshot_observed_at":"2026-08-16T15:52:48.033754Z","submitted_at":"2023-02-25T06:58:16Z","title":"AugGPT: Leveraging ChatGPT for Text Data Augmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13007","snapshot_observed_at":"2026-08-16T04:22:35.278689Z","title":"Auggpt: Leveraging chatgpt for text data augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.278689Z"},"links":{"cited_paper":"/paper/2302.13007","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:be3107666aa4cb82ded7cb623de618bb4a3b5073ddd262a584931d8d66e4510b","observation_id":"654b2a5e-eabf-40fc-943a-49af9cac24b3","resolution":{"observed_at":"2026-08-16T04:22:35.278689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02472","last_updated":"2024-12-15T03:56:04Z","snapshot_observed_at":"2026-08-16T14:12:53.258848Z","submitted_at":"2024-03-04T20:34:58Z","title":"OffensiveLang: A Community Based Implicit Offensive Language Dataset","version":8},"cited_work":{"arxiv_id":"2403.02472","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.02472","snapshot_observed_at":"2026-08-16T04:22:35.675861Z","title":"OffensiveLang: A Community Based Implicit Offensive Language Dataset","venue":"cs.CL","work_id":"85121493-503f-4557-a968-ce3fc8bd23fa","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.282944Z"},"links":{"cited_paper":"/paper/2403.02472","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:b8266b007d51a56dd897369081c8435e1d29be35b743d20f8ba1041e14f0319e","observation_id":"3a22e7c8-e326-4965-85e1-0a564f513935","resolution":{"observed_at":"2026-08-16T04:22:35.680879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:36.031689Z","title":"Identify- ing citizen-related issues from social media using llm-based data augmentation","venue":null,"work_id":"7f249e21-f5b7-48d3-9042-440677a0d4c7","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.288243Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:0ed978eb0b805884bc2c13865c72d5ed697f586474cf7bcd8c3bd338592a8b9d","observation_id":"26380adf-dcd9-4714-aaf6-f1863a83adba","resolution":{"observed_at":"2026-08-16T04:22:36.035326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:36.020476Z","title":"emojinal intelligence","venue":null,"work_id":"29cd92d3-df0d-4e05-96e7-8f37b486d00d","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.292394Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:89eefb2ba02852d1a20d5cb09039213227f0dd01792a768a7f9e8388f8cd58ac","observation_id":"cb9aa1a1-e22c-4aae-9409-d08b658011d2","resolution":{"observed_at":"2026-08-16T04:22:36.025142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:36.010679Z","title":"Socially aware synthetic data generation for suicidal ideation detection using large language models","venue":null,"work_id":"245c0d75-2548-4d4f-968f-c7f3288748d0","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.295998Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:3eb53068e4f460214299d15e3922f37d39f7a67515e21bd351e485e582038e74","observation_id":"3106ebe8-50b3-47dd-838e-7e7439f1e93a","resolution":{"observed_at":"2026-08-16T04:22:36.014412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05794","last_updated":"2022-03-11T08:35:15Z","snapshot_observed_at":"2026-07-06T12:46:41.057346Z","submitted_at":"2022-03-11T08:35:15Z","title":"BERTopic: Neural topic modeling with a class-based TF-IDF procedure","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05794","snapshot_observed_at":"2026-08-16T04:22:35.299997Z","title":"Bertopic: Neural topic modeling with a class-based tf-idf procedure","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.299997Z"},"links":{"cited_paper":"/paper/2203.05794","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:f0860b5290cbf0e13f536d24b8c90c574ad9c37affe8a1685c0c5f85412d02ec","observation_id":"bc45ae40-483f-455a-8f96-9a1cfa448992","resolution":{"observed_at":"2026-08-16T04:22:35.299997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:36.000579Z","title":"Ai and the transformation of social science research","venue":null,"work_id":"1da5f82b-169d-46a0-a220-2bdd0346e9da","year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.304111Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:b371a23ad1e94ab54dc7ca4c1510a7f5f17675d67325c2a0b00058e683d29ae9","observation_id":"5641f42c-4d58-43dd-ab9b-671646c2cb17","resolution":{"observed_at":"2026-08-16T04:22:36.004225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.989818Z","title":"Across platforms and languages: Dutch influencers and legal disclosures on instagram, youtube and tiktok","venue":null,"work_id":"d72d5113-2f9a-4586-a443-fc76687b94c4","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.307798Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:402d8787a6cf136bf2b3d8f1c30e318c6f41138f34f54b6d8f4d4925119cceed","observation_id":"f54d3f0d-19bb-4032-b507-5ee92aa251d9","resolution":{"observed_at":"2026-08-16T04:22:35.993594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.978722Z","title":"Evaluating large language models in generating synthetic hci research data: a case study","venue":null,"work_id":"524affc4-4bff-4ff2-9d2f-299d9f634555","year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.311486Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:391e0c7851207ecce6f7a0dbf2d488d9cc6c8758e5dad4167e8b3be16b0d77c8","observation_id":"15196dc5-f0fd-4903-9a05-13752a68cae2","resolution":{"observed_at":"2026-08-16T04:22:35.982498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.968071Z","title":"Happenstance: utilizing semantic search to track russian state media narratives about the russo-ukrainian war on reddit","venue":null,"work_id":"8b7893b6-7149-4988-9464-11234154fb98","year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.315065Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:98b45638d96f727108e95f4cb1ebb9bd1eccb2bcecab7159bb70562fd45c5a7d","observation_id":"d78ce1c5-8d64-4de2-bca4-7736918d897e","resolution":{"observed_at":"2026-08-16T04:22:35.971825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09509","last_updated":"2022-07-14T13:04:29Z","snapshot_observed_at":"2026-08-16T17:13:42.482483Z","submitted_at":"2022-03-17T17:57:56Z","title":"ToxiGen: A Large-Scale Machine-Generated Dataset for Adversarial and Implicit Hate Speech Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09509","snapshot_observed_at":"2026-08-16T04:22:35.318754Z","title":"Toxigen: A large-scale machine-generated dataset for adversarial and implicit hate speech detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.318754Z"},"links":{"cited_paper":"/paper/2203.09509","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:6df465cd5876486868d46ead7866f62cf559cc217a8d8f3f8c01879a46bf1534","observation_id":"227b5f57-ed15-4c60-95e1-1f7f57f5b730","resolution":{"observed_at":"2026-08-16T04:22:35.318754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.957282Z","title":"Using twitter data to understand public perceptions of approved versus off-label use for covid-19-related medications","venue":null,"work_id":"606c36e0-0748-41c7-a972-2f8b8852e08e","year":2022},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.322990Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:7d2e898f9f5d05d131201fb042921ea40dfef04d74dcd83d22dc77ee9fa76f83","observation_id":"5f7941c4-f54b-4caa-a349-9ff0255cc354","resolution":{"observed_at":"2026-08-16T04:22:35.961182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12933","last_updated":"2024-06-19T03:27:43Z","snapshot_observed_at":"2026-08-17T09:31:10.591297Z","submitted_at":"2024-04-19T15:04:30Z","title":"Cross-cultural Inspiration Detection and Analysis in Real and LLM-generated Social Media Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12933","snapshot_observed_at":"2026-08-16T04:22:35.326772Z","title":"Cross-cultural inspiration detec- tion and analysis in real and llm-generated social media data.arXiv preprint arXiv:2404.12933, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.326772Z"},"links":{"cited_paper":"/paper/2404.12933","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:d9e13c684b97aa50a86b267cd73afff212cfe1f3eb6e2bdf4c281508b73f207e","observation_id":"1f3e654b-a68b-456a-86c0-e8ca0351d736","resolution":{"observed_at":"2026-08-16T04:22:35.326772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.946160Z","title":"Employing large language models in survey research","venue":null,"work_id":"b6cc1334-bbf0-4846-bc66-3b3cfdd4a297","year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.330269Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:2fb17a7f362a9df10832f7dc989c954e1277c4e9d175bd08861cc47836eb63c0","observation_id":"d1902fe4-7862-490a-9e63-475f39da556e","resolution":{"observed_at":"2026-08-16T04:22:35.950085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04132","last_updated":"2023-10-29T14:24:46Z","snapshot_observed_at":"2026-08-17T04:43:53.297751Z","submitted_at":"2023-03-07T18:48:55Z","title":"Exploiting Asymmetry for Synthetic Training Data Generation: SynthIE and the Case of Information Extraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04132","snapshot_observed_at":"2026-08-16T04:22:35.333520Z","title":"Exploiting asymmetry for synthetic training data generation: Synthie and the case of information extraction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.333520Z"},"links":{"cited_paper":"/paper/2303.04132","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:87575699caf164a257007514f804f485418fed94f4734c5adf17c475a58e8fab","observation_id":"cc9eede0-4274-4830-a4da-b5a314accafb","resolution":{"observed_at":"2026-08-16T04:22:35.333520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15860","last_updated":"2025-08-20T21:36:23Z","snapshot_observed_at":"2026-08-16T12:56:23.672726Z","submitted_at":"2025-02-21T10:17:29Z","title":"Synthetic vs. Gold: The Role of LLM Generated Labels and Data in Cyberbullying Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15860","snapshot_observed_at":"2026-08-16T04:22:35.337457Z","title":"Synthetic vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.337457Z"},"links":{"cited_paper":"/paper/2502.15860","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:78908e2cbd2c95efe7f69799e92558d8ca7a7b4d19ab554b6b68615b1d8af224","observation_id":"a9eb81f6-7b20-4b7d-82ec-011ecbdb59f0","resolution":{"observed_at":"2026-08-16T04:22:35.337457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.934532Z","title":null,"venue":null,"work_id":"3dd761fb-be42-46fe-8c48-f4fe854f180c","year":2020},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.341112Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:701fd87eb9bd93e6aaa90035105bcd653bdea72bc2828495be480806d385f4da","observation_id":"2464694f-65d0-4b0e-b306-3c70f9a03c2c","resolution":{"observed_at":"2026-08-16T04:22:35.938619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.344988Z","title":"Data augmentation approaches in natural language processing: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.344988Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:be6c3843f1370401658d901833724b6ecc173ce099fadad5a78a12792a918d61","observation_id":"9a17df87-7095-4099-b6fc-6ee42100f7b7","resolution":{"observed_at":"2026-08-16T04:22:35.344988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.917289Z","title":"Synthetic data generation with large language models for text classification: Potential and limitations","venue":null,"work_id":"d20d2cdf-5ca3-427c-b86d-73c7a300cf73","year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.348514Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:083d8478966800c2445a1831ec26218ca18a46c75ef4050ad25bccc69b44405c","observation_id":"7a2345b8-b3f9-40af-90ab-3ec4e34af8a1","resolution":{"observed_at":"2026-08-16T04:22:35.921358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.352074Z","title":"Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.352074Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:b1ace6d348a0d98995e03fd77ab3d301c3a30c0d032b6d3f6e9fc46ec2fcd4f6","observation_id":"407ac7c7-d9d9-4813-ab4c-960c8c9614b2","resolution":{"observed_at":"2026-08-16T04:22:35.352074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-16T04:22:35.355526Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.355526Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:4ad7e6a5e0592d5f6a96c30d5ccb8b55fdb82c069f5360e75424bf61901735c7","observation_id":"8a63c60d-be2e-4dd0-bd64-957ad5b90515","resolution":{"observed_at":"2026-08-16T04:22:35.355526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.899241Z","title":"TimeLMs: Diachronic language models from Twitter","venue":null,"work_id":"65e92eea-e971-4901-95b0-8653327cb81a","year":2022},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.359865Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:16d030cee4b8703d46eb328199da6f936d77bd37a0541a631ddc67168bd03a1c","observation_id":"f2e6586c-5d02-4b5a-932e-d8aec8ba6e8b","resolution":{"observed_at":"2026-08-16T04:22:35.903099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.888992Z","title":"Coordinating a multi-platform disinformation campaign: Internet research agency activity on three u.s","venue":null,"work_id":"4e726be8-d978-4bfb-a677-a5c97fccd686","year":2015},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.363562Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:b16c9bbaae303b2a0a6da89b5641236256a90d147a09c9158eaf82aee8664095","observation_id":"0a1c1f84-8d3f-4534-9dbc-aadd6e5c6ac6","resolution":{"observed_at":"2026-08-16T04:22:35.892748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.878524Z","title":null,"venue":null,"work_id":"8d97f39b-de37-40ff-a276-9496acea967d","year":2022},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.367294Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:46f21724cbfb7e56b6addebf6259c112b0dfaddbacdfb72f32a652056f6d91fc","observation_id":"4c6d5e05-5670-459a-95a3-dab426d27aa7","resolution":{"observed_at":"2026-08-16T04:22:35.882135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13861","last_updated":"2024-02-05T14:41:35Z","snapshot_observed_at":"2026-08-16T15:37:24.924101Z","submitted_at":"2023-04-26T23:09:02Z","title":"The Parrot Dilemma: Human-Labeled vs. LLM-augmented Data in Classification Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13861","snapshot_observed_at":"2026-08-16T04:22:35.370884Z","title":"Is a prompt and a few samples all you need? using gpt-4 for data augmentation in low-resource classification tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.370884Z"},"links":{"cited_paper":"/paper/2304.13861","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:aa03b0dc17b81d8d9b818490188b10391a94920d64c5fd51e342a06f9cc298bd","observation_id":"fa490eaf-475e-4eb2-a77f-ff97c0bb9d5e","resolution":{"observed_at":"2026-08-16T04:22:35.370884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10005","last_updated":"2022-01-24T23:36:20Z","snapshot_observed_at":"2026-07-06T12:30:51.934079Z","submitted_at":"2022-01-24T23:36:20Z","title":"Text and Code Embeddings by Contrastive Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.10005","snapshot_observed_at":"2026-08-16T04:22:35.374703Z","title":"Text and code embeddings by contrastive pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.374703Z"},"links":{"cited_paper":"/paper/2201.10005","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:67311700ffffcbd2581cc6a43a34f7cbca6080b0a5b4c79e3e8d5f47b1cc642d","observation_id":"32951e68-9044-442a-bd57-4d4ef9c90d79","resolution":{"observed_at":"2026-08-16T04:22:35.374703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.866722Z","title":"Multi-platform information operations: Twitter, facebook and youtube against the white helmets","venue":null,"work_id":"612c2208-016d-4008-828c-f27f4b8c89b7","year":2021},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.378714Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:f28837710550b586a2ac22f2e20e09a0b976bb1038b7bbc4b622277aa12e7dac","observation_id":"8f60f855-647b-4e45-b61d-a690568626e6","resolution":{"observed_at":"2026-08-16T04:22:35.870726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06281","last_updated":"2024-01-03T12:20:35Z","snapshot_observed_at":"2026-08-16T14:35:56.165307Z","submitted_at":"2023-12-11T10:35:32Z","title":"EQ-Bench: An Emotional Intelligence Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06281","snapshot_observed_at":"2026-08-16T04:22:35.382932Z","title":"Eq-bench: An emotional intelligence benchmark for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.382932Z"},"links":{"cited_paper":"/paper/2312.06281","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:d584610d62754bd9869ecf4b85e66cb0ba42dfd015adabe5d53f10ecb12de637","observation_id":"49a246c2-69ef-4543-aae2-67b16f3f2b4c","resolution":{"observed_at":"2026-08-16T04:22:35.382932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.855873Z","title":"Enhancing discourse parsing for local structures from social media with llm-generated data","venue":null,"work_id":"70f47040-0bd3-4206-9afe-979f5da5add5","year":2025},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.386969Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:fa4675cb48468bbd4a16ce991d2b64295cb08ac72b440f449a03c8cedf8c2eea","observation_id":"48b8b881-8d29-4fb5-8b1e-f39505ba666b","resolution":{"observed_at":"2026-08-16T04:22:35.860167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.845511Z","title":"Ita-election-2022: A multi-platform dataset of social media conversations around the 2022 italian general election","venue":null,"work_id":"efac0af6-979f-4031-98fc-612242e5ffc1","year":2022},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.390593Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:d138ce6314c88e91fa7fb6667373ba6124e2f88550cb95172410c17923d966a7","observation_id":"1c11d7a5-ab71-4c58-8bf3-503c7aab5e7f","resolution":{"observed_at":"2026-08-16T04:22:35.849167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.835135Z","title":"Llm-based synthetic datasets: Applications and limitations in toxicity detection","venue":null,"work_id":"c3e422c0-d642-4396-ace8-960d0b008aca","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.394815Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:4f389bb1e78ae69527d365e84471e2b52e8f242e40508595499aa692ab5c064b","observation_id":"3449ecc6-328b-4a48-9e75-86d755098867","resolution":{"observed_at":"2026-08-16T04:22:35.838889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.822974Z","title":"Computational repro- ducibility in computational social science","venue":null,"work_id":"2eee0459-3146-40e9-93fb-0aa8184ef298","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.398541Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:833e9044f933b40ac1c0f1b4bfe524c9e08d98f4ee1943707c7b1b18467d78ed","observation_id":"22f2ddcb-5340-4b32-832c-2d507f93336e","resolution":{"observed_at":"2026-08-16T04:22:35.827107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06709","last_updated":"2016-06-03T15:09:54Z","snapshot_observed_at":"2026-08-14T22:21:59.885585Z","submitted_at":"2015-11-20T17:58:37Z","title":"Improving Neural Machine Translation Models with Monolingual Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06709","snapshot_observed_at":"2026-08-16T04:22:35.402129Z","title":"Improving neural machine translation models with monolingual data","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.402129Z"},"links":{"cited_paper":"/paper/1511.06709","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:8f59197f6eb93eaa7e4ddaf5c286c67714f90167c96d0bc5565899517353f00d","observation_id":"8cfdd11a-0378-40c3-9ac7-6ed8fc873276","resolution":{"observed_at":"2026-08-16T04:22:35.402129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.811453Z","title":"The rise of germany’s afd: A social media analysis","venue":null,"work_id":"6cf85b9c-aa1d-4042-ab1c-55b65d464fe7","year":2019},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.406349Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:9de4e9a4e8c6aabb4d9d6de8bbc8d7bfdfa61ba787c45ad8499fd2bf207017b1","observation_id":"581c3275-5946-4627-bfe4-0d31d354dbe6","resolution":{"observed_at":"2026-08-16T04:22:35.815312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08323","last_updated":"2024-07-11T09:12:39Z","snapshot_observed_at":"2026-08-17T09:13:10.513475Z","submitted_at":"2024-07-11T09:12:39Z","title":"Leveraging GPT for the Generation of Multi-Platform Social Media Datasets for Research","version":1},"cited_work":{"arxiv_id":"2407.08323","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.08323","snapshot_observed_at":"2026-08-16T04:22:35.547441Z","title":"Leveraging GPT for the Generation of Multi-Platform Social Media Datasets for Research","venue":"cs.CY","work_id":"8beb143e-dae0-4ac5-adbd-8be5dabc5a4e","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.409736Z"},"links":{"cited_paper":"/paper/2407.08323","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:849032698a32dacb8d5fcf00ecaac915e1d77a27b613207c74a6d57031eab451","observation_id":"3aa5478b-6483-432b-9ff2-e4aaed311e22","resolution":{"observed_at":"2026-08-16T04:22:35.554261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.799755Z","title":"Leveraging gpt for the generation of multi-platform so- cial media datasets for research","venue":null,"work_id":"ce0f0e1d-b21b-471c-8e72-7cd6580aec03","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.414755Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:9463ea33dbba30ea85c9b1d9b5ab413e2d743833c24e1862b466f31006d49128","observation_id":"ea1c1cdc-69b7-48a4-97bc-80904a56fb07","resolution":{"observed_at":"2026-08-16T04:22:35.803786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05984","last_updated":"2023-10-05T18:26:06Z","snapshot_observed_at":"2026-08-16T14:54:41.475056Z","submitted_at":"2023-10-05T18:26:06Z","title":"Simulating Social Media Using Large Language Models to Evaluate Alternative News Feed Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05984","snapshot_observed_at":"2026-08-16T04:22:35.418691Z","title":"Simulating social media using large language models to evaluate alternative news feed algorithms.arXiv preprint arXiv:2310.05984, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.418691Z"},"links":{"cited_paper":"/paper/2310.05984","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:904baba4d88d2f60bd5286f151e0659586d15b4f5a28f3681120bb654941d511","observation_id":"6114c419-44fb-41ac-a07d-d15d16a11292","resolution":{"observed_at":"2026-08-16T04:22:35.418691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.786938Z","title":"Big questions for social media big data: Representativeness, validity and other methodological pitfalls","venue":null,"work_id":"8a1de646-e7ec-45d7-af50-b0d2d12e1825","year":2014},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.423320Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:b8e1ebda80d61860a2275d8dd40cbecda2d9bd498da24ffed719c822db4c3964","observation_id":"27c70c33-b534-42f0-a067-fc01be915053","resolution":{"observed_at":"2026-08-16T04:22:35.791182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14334","last_updated":"2023-04-27T17:07:29Z","snapshot_observed_at":"2026-08-16T15:37:11.642316Z","submitted_at":"2023-04-27T17:07:29Z","title":"ZeroShotDataAug: Generating and Augmenting Training Data with ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14334","snapshot_observed_at":"2026-08-16T04:22:35.427235Z","title":"Zeroshotdataaug: Generating and augmenting training data with chatgpt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.427235Z"},"links":{"cited_paper":"/paper/2304.14334","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:64b0d14b8f25c42dfefc7131abc51e1e1133bbf044d886cd5a50034c774be91f","observation_id":"875e566a-e3e5-48e1-80b5-dd1191fbf5be","resolution":{"observed_at":"2026-08-16T04:22:35.427235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.773779Z","title":"A multi-platform dataset for detect- ing cyberbullying in social media","venue":null,"work_id":"5534010b-90e1-4b2a-93d6-8007f82b4899","year":2020},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.431827Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:c802d12f0beb1ed4e6c4db2d9bff747ad5660a3b39264d1d49debf4cb218550c","observation_id":"e2cdd483-e81c-48d2-a4fd-36301665ccdb","resolution":{"observed_at":"2026-08-16T04:22:35.778463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.761509Z","title":"Happiness and sadness in adolescents’ instagram direct messaging: A neural topic modeling approach","venue":null,"work_id":"99480b16-23f9-4c1d-b954-eb7d50673361","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.436113Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:dd1bbbfeeaab1897c3c10f77f70444698caaa5f3a8ae92df121bc4b5e4ac7aef","observation_id":"327c0768-c919-4201-b835-1c61963aac27","resolution":{"observed_at":"2026-08-16T04:22:35.765837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15041","last_updated":"2023-05-24T11:27:59Z","snapshot_observed_at":"2026-08-16T15:30:12.688719Z","submitted_at":"2023-05-24T11:27:59Z","title":"Generating Faithful Synthetic Data with Large Language Models: A Case Study in Computational Social Science","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15041","snapshot_observed_at":"2026-08-16T04:22:35.439882Z","title":"Generating faithful synthetic data with large language models: A case study in computational social science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.439882Z"},"links":{"cited_paper":"/paper/2305.15041","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:0085480e82e83c8ca032bb4973208f5f0841de969d949121b40f4df107f74f4d","observation_id":"8bde78c4-a34c-4528-947f-ea9bd71b88d5","resolution":{"observed_at":"2026-08-16T04:22:35.439882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12480","last_updated":"2025-03-12T22:04:34Z","snapshot_observed_at":"2026-08-16T13:41:53.493780Z","submitted_at":"2024-06-18T10:36:21Z","title":"The Power of LLM-Generated Synthetic Data for Stance Detection in Online Political Discussions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12480","snapshot_observed_at":"2026-08-16T04:22:35.443572Z","title":"The power of llm-generated synthetic data for stance detection in online political discussions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.443572Z"},"links":{"cited_paper":"/paper/2406.12480","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:c84ebf23353208ba50a987a2713fc01853748f3204eba4586a4d65ef8b0b5e9d","observation_id":"42a7abe1-bead-4303-88aa-c7ce2116e32d","resolution":{"observed_at":"2026-08-16T04:22:35.443572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.749773Z","title":"Minilm: Deep self-attention distillation for task-agnostic compression of pre-trained transformers","venue":null,"work_id":"2e7d048d-f2ad-4872-a246-4966a86808bb","year":2020},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.447817Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:cc56604743af5d53a5e9bc685abfc2507425215442f284f079daa0b3fd6a8125","observation_id":"261ac7a1-5a35-4f25-b6bc-009521e69ea3","resolution":{"observed_at":"2026-08-16T04:22:35.753455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11196","last_updated":"2019-08-25T23:11:07Z","snapshot_observed_at":"2026-08-14T17:23:13.764826Z","submitted_at":"2019-01-31T03:20:52Z","title":"EDA: Easy Data Augmentation Techniques for Boosting Performance on Text Classification Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11196","snapshot_observed_at":"2026-08-16T04:22:35.451463Z","title":"Eda: Easy data augmentation techniques for boosting performance on text classification tasks","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.451463Z"},"links":{"cited_paper":"/paper/1901.11196","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:44a69f66038180fb72846c29586ee947dd1895ac9cc6027100b1f131313e2743","observation_id":"63e8b6be-95f9-4ba6-97a0-8dea9f3756c7","resolution":{"observed_at":"2026-08-16T04:22:35.451463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.738650Z","title":"Cross-platform information operations: Mobilizing narratives & building resilience through both ’big’ & ’alt’ tech","venue":null,"work_id":"90ffb427-c1b9-45cd-9236-ae40d0c12408","year":2021},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.455720Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:237920e48e052367f0f24f13fb626fb61ff6ff781609bd7b627ef1f934bf0f88","observation_id":"44e8c180-130d-40e9-a640-7eba4b36eaae","resolution":{"observed_at":"2026-08-16T04:22:35.742312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T04:14:24.733274Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":3,"verified_fuzzy":26},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2505.02858."}