{"as_of":"2026-08-12T10:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c0419c6a83a0ddeeecbc095786829a72d15d321a9d58b7893705f093bd1c46b5","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:26:02.765845Z","state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.11988/citation-record","integrity":"/paper/2412.11988/integrity","json":"/paper/2412.11988/citation-record.json","paper":"/paper/2412.11988"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:26:02.689181Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11988","last_updated":"2024-12-16T17:11:48Z","snapshot_observed_at":"2026-08-11T14:21:34.736038Z","submitted_at":"2024-12-16T17:11:48Z","title":"SciFaultyQA: Benchmarking LLMs on Faulty Science Question Detection with a GAN-Inspired Approach to Synthetic Dataset Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T14:26:02.689181Z"},"links":{"citing_paper":"/paper/2412.11988"},"observation_digest":"sha256:601e4a64d005b33eb6c70201f86b7403e7d698990cb29a5f24f7ddbbd8adb1e4","observation_id":"a060630d-61b3-487b-97a4-ce393b1bba62","resolution":{"observed_at":"2026-08-11T14:26:02.689181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-11T14:26:02.698707Z","title":"Think you have solved question answering? try ARC , the AI 2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11988","last_updated":"2024-12-16T17:11:48Z","snapshot_observed_at":"2026-08-11T14:21:34.736038Z","submitted_at":"2024-12-16T17:11:48Z","title":"SciFaultyQA: Benchmarking LLMs on Faulty Science Question Detection with a GAN-Inspired Approach to Synthetic Dataset Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T14:26:02.698707Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2412.11988"},"observation_digest":"sha256:c784e442f5e06e7009ed2e8976c4d5b82e720ddaab5a576fa129f4a2a31bc466","observation_id":"7975dc92-c889-4679-b8b5-7caf0e115050","resolution":{"observed_at":"2026-08-11T14:26:02.698707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/d41586-024-01087-4","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:26:02.830682Z","title":"AI now beats humans at basic tasks — new benchmarks are needed, says major report","venue":null,"work_id":"6b14aaba-32be-42dd-9b62-27b5b3dbcf1b","year":null},"citing_paper":{"arxiv_id":"2412.11988","last_updated":"2024-12-16T17:11:48Z","snapshot_observed_at":"2026-08-11T14:21:34.736038Z","submitted_at":"2024-12-16T17:11:48Z","title":"SciFaultyQA: Benchmarking LLMs on Faulty Science Question Detection with a GAN-Inspired Approach to Synthetic Dataset Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T14:26:02.704292Z"},"links":{"citing_paper":"/paper/2412.11988"},"observation_digest":"sha256:fff4cfa78ff2d07550bc7289ef6f86233da72833d14eac3634af57e673bc4b84","observation_id":"c790df0f-0c01-491a-8b9f-dae81159b7bf","resolution":{"observed_at":"2026-08-11T14:26:02.844233Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:26:02.711431Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11988","last_updated":"2024-12-16T17:11:48Z","snapshot_observed_at":"2026-08-11T14:21:34.736038Z","submitted_at":"2024-12-16T17:11:48Z","title":"SciFaultyQA: Benchmarking LLMs on Faulty Science Question Detection with a GAN-Inspired Approach to Synthetic Dataset Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T14:26:02.711431Z"},"links":{"citing_paper":"/paper/2412.11988"},"observation_digest":"sha256:d4b9e3eb4c0838ab2132a41de1c19dad2827554f091c820e79f2605e9f6711bf","observation_id":"5a36e48c-08d1-43dc-88e7-8e1e1e71d5e8","resolution":{"observed_at":"2026-08-11T14:26:02.711431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05196","last_updated":"2021-04-12T04:25:09Z","snapshot_observed_at":"2026-08-09T12:27:43.386669Z","submitted_at":"2021-04-12T04:25:09Z","title":"StylePTB: A Compositional Benchmark for Fine-grained Controllable Text Style Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.05196","snapshot_observed_at":"2026-08-11T14:26:02.722224Z","title":"P., Pham, H., Hovy, E., Póczos, B., Salakhutdinov, R., and Morency, L.-P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11988","last_updated":"2024-12-16T17:11:48Z","snapshot_observed_at":"2026-08-11T14:21:34.736038Z","submitted_at":"2024-12-16T17:11:48Z","title":"SciFaultyQA: Benchmarking LLMs on Faulty Science Question Detection with a GAN-Inspired Approach to Synthetic Dataset Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T14:26:02.722224Z"},"links":{"cited_paper":"/paper/2104.05196","citing_paper":"/paper/2412.11988"},"observation_digest":"sha256:74766ded2a6ced6cace8bb6743e2f15b349203b76eeb2af57a9203e92d17e083","observation_id":"a97c27ac-a0a6-4193-bf31-d979cd9bc06f","resolution":{"observed_at":"2026-08-11T14:26:02.722224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19512","last_updated":"2023-06-12T02:13:16Z","snapshot_observed_at":"2026-08-11T02:28:36.817929Z","submitted_at":"2023-05-31T02:51:26Z","title":"Fine-grained Text Style Transfer with Diffusion-Based Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19512","snapshot_observed_at":"2026-08-11T14:26:02.729133Z","title":"C., and Lee, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11988","last_updated":"2024-12-16T17:11:48Z","snapshot_observed_at":"2026-08-11T14:21:34.736038Z","submitted_at":"2024-12-16T17:11:48Z","title":"SciFaultyQA: Benchmarking LLMs on Faulty Science Question Detection with a GAN-Inspired Approach to Synthetic Dataset Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T14:26:02.729133Z"},"links":{"cited_paper":"/paper/2305.19512","citing_paper":"/paper/2412.11988"},"observation_digest":"sha256:75e7d89600de6b64ca5f22393927498c25570e01b865464e15090aa2e6ed7ec8","observation_id":"0211efbe-614f-420d-aa31-5eda3a7a4614","resolution":{"observed_at":"2026-08-11T14:26:02.729133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:26:03.129703Z","title":"C., Shoham, Y., Wald, R., and Clark, J","venue":null,"work_id":"c8484b6f-e0c8-4446-b2df-8732f0bc9322","year":2024},"citing_paper":{"arxiv_id":"2412.11988","last_updated":"2024-12-16T17:11:48Z","snapshot_observed_at":"2026-08-11T14:21:34.736038Z","submitted_at":"2024-12-16T17:11:48Z","title":"SciFaultyQA: Benchmarking LLMs on Faulty Science Question Detection with a GAN-Inspired Approach to Synthetic Dataset Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T14:26:02.738232Z"},"links":{"citing_paper":"/paper/2412.11988"},"observation_digest":"sha256:3adbc0ea1073ccb54424be70049488f5216dfd223fac5e2d60c03afc78599674","observation_id":"e3d5ea51-3a4e-49b9-951d-11f840bf0365","resolution":{"observed_at":"2026-08-11T14:26:03.135865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:26:03.104889Z","title":"Learning to reason with LLMs","venue":null,"work_id":"376b5912-813d-437e-bff8-01305c196395","year":null},"citing_paper":{"arxiv_id":"2412.11988","last_updated":"2024-12-16T17:11:48Z","snapshot_observed_at":"2026-08-11T14:21:34.736038Z","submitted_at":"2024-12-16T17:11:48Z","title":"SciFaultyQA: Benchmarking LLMs on Faulty Science Question Detection with a GAN-Inspired Approach to Synthetic Dataset Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T14:26:02.743712Z"},"links":{"citing_paper":"/paper/2412.11988"},"observation_digest":"sha256:d4842e886cebbcc6538e14e3dabfb8eb67bd0cd273cb088d88a10309f206c881","observation_id":"7b3f1a3b-871c-4b00-951f-6764fc93bd23","resolution":{"observed_at":"2026-08-11T14:26:03.114324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-11T14:26:02.751752Z","title":"L., Stickland, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11988","last_updated":"2024-12-16T17:11:48Z","snapshot_observed_at":"2026-08-11T14:21:34.736038Z","submitted_at":"2024-12-16T17:11:48Z","title":"SciFaultyQA: Benchmarking LLMs on Faulty Science Question Detection with a GAN-Inspired Approach to Synthetic Dataset Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T14:26:02.751752Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2412.11988"},"observation_digest":"sha256:98ee0717ca4f5d17bd55b3adb33d076c26ff5b7a9c53fc8df0f354f95bf9e0ab","observation_id":"54d87bdb-d81b-4287-bd93-3599c098793b","resolution":{"observed_at":"2026-08-11T14:26:02.751752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-08-06T06:05:27.671303Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-08-11T14:26:02.758615Z","title":"F., and Gardner, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11988","last_updated":"2024-12-16T17:11:48Z","snapshot_observed_at":"2026-08-11T14:21:34.736038Z","submitted_at":"2024-12-16T17:11:48Z","title":"SciFaultyQA: Benchmarking LLMs on Faulty Science Question Detection with a GAN-Inspired Approach to Synthetic Dataset Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T14:26:02.758615Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2412.11988"},"observation_digest":"sha256:4ecf4ec322a169b4a00ce2afcfe1860eea89b7bfdbd5d5f00472e2eabda96c05","observation_id":"d9f1481b-f470-4768-be29-cc5edd664e29","resolution":{"observed_at":"2026-08-11T14:26:02.758615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:26:02.765845Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11988","last_updated":"2024-12-16T17:11:48Z","snapshot_observed_at":"2026-08-11T14:21:34.736038Z","submitted_at":"2024-12-16T17:11:48Z","title":"SciFaultyQA: Benchmarking LLMs on Faulty Science Question Detection with a GAN-Inspired Approach to Synthetic Dataset Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T14:26:02.765845Z"},"links":{"citing_paper":"/paper/2412.11988"},"observation_digest":"sha256:11364a786c81dddbfc7b66f3a96a0f43fd9d1a50a2005a6c43ef8b83cc635b78","observation_id":"09f2343c-70f9-4924-a5ac-bca3add8e83a","resolution":{"observed_at":"2026-08-11T14:26:02.765845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.11988","last_updated":"2024-12-16T17:11:48Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T14:21:34.736038Z","submitted_at":"2024-12-16T17:11:48Z","title":"SciFaultyQA: Benchmarking LLMs on Faulty Science Question Detection with a GAN-Inspired Approach to Synthetic Dataset Generation"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 0 inbound Pith citation observations for arXiv:2412.11988."}