{"as_of":"2026-08-08T20:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e35bc9a031cc1ad029f5476dcb4d6790cc3896d2984b6fb9c8930bbc9202427","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T16:11:18.608790Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:45:15.313592Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:45:27.776502Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.06279","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06279","snapshot_observed_at":"2026-08-07T12:45:27.776502Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","venue":"cs.CL","work_id":"2ac440a1-21f1-4520-875f-55796f36e8aa","year":2025},"citing_paper":{"arxiv_id":"2505.23713","last_updated":"2025-05-29T17:47:36Z","snapshot_observed_at":"2026-08-07T22:01:03.677076Z","submitted_at":"2025-05-29T17:47:36Z","title":"SocialMaze: A Benchmark for Evaluating Social Reasoning in Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:15.313592Z"},"links":{"cited_paper":"/paper/2502.06279","citing_paper":"/paper/2505.23713"},"observation_digest":"sha256:82f271d872376bed26280a97ee4e2c1d223441c04b305152eeba266b5a3333fd","observation_id":"5096160d-dc35-4a12-bd7d-d52ca33d0792","resolution":{"observed_at":"2026-08-07T12:45:27.847772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06279/citation-record","integrity":"/paper/2502.06279/integrity","json":"/paper/2502.06279/citation-record.json","paper":"/paper/2502.06279"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.15074","last_updated":"2023-10-23T11:55:58Z","snapshot_observed_at":"2026-08-03T17:43:44.363296Z","submitted_at":"2023-05-24T11:55:59Z","title":"Have LLMs Advanced Enough? A Challenging Problem Solving Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15074","snapshot_observed_at":"2026-08-08T16:11:18.486154Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.486154Z"},"links":{"cited_paper":"/paper/2305.15074","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:14e8764d7cbcccc2830b442eb515796369caad0e50754947b4accd55f600f762","observation_id":"cd8caff9-11fb-4582-8ecc-16047f0ac32b","resolution":{"observed_at":"2026-08-08T16:11:18.486154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-08T16:11:18.491829Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.491829Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:fa9f015bac19ab43816d358c85b0c6c9e2d904dc4241c8f8167e9b0a68793e67","observation_id":"d4031c7c-5b05-4bda-9964-018e3747ea35","resolution":{"observed_at":"2026-08-08T16:11:18.491829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-08T16:11:18.496913Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.496913Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:5483840e5cc8bee4bd4f8750cb3340ae299fbb93cee574e663fe89dacd4360d2","observation_id":"917d2ff8-be1a-4ed0-9420-bdd2cb478dbd","resolution":{"observed_at":"2026-08-08T16:11:18.496913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-08T16:11:18.501581Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.501581Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:523f58fb73a82869c672a9ff3621e4871cd8ba4830220c8a3603e9e695af55db","observation_id":"d77e5042-c4b6-4cdd-89bf-00c456542f15","resolution":{"observed_at":"2026-08-08T16:11:18.501581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-08T16:11:18.506182Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.506182Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:37c1277a9f5d4df0d7c5d453701f040dc691d78110d324b8e9f61c976555abbc","observation_id":"10063763-7df0-49db-882a-aa354370fab7","resolution":{"observed_at":"2026-08-08T16:11:18.506182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-08T16:11:18.511898Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.511898Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:0bfd8279771235cff3dc2beafd32f92a51f900691635475a2d0888ff6a008158","observation_id":"94fc4e2f-e2dc-43c5-8869-d05148b5e03a","resolution":{"observed_at":"2026-08-08T16:11:18.511898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-08T16:11:18.518463Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.518463Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:5a1b27c4aaf63e63ba50fe7e8e55f13597a7a235253b76f380830c2373c55c49","observation_id":"9d8a23f7-f692-427d-8402-ec6ee201c926","resolution":{"observed_at":"2026-08-08T16:11:18.518463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:11:18.524453Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.524453Z"},"links":{"citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:cd2d3250b93721eaf583e541adb62a2ba9d9d89ae141399af2cb6b183a3c1481","observation_id":"677caec8-45cd-4a68-a371-e34078015f5e","resolution":{"observed_at":"2026-08-08T16:11:18.524453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-08T16:11:18.529248Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.529248Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:a3a0405f8fee0547a43a4fbf4c48cef75550c09e7b27b4e7813465257a25611d","observation_id":"2e3f2138-e44b-46d9-a738-fb1e493fde1a","resolution":{"observed_at":"2026-08-08T16:11:18.529248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-08T16:11:18.534365Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.534365Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:4194c94e431116063ff8febd0694f1870c341a728f8632cc8ed702c428c7d6b6","observation_id":"6e8f89c7-074f-4661-af23-24e73cf61f5a","resolution":{"observed_at":"2026-08-08T16:11:18.534365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-08T16:11:18.539393Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.539393Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:c81a053807d584307dfa2f17e8e0605af31a09a6d873d1af18626281d100b5fb","observation_id":"18711a9e-2ab0-4e71-b4c3-9c3d00785754","resolution":{"observed_at":"2026-08-08T16:11:18.539393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16848","last_updated":"2025-02-27T08:15:49Z","snapshot_observed_at":"2026-07-06T19:37:42.469688Z","submitted_at":"2024-10-22T09:35:42Z","title":"ETHIC: Evaluating Large Language Models on Long-Context Tasks with High Information Coverage","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16848","snapshot_observed_at":"2026-08-08T16:11:18.544009Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.544009Z"},"links":{"cited_paper":"/paper/2410.16848","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:1b0ffb201f068d45bf341ed8d5624caa9947d241e0248ed6dfedc68b2f2b274b","observation_id":"43a8759a-9757-47ea-8e2a-8842b90ae72b","resolution":{"observed_at":"2026-08-08T16:11:18.544009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-08T16:11:18.548724Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.548724Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:07abb4d6a2aac509624ee41f1d0018492b687d3ad4f77ee01471aeb3929b101b","observation_id":"d604e143-5e9c-4847-ba4c-12d71d9e42c0","resolution":{"observed_at":"2026-08-08T16:11:18.548724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:11:18.553353Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.553353Z"},"links":{"citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:0f07aa2dfe12de5ef3067d16acf4d919cb4121ce952d743eb991bc9e1c8e9224","observation_id":"5e4ad9ce-873a-4e1e-a28b-fec3ba94127f","resolution":{"observed_at":"2026-08-08T16:11:18.553353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T16:11:18.557726Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.557726Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:9603c71f36e9a20edcefdeb683b783bb7165c1a9d7141f3fcea828bd7e95f37c","observation_id":"d7d359cc-271e-48f2-b038-c0de03b0bcdb","resolution":{"observed_at":"2026-08-08T16:11:18.557726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:11:18.562510Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.562510Z"},"links":{"citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:edc231149217f2fe57092c8737066605b290b7b2db31fd359a872cb45eab94fc","observation_id":"7d17e15d-de30-4fcd-9749-cf50fd25a879","resolution":{"observed_at":"2026-08-08T16:11:18.562510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12584","last_updated":"2024-01-21T14:51:26Z","snapshot_observed_at":"2026-08-05T04:02:58.923698Z","submitted_at":"2023-02-24T11:44:24Z","title":"VivesDebate-Speech: A Corpus of Spoken Argumentation to Leverage Audio Features for Argument Mining","version":2},"cited_work":{"arxiv_id":"2302.12584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.12584","snapshot_observed_at":"2026-08-08T16:11:18.765538Z","title":"VivesDebate-Speech: A Corpus of Spoken Argumentation to Leverage Audio Features for Argument Mining","venue":"cs.CL","work_id":"4d15646c-03d2-49bf-bc6d-99a7dec22cb2","year":2023},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.566920Z"},"links":{"cited_paper":"/paper/2302.12584","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:267d3c684fa985fb4a321dfba7ad5c6ffa81615df4c1c52e4603c66d32ec1067","observation_id":"eb7ae997-d196-417d-982a-be9c65607ffc","resolution":{"observed_at":"2026-08-08T16:11:18.772504Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-08T16:11:18.572248Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.572248Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:7d9a00fc4b3ad8a836d04bf8b026ff9b4468b30eb0e2dfb69d93635a07d03cd4","observation_id":"ece87034-6b18-40ac-81e5-f3ef7ad81d5a","resolution":{"observed_at":"2026-08-08T16:11:18.572248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T16:11:18.577374Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.577374Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:77477a11160ec38a0500ba56ad80591c788f14b631c1bcfdfabe2cd0429cb7df","observation_id":"8e27cc1d-708c-43d0-a8e3-657e5178bde9","resolution":{"observed_at":"2026-08-08T16:11:18.577374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11449","last_updated":"2026-06-09T04:55:57Z","snapshot_observed_at":"2026-07-06T20:07:32.814148Z","submitted_at":"2024-12-16T05:03:48Z","title":"Whisper-GPT -- Continuous Discrete Hybrid Representation Language Models For Speech And Music","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11449","snapshot_observed_at":"2026-08-08T16:11:18.582452Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.582452Z"},"links":{"cited_paper":"/paper/2412.11449","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:a37cd16cbb93d63790346babcd4916d84b66556687395dee0327615b1b015e6b","observation_id":"72ec0687-a5c1-4e87-a590-60a3940f4dff","resolution":{"observed_at":"2026-08-08T16:11:18.582452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00537","last_updated":"2020-02-13T00:28:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-05-02T00:41:50Z","title":"SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00537","snapshot_observed_at":"2026-08-08T16:11:18.587695Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.587695Z"},"links":{"cited_paper":"/paper/1905.00537","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:ee5e52e92738ee7cb11ba1570a94046beb99a322874cef319a65cdf1a29b20eb","observation_id":"ea3510d8-9973-4378-8c73-4fed6a197109","resolution":{"observed_at":"2026-08-08T16:11:18.587695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-08T16:11:18.592741Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.592741Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:85e724082f54d5e4d7c19bd1077114b63c4a764c906fff4a594a4e11c5b69247","observation_id":"9c71265b-4f29-4198-8779-1fd2c153ee48","resolution":{"observed_at":"2026-08-08T16:11:18.592741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04945","last_updated":"2023-10-07T23:29:00Z","snapshot_observed_at":"2026-07-06T16:29:15.947222Z","submitted_at":"2023-10-07T23:29:00Z","title":"Balancing Specialized and General Skills in LLMs: The Impact of Modern Tuning and Data Strategy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04945","snapshot_observed_at":"2026-08-08T16:11:18.598661Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.598661Z"},"links":{"cited_paper":"/paper/2310.04945","citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:f0347b6656fb9cec9c3d4feae8bbe2c0b176e393c56fc8d6771846d954487501","observation_id":"73a3bd7c-ae58-4ed2-91b9-a1abe31580eb","resolution":{"observed_at":"2026-08-08T16:11:18.598661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:11:18.603687Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.603687Z"},"links":{"citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:8af14d2dcd40138e5e6ccaf928591a100d1bbb9f3056f895da2f5e214d4fd523","observation_id":"688c9413-e64d-40c8-bd05-822a9ae189b1","resolution":{"observed_at":"2026-08-08T16:11:18.603687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:11:18.608790Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:18.608790Z"},"links":{"citing_paper":"/paper/2502.06279"},"observation_digest":"sha256:112e85724dbc5c4fe10b984ded9f77b1c96516f71eb7648c0724afd785c10b9c","observation_id":"a9700a8c-5fee-4d22-afdd-6d5ca9c596d9","resolution":{"observed_at":"2026-08-08T16:11:18.608790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06279","last_updated":"2025-02-10T09:23:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T15:55:46.130864Z","submitted_at":"2025-02-10T09:23:03Z","title":"DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 1 inbound Pith citation observation for arXiv:2502.06279."}