{"as_of":"2026-08-07T20:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f3e025c3c657a6e97ff031b00a89c9135997cd7dc3d9fb7667fab5709313380","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:20:04.057694Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T22:18:45.189576Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T14:05:46.699261Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"cited_work":{"arxiv_id":"2506.18421","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18421","snapshot_observed_at":"2026-07-22T00:22:12.404705Z","title":null,"venue":null,"work_id":"d0d5cabb-699a-457c-8ae7-19aa8501e94d","year":2025},"citing_paper":{"arxiv_id":"2605.12376","last_updated":"2026-06-04T17:58:18Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T16:42:38Z","title":"ProfiliTable: Profiling-Driven Tabular Data Processing via Agentic Workflows","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T05:56:36.312877Z"},"links":{"cited_paper":"/paper/2506.18421","citing_paper":"/paper/2605.12376"},"observation_digest":"sha256:f0d265ec1481c1429b837a88e687ab2b21cb445231d8f6e7ba5c4ae8b160332a","observation_id":"014cfda9-bca4-4b8a-98b3-9f9f3905be6e","resolution":{"observed_at":"2026-07-22T00:22:12.404705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"cited_work":{"arxiv_id":"2506.18421","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18421","snapshot_observed_at":"2026-07-22T00:22:12.404705Z","title":null,"venue":null,"work_id":"d0d5cabb-699a-457c-8ae7-19aa8501e94d","year":2025},"citing_paper":{"arxiv_id":"2605.12376","last_updated":"2026-06-04T17:58:18Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T16:42:38Z","title":"ProfiliTable: Profiling-Driven Tabular Data Processing via Agentic Workflows","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T22:18:45.189576Z"},"links":{"cited_paper":"/paper/2506.18421","citing_paper":"/paper/2605.12376"},"observation_digest":"sha256:19ca993a9a422c6a7043171397b5e91e5c32ddb3dcee75bab46e5420fd324f00","observation_id":"5dad171a-f708-44a9-9e65-1a3ab37af9d1","resolution":{"observed_at":"2026-07-22T00:22:12.404705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18421/citation-record","integrity":"/paper/2506.18421/integrity","json":"/paper/2506.18421/citation-record.json","paper":"/paper/2506.18421"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:20:00.709832Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:00.709832Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:d5634f750d5a39c699a37fdd98b0f341e96feeefc4b57d75566d6db6b42c8d49","observation_id":"4b3a2a05-58ce-4e41-97c9-b4b49af9becd","resolution":{"observed_at":"2026-08-06T23:20:00.709832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-06T23:20:01.001340Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.001340Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:cd6d7db797fd44d7045bd3f4e3118eb7d632fa869b419444ac34534615d27519","observation_id":"338be5f1-e943-4a6f-8e59-060ada6d38a0","resolution":{"observed_at":"2026-08-06T23:20:01.001340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:05.363864Z","title":"R., et al","venue":null,"work_id":"c9f909cf-ed92-4811-9816-dd83f3ad22e6","year":2021},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.051627Z"},"links":{"citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:130a75b8aaa09d3f83f4d052c391f738004aaf06f912ab0d2e473a2783e673a1","observation_id":"f5a0899b-0996-452e-a24a-0004dc95ce6a","resolution":{"observed_at":"2026-08-06T23:20:05.462141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T23:20:01.103215Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.103215Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:1f3ca6f842ea7b8d4f5965238b880f248ad155f261317f0a2f819a8053a504e4","observation_id":"4744b0a9-e1cc-423d-be1d-4ab347163d09","resolution":{"observed_at":"2026-08-06T23:20:01.103215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-07T08:32:00.916309Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-06T23:20:01.350485Z","title":"Rlhf workflow: From reward modeling to online rlhf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.350485Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:d13a2d1185d4d1fcb8f919321ebbe5aa33f9ddf17c6373715cb62828ed45c536","observation_id":"37bf6e34-0550-4b47-9a1c-d55322eeacbc","resolution":{"observed_at":"2026-08-06T23:20:01.350485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T23:20:01.408209Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.408209Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:dadcd82589446407c634f2fdbf02113a4d3bb265684ba1de74d0803ce2f2450a","observation_id":"da391928-f427-42e1-b027-8a07c6e7404f","resolution":{"observed_at":"2026-08-06T23:20:01.408209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-06T23:20:01.489710Z","title":"A survey on llm-as-a- judge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.489710Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:577b1c84941d1291d7bfbf717ee3e570fbfaede611b0788d49edb31b7497c537","observation_id":"27e5dc92-2636-4092-8a11-e867b2856365","resolution":{"observed_at":"2026-08-06T23:20:01.489710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-06T23:20:01.630884Z","title":"K., Luo, F., Xiong, Y ., and Liang, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.630884Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:96d6e981b981e711d97b2704b4b48032595c5e4ea1c809fa2c70a43a9db54ac0","observation_id":"8735e25e-e6f3-4e3b-9d82-d8a27040ef97","resolution":{"observed_at":"2026-08-06T23:20:01.630884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T23:20:01.729656Z","title":"Measuring math- ematical problem solving with the math dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.729656Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:922b8894d2d8ac976ab4744e6575771b5d00957c3f1931da0bcfe415233b352f","observation_id":"28ca5b0e-bb76-4375-bb69-a5af0144a6fe","resolution":{"observed_at":"2026-08-06T23:20:01.729656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-06T23:20:01.826117Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.826117Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:9c9722a3265971298789f0aa8d2ea377f1a0def9a153e130e48c2d3285d166e9","observation_id":"d4799446-eba0-46b9-abc3-7b18fee89f36","resolution":{"observed_at":"2026-08-06T23:20:01.826117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09829","last_updated":"2023-11-16T11:53:31Z","snapshot_observed_at":"2026-07-06T16:48:33.164024Z","submitted_at":"2023-11-16T11:53:31Z","title":"FollowEval: A Multi-Dimensional Benchmark for Assessing the Instruction-Following Capability of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09829","snapshot_observed_at":"2026-08-06T23:20:02.097569Z","title":"Followeval: A multi-dimensional bench- mark for assessing the instruction-following capability of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:02.097569Z"},"links":{"cited_paper":"/paper/2311.09829","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:6c213724a9885085447eab6dc2ab50dfc62bc98fbc8d36743ac69777146e7131","observation_id":"80cd3bb1-90be-4ef7-bb44-8c12aa87e8be","resolution":{"observed_at":"2026-08-06T23:20:02.097569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:05.046722Z","title":"Ait-qa: Question answering dataset over complex tables in the airline industry","venue":null,"work_id":"2e726076-8e23-453d-ac1e-d73b131f254b","year":2022},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:02.229374Z"},"links":{"citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:4bec6c72290699082decdba72e43a1deba7f5940eee3ae72b82d8e0a6967cdd6","observation_id":"8d00a86d-a6ac-4f38-ac47-b5ce33ac0601","resolution":{"observed_at":"2026-08-06T23:20:05.113736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19205","last_updated":"2024-04-30T02:05:18Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T02:05:18Z","title":"TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19205","snapshot_observed_at":"2026-08-06T23:20:02.470277Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:02.470277Z"},"links":{"cited_paper":"/paper/2404.19205","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:34c8b5826587d4a34c463ca7bc8fb10bf99d76ca434d68ea50c54626cf666bc1","observation_id":"12d33cae-f6e2-4ee8-8fb0-29985d374f4c","resolution":{"observed_at":"2026-08-06T23:20:02.470277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15075","last_updated":"2023-10-23T16:33:23Z","snapshot_observed_at":"2026-08-02T13:21:27.581593Z","submitted_at":"2023-10-23T16:33:23Z","title":"TableQAKit: A Comprehensive and Practical Toolkit for Table-based Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15075","snapshot_observed_at":"2026-08-06T23:20:02.598781Z","title":"Tableqakit: a com- prehensive and practical toolkit for table-based question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:02.598781Z"},"links":{"cited_paper":"/paper/2310.15075","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:738f2135fe00fdbff218490ca50f981c08b51e4862e5a562441aed7b1825a36f","observation_id":"d897cdce-52af-46b2-ac59-5c62e1a1d68f","resolution":{"observed_at":"2026-08-06T23:20:02.598781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15296","last_updated":"2024-05-24T03:29:14Z","snapshot_observed_at":"2026-07-06T16:52:27.457437Z","submitted_at":"2023-11-26T13:42:56Z","title":"UHGEval: Benchmarking the Hallucination of Chinese Large Language Models via Unconstrained Generation","version":3},"cited_work":{"arxiv_id":"2311.15296","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.15296","snapshot_observed_at":"2026-08-06T23:20:04.338594Z","title":"UHGEval: Benchmarking the Hallucination of Chinese Large Language Models via Unconstrained Generation","venue":"cs.CL","work_id":"35152e2e-0b2d-4920-9b91-1b139d8f84da","year":2023},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:02.713992Z"},"links":{"cited_paper":"/paper/2311.15296","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:f9ae8a81947d992826f09ac99eae913efb0177cb296a8160bc61db6771af5f36","observation_id":"fa4b1cff-1354-4f94-a1b6-c2ffd55a2a6d","resolution":{"observed_at":"2026-08-06T23:20:04.474776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T23:20:03.205192Z","title":"Deepseekmath: Push- ing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.205192Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:1ff5ba633791f72654c2c3707e9143f0cb2b2664dc5c22e62c543e2edaff6984","observation_id":"86b4b131-021c-4617-80dd-67208fb4602b","resolution":{"observed_at":"2026-08-06T23:20:03.205192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02059","last_updated":"2024-11-07T03:32:44Z","snapshot_observed_at":"2026-08-07T15:32:17.369903Z","submitted_at":"2024-11-04T13:03:13Z","title":"TableGPT2: A Large Multimodal Model with Tabular Data Integration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02059","snapshot_observed_at":"2026-08-06T23:20:03.333517Z","title":"Tablegpt2: A large multimodal model with tabular data integration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.333517Z"},"links":{"cited_paper":"/paper/2411.02059","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:223b7acc881fb3a918cd274a4c62b92d14a59d9e1bcc3f84fd50034202f5283e","observation_id":"bdf2d175-1d2b-4802-868a-b97e70998156","resolution":{"observed_at":"2026-08-06T23:20:03.333517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-07-06T12:05:25.336577Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-08-06T23:20:03.461424Z","title":"H., and Li, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.461424Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:de582bac77085772ec9738d3f7ec215d93e167e5de73d7721010688711d81520","observation_id":"6f6c6654-9fed-443f-8b78-24f80ffffc80","resolution":{"observed_at":"2026-08-06T23:20:03.461424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11242","last_updated":"2025-03-18T02:12:21Z","snapshot_observed_at":"2026-07-06T17:04:37.751364Z","submitted_at":"2023-12-18T14:40:20Z","title":"MAC-SQL: A Multi-Agent Collaborative Framework for Text-to-SQL","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11242","snapshot_observed_at":"2026-08-06T23:20:03.588865Z","title":"Mac-sql: A multi-agent collaborative framework for text-to-sql.arXiv preprint arXiv:2312.11242,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.588865Z"},"links":{"cited_paper":"/paper/2312.11242","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:b5bc1dea4ad24a214d44afc4931d4a22dc9a32c9beddfa479c463d0b8b7b3030","observation_id":"30c8885d-9fdf-40f1-b468-994f82b39700","resolution":{"observed_at":"2026-08-06T23:20:03.588865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11354","last_updated":"2025-04-15T16:23:44Z","snapshot_observed_at":"2026-08-03T03:38:06.953412Z","submitted_at":"2025-04-15T16:23:44Z","title":"Kimina-Prover Preview: Towards Large Formal Reasoning Models with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11354","snapshot_observed_at":"2026-08-06T23:20:03.663026Z","title":"D., Sung, F., Vinyes, M., Ying, Z., Zhu, Z., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.663026Z"},"links":{"cited_paper":"/paper/2504.11354","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:1070619c64ed20649b3e786418764903032bee13b171efb5abe90ca818f6c23b","observation_id":"c82b98e5-bc45-4474-9226-1faf9aee2f94","resolution":{"observed_at":"2026-08-06T23:20:03.663026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T23:20:03.756297Z","title":"Mmqa: Evaluating llms with multi-table multi-hop complex questions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.756297Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:3070e3831456ba4d54cee8236acebc79a24368c614bca7ceac6d70b3ebd65f62","observation_id":"b8ee7cea-3bc6-4461-85a4-b7c960ad444e","resolution":{"observed_at":"2026-08-06T23:20:03.756297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-06T23:20:03.872378Z","title":"arXiv preprint arXiv:2403.04652,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.872378Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:033e834bad4a58fc488a939749e68a6ffdb447070593568c950392114b702993","observation_id":"d44e477d-a053-445e-b0d9-c49b8f7aa476","resolution":{"observed_at":"2026-08-06T23:20:03.872378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:04.701121Z","title":"Spider: A large-scale human-labeled dataset for complex and cross- domain semantic parsing and text-to-sql task","venue":null,"work_id":"2e6fb93d-fc26-4d5c-81bb-2baae9ce0504","year":2018},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.958511Z"},"links":{"citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:209ed3a2f96a32ff438af154f4fe42931135e540e097ecbced43df2a345c69bc","observation_id":"5424cf12-9e9c-4ac5-996c-feb3e76872a5","resolution":{"observed_at":"2026-08-06T23:20:04.802096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-07-31T19:00:59.311189Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-08-06T23:20:04.057694Z","title":"Y ., Vu, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:04.057694Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:301a50feeba190bf47cf98367ec7c4e54ebc1b3f5f0d4def198368384269a252","observation_id":"409a6220-26df-4c16-b46e-06bbdf72dbe6","resolution":{"observed_at":"2026-08-06T23:20:04.057694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:04.896260Z","title":"Totto: A controlled table- to-text generation dataset","venue":null,"work_id":"63933e7a-b311-4672-b4c2-6725fb1ab0ff","year":2020},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:02.940097Z"},"links":{"citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:67f506985e19eb60874e4d056e97856bbf76f3955360daab6047128dba37aa2c","observation_id":"85074de9-9cc1-4f2f-a4cd-dd4e197a6f2a","resolution":{"observed_at":"2026-08-06T23:20:04.964808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12209","last_updated":"2024-05-20T17:52:29Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:52:29Z","title":"MathBench: Evaluating the Theory and Application Proficiency of LLMs with a Hierarchical Mathematics Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12209","snapshot_observed_at":"2026-08-06T23:20:02.838439Z","title":"Math- bench: Evaluating the theory and application proficiency of llms with a hierarchical mathematics benchmark.arXiv preprint arXiv:2405.12209,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:02.838439Z"},"links":{"cited_paper":"/paper/2405.12209","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:f89bde15c3f3b87eb91f12150518665f9b682e0c478be011263820c0ff6cd927","observation_id":"193dd8cc-9d80-4f51-8211-c7db35f3a691","resolution":{"observed_at":"2026-08-06T23:20:02.838439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19504","last_updated":"2026-06-05T23:48:53Z","snapshot_observed_at":"2026-07-06T19:58:48.586415Z","submitted_at":"2024-11-29T06:48:13Z","title":"TQA-Bench: Evaluating LLMs for Multi-Table Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19504","snapshot_observed_at":"2026-08-06T23:20:03.071359Z","title":"Tqa-bench: Evaluating llms for multi-table question answering with scalable context and symbolic extension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.071359Z"},"links":{"cited_paper":"/paper/2411.19504","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:c46ef4c9e23a0ec42a46d96273432a23b9169935d726efe9f925b51feb23e628","observation_id":"111542bc-8bb5-4529-a60e-5f500ef79af2","resolution":{"observed_at":"2026-08-06T23:20:03.071359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T23:20:01.965467Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.965467Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:7fd08172a8d683e18dd73082d559189210ca1c6232740e32135cd9b79a3d7ad2","observation_id":"f7b13eb3-f7c8-4ef6-aa61-1394f2fbae1f","resolution":{"observed_at":"2026-08-06T23:20:01.965467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07436","last_updated":"2024-06-11T16:45:17Z","snapshot_observed_at":"2026-07-06T18:29:00.001236Z","submitted_at":"2024-06-11T16:45:17Z","title":"McEval: Massively Multilingual Code Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07436","snapshot_observed_at":"2026-08-06T23:20:00.861149Z","title":"Mceval: Massively multilingual code evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:00.861149Z"},"links":{"cited_paper":"/paper/2406.07436","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:941688b2b906b82db95817bbaabc19db40f7aca52b2318dbe4460483df8ec040","observation_id":"0f7daa07-7220-4925-a7c1-5faf4bcceee0","resolution":{"observed_at":"2026-08-06T23:20:00.861149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:20:01.190008Z","title":"Deepseek-r1: Incentivizing reasoning capa- bility in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.190008Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:eaef66123e7728e1024f0a926cf5208d83a22aa2010de38620e50c575b1583cc","observation_id":"bf0866df-e83f-417e-ba0d-bdbccb941bb4","resolution":{"observed_at":"2026-08-06T23:20:01.190008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14415","last_updated":"2025-06-30T15:48:16Z","snapshot_observed_at":"2026-08-07T15:32:09.778337Z","submitted_at":"2025-05-20T14:27:51Z","title":"Table Foundation Models: on knowledge pre-training for tabular learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14415","snapshot_observed_at":"2026-08-06T23:20:02.370073Z","title":"J., Lefebvre, F., Brison, G., Perez-Lebel, A., and Varoquaux, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:02.370073Z"},"links":{"cited_paper":"/paper/2505.14415","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:995ad0c79c17e50ea559fd7c0f5cafec308b08f0ef7908443cb7b3598e95c6bf","observation_id":"48d2a58e-7701-44fd-a6bd-4891431660d6","resolution":{"observed_at":"2026-08-06T23:20:02.370073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:00.771769Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:00.771769Z"},"links":{"citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:cea4c6531bdf9cfd4a1d884b2512aae592fa751f8c992a74708a3e26bb7888a9","observation_id":"1d4d8fcb-ca5b-4c36-b977-d8630df5f8ee","resolution":{"observed_at":"2026-08-06T23:20:00.771769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:05.569189Z","title":null,"venue":null,"work_id":"8357c004-8a19-49fe-8a50-0dc506921295","year":2020},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:00.940491Z"},"links":{"citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:4f6bc06ecd18593fa8224515b6e45d162d234578056087613a38d5d8644fa506","observation_id":"84d11dd7-80f8-4fce-929c-67c01f7d8945","resolution":{"observed_at":"2026-08-06T23:20:05.669312Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:05.214823Z","title":"Tables as texts or images: Evaluating the table reasoning ability of llms and mllms","venue":null,"work_id":"36626f6c-bd62-43a8-825e-5ef2557a2576","year":2024},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.257151Z"},"links":{"citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:0a7427c501526453c8f4c0bbc99619a142d56a7f5be799ecca97227c9f797ef2","observation_id":"c8c641df-fc1f-43b5-ae47-b30e5d7f0afa","resolution":{"observed_at":"2026-08-06T23:20:05.289155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T08:33:49.466678Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 2 inbound Pith citation observations for arXiv:2506.18421."}