Pith. sign in

Paper Citation Record · LEDGER

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models

As of 8 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2505.21409.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.21409 v1

Coverage vector

measured 61 of 61 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T13:32:50.913865Z

measured 61 of 61 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

61 of 61 outbound references displayed

  • verified exact7
  • verified fuzzy16
  • unresolved34
  • parse uncertain0
  • malformed identifier3
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 07e3c137-1528-4fef-8fd3-8ee46e10ba6c · outbound

This paper cites Ai hallucination report 2025, 2025.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Ai hallucination report 2025, 2025

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:59.261936Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:46.361753Z digest=sha256:20483ea7dfb6f0835e9941b638c054e2ba3c8d1f3017499afe48f080a2351e6b

Observation db2fe7a2-deb1-4651-8dfb-b2face751cf2 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:59.051641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:46.403729Z digest=sha256:060170868596af0878bd3b04a6d7bfc6c45f9713210588c26a1f688ebea4b750

Observation f386ed11-ef70-4e89-b24e-978300c46ede · outbound

This paper cites Balsiger, H.-R.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Balsiger, H.-R

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:58.749755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:46.441750Z digest=sha256:9a1de823369648ab7ef0b3e472e855ae173dc69480f9f568bdc75ebd9eeaa9d8

Observation 09c7ceea-687d-4aab-841f-bb57859f6cac · outbound

This paper cites Interpretable Medical Diagnostics with Structured Data Extraction by Large Language Models.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Interpretable Medical Diagnostics with Structured Data Extraction by Large Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:46.520937Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:46.520937Z digest=sha256:9a92d4df65ec291fb9fedfc6667db78b787112f8361309683cfabc3f06ba0288

Observation 83d20bd7-532e-4110-9a9a-e04daa29a71b · outbound

This paper cites Borisov, K.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Borisov, K

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:58.517294Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:46.573788Z digest=sha256:f1c3777096ac22d24c5aeeb8d92bf6b4eeeffbf7550658d93a9fa1e1ab6ed1c1

Observation 5a333f0c-374c-44d2-8ba9-77c3db137e51 · outbound

This paper cites Buoncristiano, G.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Buoncristiano, G

Reference 6

Resolution
verified exact
doi, observed 2026-08-07T13:32:52.299853Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:46.625119Z digest=sha256:01613b9de067cac39ee7eb4bc7ecc4093b36b4c158e4773b32277ae0d5fd3ee9

Observation 21db787f-3b63-472b-a4e7-8305a2cc2a45 · outbound

This paper cites Retrieve, Merge, Predict: Augmenting Tables with Data Lakes.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Retrieve, Merge, Predict: Augmenting Tables with Data Lakes

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:46.676074Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:46.676074Z digest=sha256:f3afbe5b6c68751550a4bc675f296843fdd2ab0de9c6d86d0e76d9b6bc128e50

Observation c3536f04-1b0a-4238-b799-71090ed6f0d8 · outbound

This paper cites Chang, X.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Chang, X

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:46.713259Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:46.713259Z digest=sha256:de7f9c76091844719c61ceb1b2268f52a0a40848338c2cce8c9675525b7b235e

Observation 3de3a363-6858-4b22-bd6b-b316ecd28949 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:58.348469Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:46.750093Z digest=sha256:57a5411a4ff71bd5260ca319f4d957ced5b3c3c5937166cb411878de9d287a79

Observation 539ed863-a7ca-4ace-bee0-2aa5697e9122 · outbound

This paper cites Chowdhury, D.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Chowdhury, D

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:58.162748Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:46.790043Z digest=sha256:6c2f1ae084ecf22ac9c085f77dbc807b11ed5da8de178682022821ebda759b9c

Observation 6ebb0201-619e-4392-9502-01af1f438bcc · outbound

This paper cites Christophides, V.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Christophides, V

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:57.979386Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:46.827253Z digest=sha256:51eb3c633843129022c1c5434c7dacf9ae036d44339b489ce28aae7cc292c21b

Observation 9b9c87c3-d87c-4b35-8027-caa2498e6fc6 · outbound

This paper cites DeepSeek LLM: Scaling Open-Source Language Models with Longtermism.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models DeepSeek LLM: Scaling Open-Source Language Models with Longtermism

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:46.863793Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:46.863793Z digest=sha256:61b695dd4c3653d6f473439a01e733d40d7cdfb46bbb9092725cf07336233593

Observation ccc29672-a4f9-4b2f-8a84-b3a2504f780e · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 13

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:57.759832Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:46.949789Z digest=sha256:f493ef94b8752387af45df01440a297ae0579146ce9fc91a2e73d91e8f709976

Observation df98fbb8-4333-4889-92e7-52e433d66a7b · outbound

This paper cites Elnashar, J.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Elnashar, J

Reference 14

Resolution
metadata mismatch
raw_fallback, observed 2026-08-07T13:32:53.373000Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:47.101631Z digest=sha256:3e6793891515936843d888a5d1defee39521ac57620a37049500b74a35d369d7

Observation 08c5554f-d8b2-4bf7-9373-0fa7ba694972 · outbound

This paper cites doi: https://doi.org/10.1016/j.accinf.2024.100715.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models doi: https://doi.org/10.1016/j.accinf.2024.100715

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:47.021461Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:47.021461Z digest=sha256:0da6a8a17eb2915be06ce66a7322091d5844ab06edfffeda8674f8fa2b99722e

Observation 04667e40-d325-417c-be23-747a66d0cc9d · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Gemma: Open Models Based on Gemini Research and Technology

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:47.265524Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:47.265524Z digest=sha256:111a8490dadaa6ce89b322b35072bc4faa590af6e10f70a83b8fd283b8bf3b88

Observation 9f9808ce-865c-42ec-99b6-36da7c895896 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 17

Resolution
malformed identifier
no resolver link, observed 2026-08-07T13:32:47.190773Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:47.190773Z digest=sha256:d34f676d7e86350a6e71a6e50d3c3ac8ccfb7707dbe527f47007d0d2329f118d

Observation c55372c2-1aaa-46f7-83f6-e76287c276b7 · outbound

This paper cites Holtzman, J.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Holtzman, J

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:57.520675Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:47.392521Z digest=sha256:678b5d7e6efb5db720f718ad5e1a89c990ae29eb9fe373d526fbdedf7214e050

Observation 5d98f628-b3f6-4e59-9b1d-f2e583163ebb · outbound

This paper cites Glavic, G.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Glavic, G

Reference 19

Resolution
verified exact
doi, observed 2026-08-07T13:32:52.010553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:47.329050Z digest=sha256:360f4ef42b74a9b6c72d7142926f66670f511c66e0dc7bf184b8f02ee3212334

Observation 1f775385-3eef-40b5-8c87-0d5b04d31c49 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:47.559143Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:47.559143Z digest=sha256:6ee53f9dc9d49a9b6a0309e81d52df724517fff5c5b54e0da0bb173b08548a87

Observation 7648c6b5-6d7b-4221-a791-bd58a2912d55 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:47.478077Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:47.478077Z digest=sha256:5c657e3826431f78099cdda8db07da4a91c868f81c9d937273c8671c292376cf

Observation 8f6d8c24-3092-4da0-9839-90c9010a4939 · outbound

This paper cites Joshi, E.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Joshi, E

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:57.315874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:47.778376Z digest=sha256:9bf1c21298e3ec7c274c66955dc3c32c63f665cc1f6792f474073a7c06435c82

Observation f9bc9594-3b18-4636-a527-fdaf7ec9b2e3 · outbound

This paper cites Mistral 7B.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Mistral 7B

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:47.623703Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:47.623703Z digest=sha256:e6f593601d48520e1e772cbe6ccd3ecfb56dcd9e4301c686cc281cda049c437d

Observation 07134d5f-adf9-4e76-b9f3-13bc1c1d65d0 · outbound

This paper cites Open-WikiTable: Dataset for Open Domain Question Answering with Complex Reasoning over Table.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Open-WikiTable: Dataset for Open Domain Question Answering with Complex Reasoning over Table

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:47.935799Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:47.935799Z digest=sha256:eaf81cad7d8a0b7a9a42da26a3df012fdc564cd6b6c4a631b86e56f4d8f26b0d

Observation 75b5265f-a770-4f4b-a55e-786304332ccc · outbound

This paper cites Kwiatkowski, J.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Kwiatkowski, J

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:56.853352Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:48.009190Z digest=sha256:f1d24d1f1b839521a715e1bff0f1d9b100c9b392f415010281f594e63e4c666d

Observation d849b4bf-17e1-4e8a-a17c-0de972ad3745 · outbound

This paper cites Kasneci, K.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Kasneci, K

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:57.073960Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:47.860715Z digest=sha256:b87d7bf2f8955c2b09debb35da21cc42447934d71f377e1dbeffdf3147ef549e

Observation 03ba16d3-e65d-4c38-9153-14c06ef62a34 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:56.626350Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:48.148989Z digest=sha256:9a74c413cab6bf6a93c5cf83fcb4d8ae8da89333ab3d81450b0e2b2159415e1c

Observation ef23b778-e2ee-4279-ad2b-b2f3286ff541 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 28

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:56.448911Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:48.227184Z digest=sha256:14315e9b61edf020999f70ea2af37d82e0d1903f368c9c79016b08ea873d28e3

Observation 8047c490-164c-4fb7-b9dd-bd8b8615ba34 · outbound

This paper cites Lee, M.-W.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Lee, M.-W

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:48.066912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:48.066912Z digest=sha256:646e64ac6147fce63d4620a63774364105ad35b5e98e71eed37d13b791147bd6

Observation d711835e-1280-4b37-bf07-db934020e050 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 30

Resolution
malformed identifier
no resolver link, observed 2026-08-07T13:32:48.433952Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:48.433952Z digest=sha256:954e9c3039b29f43b5060e7f5c8248f919ddab5cf7b55c549d6e5c826d9d5d54

Observation 72d61015-d0fe-4da7-b5f8-f561bddc1362 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:48.521291Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:48.521291Z digest=sha256:fba79f6be3a0cef4540cf97dd781c2ed87a71a099c53517fc45ef19027c218b2

Observation 2b4bc770-9318-4679-b948-ecb4b16afbbc · outbound

This paper cites The Llama 3 Herd of Models.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models The Llama 3 Herd of Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:48.609492Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:48.609492Z digest=sha256:c795ec3fe4fe2c489a3bea305b11181be8d8332aabdcf33dffb85ad31a07f81a

Observation 48022fea-0bfc-464d-a74c-451b1da09a50 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 33

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:56.258592Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:48.357266Z digest=sha256:739f3281995ace37bc89f1f175bdf92677df2b6eeffdaa94fe7ccd1affa8a485

Observation 203906d0-b638-40db-9095-63eb26094c58 · outbound

This paper cites Papicchio, P.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Papicchio, P

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:56.093936Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:48.801222Z digest=sha256:b904947c956a8f406d389beb6ab86b33a88b3917e582d573f1575f4de7e339d6

Observation 3ee3bf0f-0a9c-4f6c-b505-6038d0c9fac2 · outbound

This paper cites Pasupat and P.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Pasupat and P

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:55.903693Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:48.872971Z digest=sha256:8188e755e53986adaceb9b527d933d4544544004ad3616a843b7dc87869df70d

Observation 53540648-f8a8-493c-8e1f-b972c4829785 · outbound

This paper cites Semantic Operators: A Declarative Model for Rich, AI-based Data Processing.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Semantic Operators: A Declarative Model for Rich, AI-based Data Processing

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:48.953399Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:48.953399Z digest=sha256:08fb8880ef0f135a45d3c5cc1b5f5fc3aa2fdf49b6e6650daa1910a76672a577

Observation 4bb87158-d39f-489e-8709-8416759587c1 · outbound

This paper cites GPT-4 Technical Report.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models GPT-4 Technical Report

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:48.702771Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:48.702771Z digest=sha256:537cd4f689aaa84a484dee125014616a773de373e113c4d05db1dfeb7bc50711

Observation 7e8e62e6-53d7-420c-93e4-800ae8fd1de9 · outbound

This paper cites Petroni, P.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Petroni, P

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:55.477197Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:49.165647Z digest=sha256:65796072ab15fe35b80d5d4a867dab38ad7a2dd77548175c03eae6b6375b9b5f

Observation 346a7052-f8cf-4ad8-902a-20fa0f0b3bd2 · outbound

This paper cites Qwen2.5 Technical Report.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Qwen2.5 Technical Report

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:49.327226Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:49.327226Z digest=sha256:c02f8cd52d0037160c21b5fef7ffb12a02ddb8459170eb2339d189763b611b66

Observation f39c3868-ee30-4293-9d2e-30ac78f08a52 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 40

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:55.007684Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:49.414543Z digest=sha256:715751c1bddf00dca197e80ea1cc061f686d556ff4fc9e7c93a426e2517b3d99

Observation 5617f6dd-a755-4803-bf1c-fa10dbccc684 · outbound

This paper cites Petroni, T.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Petroni, T

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:55.666087Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:49.017964Z digest=sha256:8ce0e95bd9fcfcda6ea5dc318d4c2d8ccd238667afb28839fcea1c7a8d6e208d

Observation 214e4505-e483-4ee3-a224-aaef144eca94 · outbound

This paper cites Saparina and M.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Saparina and M

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:54.724969Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:49.681402Z digest=sha256:47a8e35030d32a92f05b03b64f34bcf1094a11c3c0df4a1f2121480df01ab24f

Observation f2628c97-c9c0-4033-b7cd-b815f8e49dd5 · outbound

This paper cites DocETL: Agentic Query Rewriting and Evaluation for Complex Document Processing.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models DocETL: Agentic Query Rewriting and Evaluation for Complex Document Processing

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:49.753681Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:49.753681Z digest=sha256:d579e5cd777bb6a9719f4c4732e7f9f4a424588ae45ee3f150910a47b3a21cb4

Observation 5393e0aa-2a2f-4186-b6ab-b3c38c2baa2f · outbound

This paper cites Singhal, S.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Singhal, S

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:54.457394Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:49.844507Z digest=sha256:ffc2350313656b178f9b61cfffc7bc48b910e2d4cf86798381c7015dda1383cc

Observation 56c35b50-fe33-4bc5-ace0-e2f4d064e867 · outbound

This paper cites Stuhler, C.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Stuhler, C

Reference 45

Resolution
verified exact
doi, observed 2026-08-07T13:32:51.146841Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:49.922990Z digest=sha256:5ff93a5a61fb8c9835ce8401f3d7bd51994f8f3e7e98d0969984e82769bbe49c

Observation 31cc0abf-f788-4a7e-8436-331998aaef12 · outbound

This paper cites Saeed, N.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Saeed, N

Reference 46

Resolution
verified exact
doi, observed 2026-08-07T13:32:51.625148Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:49.511762Z digest=sha256:25a011da117f7a2ec08cf355125130056449383d8eb115deb0c5f20326d76ca5

Observation 462e6e3c-9e7f-4112-be47-7ce49f70b95c · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 47

Resolution
verified exact
doi, observed 2026-08-07T13:32:51.376941Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:49.580285Z digest=sha256:5fef10181d7a7a009b9011cf014f45f9065b6b28d4f37129c5578a79a1669a09

Observation f584738f-6c6d-449e-bf4f-c33a73286a87 · outbound

This paper cites Truhn, J.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Truhn, J

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:54.214399Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:50.181882Z digest=sha256:8a8e68714abba48689a2ca5d9c45888450bdedb6281d645d80709130da9e0c52

Observation acbd60b6-dba9-4d11-8652-d52550417321 · outbound

This paper cites Measuring short-form factuality in large language models.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Measuring short-form factuality in large language models

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:50.289751Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:50.289751Z digest=sha256:d31bb24a78714f1a36a7b48cc5b9bf2af46690d648f67940594f4695b2cd675a

Observation ffa750af-20cd-4e63-9098-d18d57002d8a · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 50

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:53.944357Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:50.376486Z digest=sha256:0fd41a77762e2e374bf01673b0792e8f9eb47e748b3eb2ae224425f0f38e30fb

Observation 80ac46d7-739e-4dfd-a43a-8510c0dbccc0 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:50.438462Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:50.438462Z digest=sha256:097c51bcb73567771ea404f9bb3d2889678a99f1c45c1387746d295020cb0f16

Observation fa26c866-5deb-493d-8ea9-74b2814f7e04 · outbound

This paper cites YAGO 4.5: A Large and Clean Knowledge Base with a Rich Taxonomy.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models YAGO 4.5: A Large and Clean Knowledge Base with a Rich Taxonomy

Reference 52

Resolution
verified exact
local_arxiv, observed 2026-08-07T13:32:52.885759Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:50.036801Z digest=sha256:4e1384ee90c28a2619b6ea4ec884c67c8dea8803de61ed0acce1262bee0bbfd2

Observation 51a3bf34-1a99-41c8-be65-de9f2fc3be9c · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 53

Resolution
malformed identifier
no resolver link, observed 2026-08-07T13:32:50.108142Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:50.108142Z digest=sha256:5c37ff3ae639628f793552a82a5b3d1422d95a647e523731df1cfb5ac31ad3ac

Observation 1f7e146c-038d-4741-8944-43da98534dda · outbound

This paper cites Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:50.822133Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:50.822133Z digest=sha256:fe3b548b332550e94905d27bc8e20e0c5fc6be49ed0efe10269ec65d65a234c1

Observation 85c57c1d-5f7a-4778-b8c9-00cb62d2b7bc · outbound

This paper cites bird”, “galois.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models bird”, “galois

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:50.913865Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:50.913865Z digest=sha256:173c9ef905151fd5d6297e6f5b1b54d14f2171f11173af9b81bcacdf551f8cbb

Observation c30f6445-753b-4c35-bd49-80e5b3e8ccc1 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 58

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:53.698539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:50.566418Z digest=sha256:6a324a5dcfc56d933bc525a751399bbf132cfe6b56ef424446de47b56ab35614

Observation 6bff2db9-7609-4480-b209-367f9cc1daba · outbound

This paper cites TableLLM: Enabling Tabular Data Manipulation by LLMs in Real Office Usage Scenarios.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models TableLLM: Enabling Tabular Data Manipulation by LLMs in Real Office Usage Scenarios

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:50.689286Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:50.689286Z digest=sha256:bfe6e427f24c2e4859f420e9f2544dc7356359d45cef1fb266b0bcba229ff8a5

Observation 88eec023-3341-49c6-969a-3536460f28ae · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 2020

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:55.258363Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:49.254197Z digest=sha256:e24477139ba2d49961391859270c1328b87b0829d752f51b6de5ef00a126578d

Observation c5c90338-bdf0-448d-867b-c46c29e78773 · outbound

This paper cites TruthfulQA: Measuring How Models Mimic Human Falsehoods.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models TruthfulQA: Measuring How Models Mimic Human Falsehoods

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:48.282123Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:48.282123Z digest=sha256:c244109c9f2b1bc7eeae3ddeae08c7e8dc59274b4cb3264aadc89ccb78e74484

Observation 23a283f7-c1e8-4d6f-9126-2fc6563a52d4 · outbound

This paper cites Mistral 7B.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Mistral 7B

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:47.702623Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:47.702623Z digest=sha256:4667945479cc1cc105d7bd0cf61d957e8c459edbc6f2d0dd0a9ea7c828eb7809

Observation 29306f15-a00a-40f5-8bf4-dd5123b49722 · outbound

This paper cites doi: 10.3390/computers13100257.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models doi: 10.3390/computers13100257

Reference 2024

Resolution
verified exact
doi, observed 2026-08-07T13:32:52.618710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:32:46.481258Z digest=sha256:f462db41e94146c339653e203cdd7786172300bd20939f171efb520a2196cea2

Pith citing papers

No inbound Pith citation observations are available.