{"as_of":"2026-08-08T17:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb6e449dcbb45342e4b3c234019a1637e2e9e89d1f7d4a0f077e7538cfe54ae7","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:32:50.913865Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21409/citation-record","integrity":"/paper/2505.21409/integrity","json":"/paper/2505.21409/citation-record.json","paper":"/paper/2505.21409"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:59.165972Z","title":"Ai hallucination report 2025, 2025","venue":null,"work_id":"ee868b10-ee46-4dba-a322-6d4b07308902","year":2025},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:46.361753Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:32a2114385380d358d3136b0369490c4bd0276288e358c273d6bda5413856cf1","observation_id":"07e3c137-1528-4fef-8fd3-8ee46e10ba6c","resolution":{"observed_at":"2026-08-07T13:32:59.261936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:58.911605Z","title":null,"venue":null,"work_id":"549ea9c4-8a51-4ad2-ab6b-3b9c7164f30a","year":2021},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:46.403729Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:a1724d7961f4f203c93e37c260330b970afb285cf0129de7ddd66c2880058c2e","observation_id":"db2fe7a2-deb1-4651-8dfb-b2face751cf2","resolution":{"observed_at":"2026-08-07T13:32:59.051641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:58.630570Z","title":"Balsiger, H.-R","venue":null,"work_id":"4a2dc65b-cc48-4093-9bae-f41b9a625c81","year":null},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:46.441750Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:57e94e3350087435a1526c4f62228cf0272c9cc8819c6b3cddcfe2ef19ee7124","observation_id":"f386ed11-ef70-4e89-b24e-978300c46ede","resolution":{"observed_at":"2026-08-07T13:32:58.749755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05052","last_updated":"2023-06-08T09:12:28Z","snapshot_observed_at":"2026-08-08T10:21:23.347337Z","submitted_at":"2023-06-08T09:12:28Z","title":"Interpretable Medical Diagnostics with Structured Data Extraction by Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05052","snapshot_observed_at":"2026-08-07T13:32:46.520937Z","title":"Bisercic, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:46.520937Z"},"links":{"cited_paper":"/paper/2306.05052","citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:67c7fc011306ff47e5652f22751ab2ea49704916d5e7aaece11a1fc5b0521e92","observation_id":"09c7ceea-687d-4aab-841f-bb57859f6cac","resolution":{"observed_at":"2026-08-07T13:32:46.520937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:58.433301Z","title":"Borisov, K","venue":null,"work_id":"a111fec3-7c88-414c-8882-a4d188031106","year":2023},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:46.573788Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:a62cc7b1dffb643c363845f51170e3593d2accb2118604decef8247d5a3fcf78","observation_id":"83d20bd7-532e-4110-9a9a-e04daa29a71b","resolution":{"observed_at":"2026-08-07T13:32:58.517294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/data9120139","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:52.191954Z","title":"Buoncristiano, G","venue":null,"work_id":"d7f079e4-48e8-46dd-931c-22ffe3c42409","year":2024},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:46.625119Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:1653197c2bfc6f57158bd22c84c363f0c43fab3ebf420ce954c52ea8034edf82","observation_id":"5a333f0c-374c-44d2-8ba9-77c3db137e51","resolution":{"observed_at":"2026-08-07T13:32:52.299853Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06282","last_updated":"2025-05-19T10:51:55Z","snapshot_observed_at":"2026-08-07T10:58:29.785438Z","submitted_at":"2024-02-09T09:48:38Z","title":"Retrieve, Merge, Predict: Augmenting Tables with Data Lakes","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06282","snapshot_observed_at":"2026-08-07T13:32:46.676074Z","title":"Cappuzzo, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:46.676074Z"},"links":{"cited_paper":"/paper/2402.06282","citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:79f207525453ec391c431cfc06546c3b685c84dc7f1fdb0cf51d19961eb0f97c","observation_id":"21db787f-3b63-472b-a4e7-8305a2cc2a45","resolution":{"observed_at":"2026-08-07T13:32:46.676074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:46.713259Z","title":"Chang, X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:46.713259Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:1b3b4c105e118a7c23487359e439603e4c147480aa5d4f76e5e538076816a8d3","observation_id":"c3536f04-1b0a-4238-b799-71090ed6f0d8","resolution":{"observed_at":"2026-08-07T13:32:46.713259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:58.254993Z","title":null,"venue":null,"work_id":"7166957c-ceab-4ef4-b5ed-bdb1389819f5","year":2020},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:46.750093Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:5a6ab3ea845c6404dc4a92ea91e2775dd255696155e804f66905a02d1f84eba1","observation_id":"3de3a363-6858-4b22-bd6b-b316ecd28949","resolution":{"observed_at":"2026-08-07T13:32:58.348469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:58.091242Z","title":"Chowdhury, D","venue":null,"work_id":"e354dddd-0991-4892-a59d-b195fe976cfd","year":2025},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:46.790043Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:be5ccf204b63cae5384364fcfe26b2d64361ab38357da7b041288cbfeac55d3d","observation_id":"539ed863-a7ca-4ace-bee0-2aa5697e9122","resolution":{"observed_at":"2026-08-07T13:32:58.162748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:57.872964Z","title":"Christophides, V","venue":null,"work_id":"7b664a15-36fc-4279-a0c7-37195c2fbab5","year":2021},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:46.827253Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:eec698bcdd095e817f10ef4e5dfe626cd50ba414f538d30dea2f32ce6d0f4615","observation_id":"6ebb0201-619e-4392-9502-01af1f438bcc","resolution":{"observed_at":"2026-08-07T13:32:57.979386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-07T13:32:46.863793Z","title":"Deepseek llm: Scaling open-source language models with longtermism.arXiv preprint arXiv:2401.02954, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:46.863793Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:996bb6789ea0d4589661a0688d4658894280e3abc04e3a248b731c3a6372c894","observation_id":"9b9c87c3-d87c-4b35-8027-caa2498e6fc6","resolution":{"observed_at":"2026-08-07T13:32:46.863793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:57.638514Z","title":null,"venue":null,"work_id":"5defa924-4956-4a11-8c1c-46cd02303c9d","year":null},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:46.949789Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:8c2f0f74d6fcc20b866daa5d4073ae9274d323081e3e335b589cebef42b44e58","observation_id":"ccc29672-a4f9-4b2f-8a84-b3a2504f780e","resolution":{"observed_at":"2026-08-07T13:32:57.759832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.15589","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:53.268721Z","title":"Elnashar, J","venue":null,"work_id":"791a0c1b-3e2a-4927-a991-d49fd73ea218","year":2025},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:47.101631Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:c76f98c972782c859e4dd163b8203fb97140dd1bbbbe19bde00f945c98d6e073","observation_id":"df98fbb8-4333-4889-92e7-52e433d66a7b","resolution":{"observed_at":"2026-08-07T13:32:53.373000Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:47.021461Z","title":"doi: https://doi.org/10.1016/j.accinf.2024.100715","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:47.021461Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:959565261fd0c5f9ec4ba67705d16b2fa30fba06973b62b1c7d7e5ba1ae71cc1","observation_id":"08c5554f-d8b2-4bf7-9373-0fa7ba694972","resolution":{"observed_at":"2026-08-07T13:32:47.021461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-07T13:32:47.265524Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:47.265524Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:7d9792104034b984cf5fd0a7acfc04911603e9ae466b6059acd59dd4ef6afff0","observation_id":"04667e40-d325-417c-be23-747a66d0cc9d","resolution":{"observed_at":"2026-08-07T13:32:47.265524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:47.190773Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:47.190773Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:1b9ca8eef012f364b76d9d7936478c2de9aa4d6849b0dd093d1e0a02caf766c8","observation_id":"9f9808ce-865c-42ec-99b6-36da7c895896","resolution":{"observed_at":"2026-08-07T13:32:47.190773Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:57.436852Z","title":"Holtzman, J","venue":null,"work_id":"8796ef31-ed99-4baf-894e-836cfab65ba9","year":2020},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:47.392521Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:7c446b9e7da72311c90848994998c68c6f521fc50417023dffe8956a05dc98f9","observation_id":"c55372c2-1aaa-46f7-83f6-e76287c276b7","resolution":{"observed_at":"2026-08-07T13:32:57.520675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48786/edbt.2024.40","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:51.885996Z","title":"Glavic, G","venue":null,"work_id":"76f1eead-b936-4c83-be54-26c7c6dc7a09","year":2024},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:47.329050Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:6774df8c70aaa87f664ed67597f638dcc9b8a1061806c16677fd7731806536b9","observation_id":"5d98f628-b3f6-4e59-9b1d-f2e583163ebb","resolution":{"observed_at":"2026-08-07T13:32:52.010553Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:47.559143Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:47.559143Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:26dfff6dcd017dbbc9487e49ab60b4c6758ac0664a41d95f15c30f56c4dcbda2","observation_id":"1f775385-3eef-40b5-8c87-0d5b04d31c49","resolution":{"observed_at":"2026-08-07T13:32:47.559143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:47.478077Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:47.478077Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:3f188d2e12929519bbccb78eb2e5771b56ba375d228dd5ae90b9c1edc538166d","observation_id":"7648c6b5-6d7b-4221-a791-bd58a2912d55","resolution":{"observed_at":"2026-08-07T13:32:47.478077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:57.192131Z","title":"Joshi, E","venue":null,"work_id":"46a5f42a-b8cd-4901-8df5-29b6f136f625","year":2017},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:47.778376Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:8ff16b94f6b736d62a0330b249cd8339eb012f6961aeabdbadb597db2a0719c3","observation_id":"8f6d8c24-3092-4da0-9839-90c9010a4939","resolution":{"observed_at":"2026-08-07T13:32:57.315874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T13:32:47.623703Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:47.623703Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:23dfa590081cbf14fef41168a3d08e134d36af633046e68d26bca64e3e5f942d","observation_id":"f9bc9594-3b18-4636-a527-fdaf7ec9b2e3","resolution":{"observed_at":"2026-08-07T13:32:47.623703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07288","last_updated":"2023-05-12T07:24:16Z","snapshot_observed_at":"2026-07-06T15:26:22.787911Z","submitted_at":"2023-05-12T07:24:16Z","title":"Open-WikiTable: Dataset for Open Domain Question Answering with Complex Reasoning over Table","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07288","snapshot_observed_at":"2026-08-07T13:32:47.935799Z","title":"Kweon, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:47.935799Z"},"links":{"cited_paper":"/paper/2305.07288","citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:7537c321a36337011f1b2292be9a4d467e44ea20ca01230fded146b13b7d3465","observation_id":"07134d5f-adf9-4e76-b9f3-13bc1c1d65d0","resolution":{"observed_at":"2026-08-07T13:32:47.935799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:56.723766Z","title":"Kwiatkowski, J","venue":null,"work_id":"35424efb-bc6d-4221-8481-829ac42ffddd","year":2019},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:48.009190Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:048756d303b94b50db122749be621297b64f6279a1f76b8076065c3760fc9c5f","observation_id":"75b5265f-a770-4f4b-a55e-786304332ccc","resolution":{"observed_at":"2026-08-07T13:32:56.853352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:56.978642Z","title":"Kasneci, K","venue":null,"work_id":"a9cb29e9-6752-4a1a-83bf-73aa9ebdb959","year":2023},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:47.860715Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:b37f0b30b3f04c13c304977113f43606f0b840500dfe0ba076c5e3eacc3f08fb","observation_id":"d849b4bf-17e1-4e8a-a17c-0de972ad3745","resolution":{"observed_at":"2026-08-07T13:32:57.073960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:56.552896Z","title":null,"venue":null,"work_id":"b25ad0ad-5c88-403a-9cfe-a48be5265df6","year":2024},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:48.148989Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:d2957b9ef53f751827ad4e3958e9ec930d1e51b958c0d5dfa833cd79e5c010f4","observation_id":"03ba16d3-e65d-4c38-9153-14c06ef62a34","resolution":{"observed_at":"2026-08-07T13:32:56.626350Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:56.359946Z","title":null,"venue":null,"work_id":"50ea1bbb-4520-4f74-9963-fe5798c01378","year":null},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:48.227184Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:9f475b46d943e1a478fc3ede1ed93ec41b400a7f1adb1cdf90013a3aa6dc2dd1","observation_id":"ef23b778-e2ee-4279-ad2b-b2f3286ff541","resolution":{"observed_at":"2026-08-07T13:32:56.448911Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:48.066912Z","title":"Lee, M.-W","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:48.066912Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:0ebabe1b1825d4a1b38e54adffee1385035cf83c315f83929a84ee23e2c38d5d","observation_id":"8047c490-164c-4fb7-b9dd-bd8b8615ba34","resolution":{"observed_at":"2026-08-07T13:32:48.066912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:48.433952Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:48.433952Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:cf9fa1dded8a4f2ca4f93be12de65a00d56eff2cede96e4237d2f1663fa00b6b","observation_id":"d711835e-1280-4b37-bf07-db934020e050","resolution":{"observed_at":"2026-08-07T13:32:48.433952Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:48.521291Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:48.521291Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:36ed66a2ac999a3142687d646b8be1d3a42c286512e6168c115ee2abd4a6f0fd","observation_id":"72d61015-d0fe-4da7-b5f8-f561bddc1362","resolution":{"observed_at":"2026-08-07T13:32:48.521291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T13:32:48.609492Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:48.609492Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:2322585701904848c16b9f90b07ac5d35083c9f54f3dc01d335679cc755c33d8","observation_id":"2b4bc770-9318-4679-b948-ecb4b16afbbc","resolution":{"observed_at":"2026-08-07T13:32:48.609492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:56.197859Z","title":null,"venue":null,"work_id":"4b1b8ee4-0c45-405d-b86a-4f92e0d7e69c","year":null},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:48.357266Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:680f5c10c95e37fb1d5f627d408e535e7b72460475f079b62b1210e0a141dea7","observation_id":"48022fea-0bfc-464d-a74c-451b1da09a50","resolution":{"observed_at":"2026-08-07T13:32:56.258592Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:55.990730Z","title":"Papicchio, P","venue":null,"work_id":"fc40f127-93ee-4070-ac2d-e710a0e794ac","year":2023},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:48.801222Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:4e6bb65cf8e96236d2d1530bb379ade8a524027fc69856207539d97696f0328d","observation_id":"203906d0-b638-40db-9095-63eb26094c58","resolution":{"observed_at":"2026-08-07T13:32:56.093936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:55.770735Z","title":"Pasupat and P","venue":null,"work_id":"3ae7e192-4d58-4385-b0fb-01d38bdeaee1","year":2015},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:48.872971Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:892db4cd8fdf987bd647a7ea6ed93482bfc61a8e2656c10fa365561e96c77498","observation_id":"3ee3bf0f-0a9c-4f6c-b505-6038d0c9fac2","resolution":{"observed_at":"2026-08-07T13:32:55.903693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11418","last_updated":"2025-03-01T01:47:51Z","snapshot_observed_at":"2026-08-02T08:18:22.756770Z","submitted_at":"2024-07-16T06:19:14Z","title":"Semantic Operators: A Declarative Model for Rich, AI-based Data Processing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11418","snapshot_observed_at":"2026-08-07T13:32:48.953399Z","title":"Patel, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:48.953399Z"},"links":{"cited_paper":"/paper/2407.11418","citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:d88fe542ef3d72466787bcac5d61641bf0efafce4865ec8921176a470e2cc37e","observation_id":"53540648-f8a8-493c-8e1f-b972c4829785","resolution":{"observed_at":"2026-08-07T13:32:48.953399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:32:48.702771Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:48.702771Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:9a7d9979d32ebe33d665bf5a6ef383e9d36ebd4e5bb50652b149a4a4d84053e1","observation_id":"4bb87158-d39f-489e-8709-8416759587c1","resolution":{"observed_at":"2026-08-07T13:32:48.702771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:55.382638Z","title":"Petroni, P","venue":null,"work_id":"d734e16b-58e9-4319-b995-97105b0c9e78","year":null},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:49.165647Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:f6eac1e05c10648ceb7a5d77cf0af0c665280b4fb1a91047c750e0260c506103","observation_id":"7e8e62e6-53d7-420c-93e4-800ae8fd1de9","resolution":{"observed_at":"2026-08-07T13:32:55.477197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:32:49.327226Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:49.327226Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:603e8d6713450ceb5feb54d00a8f484a2c214d46c7d362be5f27d5487f02be7f","observation_id":"346a7052-f8cf-4ad8-902a-20fa0f0b3bd2","resolution":{"observed_at":"2026-08-07T13:32:49.327226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:54.882989Z","title":null,"venue":null,"work_id":"65416ad7-e86f-48b2-aeba-49099a468e1a","year":1998},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:49.414543Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:eb0ba990e6ec5654f05309da46a07e28fc433d90d24177e6b2e8b99f629f9925","observation_id":"f39c3868-ee30-4293-9d2e-30ac78f08a52","resolution":{"observed_at":"2026-08-07T13:32:55.007684Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:55.580756Z","title":"Petroni, T","venue":null,"work_id":"690fde31-340d-4996-8fbe-50de9351042a","year":2019},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:49.017964Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:b03d223d262824809e6273f15cb43ca25d9531c45706c1c8f973c79c0796159b","observation_id":"5617f6dd-a755-4803-bf1c-fa10dbccc684","resolution":{"observed_at":"2026-08-07T13:32:55.666087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:54.611741Z","title":"Saparina and M","venue":null,"work_id":"cf9bc013-25de-4f81-ab09-e9a1e2fae1d7","year":2024},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:49.681402Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:aed509b51917718f4da2acc9d33666deb83cf80b0cab6edc5ec129f7b7d5969a","observation_id":"214e4505-e483-4ee3-a224-aaef144eca94","resolution":{"observed_at":"2026-08-07T13:32:54.724969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12189","last_updated":"2025-04-01T19:47:19Z","snapshot_observed_at":"2026-08-08T15:20:57.103568Z","submitted_at":"2024-10-16T03:22:35Z","title":"DocETL: Agentic Query Rewriting and Evaluation for Complex Document Processing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12189","snapshot_observed_at":"2026-08-07T13:32:49.753681Z","title":"Shankar, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:49.753681Z"},"links":{"cited_paper":"/paper/2410.12189","citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:3b236368bdf6e7912c12d1945fc1dacf3ee8e35361ee13973ef2e313093c63be","observation_id":"f2628c97-c9c0-4033-b7cd-b815f8e49dd5","resolution":{"observed_at":"2026-08-07T13:32:49.753681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:54.347491Z","title":"Singhal, S","venue":null,"work_id":"698d395c-e9f9-423a-8fa5-8bb3dd3c65b0","year":2023},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:49.844507Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:c0d7d82fc5be38e063fa41f0f9b6ee19f5822220863c1bb57fd39f656ff2c426","observation_id":"5393e0aa-2a2f-4186-b6ab-b3c38c2baa2f","resolution":{"observed_at":"2026-08-07T13:32:54.457394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1177/00491241251336794","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:51.079160Z","title":"Stuhler, C","venue":null,"work_id":"af310131-91a9-445b-8219-8e79b5c58e1b","year":null},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:49.922990Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:8e1508b0c2506cea3ac473f3a94f9101ec1cb7066514464269efd8d799fac789","observation_id":"56c35b50-fe33-4bc5-ace0-e2f4d064e867","resolution":{"observed_at":"2026-08-07T13:32:51.146841Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48786/edbt.2024","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:51.502431Z","title":"Saeed, N","venue":null,"work_id":"d9eabe35-d5a0-40e0-8654-b0090ad9cc3b","year":2024},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:49.511762Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:00baf133d12bc84faf72720d4d90ffc1716d55d2f737e9f10066b6dab2ad3c0f","observation_id":"31cc0abf-f788-4a7e-8436-331998aaef12","resolution":{"observed_at":"2026-08-07T13:32:51.625148Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48786/edbt.2024.32","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:51.268350Z","title":null,"venue":null,"work_id":"9908d8c4-920b-4842-808b-de2a99c23950","year":2024},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:49.580285Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:517befdc3288d092c44c8cdf776f3f21f93ae3b21a40f773b413d9074d4a9b0e","observation_id":"462e6e3c-9e7f-4112-be47-7ce49f70b95c","resolution":{"observed_at":"2026-08-07T13:32:51.376941Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:54.060299Z","title":"Truhn, J","venue":null,"work_id":"2b99ba9c-981b-46d1-86f9-336b455ae9a8","year":2023},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:50.181882Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:d09ced4c19b4550f579f588f9343b5458585a6c3bc5dfb6a31a02652957e2b35","observation_id":"f584738f-6c6d-449e-bf4f-c33a73286a87","resolution":{"observed_at":"2026-08-07T13:32:54.214399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-07T13:32:50.289751Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:50.289751Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:be428d2674c0444296c2f6445c9fc3a58370ea5dbd1378c1d8f9c010d053704e","observation_id":"acbd60b6-dba9-4d11-8652-d52550417321","resolution":{"observed_at":"2026-08-07T13:32:50.289751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:53.822593Z","title":null,"venue":null,"work_id":"61e4e9ae-f286-4c4e-b4db-308e2b8de2c4","year":2025},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:50.376486Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:a9a959b7755dcd5c5abf0671884abb2944eba95a40674bd49b07a6825e85a351","observation_id":"ffa750af-20cd-4e63-9098-d18d57002d8a","resolution":{"observed_at":"2026-08-07T13:32:53.944357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:50.438462Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:50.438462Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:7390c6ec73894f744ce1950dd36548b1d31690e78c1cead8e3ca7c37260217eb","observation_id":"80ac46d7-739e-4dfd-a43a-8510c0dbccc0","resolution":{"observed_at":"2026-08-07T13:32:50.438462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11884","last_updated":"2024-04-10T07:45:22Z","snapshot_observed_at":"2026-07-06T16:09:21.043575Z","submitted_at":"2023-08-23T03:03:14Z","title":"YAGO 4.5: A Large and Clean Knowledge Base with a Rich Taxonomy","version":2},"cited_work":{"arxiv_id":"2308.11884","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.11884","snapshot_observed_at":"2026-08-07T13:32:52.765946Z","title":"YAGO 4.5: A Large and Clean Knowledge Base with a Rich Taxonomy","venue":"cs.AI","work_id":"24e269b2-58d9-4780-8fc7-4196fb53135e","year":2023},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:50.036801Z"},"links":{"cited_paper":"/paper/2308.11884","citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:7847cd78d83d2c65b96029b2697c7630a80c71ad309255da87fa55db642a9bd8","observation_id":"fa26c866-5deb-493d-8ea9-74b2814f7e04","resolution":{"observed_at":"2026-08-07T13:32:52.885759Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:50.108142Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:50.108142Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:30fee851fe1960c3a76ead0b325c49164d07e5084273156a811f40b1f662e955","observation_id":"51a3bf34-1a99-41c8-be65-de9f2fc3be9c","resolution":{"observed_at":"2026-08-07T13:32:50.108142Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.00103","last_updated":"2017-11-09T23:06:14Z","snapshot_observed_at":"2026-08-03T05:45:09.122112Z","submitted_at":"2017-08-31T23:12:15Z","title":"Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.00103","snapshot_observed_at":"2026-08-07T13:32:50.822133Z","title":"Zhong, C","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:50.822133Z"},"links":{"cited_paper":"/paper/1709.00103","citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:67a48a0f506cb533eed5dede4314f2dd0efc0ff4c677e1c17e473beb9278b36c","observation_id":"1f7e146c-038d-4741-8944-43da98534dda","resolution":{"observed_at":"2026-08-07T13:32:50.822133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:50.913865Z","title":"bird”, “galois","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:50.913865Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:bb72c89c7ae3914fb19175d6f1cb7ad9aa269e2f64a25b2297c83c670a80f8c9","observation_id":"85c57c1d-5f7a-4778-b8c9-00cb62d2b7bc","resolution":{"observed_at":"2026-08-07T13:32:50.913865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:53.636821Z","title":null,"venue":null,"work_id":"a41c208c-b4f4-4c2a-b682-c9feb1a9dcec","year":2018},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:50.566418Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:c929a95ea10579df99ab3dac5e1b63c74bb03e17d5be371eb65c050e794d3e9f","observation_id":"c30f6445-753b-4c35-bd49-80e5b3e8ccc1","resolution":{"observed_at":"2026-08-07T13:32:53.698539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19318","last_updated":"2025-02-17T13:45:00Z","snapshot_observed_at":"2026-07-06T17:52:30.328601Z","submitted_at":"2024-03-28T11:21:12Z","title":"TableLLM: Enabling Tabular Data Manipulation by LLMs in Real Office Usage Scenarios","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19318","snapshot_observed_at":"2026-08-07T13:32:50.689286Z","title":"Zhang, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:50.689286Z"},"links":{"cited_paper":"/paper/2403.19318","citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:a1b6134155d54837b42e2b8244cb32f0a9c9ed202556925754b95daca947130f","observation_id":"6bff2db9-7609-4480-b209-367f9cc1daba","resolution":{"observed_at":"2026-08-07T13:32:50.689286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:55.167072Z","title":null,"venue":null,"work_id":"a6e20362-934f-43ec-a426-78a69c2a0c75","year":null},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:49.254197Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:45b924f90fb583ab8c93e200b1b91df9a455fe81ce34adb38a9ca17b67aa07c6","observation_id":"88eec023-3341-49c6-969a-3536460f28ae","resolution":{"observed_at":"2026-08-07T13:32:55.258363Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-07T13:32:48.282123Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:48.282123Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:8c28e4b3ccff7c2a09e8af35ca9d3f353e640ce119e82681bf386719c3546bc9","observation_id":"c5c90338-bdf0-448d-867b-c46c29e78773","resolution":{"observed_at":"2026-08-07T13:32:48.282123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T13:32:47.702623Z","title":"URL https://doi.org/10.48550/arXiv.2310","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:47.702623Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:7b8c6007b08838d003f6880343b41e20a2aafcc81273ab11e8bf1c42cb3a7a48","observation_id":"23a283f7-c1e8-4d6f-9126-2fc6563a52d4","resolution":{"observed_at":"2026-08-07T13:32:47.702623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/computers13100257","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:52.468542Z","title":"doi: 10.3390/computers13100257","venue":null,"work_id":"2810f82b-b1bb-4b3d-a370-6d94721120cc","year":null},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:46.481258Z"},"links":{"citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:395289fb77bdab4ad85ffda11d0a366dfa9423a9334088ae8d47f9920ee0bb80","observation_id":"29306f15-a00a-40f5-8bf4-dd5123b49722","resolution":{"observed_at":"2026-08-07T13:32:52.618710Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T09:18:37.375036Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":3,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":34,"verified_exact":7,"verified_fuzzy":16},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2505.21409."}