{"as_of":"2026-08-06T06:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da52c6de90af691f5a656c3e4a74a277965d59fc7dce24e0cbca603ef0d24959","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:20:26.273267Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.04469/citation-record","integrity":"/paper/2509.04469/integrity","json":"/paper/2509.04469/citation-record.json","paper":"/paper/2509.04469"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03801","last_updated":"2025-06-04T10:12:09Z","snapshot_observed_at":"2026-07-06T21:36:25.818579Z","submitted_at":"2025-06-04T10:12:09Z","title":"From Theory to Practice: Real-World Use Cases on Trustworthy LLM-Driven Process Modeling, Prediction and Automation","version":1},"cited_work":{"arxiv_id":"2506.03801","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03801","snapshot_observed_at":"2026-08-05T14:20:28.224755Z","title":"From Theory to Practice: Real-World Use Cases on Trustworthy LLM-Driven Process Modeling, Prediction and Automation","venue":"cs.SE","work_id":"83e7efb8-4cc4-43bc-ba23-fbc9849d8845","year":2025},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:23.118070Z"},"links":{"cited_paper":"/paper/2506.03801","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:26b11207785433b94648dc7d864d54beed5c2c6198fc2135c9e37a42ed2382bc","observation_id":"a8c3042f-6252-44b7-8a55-71f5ec398a58","resolution":{"observed_at":"2026-08-05T14:20:28.336247Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:31.401824Z","title":"Towards automated auditing with machine learning,","venue":null,"work_id":"64a30b8b-8604-40d4-b331-f62079a760de","year":2019},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:23.226947Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:4182fc6cc5c05b75bf898f194889aec1a926e5fbac2007d2f8951db09dbda5dc","observation_id":"5a4f03fa-640c-45c2-9896-a7fbdbc26a68","resolution":{"observed_at":"2026-08-05T14:20:31.555716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:31.164859Z","title":"Advancing risk and quality assurance: A rag chatbot for improved regulatory compliance,","venue":null,"work_id":"77dac4ae-8a14-440f-a6d8-49cc8e5c334a","year":2024},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:23.386519Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:9485124d95f2fb6571e4761a7e95d70525747ca65495aaadf5cd00016b291254","observation_id":"c881b657-495f-4979-ab75-5612ad701b3c","resolution":{"observed_at":"2026-08-05T14:20:31.274844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:30.869303Z","title":"Fine-tuning large language models for compliance checks,","venue":null,"work_id":"707847f3-478b-4e74-be72-a9d5e33831ab","year":2024},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:23.486011Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:e51d0681522fc5916948d1cc3840bc523f3b0ba5e331ac31efdc7a1ecb11f123","observation_id":"d3fd2493-b4f4-4333-bbf0-38a0d62f60d7","resolution":{"observed_at":"2026-08-05T14:20:31.033404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:30.601270Z","title":"An overview of data extraction from invoices,","venue":null,"work_id":"3c4f747e-2e0b-47f0-b22c-b431c26e763c","year":2024},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:23.624840Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:3ff7b7bd10f951188ceec71491eb8906febba45c1f38f45e81da14037da1b003","observation_id":"bb6c00df-3c0b-4bb5-9eda-4d0ee44c3118","resolution":{"observed_at":"2026-08-05T14:20:30.695448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13534","last_updated":"2021-02-04T23:48:39Z","snapshot_observed_at":"2026-07-06T10:18:15.258077Z","submitted_at":"2020-11-27T03:05:59Z","title":"A Survey of Deep Learning Approaches for OCR and Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13534","snapshot_observed_at":"2026-08-05T14:20:23.707156Z","title":"A survey of deep learning approaches for ocr and document understanding,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:23.707156Z"},"links":{"cited_paper":"/paper/2011.13534","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:a525a62f5091867ec1f1fc7468eb67bd0b43dc51131619a0d20918d118969c2e","observation_id":"a5f28a53-32a9-4176-afea-91452a2ba6fd","resolution":{"observed_at":"2026-08-05T14:20:23.707156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01287","last_updated":"2025-06-20T10:23:37Z","snapshot_observed_at":"2026-08-06T04:13:59.119507Z","submitted_at":"2024-08-02T14:19:34Z","title":"Deep Learning based Visually Rich Document Content Understanding: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01287","snapshot_observed_at":"2026-08-05T14:20:23.881572Z","title":"Deep learning based visually rich document content understanding: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:23.881572Z"},"links":{"cited_paper":"/paper/2408.01287","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:eb6c71166f2f27a193d81f538b303703d77e27f465e4ac0cea0a9387fd61db07","observation_id":"a577dc6c-28e4-4526-bf59-61180c98fc14","resolution":{"observed_at":"2026-08-05T14:20:23.881572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:30.394142Z","title":"Memory-augmented agent training for business document understanding,","venue":null,"work_id":"1afcf5da-b208-4a12-9eaa-08fa6b73b681","year":2024},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:24.050023Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:cb0a58b4c9273e3dbe9ef8a60fc21fa7a82b85776916c7c5f626c996a80c8208","observation_id":"3f2573d4-a449-446b-831a-a0bee46287a9","resolution":{"observed_at":"2026-08-05T14:20:30.461236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:30.231851Z","title":"Wonderbread: A benchmark for evaluating multimodal foundation models on business process management tasks,","venue":null,"work_id":"b3c0e2b4-d7ca-4731-baf9-dbafb204f210","year":null},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:24.224802Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:85cee586a7b890b7a105f4e61f6c4903a314e5739f05e1a981b2a4a54e29a136","observation_id":"a025c8de-59a3-43eb-bcae-a02bba2427cf","resolution":{"observed_at":"2026-08-05T14:20:30.301934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:30.094689Z","title":"MMLONGBENCH-DOC: Benchmarking long-context document understanding with visualizations,","venue":null,"work_id":"776a67b2-e8d0-4357-9bcd-51065ba839ac","year":2024},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:24.436236Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:86ad9eec81f3fd49f524074ec5eb9679c0f9e085502968454f29d0d9adad641e","observation_id":"8f82b2bb-18c4-4e96-9a2a-b11a4d3fad16","resolution":{"observed_at":"2026-08-05T14:20:30.148048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:29.899655Z","title":"M-longdoc: A benchmark for multimodal super- long document understanding and a retrieval-aware tuning framework,","venue":null,"work_id":"67b2eefd-a1d7-41c9-88d7-13e588752627","year":null},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:24.581017Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:202f76eacbfd8a37f8bec9d17d9bd8effbdbe647ee8b6ab25bd4f2a3f5cd104f","observation_id":"5b09afa9-9cd9-4903-9a5a-e813cffb0543","resolution":{"observed_at":"2026-08-05T14:20:29.998179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10701","last_updated":"2024-07-15T13:17:42Z","snapshot_observed_at":"2026-07-06T18:46:26.900364Z","submitted_at":"2024-07-15T13:17:42Z","title":"DOCBENCH: A Benchmark for Evaluating LLM-based Document Reading Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10701","snapshot_observed_at":"2026-08-05T14:20:24.762308Z","title":"Docbench: A benchmark for evaluating llm-based document reading systems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:24.762308Z"},"links":{"cited_paper":"/paper/2407.10701","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:c362b748021702b699533a418d57971083f818fe77e1c10b53af0d90191475a1","observation_id":"a7068012-6c16-455a-ba9a-a227db41d7bb","resolution":{"observed_at":"2026-08-05T14:20:24.762308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-05T14:20:24.883307Z","title":"Gemma 3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:24.883307Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:7db3e36f53096553133478b64e6faf072dfa5a2f5abc18ca4faf62d9d2b3d2b6","observation_id":"463c174f-422f-4bf7-8a24-ff1346cb8e08","resolution":{"observed_at":"2026-08-05T14:20:24.883307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06176","last_updated":"2024-11-09T13:30:38Z","snapshot_observed_at":"2026-07-06T19:47:51.117687Z","submitted_at":"2024-11-09T13:30:38Z","title":"M-Longdoc: A Benchmark For Multimodal Super-Long Document Understanding And A Retrieval-Aware Tuning Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06176","snapshot_observed_at":"2026-08-05T14:20:24.672980Z","title":"Available: https://arxiv.org/abs/2411.06176","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:24.672980Z"},"links":{"cited_paper":"/paper/2411.06176","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:d71411901eb27826fb0043aaa011a859656287fbfb57902bf4f9c369aef1a997","observation_id":"63cf2eeb-754b-40e3-829e-c38033740bdd","resolution":{"observed_at":"2026-08-05T14:20:24.672980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","snapshot_observed_at":"2026-07-06T20:52:51.138710Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11576","snapshot_observed_at":"2026-08-05T14:20:25.170342Z","title":"Smoldocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:25.170342Z"},"links":{"cited_paper":"/paper/2503.11576","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:216d590d10b35acddf6b97d0038989da6a8e7c21aa583b6be68f85efd8485fb0","observation_id":"0b8afe44-8a1a-46f0-bb21-6192ce1ac89a","resolution":{"observed_at":"2026-08-05T14:20:25.170342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:29.626744Z","title":"Pdf data extraction benchmark 2025: Comparing docling, unstructured, and llamaparse for document processing pipelines,","venue":null,"work_id":"15efcdaa-bbd9-41a9-b4b9-71d67dc21fcd","year":2025},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:25.310390Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:8e1a94ef45dc99ed64b699c8441bed9dcf09f98d44774183c1a89a2354e0def8","observation_id":"63da7747-6544-42c2-b6f3-28763bbb382e","resolution":{"observed_at":"2026-08-05T14:20:29.714799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09869","last_updated":"2024-12-09T09:20:54Z","snapshot_observed_at":"2026-07-06T19:02:37.923787Z","submitted_at":"2024-08-19T10:20:06Z","title":"Docling Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09869","snapshot_observed_at":"2026-08-05T14:20:25.043109Z","title":"Docling technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:25.043109Z"},"links":{"cited_paper":"/paper/2408.09869","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:48be4c64cfd38f9465e0e02014173a9e30afc43dd83fcaf6ae6204e96727bcd9","observation_id":"d89c6c31-da03-41d0-9765-b874d46061af","resolution":{"observed_at":"2026-08-05T14:20:25.043109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:29.421433Z","title":"Icdar 2019 robust reading challenge on scanned receipts ocr and information extraction,","venue":null,"work_id":"5681aefd-543a-4065-84dc-edacd46c1f12","year":2019},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:25.574862Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:d81cf1b3e245eab6861bdafca2cda3e5bbddbaf5afa23f955679a6e7219a262c","observation_id":"28516716-8c73-4d53-8e84-be9d4e3feef8","resolution":{"observed_at":"2026-08-05T14:20:29.494652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:29.181597Z","title":"Field extraction from forms with unlabeled data,","venue":null,"work_id":"908427cf-fed8-4fcb-8960-9bc03e2b322f","year":2022},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:25.713563Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:5988d57ecd99596bee3da761242d6bb11fea936cb23d15e6130af4a4d3ba72f2","observation_id":"d495aad1-eb43-4047-83c5-ac40093a04a4","resolution":{"observed_at":"2026-08-05T14:20:29.253485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:25.424347Z","title":"Ocr-free document understanding transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:25.424347Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:0a8f919dc2c480f2d593dfe5d00da8c813dc8d4edde3ff00c45eb00977807d05","observation_id":"420f57b5-134c-4055-91b6-f8da0a8e243e","resolution":{"observed_at":"2026-08-05T14:20:25.424347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:27.012195Z","title":"Layoutlm: Pre-training of text and layout for document image understanding,","venue":null,"work_id":"ddf6c1dc-e0a1-4855-a53d-095c1ab32091","year":2020},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:25.924804Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:22593f9f1451f2610e928734af29d8413c63ed505b59c9e634e6f8f0f47bda5e","observation_id":"8f899c6e-b581-4a55-bb0e-b5dc7e5d3b86","resolution":{"observed_at":"2026-08-05T14:20:27.117317Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:26.608241Z","title":"Layoutlmv3: Pre-training for document ai with unified text and image masking,","venue":null,"work_id":"abedb03f-d03d-4e2a-a1d4-e6e50943fb70","year":2022},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:26.035589Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:0de334cd6af2aa85ba5a972724dc74bd187c765f1b9e2bb84faab7cf78056790","observation_id":"cd29b14b-566c-4a13-8616-c2885530940f","resolution":{"observed_at":"2026-08-05T14:20:26.734768Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:28.964750Z","title":"Truth tobacco industry documents (formerly legacy tobacco documents library),","venue":null,"work_id":"1f24eea2-4a71-4dca-ada5-f5e0d1a6b40d","year":2002},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:25.840205Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:4daa243fdc7086ad7e5af3b8e72bd3f8fb53560e71965c6cbf89e51982ccede7","observation_id":"8f6fbf9d-d63a-42fb-8116-d30b7f2a2fe9","resolution":{"observed_at":"2026-08-05T14:20:29.089939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:28.786747Z","title":"Lilt: A simple yet effective language- independent layout transformer for structured document understanding,","venue":null,"work_id":"101a384f-cab1-47f9-9d58-ceed6341c632","year":null},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:26.134753Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:d7b9050f07825955faa84ee115d4fc751d66e8906e79e7bab042f5fe6e99af67","observation_id":"1453c3ad-843d-464a-9243-9ea03ac71c51","resolution":{"observed_at":"2026-08-05T14:20:28.848561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:27.880244Z","title":"Available: https://doi.org/10.1145/3342558.3345421","venue":null,"work_id":"be88691c-961b-4945-8313-974b76018926","year":null},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:23.281575Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:c55c1f027bf40f30162d57ecb865ff9a7ab593102fd403b08d59df451390332d","observation_id":"4c7db77f-c7e1-43c0-9a40-0aa40ab351d7","resolution":{"observed_at":"2026-08-05T14:20:28.028635Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:28.507158Z","title":null,"venue":null,"work_id":"c89c6427-6747-4cd2-9edd-0de115c6e810","year":null},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:26.273267Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:27008d26bbfcba8ca1032b3aa3b64efdf201385e8dc416093f0b16fd7261b8e8","observation_id":"9fb6ba9c-b98d-43be-a961-0e4f1390640f","resolution":{"observed_at":"2026-08-05T14:20:28.634779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13264","last_updated":"2024-10-11T00:06:31Z","snapshot_observed_at":"2026-07-06T18:33:28.511600Z","submitted_at":"2024-06-19T06:50:15Z","title":"WONDERBREAD: A Benchmark for Evaluating Multimodal Foundation Models on Business Process Management Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13264","snapshot_observed_at":"2026-08-05T14:20:24.320091Z","title":"Available: https://arxiv.org/abs/2406.13264","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:24.320091Z"},"links":{"cited_paper":"/paper/2406.13264","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:ea7351cd7cc268a04bd74a82c88722b9f02ba61b7bfd67395e6c93b252cb8f40","observation_id":"21ee41fd-fcae-48f7-a742-f5ac024f7e33","resolution":{"observed_at":"2026-08-05T14:20:24.320091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T14:20:22.552855Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":4,"verified_fuzzy":13},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2509.04469."}