{"as_of":"2026-08-15T23:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f86383f19cafa9a749837d49c28deedb65f4ced20f4091c624db79fd49292481","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:53:55.976780Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.04026/citation-record","integrity":"/paper/2412.04026/integrity","json":"/paper/2412.04026/citation-record.json","paper":"/paper/2412.04026"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:57.093108Z","title":"DiffusionNER: Boundary diffusion for named entity recognition,","venue":null,"work_id":"bd87a1d8-344a-4efd-ac00-98261afbb440","year":2023},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.645493Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:6721e3ed4a3448f7d0e04aaffb911ceac0717f5feca0e043e612f6121c0b38ee","observation_id":"8593755e-5d6b-433e-baff-aa8db76bb587","resolution":{"observed_at":"2026-08-11T21:53:57.098637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:57.076357Z","title":"Dual cache for long document neural coreference resolution,","venue":null,"work_id":"bafb48f8-c45f-4cc9-a076-4147f9558eaf","year":2023},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.651675Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:11caf74aff910d8a1a2ee2662055c8d8eb5dda39da204bb4785278c219305051","observation_id":"46c8358c-55d4-491d-87e7-4dafacc56f73","resolution":{"observed_at":"2026-08-11T21:53:57.082147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:57.059011Z","title":"An autoregressive text-to-graph framework for joint entity and relation extraction,","venue":null,"work_id":"06f8ba33-e4fb-4ee9-b52a-9a4fda4666f3","year":2024},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.656845Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:3e1ad0a458ba8a2eca27cbbe4f82bc6c10398f950f3cc85a662fa1e2a6e8befe","observation_id":"4a8f2460-1eaa-4815-850b-1764e609ff6b","resolution":{"observed_at":"2026-08-11T21:53:57.064499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:57.041803Z","title":"Event extraction as question generation and answering,","venue":null,"work_id":"bb22edb4-d5b3-4d41-9f8d-0618d482c9d0","year":2023},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.662619Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:ec32a77e5fad22cf6eaf2d50ae5a7bc085fba56a2150ba5796442a133bab4202","observation_id":"35ec8c6f-d5fe-4053-ad91-9bf35c1e0844","resolution":{"observed_at":"2026-08-11T21:53:57.047700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:57.023479Z","title":"Rethinking boundaries: End-to-end recognition of discontinuous mentions with pointer networks,","venue":null,"work_id":"76769151-9888-422b-a28d-492bacea789d","year":2021},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.667965Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:867c67985844f0029f89d5c9964160b97c4e00172243e2504093a277f0f9edeb","observation_id":"daa359ee-d090-4e94-80c5-e864f9b48fd6","resolution":{"observed_at":"2026-08-11T21:53:57.029864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:57.004773Z","title":"A span-based model for joint overlapped and discontinuous named entity recognition,","venue":null,"work_id":"1d57368c-abb2-44d5-a637-84cdaeb84538","year":2021},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.674857Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:22b6d971ea44f9607b8553bfdcb66ba07b0c389689d6c73974361ad3d9b95eda","observation_id":"0b73483d-7035-4c59-aa5b-37e6ccfba00c","resolution":{"observed_at":"2026-08-11T21:53:57.010404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.985223Z","title":"Unified named entity recognition as word-word relation classification,","venue":null,"work_id":"a0621dd4-d15f-41fb-b867-6d9893cae2c2","year":2022},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.681483Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:f92c226f626859599167408b6f6d0a63fd8f8b60161aba5cb0b3e81317238b4c","observation_id":"fac3f90b-679e-4034-aa33-1d6960dc460e","resolution":{"observed_at":"2026-08-11T21:53:56.991325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.967213Z","title":"Knowledge enhanced coreference resolution via gated attention,","venue":null,"work_id":"3f0b32e8-7e23-4f48-a8aa-b001638c4cd4","year":2022},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.686416Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:f3d6773a728a5bd7acce09786ea41de39d55cdaaa8555aec52b8b8c3444fe3fa","observation_id":"085f8686-478d-456b-9cb0-116e5f2da0b2","resolution":{"observed_at":"2026-08-11T21:53:56.972872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.947062Z","title":"Double graph based reasoning for document-level relation extraction,","venue":null,"work_id":"f0b2eda5-8359-40e2-b7b1-e1fee568095b","year":2020},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.691524Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:f4f9efc02e9331c2faa512d1284f43487c9fd73150333d4f53433559ef2b6a03","observation_id":"7dd0163b-1bad-41fc-835e-eaa662995bae","resolution":{"observed_at":"2026-08-11T21:53:56.953381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.927553Z","title":"Coreference resolution without span representations,","venue":null,"work_id":"15019475-a088-4052-b637-01dea57f63c8","year":2021},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.696807Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:8c8a8933157dbc743e3bfeb184e534353985dbb4a94ade19c4492480cf02be9f","observation_id":"22b73191-308e-44e7-8b50-839af3353d3a","resolution":{"observed_at":"2026-08-11T21:53:56.933021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.910385Z","title":"A sequence-to-sequence approach for document-level relation extraction,","venue":null,"work_id":"75660945-776b-4c6b-964e-bd7bc4473977","year":2022},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.701825Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:68ca95d50602fc44fda929f52d0165b7e002750653a7f79c281b4d739837272f","observation_id":"f7f6b36d-0c67-497c-abdf-afe1d63d9955","resolution":{"observed_at":"2026-08-11T21:53:56.915822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.893540Z","title":"Visual attention model for name tagging in multimodal social media,","venue":null,"work_id":"8edf8f8c-5a12-4ab1-8f3e-fe59da15251b","year":2018},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.707133Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:13e320f8983d506fd88be5099adedc6866ccce0a56cc7751f0974193b8fa9fc7","observation_id":"20c8838f-bcaa-4d4a-a2b0-2e48930fb651","resolution":{"observed_at":"2026-08-11T21:53:56.899191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.877097Z","title":"Adaptive co-attention network for named entity recognition in tweets,","venue":null,"work_id":"2c782dcd-49f8-4372-9ae4-df51d0050110","year":2018},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.712237Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:6fa61147fa9f7be2b77ac9b64e3dabe4c51e64cee51736a6451bf13b8e8acdac","observation_id":"6d315406-ac50-46b1-aaea-0ba94cd620c1","resolution":{"observed_at":"2026-08-11T21:53:56.882580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.860651Z","title":"A large-scale chinese multimodal ner dataset with speech clues,","venue":null,"work_id":"bba61b4b-4b41-4e54-a013-578f3f0f9ee2","year":2021},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.717006Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:6ceaae4a5dc2e13462fdb3e950c0cbc00a5cf6ec22cac1380fe327c0dd04c9b0","observation_id":"127096dd-19e9-442e-b007-70ea11d91e36","resolution":{"observed_at":"2026-08-11T21:53:56.866161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.826065Z","title":"Who are you referring to? coreference resolution in image narrations,","venue":null,"work_id":"04196c27-4d54-4018-a26d-4d340eb01987","year":2023},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.726731Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:16a3cd653b379112bdddc193bc2fb656d9424bbbbb332cdb505ef1a4bcd3ad6b","observation_id":"21f13c5b-8483-4977-b277-ce850b99b0a7","resolution":{"observed_at":"2026-08-11T21:53:56.831366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.806002Z","title":"Mnre: A challenge multimodal dataset for neural relation extraction with visual evidence in social media posts,","venue":null,"work_id":"233e45d5-5b64-48ca-9b60-e28c2156eefc","year":2021},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.731553Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:9a274def86adc0e048f7cb88a66d791812338cf60d1e83926af19b2592e30fae","observation_id":"d366b976-7698-4089-944c-07597330d6f4","resolution":{"observed_at":"2026-08-11T21:53:56.811261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.788733Z","title":"A hierarchical network for multimodal document-level relation extraction,","venue":null,"work_id":"5be37b66-fd98-4a1e-bec6-6078e8f3e4d9","year":2024},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.736909Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:7e53c34439e925404f495217c48852eed04dd3b4088ff2caa04b689d443e35b6","observation_id":"ee792f39-f53b-48f1-8a22-1e680a79554c","resolution":{"observed_at":"2026-08-11T21:53:56.794259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.843558Z","title":"Grounded multimodal named entity recognition on social media,","venue":null,"work_id":"89519342-f597-4f4b-bd63-a10bf76146c4","year":2023},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.741883Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:7d47cecee17a432dc4884e9049eec254ffa8f7812433ec259f81840ade578359","observation_id":"64464a7c-2ce7-4c67-b625-b49e06889e5a","resolution":{"observed_at":"2026-08-11T21:53:56.849101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.770183Z","title":"Semi-supervised multimodal coreference resolution in image narrations,","venue":null,"work_id":"04a6d450-7d91-4fb7-98fd-e76f22f867d3","year":2023},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.748153Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:4daea9860c77da77eed933a0354ed7665d2db8bb14cfac1d76770750011a87f9","observation_id":"3b718cd1-8fc2-412e-be63-439595997b9c","resolution":{"observed_at":"2026-08-11T21:53:56.775857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.752482Z","title":"Joint multimodal entity-relation extraction based on edge-enhanced graph alignment network and word- pair relation tagging,","venue":null,"work_id":"86b43046-8cf9-48f3-bb6c-9b1a7ecc4766","year":2023},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.753323Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:fbf8167de04c0f8c8c84298c1d6520d6cc2275b915f6e0ac08f6596239b7f745","observation_id":"f55bcf04-1a0f-4fb6-869e-cfbbf9ab1d60","resolution":{"observed_at":"2026-08-11T21:53:56.759051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.735285Z","title":"Multimodal relation extraction with efficient graph alignment,","venue":null,"work_id":"3dd5f371-9520-483c-a2a3-c539b84ab104","year":2021},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.759044Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:3cab4ff7327eb1fecbfbc3101944dde8c1238fb141124ed874d74a7baffed0f5","observation_id":"3bff049b-ab28-422b-b1af-03f0c210678b","resolution":{"observed_at":"2026-08-11T21:53:56.740778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.718494Z","title":"Docred: A large-scale document-level relation extraction dataset,","venue":null,"work_id":"eeb5fa0c-fa59-455f-8c04-502f5749e007","year":2019},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.764038Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:e56bb05adffdce6b9ce6102183eb5434537e57a1b80d27903819e89b18b48414","observation_id":"1700b069-affd-4949-a99c-3afae2238976","resolution":{"observed_at":"2026-08-11T21:53:56.724088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.700240Z","title":"Improving multimodal named entity recognition via entity span detection with unified multimodal transformer,","venue":null,"work_id":"fde7f4e6-3bcf-4afe-a344-011386ff32c1","year":2020},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.768999Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:749819f00974cceda515d691e50c1ee57c3d898ea23ba563e9f376bbecdb6d37","observation_id":"ce4a9515-a6dd-414c-a1f1-7c77d4244199","resolution":{"observed_at":"2026-08-11T21:53:56.706299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.682875Z","title":"A span-based multimodal variational autoencoder for semi-supervised multimodal named entity recognition,","venue":null,"work_id":"da535fbb-a552-4d82-a678-9e081809d3c6","year":2022},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.774151Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:3d061e1150c8d788e4be825c0a8c4f7502edd9b2ae634cfc48f9bfbcc44a2e93","observation_id":"dcea31c6-3b17-4c7d-8673-8791ac23cdef","resolution":{"observed_at":"2026-08-11T21:53:56.688592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.664612Z","title":"Entity- level interaction via heterogeneous graph for multimodal named entity recognition,","venue":null,"work_id":"b05c008f-9424-4227-b67f-d2840970994e","year":2022},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.779488Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:acf3f9be94a16287276fe7eedb2a1792cfa02b09bca34271a4e7df46ed2de51e","observation_id":"a925a4fa-ce05-4b19-b1dd-99d624be8349","resolution":{"observed_at":"2026-08-11T21:53:56.670543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.645290Z","title":"Prompt- ing chatgpt in mner: Enhanced multimodal named entity recognition with auxiliary refined knowledge,","venue":null,"work_id":"f2ba502e-7fa5-4612-bca2-2e7726a10b26","year":2023},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.785111Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:e50d27009081f264266a102c02d3aac8cb793fc393945db3d40383e09b62ed2a","observation_id":"0b949fab-1e68-48aa-b1b8-73d0f3058adc","resolution":{"observed_at":"2026-08-11T21:53:56.650947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.627657Z","title":"Gravl-bert: graphical visual-linguistic representations for multimodal coreference resolution,","venue":null,"work_id":"19948095-bfc4-4e25-958b-38d4c6d259e4","year":2022},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.790468Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:e8f39e03ccbcb34c132830e58be528d0ae19d3777fe4bc3ec7281ce39df9e25b","observation_id":"6b13dd77-f9ea-4701-b6d7-a924b15827e6","resolution":{"observed_at":"2026-08-11T21:53:56.632958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.609591Z","title":"Good visual guidance make a better extractor: Hierarchical visual prefix for multimodal entity and relation extraction,","venue":null,"work_id":"b6df822f-0872-4e5e-b795-0e07a77b421b","year":2022},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.795316Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:f0b83bc0793040ca6fe1b7d705278e13df115fa91b7015614834e285a2f2c086","observation_id":"6a183391-336c-4d56-8247-c8f194b86873","resolution":{"observed_at":"2026-08-11T21:53:56.615185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.591456Z","title":"Rethinking multimodal entity and relation extraction from a translation point of view,","venue":null,"work_id":"4e4e2ff2-9f47-4825-b708-566579311802","year":2023},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.802304Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:0ae449c91259575fe5a77ec78e1360205e854d3c3ce3ac5496cfa18700f46d48","observation_id":"289e4c81-903e-449d-9171-41c4d900c578","resolution":{"observed_at":"2026-08-11T21:53:56.597643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.574206Z","title":"Information screening whilst exploiting! multimodal relation extraction with feature denoising and multimodal topic modeling,","venue":null,"work_id":"85149f70-24b5-4094-95ae-abb2caefa7fa","year":2023},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.807645Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:228a6e6e78911cf9b22ec39393d7a4ffc34dbb1d00633ca651ca1c9f7d5ed9cd","observation_id":"aba6abb6-d9f3-43dd-b520-2b7b4884d727","resolution":{"observed_at":"2026-08-11T21:53:56.579968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:55.812633Z","title":"Transvg: End-to-end visual grounding with transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.812633Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:5ae519b5f4e2e033082733f54065b1e5de4e8f4490bc5fdfd605c69ebcd443eb","observation_id":"59b3563e-06c6-444f-be96-14b66d40ae54","resolution":{"observed_at":"2026-08-11T21:53:55.812633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.544058Z","title":"Shifting more attention to visual backbone: Query-modulated refinement networks for end-to-end visual grounding,","venue":null,"work_id":"3c0e2360-caac-4109-bb0b-efaa4f7fc4f2","year":2022},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.818110Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:094ecf509d1b82bdc7c8fc5931e3cebb41b7bc4925b58baa343639137e7763c8","observation_id":"10d8a44e-499c-4f42-9bad-5b21ba5e3538","resolution":{"observed_at":"2026-08-11T21:53:56.549750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:55.823763Z","title":"You only look once: Unified, real-time object detection,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.823763Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:262c826413a6463771c9a3f9e90a28f0a2eb36387c0808d4d885c08929d7398f","observation_id":"b6a867e3-aab2-4351-b594-4ae5589fcb64","resolution":{"observed_at":"2026-08-11T21:53:55.823763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.513732Z","title":"Ssd: Single shot multibox detector,","venue":null,"work_id":"6a540e28-61b3-43c5-847d-492250881d86","year":2016},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.829059Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:5aa44900ef63b2c482fbbbe288f970e3f3246febb0f2029e870a7f4c22ef9efd","observation_id":"e60e0871-744e-4ab5-a7c4-3cc522724eb6","resolution":{"observed_at":"2026-08-11T21:53:56.519786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.495393Z","title":"Ref-nms: Breaking proposal bottlenecks in two-stage referring expression grounding,","venue":null,"work_id":"ea704b4b-aeca-4011-a3b1-47da62c0d9e0","year":2021},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.834799Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:a9c5c5e96445ef8f018671f081efc9932ec0dff0eb3662f543acf769ee551791","observation_id":"70f282fc-3a62-43f4-821c-dbd7404185a1","resolution":{"observed_at":"2026-08-11T21:53:56.500810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.475912Z","title":"Missing modalities imputation via cascaded residual autoencoder,","venue":null,"work_id":"db0d3877-4005-4bb2-a8e6-3f3d0100d297","year":2017},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.839867Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:76ffd1f108ea8eceae263f86d4a7c565cf189e2c804094b650146d0e37555a4a","observation_id":"c63856b6-a7dc-4429-b84e-660cddeb2d03","resolution":{"observed_at":"2026-08-11T21:53:56.481316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.457771Z","title":"Lrmm: Learning to recommend with missing modalities,","venue":null,"work_id":"24bf5e77-feca-454b-8eb4-af9838e8533a","year":2018},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.844766Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:50f7e7c8b391dfa8b8bd7768124fa7aea6931594efc0acef5df93255fe276441","observation_id":"29585045-df22-4ae7-8611-bcf375eb6047","resolution":{"observed_at":"2026-08-11T21:53:56.463516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.439711Z","title":"Dealing with missing modalities in the visual question answer-difference prediction task through knowledge distillation,","venue":null,"work_id":"1cb2f478-ad19-4fdd-97d6-58918e2ec475","year":2021},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.850013Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:89398a4555d24b388b4d8b6f900cf1e56adb6c203498ba6378cb95fcae2bb06a","observation_id":"3d5846a8-68ac-426e-9596-808564db30f7","resolution":{"observed_at":"2026-08-11T21:53:56.445404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.422187Z","title":"A unified self-distillation framework for multimodal sentiment analysis with uncertain missing modalities,","venue":null,"work_id":"aeffc937-5798-4740-bf77-5bd80db3e91e","year":2024},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.855160Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:3deb165ae1c0d76b370157926ae87ea272b49b181cc9ab8873baf631084b1901","observation_id":"93c3b3cb-0854-4ddc-807a-2ed9696d3f8a","resolution":{"observed_at":"2026-08-11T21:53:56.427616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:55.860148Z","title":"Missing modality imagination network for emotion recognition with uncertain missing modalities,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.860148Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:b0022a5330bc5f4fe5c022566db4c199854cbc1d3de570d75304cde247c07fc3","observation_id":"398e2ac7-d9c4-4c6b-8fef-6f8e1c49bfbf","resolution":{"observed_at":"2026-08-11T21:53:55.860148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:55.865429Z","title":"Mitigating inconsistencies in multimodal sentiment analysis under uncertain missing modalities,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.865429Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:8b668b5ebf7ddb5ce15147cc51e36088169ede51915526a303936fb259f63903","observation_id":"3d58a6d9-b30a-42cb-a99e-9020de48ed42","resolution":{"observed_at":"2026-08-11T21:53:55.865429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.380409Z","title":"Multimodal prompting with missing modalities for visual recognition,","venue":null,"work_id":"e5e07dfc-22e3-4d8a-a6d4-82bdac9dcbe9","year":2023},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.870407Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:7d116c930eba4ec24788f9786cfe9bf45b1f6405767ad764e58fe58f647ab578","observation_id":"39c5209d-1341-4f87-a005-90bf62d45817","resolution":{"observed_at":"2026-08-11T21:53:56.386234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.362890Z","title":"Multimodal prompt learning with missing modalities for sentiment analysis and emotion recognition,","venue":null,"work_id":"d69f8a3f-0851-4c08-b7df-b1bb6de158ba","year":2024},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.875900Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:33c6c63c2dfedbf462913464dfb5eba7bb0269199a69ee28fef83edb3bab7a08","observation_id":"1f90a499-dbcd-4942-8037-355dd9c53f14","resolution":{"observed_at":"2026-08-11T21:53:56.368424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-11T21:53:55.881703Z","title":"Longformer: The long-document transformer,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.881703Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:7b11f20155f09723f4f95b73fccc02e858ec033365238575613a8e42fa9856f9","observation_id":"29abe825-40e1-4009-826e-5e293f1e5201","resolution":{"observed_at":"2026-08-11T21:53:55.881703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-11T21:53:55.887844Z","title":"Visual transformers: Token- based image representation and processing for computer vision,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.887844Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:9257140cf950e2619211dda3c5cd1e2f9c4f8a4db988283ffd5a240bf10816f1","observation_id":"2fd49c31-be75-4af4-84ec-3e9a8d5c17d2","resolution":{"observed_at":"2026-08-11T21:53:55.887844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.343184Z","title":"A primer in bertology: What we know about how bert works,","venue":null,"work_id":"0d90f102-4c63-4408-84ed-b225dbf6ce9d","year":2021},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.894087Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:14fbb4e1def3cb3b3b32f1c262dea869377910fe730840ff25183338fe4d636d","observation_id":"e36b2296-2cc4-4840-883f-2255bf452579","resolution":{"observed_at":"2026-08-11T21:53:56.349562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.322784Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"0cd13f58-adab-4ee6-9191-ec1249b98be9","year":2019},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.899056Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:0f3938510b60047e6c56f9f97fde5fa9b2a6561b0ae8ebc768de55555bfaddfd","observation_id":"548d5047-ec8e-48f8-9686-4e80da3b10bc","resolution":{"observed_at":"2026-08-11T21:53:56.328333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.303397Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"b36a8900-98d4-4b56-a71a-7ade984290e8","year":2021},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.904139Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:dc037c75d23757372c0ae474cc152d52ba32b3dd5832eba111d316654eb6cb2c","observation_id":"9696bcfe-f93b-4c3c-aff7-4a3c73dba5d9","resolution":{"observed_at":"2026-08-11T21:53:56.309219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.284003Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":"2d46f961-8bbf-4ab0-9fb7-4b1821297cc4","year":2014},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.910780Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:93c0a9d27d0088c5b486d6f48ac27557ea28554eeec921d7a7c061aa26a6d0f8","observation_id":"3609f568-0b54-49d9-94c9-774cda0cecc7","resolution":{"observed_at":"2026-08-11T21:53:56.289980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.261095Z","title":"Exploring universal intrinsic task subspace for few-shot learning via prompt tuning,","venue":null,"work_id":"7540a5fa-d369-4854-84c0-2b720cf789ea","year":2024},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.915496Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:54c3b32cd9a95a35a5c1dfc5b6b2ac29db526fa0f23e4669c7336ce53c2840e7","observation_id":"c8b2cd50-66c0-47ab-a728-8d61aeeca6a8","resolution":{"observed_at":"2026-08-11T21:53:56.267587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.241768Z","title":"Attention is all you need,","venue":null,"work_id":"7f8e9025-6113-44ac-9acb-5d26740fe19a","year":2017},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.920736Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:eca3a83f256471b26a9c3881a4271453600f5ae2d7ff53fef66c8b845b7bdee9","observation_id":"53c937e7-2558-431c-a72b-ec0c375c9853","resolution":{"observed_at":"2026-08-11T21:53:56.247428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:55.925634Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.925634Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:93c8c962ac1896361d58f923b184e868ec5d4ce4e52d7746fe7183f1de9226e9","observation_id":"f589483d-954d-4cfd-a5eb-b4ef49dc5c17","resolution":{"observed_at":"2026-08-11T21:53:55.925634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.209355Z","title":"Conditional random fields: Probabilistic models for segmenting and labeling sequence data,","venue":null,"work_id":"d9ea0260-5c01-4212-bbd8-63922ed86dbf","year":2001},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.931019Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:e815426a933736b52d2b8f3374dbcdd9a8171b488ab3e97a6a2bdb59f295644b","observation_id":"c679d900-ee18-442a-b05f-a707877b0d08","resolution":{"observed_at":"2026-08-11T21:53:56.215489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-11T21:53:55.935726Z","title":"Visualbert: A simple and performant baseline for vision and language,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.935726Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:a2119957cc4ac103f7eecf94877e88882335632fd008a88f19a7478ab39d9bad","observation_id":"1a07ebe0-1223-4048-bec1-804043acef90","resolution":{"observed_at":"2026-08-11T21:53:55.935726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:55.940778Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.940778Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:47b21364a1a469e79802a06a6f49770915c7c5aacf2c74959f35690be50e08ac","observation_id":"327576fc-5332-447d-a2c5-cdbbc9b28a7f","resolution":{"observed_at":"2026-08-11T21:53:55.940778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:55.945512Z","title":"Vivit: A video vision transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.945512Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:6e57ce39bfd41cad954edf4257ab0cc8036a5132aa37250cb6977f4ec0f65d53","observation_id":"dc33cd84-8a54-47fb-be2e-8c7e25261b2f","resolution":{"observed_at":"2026-08-11T21:53:55.945512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:55.950362Z","title":"Videomae: Masked autoen- coders are data-efficient learners for self-supervised video pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.950362Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:8ba4d680722a15986f85889d479e0748925f326fa5ef199f4aa073ab58acd7ff","observation_id":"f4c4426e-de7d-41ac-966a-d60a7f21d47e","resolution":{"observed_at":"2026-08-11T21:53:55.950362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:55.955213Z","title":"Video-llama: An instruction-tuned audio- visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.955213Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:dbdd47994f0716d6c0130c810a9d5295551889381312ff04a7c15d0207101679","observation_id":"e0ea64b8-955c-4ba8-972f-e48df9251217","resolution":{"observed_at":"2026-08-11T21:53:55.955213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.127199Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":"44c71b04-0b25-4357-b9d7-7d6802bcbd8d","year":2024},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.960826Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:0a9de003cc496871be0eec74aea5bfd77f83e882eafc3fbd22321102afeb7adf","observation_id":"dd061f07-0ff1-49b2-981b-b3c6017764f1","resolution":{"observed_at":"2026-08-11T21:53:56.132655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.109480Z","title":"Parallel data helps neural entity coreference resolution,","venue":null,"work_id":"8d0af7b0-f9a6-4798-a9a8-2ac04ecf5ab3","year":2023},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.965982Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:38b12fc09b165a4c0669ce4ba3ce1bb40820f5fd7c81560abd8f40af6337cb1d","observation_id":"060b76a4-32cf-41e9-a904-9eddfe4745bb","resolution":{"observed_at":"2026-08-11T21:53:56.115435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:56.087221Z","title":"Toe: A grid-tagging discontinuous ner model enhanced by embedding tag/word relations and more fine-grained tags,","venue":null,"work_id":"a4e83174-7e4d-4616-a544-4b98bcbc6264","year":2022},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.971683Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:2b63e409f7a460900c54584fb126f9dfbdca4c347ae56418bd2a98536835932a","observation_id":"a6c55131-0d59-431e-ba0e-6846f88eba82","resolution":{"observed_at":"2026-08-11T21:53:56.095439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:55.976780Z","title":"A fast and accurate one-stage approach to visual grounding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.976780Z"},"links":{"citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:0b6f62977a7db303b2956c1f243fe65233330a651f02257eabb386927cc177dd","observation_id":"acb1842e-afd2-49d1-9f2f-3db8a1d6502e","resolution":{"observed_at":"2026-08-11T21:53:55.976780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T18:51:37.605211Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":49},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2412.04026."}