{"as_of":"2026-08-21T14:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e747757870b7db3d240881d9fe56e400daac545cf889348748f18d73c10d1602","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T00:03:55.551725Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23235/citation-record","integrity":"/paper/2607.23235/integrity","json":"/paper/2607.23235/citation-record.json","paper":"/paper/2607.23235"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:53.826066Z","title":"Image captioning: Transform- ing objects into words.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:53.826066Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:932d5bc62e5bab03b5a38c2d234fa3da068461a20bb9a8585f1efb04be44e733","observation_id":"de9bb82a-8b21-466b-896b-75f2732a3774","resolution":{"observed_at":"2026-08-01T00:03:53.826066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:53.911123Z","title":"A comprehen- sive survey of deep learning for image captioning.ACM Computing Surveys (CsUR), 51(6): 1–36, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:53.911123Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:36668b42160476e4463162405f8e22b04ece688989d2e5f7405e727eafe73134","observation_id":"ec69123c-8d40-43d7-8397-04aa21157e27","resolution":{"observed_at":"2026-08-01T00:03:53.911123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:54.018826Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.018826Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:b2320ee92b708abcb19813635572682a634110b30a1246eba2884dcf2cc922d9","observation_id":"1b3f5a94-b55a-4720-98f0-129e4b7a8758","resolution":{"observed_at":"2026-08-01T00:03:54.018826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:54.132944Z","title":"Surveying the landscape of image captioning evaluation: A comprehensive taxonomy and novel ensemble method.arXiv e-prints, pages arXiv–2408, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.132944Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:ccb63afe87dec804478ce6a089f4e439d55b9c66a5784b34a48eccc5971f79ef","observation_id":"c9cb565e-3ac3-4d85-b09e-16220d3f368f","resolution":{"observed_at":"2026-08-01T00:03:54.132944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02740","last_updated":"2024-10-03T17:54:52Z","snapshot_observed_at":"2026-08-16T13:12:51.769854Z","submitted_at":"2024-10-03T17:54:52Z","title":"Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02740","snapshot_observed_at":"2026-08-01T00:03:54.285204Z","title":"Revisit large-scale image-caption data in pre-training multimodal foundation models.arXiv preprint arXiv:2410.02740, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.285204Z"},"links":{"cited_paper":"/paper/2410.02740","citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:8fd6c941a445c0f7ed0904e5d1b1c5e2eba34473b90512782479f56c31b816df","observation_id":"1592e1d7-4a1c-4987-96b0-93cab0612cbe","resolution":{"observed_at":"2026-08-01T00:03:54.285204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14604","last_updated":"2025-05-30T14:11:25Z","snapshot_observed_at":"2026-08-21T07:56:01.079099Z","submitted_at":"2025-03-18T18:03:56Z","title":"Image Captioning Evaluation in the Age of Multimodal LLMs: Challenges and Future Perspectives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14604","snapshot_observed_at":"2026-08-01T00:03:54.390830Z","title":"Image captioning evaluation in the age of multimodal llms: Challenges and future perspectives.arXiv preprint arXiv:2503.14604, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.390830Z"},"links":{"cited_paper":"/paper/2503.14604","citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:48fb42198e139200c11f17e51c709ab49c1a7573a4bd76d2b365b02b12d02619","observation_id":"f67b4f26-d368-4036-8a39-a626c20d35d1","resolution":{"observed_at":"2026-08-01T00:03:54.390830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:54.555733Z","title":"Show and tell: A neural image caption generator","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.555733Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:a7ca737ba714998a9afbf5b7e02c96dbd9a18d2ef061d045f624f9dcbdd2f0e7","observation_id":"4bacc46c-d093-4197-94d7-7e97b0c39f0e","resolution":{"observed_at":"2026-08-01T00:03:54.555733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:54.723648Z","title":"End-to-end transformer based model for image captioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.723648Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:a4869948b92fe803f1ee3361a5489093c6cd67f973e24c0ae01587f799fcc368","observation_id":"edc2adb1-0f1c-4218-a72e-a33ea1749f93","resolution":{"observed_at":"2026-08-01T00:03:54.723648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:54.799819Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.799819Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:2b33f251e0b4ad95faab171e471304727cc5d93150a9d3857f3c9f131630e444","observation_id":"06e431af-6471-48f8-b589-2aa773f0d7a0","resolution":{"observed_at":"2026-08-01T00:03:54.799819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:54.803504Z","title":"Cccaption: Dual-reward reinforcement learning for complete and correct image captioning.arXiv preprint arXiv:2602.21655, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.803504Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:a80d2c399e77e89648b2a585901958749881c11afaa97816b7e48d3f77d60464","observation_id":"ca182a09-b1f8-4bc1-ba63-74f61bfd27d5","resolution":{"observed_at":"2026-08-01T00:03:54.803504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:54.807372Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.807372Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:3e8f4648eed29443d404c1bc2c9454e88562d4e71a35355b1371699b4369664e","observation_id":"e1c1aa8d-138b-46ab-9229-c9bfa5ca1e76","resolution":{"observed_at":"2026-08-01T00:03:54.807372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:54.811305Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.811305Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:e6a00300029388fa3a2fe2905398586c891c272d2e7aa8b043e7c2b98c0e1e47","observation_id":"1924cb55-3517-4cc0-93de-8c1ca9103f66","resolution":{"observed_at":"2026-08-01T00:03:54.811305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:54.814700Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901, 2020","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.814700Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:548553b08eff192795780a723ce9bd594de17925076c5858c370d1b1a2d42919","observation_id":"7d61b1ac-53bd-400b-8b04-be6af738f114","resolution":{"observed_at":"2026-08-01T00:03:54.814700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-01T00:03:54.818105Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.818105Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:e8d412645711c68ead6781e12b666ad27443f5bdb8b76ef5c09612e17c9747d5","observation_id":"bbc2ebdd-6316-4446-bbdc-66241cca246c","resolution":{"observed_at":"2026-08-01T00:03:54.818105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T00:03:54.822192Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.822192Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:40cfd82d807f44778219d80407922e5f7bcbdced337ce18fef479d53713819fe","observation_id":"ab0b9b6a-df27-4efd-a05d-bba5c842678c","resolution":{"observed_at":"2026-08-01T00:03:54.822192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:54.825892Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.825892Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:02bbe194e47ed5e820bd03eaf1d53030d7b6f84b7026cd5cb1b0b0cf0e137fb2","observation_id":"6222624d-ce3d-41f3-853c-e876c5b631ce","resolution":{"observed_at":"2026-08-01T00:03:54.825892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06004","last_updated":"2024-06-10T03:57:39Z","snapshot_observed_at":"2026-08-16T13:44:41.295915Z","submitted_at":"2024-06-10T03:57:39Z","title":"FLEUR: An Explainable Reference-Free Evaluation Metric for Image Captioning Using a Large Multimodal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06004","snapshot_observed_at":"2026-08-01T00:03:54.830417Z","title":"Fleur: An explainable reference-free evaluation metric for image captioning using a large multimodal model.arXiv preprint arXiv:2406.06004, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.830417Z"},"links":{"cited_paper":"/paper/2406.06004","citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:ce627d0af8040f7ea3b6b4740c46dbb5e44d97db21fa5a4682e85636cf8f8085","observation_id":"6e255aaf-3065-4dcc-95b7-10398ba50bf6","resolution":{"observed_at":"2026-08-01T00:03:54.830417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12329","last_updated":"2025-03-16T02:56:09Z","snapshot_observed_at":"2026-08-16T12:49:41.473450Z","submitted_at":"2025-03-16T02:56:09Z","title":"CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12329","snapshot_observed_at":"2026-08-01T00:03:54.834315Z","title":"Caparena: Benchmarking and analyzing detailed image captioning in the llm era.arXiv preprint arXiv:2503.12329, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.834315Z"},"links":{"cited_paper":"/paper/2503.12329","citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:b43e2496975edc839a5e78cc84890af6cbdbe1e5b41301cee33e2311ee320b9c","observation_id":"4053493b-0866-4e49-b640-edcdf83ca423","resolution":{"observed_at":"2026-08-01T00:03:54.834315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:54.838788Z","title":"Prometheus-vision: Vision-language model as a judge for fine-grained evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.838788Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:546980b394c60ba360d56a925790d8c7fe9256e7e4a07d0e9fc8e2a3634c5931","observation_id":"fcee4a54-64e3-4c9c-8660-633eec882e8c","resolution":{"observed_at":"2026-08-01T00:03:54.838788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:54.842474Z","title":"Caprl: Stimulating dense image caption capabilities via reinforcement learning.arXiv preprint arXiv:2509.22647, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.842474Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:f048485053ece6182f5d0ee4e8e29cea22060fa6a429d330137cbc364ab524cd","observation_id":"824807e0-7ee9-4a89-995f-a8dc7096958a","resolution":{"observed_at":"2026-08-01T00:03:54.842474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:54.846076Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.846076Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:56a58d5826d622fbdc76a4a793328de8dc5c9abdcaf1a4f3157b063c85b0d823","observation_id":"5601d520-b86d-4d48-8d07-d7162a776818","resolution":{"observed_at":"2026-08-01T00:03:54.846076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-01T00:03:54.849522Z","title":"Clipscore: A reference-free evaluation metric for image captioning.arXiv preprint arXiv:2104.08718, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.849522Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:1589f58aef9c67dd40022a0c7bb59eb817afb2a15ce019b7dbd2eae51fb3536e","observation_id":"0f825394-57c9-4c17-8cac-a67cbc569acf","resolution":{"observed_at":"2026-08-01T00:03:54.849522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:54.853171Z","title":"Positive- augmented contrastive learning for image and video captioning evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.853171Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:7b9546f6b3384c7b9a2060f537dc82950d41636c3a1bfc62f9e98c5fa8dfe83a","observation_id":"ed5e168c-6f53-4ece-bef1-d084656422e4","resolution":{"observed_at":"2026-08-01T00:03:54.853171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03567","last_updated":"2025-01-08T11:20:00Z","snapshot_observed_at":"2026-08-16T12:59:35.464738Z","submitted_at":"2025-01-07T06:35:34Z","title":"Evaluating Image Caption via Cycle-consistent Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03567","snapshot_observed_at":"2026-08-01T00:03:54.856531Z","title":"Evaluating image caption via cycle-consistent text-to-image generation.arXiv preprint arXiv:2501.03567, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.856531Z"},"links":{"cited_paper":"/paper/2501.03567","citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:0337706dea8195d2cd4bd4b62ebd3d7f6073fa11f9700f14d274278f6cfc4680","observation_id":"d0c275ef-fe7a-421c-957a-f7f46703118c","resolution":{"observed_at":"2026-08-01T00:03:54.856531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:54.860280Z","title":"Im- age2text2image: A novel framework for label-free evaluation of image-to-text generation with text-to-image diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.860280Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:514f99be3ac4ab1b65d7bf52b598e23d100938c89e2df70c4628c84174bc6f3e","observation_id":"86224940-f088-419c-b747-c63cdb19c656","resolution":{"observed_at":"2026-08-01T00:03:54.860280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:54.863659Z","title":"Visual fact checker: Enabling high-fidelity detailed caption generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.863659Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:c7239b45e856fa7e67ece878dc1065d1ae25f5eafbf2106832c4b7b4147a1f75","observation_id":"d760d816-c7ee-4a39-b9eb-39787985c465","resolution":{"observed_at":"2026-08-01T00:03:54.863659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11897","last_updated":"2023-08-17T21:45:52Z","snapshot_observed_at":"2026-08-16T15:46:31.920890Z","submitted_at":"2023-03-21T14:41:02Z","title":"TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11897","snapshot_observed_at":"2026-08-01T00:03:54.867139Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.867139Z"},"links":{"cited_paper":"/paper/2303.11897","citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:5359a5060968bb32afb37476af1ca60a30aebc6d7b378dc30b06bd9bb4e4d837","observation_id":"b557d234-f48b-4829-8f35-10d73131098d","resolution":{"observed_at":"2026-08-01T00:03:54.867139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:54.874458Z","title":"Davidsonian scene graph: Improving reliability in fine-grained evaluation for text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.874458Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:6867991ba1c06c4231b2f6e5d35c76cce7c3e8da4c20ac677846c5c195b4ff75","observation_id":"a4454d93-4993-4a2a-ad70-aca87f72da10","resolution":{"observed_at":"2026-08-01T00:03:54.874458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:54.936994Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:54.936994Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:dd25e9f8ddcf8bd2ee34e9d9b352810e1be1be114deab0db05ba1591be20d283","observation_id":"a06b21d3-1251-4760-9ed6-0a91ad2de85a","resolution":{"observed_at":"2026-08-01T00:03:54.936994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.046200Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.046200Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:49d4466d3e1aa180a0cd2a005fd218882aaf9eebbbf1ed9f3de3b06a3582b7de","observation_id":"a2459e5d-a224-4bd9-8fbf-24c56d8981de","resolution":{"observed_at":"2026-08-01T00:03:55.046200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.197279Z","title":"Beyond quantity: Distribution- aware labeling for visual grounding.arXiv preprint arXiv:2505.24372, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.197279Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:81231e85c957ce3db3c888baab28c4cf3c480b95ffd4660fd90490538ab203e9","observation_id":"ea811959-84c1-4db9-9c08-3fa46ba4dd24","resolution":{"observed_at":"2026-08-01T00:03:55.197279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.355646Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean Conference on Computer Vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.355646Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:345a5dd7a4d0deeaefddc9bc7e0f2807a116beead01d0349c7a6af604821cc44","observation_id":"cdce35e3-d0d8-497e-811f-e4419971087c","resolution":{"observed_at":"2026-08-01T00:03:55.355646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.461172Z","title":"Are we on the right way for evaluating large vision- language models?Advances in Neural Information Processing Systems, 37:27056–27087, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.461172Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:8ddb344b9586a7f1cf552a5787624d0108eb2f8b1d8e87da1fd28dfca57eea7f","observation_id":"6ad42cf7-0956-48a8-a8c7-940d7755b153","resolution":{"observed_at":"2026-08-01T00:03:55.461172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.464973Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.464973Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:2238563bacb0d2a10d5c436b7a47120466d536361eee162775dcf8cde80592cf","observation_id":"4dab1268-75c8-4190-adef-9f4ae9020ae4","resolution":{"observed_at":"2026-08-01T00:03:55.464973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-01T00:03:55.469092Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394, 3, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.469092Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:86ac129f8561dcf548d0ce898e78cd301f923f596d817e4086e100f52284c0e8","observation_id":"9ab00de5-cb71-4dbc-8162-53162fca8cd4","resolution":{"observed_at":"2026-08-01T00:03:55.469092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-08-20T14:58:44.877503Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-01T00:03:55.472736Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.472736Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:b6389d238f39a3148cc7c9937a77e43290b6d547f3a57dc5cc962dc98f81dcc0","observation_id":"c6675f83-2f1f-48b5-89c5-2e52fc679dcb","resolution":{"observed_at":"2026-08-01T00:03:55.472736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.476457Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? InEuropean Conference on Computer Vision, pages 169–186","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.476457Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:93f4f374a4a82da0d9679e8aca6f727f0fb9a62fd93abd0ae394bf92350511f1","observation_id":"97a2ed12-8357-4d50-acde-0bb217817342","resolution":{"observed_at":"2026-08-01T00:03:55.476457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.480121Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.480121Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:ce83daea0b97e30459e71f2a745f7221d53d09600393e85c4e03b6743d8f7767","observation_id":"6e5f531b-3f8f-4612-9638-7a2ff6a6df15","resolution":{"observed_at":"2026-08-01T00:03:55.480121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.483851Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models.Science China Information Sciences, 67(12):220102, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.483851Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:8642110d044e6152ecbe2394c3b99852d8a5b812a50696701f0c40e12bf57204","observation_id":"da2fef2f-9f97-468f-84a1-07e11fc165c8","resolution":{"observed_at":"2026-08-01T00:03:55.483851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.487616Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.487616Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:526f740c8b32945a3b4b8aa4d94a2b54bd7f3fe9d0021964dfe3ad527eb3a8f1","observation_id":"636f817c-2c60-4728-be89-ab62bbac3110","resolution":{"observed_at":"2026-08-01T00:03:55.487616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.491028Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.491028Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:5500a26877b14cd556181932edff9b635540df42991800c9a433c2d4cc6ae018","observation_id":"cdd9693b-fd8f-4670-be20-27f3e3eac1a1","resolution":{"observed_at":"2026-08-01T00:03:55.491028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.494520Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.494520Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:b20dedeea30a21f1e829c39c7b86da6880b340537ce9e637cbbd964d020728ac","observation_id":"b6d4ddd4-45b7-4beb-a220-523c16d3a8bd","resolution":{"observed_at":"2026-08-01T00:03:55.494520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.498441Z","title":"Llama-3.2-11b-vision – multimodal large language model (text + image → text)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.498441Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:9ae32d8e982f5b027deb129de0aaef8d97f89ee80bf660134a365878ef56808d","observation_id":"61ac7eb2-943a-4d9b-acc2-967d7f0b56b4","resolution":{"observed_at":"2026-08-01T00:03:55.498441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-01T00:03:55.502062Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.502062Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:ed469451682f332d3e686f87ecb62e4ca2f1b902e52333da5b5fe45a70433f79","observation_id":"a4e25302-67e0-48c7-ae84-8151916f4a1e","resolution":{"observed_at":"2026-08-01T00:03:55.502062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.505878Z","title":"Finite mixture models.Annual review of statistics and its application, 6(1):355–378, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.505878Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:e12579604213dcdf4ee247c1a5588b1b934d9926cbb671cb7dce570be8085371","observation_id":"6399c4b2-7c03-46d9-8ed9-d68d57647d12","resolution":{"observed_at":"2026-08-01T00:03:55.505878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.509506Z","title":"A density-based algorithm for discovering clusters in large spatial databases with noise","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.509506Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:98520229589228c88ceaf059b840b323e9d620f11fbebaa5c2efc5fb96656de5","observation_id":"1ebe9983-979c-4dad-8819-c3f9b26d089d","resolution":{"observed_at":"2026-08-01T00:03:55.509506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-01T00:03:55.513125Z","title":"Qwen-image technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.513125Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:7bb2947bb10a717ad40f5fd98fa2769b6db953ef5f089081e9fe2c28bde92c8c","observation_id":"09792c1d-2976-4d88-a576-7955c28e6100","resolution":{"observed_at":"2026-08-01T00:03:55.513125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.517181Z","title":"Unitbox: An advanced object detection network","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.517181Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:b9b467a152287d519007235574d74bfa075703c30a4aae1a5b6abe7c51e54a8d","observation_id":"f010210b-df38-4485-9d34-cd89dcb7f9fc","resolution":{"observed_at":"2026-08-01T00:03:55.517181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.520716Z","title":"Opensearch-ai / ops-mm-embedding-v1-7b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.520716Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:4ffca8f4a3b381cfc26970eb799f39ddd98007bdf51651d5e4145a660052f36b","observation_id":"62414ae0-c443-4f4c-869b-226b1ea7010e","resolution":{"observed_at":"2026-08-01T00:03:55.520716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.524213Z","title":"Gpt-5: A new era in language models.OpenAI Technical Report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.524213Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:06207e318eb6dc3ce5284ca4eed717696cab3bc5096aa71938493325dc232782","observation_id":"2606616d-bfa6-47bc-ad81-aa284a0ae4df","resolution":{"observed_at":"2026-08-01T00:03:55.524213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-01T00:03:55.528338Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.528338Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:cdc24ca86e086e52d46ecd09343c2bfcfd20c44007f25d3ef98ac474268c1160","observation_id":"86dd6d9b-d379-489b-b898-047473b38ff3","resolution":{"observed_at":"2026-08-01T00:03:55.528338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.531910Z","title":"Prism: A framework for decoupling and assessing the capabilities of vlms.Advances in Neural Information Processing Systems, 37:111863–111898, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.531910Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:b0f54c290f6500d4c0574966bda31ec19c7fa76d1c1c8c03bfd079897f29ca24","observation_id":"5181199c-25e9-4ae8-9847-8d597757ba8d","resolution":{"observed_at":"2026-08-01T00:03:55.531910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.535566Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.535566Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:2d524faae7cc6605607d63f4affe4cb735ce9c5d80257b959a90ecef09ce5af6","observation_id":"bc17697f-a386-4aa6-84c2-6440d632210d","resolution":{"observed_at":"2026-08-01T00:03:55.535566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.539199Z","title":"question","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.539199Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:c78354130e1a4584ae91ecd35048a401fc18838579df236b1c2a2e5212b30eb3","observation_id":"e7066cee-b6ef-45f8-8ae7-29fb0fed6d7a","resolution":{"observed_at":"2026-08-01T00:03:55.539199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.543775Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.543775Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:499fc73a93528fe37170e7c1cc82713f15555e036ab53f93b7ff972e7c2949d1","observation_id":"26925ec0-cdb4-40ee-af5f-f3595014d1df","resolution":{"observed_at":"2026-08-01T00:03:55.543775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.547632Z","title":"gold standard","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.547632Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:04b1f319cdd30f9495e24ba45b9e5fa78f2a350daf0cb079f210560de128f54f","observation_id":"472851b9-bdb6-470e-9596-53bf21ca11e9","resolution":{"observed_at":"2026-08-01T00:03:55.547632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:03:55.551725Z","title":"Compares the performance of two judgers, Qwen2.5 (Qwen2.5-VL-3B) and Qwen3 (Qwen3-VL-8B)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:55.551725Z"},"links":{"citing_paper":"/paper/2607.23235"},"observation_digest":"sha256:a376b845ed074a5c11bfc4b57956c016776fc24b474461d82b484bb723b4e904","observation_id":"9fc606de-a5fc-4260-bbec-4aca9748345b","resolution":{"observed_at":"2026-08-01T00:03:55.551725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23235","last_updated":"2026-07-25T14:41:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T08:16:37.949014Z","submitted_at":"2026-07-25T14:41:34Z","title":"A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2607.23235."}