{"as_of":"2026-08-13T13:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3a407869f9c02bdca76611b5908f73ccbd7a3bab5bd76081290e6c6b88e6b329","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:16:47.614230Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.00095/citation-record","integrity":"/paper/2412.00095/integrity","json":"/paper/2412.00095/citation-record.json","paper":"/paper/2412.00095"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.457623Z","title":"Object hallucination in image captioning, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.457623Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:fe2ca11183c545faa486c70d6cdb02240d179fef2536d472c31eb3325e70e1b9","observation_id":"5ec5f466-ccfe-4fbb-a313-9a89b1911c22","resolution":{"observed_at":"2026-08-12T11:16:47.457623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:48.103803Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":"c73e0c23-61c3-4fd4-ab83-66e1a7e4c8be","year":2018},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.463695Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:1479d1a939a6d9f5e9c2b17441f16bd55317f424781fc5b9fc3054af2ec36e0c","observation_id":"2c85127e-28b6-4b70-b5a6-97300ee71564","resolution":{"observed_at":"2026-08-12T11:16:48.109070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:48.084810Z","title":"Look back and predict forward in image cap- tioning","venue":null,"work_id":"455eecb3-7a3d-40e1-af62-cffb970e48ae","year":2019},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.468868Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:171ba59d8bac084fdc351bc8889fbd45683405fd8f2858b05d31e52f283fd29b","observation_id":"5680fb35-4b68-4533-9e04-c7084191eec5","resolution":{"observed_at":"2026-08-12T11:16:48.090958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:48.068645Z","title":"Attention on attention for image cap- tioning","venue":null,"work_id":"8e94e524-db7c-4c4c-b94a-2ba5b04d386b","year":2019},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.474372Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:f871a52db780b1d2ceb4a2931527c04445af3c35914d83eccedcc23c36ae30b7","observation_id":"19a990e6-1974-4606-9b08-309770e20b8f","resolution":{"observed_at":"2026-08-12T11:16:48.073810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:48.053480Z","title":null,"venue":null,"work_id":"955be103-131b-4557-925c-3bdb17a19df9","year":2021},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.480583Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:7ec6306b02ffeebcfb7ceea7c07efc2c797f5bfea4b4e20cef2c54ef89914968","observation_id":"2ffa8912-cf25-4fa2-b8dd-b52618b1bd06","resolution":{"observed_at":"2026-08-12T11:16:48.058618Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:48.038601Z","title":"Show and tell: A neural im- age caption generator","venue":null,"work_id":"9a5a8464-9cb0-419b-b1ea-46f8e92e9ea7","year":2015},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.486562Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:56cc57620c6b040b515fa8b27d93f6af19f9665c20dc6d7b6f08fd819b82546e","observation_id":"6c3dcae9-b3df-4fc0-a9bc-5821be50009e","resolution":{"observed_at":"2026-08-12T11:16:48.043460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:48.023359Z","title":"Long short-term memory","venue":null,"work_id":"8a66e2df-d76d-4332-8c8e-35ba1d5948db","year":1997},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.491963Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:717fe1947d321032882566466ce5f6213aae8b6293288dc2bd91f0684999771c","observation_id":"e72201f6-dc23-4c1a-bff7-82c24a3f117c","resolution":{"observed_at":"2026-08-12T11:16:48.028524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:48.008682Z","title":"Show, attend and tell: Neural image caption generation with visual at- tention","venue":null,"work_id":"08dd2c98-c8de-4bd9-81b0-36453d96e8ad","year":2015},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.497693Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:45f49ed528ab5232d6921764d5b8babc705c377ec5835d8c932d27ff6bee31fc","observation_id":"65adc94c-1be5-4d45-9fe9-a561f166e0da","resolution":{"observed_at":"2026-08-12T11:16:48.013261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.994813Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"bee5d2a4-df39-47c8-bf6e-8bfe7baef3e1","year":2017},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.503537Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:e4756484a0e7b873839d9dcdedac2a2377dc8b65ae41943d3f7f56553c2460d3","observation_id":"f77dd1a8-cb9f-44d8-9a79-50f48e29eb7e","resolution":{"observed_at":"2026-08-12T11:16:47.999241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.980434Z","title":"Adaptive path selection for dynamic image captioning","venue":null,"work_id":"34f9cc54-e86d-481a-8d87-f7d63b6b3ed3","year":null},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.509149Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:ec240eb6b9f3d05b2f543357a84b6eb1864b4bf54d9f58ee5fe168bc86292fe7","observation_id":"a5f6bb5f-3001-45f9-9cfd-4816fb82446e","resolution":{"observed_at":"2026-08-12T11:16:47.985288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.965049Z","title":"Vision-enhanced and consensus-aware transformer for image captioning","venue":null,"work_id":"aee2f314-98e5-4c89-be07-5c79fbe9af57","year":2022},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.514774Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:df15cc97a5e8e43a9ed378d057702897b7676f7f546b9ca6565d8a83dded8ccb","observation_id":"d72b619e-55c6-428f-94b9-f63d00191ea8","resolution":{"observed_at":"2026-08-12T11:16:47.969987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.949993Z","title":"Remote sensing image caption generation via transformer and reinforcement learning","venue":null,"work_id":"5bf35910-25ff-4822-aa9d-753545dab14c","year":null},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.519681Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:b02ee103d56fa3b4f29dd598c0b7b8cac2505449c7ece23e39482d02ed5034af","observation_id":"27d9ab19-d056-4de5-a761-c1648d125dc8","resolution":{"observed_at":"2026-08-12T11:16:47.955017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-10T08:25:28.506770Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-12T11:16:47.525034Z","title":"Object hallucination in image captioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.525034Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:0ed790fdf5f924d7252bf4bdaf013b65a12b507ba03749151786174d74c9450d","observation_id":"8625f324-575e-414f-87e7-4f83f4db406a","resolution":{"observed_at":"2026-08-12T11:16:47.525034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.931709Z","title":"Self-critical n-step train- ing for image captioning","venue":null,"work_id":"33d0c2fc-61c7-47ec-ba1c-548d1190d803","year":2019},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.530303Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:bd26318b9c0ce8d4393d534d2a64fa5def95ac2cc07fbace1c37d6482e3c0242","observation_id":"4e809362-f3d3-4f46-8f94-11f76959cf87","resolution":{"observed_at":"2026-08-12T11:16:47.939598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.914986Z","title":"Let there be a clock on the beach: Reducing object hallucination in image cap- tioning","venue":null,"work_id":"3af55b4a-b76e-4136-99c7-629f28d1a644","year":2022},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.534700Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:acbd0eea90b43833494d09c9a606298f5f931c8086a177bb3327432eee8d5fc3","observation_id":"f06998b6-758a-4794-a68f-162f5e5c7e37","resolution":{"observed_at":"2026-08-12T11:16:47.921091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.898508Z","title":"Mitigating fine-grained hallucina- tion by fine-tuning large vision-language models with caption rewrites","venue":null,"work_id":"f9f365dd-3d5d-4430-aa4d-7556c630bf31","year":null},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.540346Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:2688e132f5264bb541ca269127442fba42c12073d5f37f039c28108892fff6fc","observation_id":"6b4d4dfc-58c5-4a1b-b922-c133c0a24bf8","resolution":{"observed_at":"2026-08-12T11:16:47.903965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00666","last_updated":"2021-10-27T02:14:12Z","snapshot_observed_at":"2026-07-06T11:14:53.651087Z","submitted_at":"2021-06-01T17:54:09Z","title":"You Only Look at One Sequence: Rethinking Transformer in Vision through Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.00666","snapshot_observed_at":"2026-08-12T11:16:47.544920Z","title":"You only look at one sequence: Re- thinking transformer in vision through object de- tection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.544920Z"},"links":{"cited_paper":"/paper/2106.00666","citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:0f272f3a3630f993adb4a9551492d9a1f7d6db37b0a0e7ef43d5d150e4db2aec","observation_id":"5a5e9f11-d986-4c35-a91a-26a8bfbc1154","resolution":{"observed_at":"2026-08-12T11:16:47.544920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.880909Z","title":"Learning to predict visual attributes in the wild","venue":null,"work_id":"e9430be4-fb24-41ee-9443-1cea6d800d6c","year":2021},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.549858Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:98aa42a507bc48264078d48656aa8e97e22605949ab09cc74e69992504b580b6","observation_id":"516d3c30-5a9e-4092-86bd-1a6d81bc89c5","resolution":{"observed_at":"2026-08-12T11:16:47.886237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.864193Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"bb7648e8-1e26-4b72-aeb3-80c4ca800967","year":2021},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.554778Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:6723c57e92e064a5170f144f9e6badb30dca0c1409c76078f78f9fc4e79c8344","observation_id":"22614c81-bbb0-484a-a09a-fcb2994316a3","resolution":{"observed_at":"2026-08-12T11:16:47.870347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.846641Z","title":"Lawrence Zit- nick, and Piotr Doll ´ar","venue":null,"work_id":"e47aeb0b-b336-4615-8a2d-4fb430bb8876","year":2015},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.561699Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:61f47de61a85bf1ab336d5485f5328854be4d69f07741bafe66c5a093dcb3d89","observation_id":"ef7dc71d-aa0d-411b-b55e-c378f4c1dd54","resolution":{"observed_at":"2026-08-12T11:16:47.852338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.829123Z","title":"Cider: Consensus-based image de- scription evaluation","venue":null,"work_id":"302e0091-f125-4dd7-ac07-11bbd6a5cf2c","year":2015},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.567291Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:4f78bc05e5d4498a7b5f58d497108a99561b9b8904a8185e9f5c3aca7ea69a63","observation_id":"7bdd5e51-21bc-4c2d-a375-61613323d8a2","resolution":{"observed_at":"2026-08-12T11:16:47.834157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.807971Z","title":"Bleu: a method for automatic evalu- ation of machine translation","venue":null,"work_id":"0a7d0814-5be1-4e09-a954-3a4a4fa30f6d","year":2002},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.572128Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:4153357ac742053f883221e26e0697de4d09322305dbbeb2e55d08f4947d49cf","observation_id":"27f57047-f47f-4452-9088-62741b621ddf","resolution":{"observed_at":"2026-08-12T11:16:47.813725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.789674Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":"134b7164-1342-4f4a-ad0b-4ac42a6fd257","year":2005},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.578266Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:d798a23de3701e2087373077d5d60f61aaa0d568d0e79a89dc7c037d0bcdd1c3","observation_id":"679c788f-0da9-4a27-ab1e-146625725fa5","resolution":{"observed_at":"2026-08-12T11:16:47.795828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.770932Z","title":"Spice: Semantic propositional image caption evaluation","venue":null,"work_id":"30d38fba-081f-472d-be39-f32cef947b0d","year":2016},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.584117Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:d9783b00a89164890d833cf5f8221d413dd414b365d270e293e631f28d2c2fec","observation_id":"ddacfec6-56f8-4f0c-9ff8-e4b2c0e1df71","resolution":{"observed_at":"2026-08-12T11:16:47.777062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.753071Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":"64405377-3d05-48a4-94fa-44924caf66d2","year":null},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.589129Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:c0280353de0244e4b38d094bb790306a49cb0355e1dbedf038c984aa4a63018a","observation_id":"029a3c29-d0ce-4a18-bc59-abc753d0f6f6","resolution":{"observed_at":"2026-08-12T11:16:47.759487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.734161Z","title":"Attention on attention for image cap- tioning","venue":null,"work_id":"c48088d0-3124-40c9-83c8-dfb84ac66a57","year":2019},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.594529Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:0ab111e3f5e14a5967f7f434ed82e478f5c47f335d56bf05974ab523e4a8e057","observation_id":"05f2e770-dcee-4d4d-83b2-56ce91f11ed2","resolution":{"observed_at":"2026-08-12T11:16:47.741378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.602668Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.602668Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:2f43b9143e1c6e9b3768484d973bc2c84ff804f63958f5ae035d6b450d57bb5a","observation_id":"a1e2b98e-3ee4-47b8-80aa-90e4deed6648","resolution":{"observed_at":"2026-08-12T11:16:47.602668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.708209Z","title":"no- caps: novel object captioning at scale","venue":null,"work_id":"2a25cb32-0f73-47c0-805f-f0ff66d88028","year":2019},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.608765Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:d9288289a6fd33265e3ff86c4d11332f47ff9a8e780f1e68f0362e1addadce8e","observation_id":"68fa1ff8-88c2-4e6f-9b49-f2b3a57b40fa","resolution":{"observed_at":"2026-08-12T11:16:47.713272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:16:47.687032Z","title":"Fusecap: Leveraging large language models for enriched fused image captions","venue":null,"work_id":"23072d2b-e881-4823-ad85-76a41efa5fbc","year":2024},"citing_paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:16:47.614230Z"},"links":{"citing_paper":"/paper/2412.00095"},"observation_digest":"sha256:026c0cfdbb80d1bfdb788e61cc28a2dee085076d7bff460a1770d56d62e55a06","observation_id":"3dd29753-9965-4702-bb59-d85d366974b9","resolution":{"observed_at":"2026-08-12T11:16:47.693752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00095","last_updated":"2025-01-17T06:53:45Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T11:09:32.015267Z","submitted_at":"2024-11-27T15:45:02Z","title":"OPCap:Object-aware Prompting Captioning"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2412.00095."}