{"as_of":"2026-08-20T20:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d5bdd6edb8876cf2c65ebea52fe0f49c894d77f8ea133d504cf3602330e38bc9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:13:25.708993Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T16:29:57.874633Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":"1505.04870","doi":null,"metadata_source":"pith","pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-07-04T16:29:57.874633Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","venue":"cs.CV","work_id":"7b107a59-1658-40dc-9893-3297124c3ed9","year":2015},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:a51593b5ececbafdd26e433b645d99e6779067aae109dc49603ce646b512790e","observation_id":"634c8446-581f-4fc9-a4e7-62490b733990","resolution":{"observed_at":"2026-05-16T09:38:09.538355Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-08-11T00:47:52.472320Z","title":"A.; Wang, L.; Cervantes, C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-15T16:37:06.956343Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.472320Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:9b264d3043945772f2b8166224a077a7f98096b1bde065f6c238373a4b10d1a9","observation_id":"5841e810-0639-45f3-bec8-1f34f573c01e","resolution":{"observed_at":"2026-08-11T00:47:52.472320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-08-16T12:13:25.708993Z","title":"Plummer, Liwei Wang, Chris M","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.13392","last_updated":"2025-09-04T03:45:36Z","snapshot_observed_at":"2026-08-19T15:34:49.669579Z","submitted_at":"2025-04-18T00:54:36Z","title":"POET: Supporting Prompting Creativity and Personalization with Automated Expansion of Text-to-Image Generation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T12:13:25.708993Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2504.13392"},"observation_digest":"sha256:893464099697c2eea53bd4480457678d5226cb4dd8e59668708f754fc3eaa208","observation_id":"5e06a9ef-f940-4230-9e47-9a1a2fc2b20c","resolution":{"observed_at":"2026-08-16T12:13:25.708993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-08-16T05:10:32.976270Z","title":"Chen Qiu, Xingyu Li, Chaithanya Kumar Mummadi, Madan Ravi Ganesh, Zhenzhen Li, Lu Peng, and Wan-Yi Lin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.21423","last_updated":"2025-04-30T08:28:38Z","snapshot_observed_at":"2026-08-17T00:04:25.720549Z","submitted_at":"2025-04-30T08:28:38Z","title":"Diff-Prompt: Diffusion-Driven Prompt Generator with Mask Supervision","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-16T05:10:32.976270Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2504.21423"},"observation_digest":"sha256:963e39c880085d329f065bfe48ec825b5e302c2ab83722a1e7e7bc0bfe0131ff","observation_id":"41bfaf0e-3822-42db-9510-5eb1cf42d5f1","resolution":{"observed_at":"2026-08-16T05:10:32.976270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-08-15T21:24:01.101202Z","title":"Plummer, Liwei Wang, Chris M","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.09990","last_updated":"2025-05-16T18:37:26Z","snapshot_observed_at":"2026-08-17T13:03:45.522349Z","submitted_at":"2025-05-15T06:04:42Z","title":"PointArena: Probing Multimodal Grounding Through Language-Guided Pointing","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T21:24:01.101202Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2505.09990"},"observation_digest":"sha256:4b1950f9427b90266d02b9f2484f92aef874dc0b7997e644073862d5c1acc26e","observation_id":"878890d2-951f-4555-9dd9-6a3e351a436f","resolution":{"observed_at":"2026-08-15T21:24:01.101202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-08-07T14:35:00.396259Z","title":"Plummer, Liwei Wang, Chris M","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18434","last_updated":"2025-05-24T00:02:48Z","snapshot_observed_at":"2026-08-13T07:05:13.469833Z","submitted_at":"2025-05-24T00:02:48Z","title":"TNG-CLIP:Training-Time Negation Data Generation for Negation Awareness of CLIP","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:35:00.396259Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2505.18434"},"observation_digest":"sha256:b8e5e3c238840244570f591a695a32a46b497a1ce8b04563d6eafaa79a973395","observation_id":"be44f958-c33a-4fd3-8214-91d47c34f5a9","resolution":{"observed_at":"2026-08-07T14:35:00.396259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-08-07T05:18:04.406711Z","title":"https://arxiv.org/abs/1505.04870","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.08462","last_updated":"2025-06-10T05:37:33Z","snapshot_observed_at":"2026-08-15T03:33:23.019908Z","submitted_at":"2025-06-10T05:37:33Z","title":"Hybrid Reasoning for Perception, Explanation, and Autonomous Action in Manufacturing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:04.406711Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2506.08462"},"observation_digest":"sha256:7194f3f9f86698d98a0cd4f08bfd9060dc100cae66b129f8aefadedd9ffc01f0","observation_id":"8b6af184-38bb-4335-a2ee-a826093c41e8","resolution":{"observed_at":"2026-08-07T05:18:04.406711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-08-07T04:59:41.110128Z","title":"Schwenk, D., Khandelwal, A., Clark, C., Marino, K., and Mottaghi, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09172","last_updated":"2025-06-17T03:30:48Z","snapshot_observed_at":"2026-08-20T08:51:01.559971Z","submitted_at":"2025-06-10T18:38:19Z","title":"An Open-Source Software Toolkit & Benchmark Suite for the Evaluation and Adaptation of Multimodal Action Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:59:41.110128Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2506.09172"},"observation_digest":"sha256:34879be393b05c03a7f83de4ca85e332faa828a3d2bdcd1bd91947f3e88bc8ad","observation_id":"2f61d586-ef08-44ce-8b03-c26ca978f2b0","resolution":{"observed_at":"2026-08-07T04:59:41.110128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-08-07T00:42:53.686184Z","title":"A.; Wang, L.; Cervantes, C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-18T04:15:29.725385Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.686184Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:76eb0d2a6aa316a7e086f6ecacf65c1cadccc7f5a73d1bbe50855dd04e3d6122","observation_id":"d1e6a688-4d00-4f77-913b-2b58ee3d0394","resolution":{"observed_at":"2026-08-07T00:42:53.686184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-08-05T18:47:45.349883Z","title":"A.�� ���Flickr30k entities: Collecting region-to-phrase correspon- dences for richer image-to-sentence models (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.18235","last_updated":"2025-08-20T00:57:21Z","snapshot_observed_at":"2026-08-19T23:45:05.514496Z","submitted_at":"2025-08-20T00:57:21Z","title":"Sealing The Backdoor: Unlearning Adversarial Text Triggers In Diffusion Models Using Knowledge Distillation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-05T18:47:45.349883Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2508.18235"},"observation_digest":"sha256:28435fa759633081af4cff838122069b64cf8f0c845d9a7e0d01a69269a6ad97","observation_id":"37fe6998-8d8c-4dbe-b484-a1a27a21b5f7","resolution":{"observed_at":"2026-08-05T18:47:45.349883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":"1505.04870","doi":null,"metadata_source":"pith","pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-07-04T16:29:57.874633Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","venue":"cs.CV","work_id":"7b107a59-1658-40dc-9893-3297124c3ed9","year":2015},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-18T02:43:54.318721Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:397c77274799b88531711c7acb2c8f4d402654358bda2ba3fb680474f66f9b9d","observation_id":"7cd2decd-4774-4b03-8060-2878214813bf","resolution":{"observed_at":"2026-06-29T18:23:50.301057Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":"1505.04870","doi":null,"metadata_source":"pith","pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-07-04T16:29:57.874633Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","venue":"cs.CV","work_id":"7b107a59-1658-40dc-9893-3297124c3ed9","year":2015},"citing_paper":{"arxiv_id":"2605.27365","last_updated":"2026-05-27T02:30:49Z","snapshot_observed_at":"2026-08-15T00:47:32.172642Z","submitted_at":"2026-05-26T17:59:12Z","title":"LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T17:52:59.346637Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2605.27365"},"observation_digest":"sha256:390ec65ded5a97cfbf15ba3031ab98431d33e0700e02339eb01d55dee8af9e2e","observation_id":"4a6d6ff8-6333-4b91-b2cd-441785d0ea0c","resolution":{"observed_at":"2026-06-29T17:53:46.733539Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":"1505.04870","doi":null,"metadata_source":"pith","pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-07-04T16:29:57.874633Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","venue":"cs.CV","work_id":"7b107a59-1658-40dc-9893-3297124c3ed9","year":2015},"citing_paper":{"arxiv_id":"2606.22495","last_updated":"2026-06-21T13:34:18Z","snapshot_observed_at":"2026-08-18T04:00:19.608706Z","submitted_at":"2026-06-21T13:34:18Z","title":"Grounded Scaling: Why Agentic AI Needs Deterministic Environments","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T10:51:34.720931Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2606.22495"},"observation_digest":"sha256:caa1cf5c012be81018cfd3713c47da276c44996dfec030d316274a5e8f5e9198","observation_id":"bbe0e001-b902-4287-b621-f74b2714a4ba","resolution":{"observed_at":"2026-07-04T08:49:42.668100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":"1505.04870","doi":null,"metadata_source":"pith","pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-07-04T16:29:57.874633Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","venue":"cs.CV","work_id":"7b107a59-1658-40dc-9893-3297124c3ed9","year":2015},"citing_paper":{"arxiv_id":"2606.24253","last_updated":"2026-06-26T09:37:54Z","snapshot_observed_at":"2026-08-12T17:36:15.119929Z","submitted_at":"2026-06-23T07:42:22Z","title":"TuringViT: Making SOTA Vision Transformers Accessible to All","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T00:29:41.291832Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2606.24253"},"observation_digest":"sha256:6af57d1f5830a42638dcb6c0a975a8d36d289df689842f03dfb29111c733ffac","observation_id":"db2ec889-8a69-4add-ab49-22d2143fd77c","resolution":{"observed_at":"2026-07-04T16:29:57.875807Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":"1505.04870","doi":null,"metadata_source":"pith","pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-07-04T16:29:57.874633Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","venue":"cs.CV","work_id":"7b107a59-1658-40dc-9893-3297124c3ed9","year":2015},"citing_paper":{"arxiv_id":"2606.24253","last_updated":"2026-06-26T09:37:54Z","snapshot_observed_at":"2026-08-12T17:36:15.119929Z","submitted_at":"2026-06-23T07:42:22Z","title":"TuringViT: Making SOTA Vision Transformers Accessible to All","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T05:32:26.746776Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2606.24253"},"observation_digest":"sha256:6448b0e9d23e278b1c07cc9bf24ae68283b81f23be9519e9fa510e90e80b207f","observation_id":"87159781-7554-4b8f-af18-b7686068359d","resolution":{"observed_at":"2026-06-29T15:03:32.190184Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-07-11T16:32:55.757864Z","title":"arXiv preprint arXiv:1505.04870 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-14T18:53:07.284837Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-11T16:32:55.757864Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:304aee5285a9facba63c3e5d1346457cb6501d7ee4a7d2bcb7ce811b63629655","observation_id":"27ef41ee-da4e-41f5-aafd-2ca362cdedc0","resolution":{"observed_at":"2026-07-11T16:32:55.757864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:1505.04870 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-14T18:53:07.284837Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:ec018dd9d1e6c01695da385477105e840f398721d4f35d952a895217fae9d1ea","observation_id":"70a783c4-b83b-49c6-b3a1-bf9c97b06cb4","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-08-16T00:12:08.692697Z","title":"Plummer, Liwei Wang, Chris M","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.12532","last_updated":"2026-08-12T19:07:07Z","snapshot_observed_at":"2026-08-18T17:51:28.390002Z","submitted_at":"2026-08-12T19:07:07Z","title":"MASCOT: Model-Aware Submodular Coverage for Composite-Attribute Text-to-Image Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:12:08.692697Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2608.12532"},"observation_digest":"sha256:e0f91e5b8d1c6b3e8b588350c321c235e8f83a6a113813a5a9813bd1fefddceb","observation_id":"f0ec3cfe-b7b7-4b23-afae-c7f11f703ec1","resolution":{"observed_at":"2026-08-16T00:12:08.692697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1505.04870/citation-record","integrity":"/paper/1505.04870/integrity","json":"/paper/1505.04870/citation-record.json","paper":"/paper/1505.04870"},"outbound":[],"paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T22:48:03.209909Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:1505.04870."}