{"as_of":"2026-08-18T17:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:59a74ec18c761c4efe34b758929f365255c0518ca1188a42070b394a00084b39","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:24:45.510794Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.11025/citation-record","integrity":"/paper/2412.11025/integrity","json":"/paper/2412.11025/citation-record.json","paper":"/paper/2412.11025"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:24:45.787529Z","title":"Good news, everyone! context driven entity-aware captioning for news images","venue":null,"work_id":"553abdd1-5105-4168-a191-551c9a804564","year":2019},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.422684Z"},"links":{"citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:a2e616da6c74d64effcc35d13b42225bbf3843bfe92600a723faec8a520e9e4e","observation_id":"9f798f5a-8b1f-48b6-b20c-405ec84d3731","resolution":{"observed_at":"2026-08-11T15:24:45.792115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:24:45.427686Z","title":"Bge m3- embedding: Multi-lingual, multi-functionality, multi-granularity text embeddings through self-knowledge distillation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.427686Z"},"links":{"citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:8ee515c4be37a5da2f72bc692de28a9d3a1774971f11f5e864d05c7ecec3078c","observation_id":"dcc01e6e-35ec-4c0a-afe4-84776b8f068e","resolution":{"observed_at":"2026-08-11T15:24:45.427686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-16T01:18:27.067382Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-11T15:24:45.432294Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.432294Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:508e15563c7d81066dcda98b38851255bd365242c505124b77a68ccf4894a0f3","observation_id":"89011de0-0139-4ba5-b6df-fd8d491c500a","resolution":{"observed_at":"2026-08-11T15:24:45.432294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-08-16T13:48:12.744103Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-11T15:24:45.437278Z","title":"Benchmarking and improving detail image caption","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.437278Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:9ec567cf138ab3323ec597eeb0c5765534df094d7baa1ff9d3cf59cc1e7a8f7d","observation_id":"62cf5feb-ad2f-4ad4-97c4-a9c25d693aac","resolution":{"observed_at":"2026-08-11T15:24:45.437278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:24:45.764636Z","title":"Flex- cap: Generating rich, localized, and flexible captions in images, 2024","venue":null,"work_id":"16fc79a8-42f4-47fe-b595-c4d0b1981a8a","year":2024},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.442433Z"},"links":{"citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:5de680abf17294ba3c9e9af0671837d9fa152f6d257f23280d5441a3ac695db9","observation_id":"3ce52d7b-34ff-4845-8e1d-06e17d618095","resolution":{"observed_at":"2026-08-11T15:24:45.768616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02793","last_updated":"2024-10-28T21:15:36Z","snapshot_observed_at":"2026-08-16T13:55:21.927218Z","submitted_at":"2024-05-05T02:15:11Z","title":"ImageInWords: Unlocking Hyper-Detailed Image Descriptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02793","snapshot_observed_at":"2026-08-11T15:24:45.447605Z","title":"Im- ageinwords: Unlocking hyper-detailed image descriptions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.447605Z"},"links":{"cited_paper":"/paper/2405.02793","citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:9d914b190c31eae86b667e68178edd427dc46a3bd953a528a3e0ed310cc00497","observation_id":"557222db-bd1b-4235-b7f7-8c1808cf946d","resolution":{"observed_at":"2026-08-11T15:24:45.447605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-16T13:43:12.869356Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-11T15:24:45.452767Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.452767Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:47c6d9ef07815b248db5a0550ffa86b8d72d33facd01dc7eea327e092cdf0c95","observation_id":"e0842e1a-3e7c-4ca2-a756-87da781f5ce0","resolution":{"observed_at":"2026-08-11T15:24:45.452767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:24:45.750556Z","title":"Goucher, Adam Perelman, Aditya Ramesh, Aidan Clark, AJ Ostrow, Akila Welihinda, and Alan Hayes","venue":null,"work_id":"aac38071-5995-40b5-9a7b-c144a49f5da3","year":2024},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.457139Z"},"links":{"citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:3b930643f2e93aa11f8d14ada569b49cc1b38a6e3fd36d5a767016a262a4eb22","observation_id":"d799bd77-51f6-4de9-bda4-eeda26f96dd2","resolution":{"observed_at":"2026-08-11T15:24:45.755390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:24:45.737339Z","title":"Rap: Retrieval-augmented planning with contextual memory for multimodal llm agents, 2024","venue":null,"work_id":"42e3ce28-196f-4902-980e-dd73cc7f378d","year":2024},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.463875Z"},"links":{"citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:556ea28f7b056f7e059d517b6881d8aba1bac86e652db829a37bd0ed951922a0","observation_id":"fa20db53-90ea-4395-b2ee-7b17ab03abdf","resolution":{"observed_at":"2026-08-11T15:24:45.742260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:24:45.724002Z","title":"St Edward's Crown","venue":null,"work_id":"55360759-494f-4e62-a232-b4eb2c22f2dd","year":2020},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.467821Z"},"links":{"citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:1fef178d4ba5981c526c0e2a2079f1c3e6142d20c1d3f7c83c3ce629b7cf66b8","observation_id":"295be078-6f95-4d4a-8532-579b63485f6a","resolution":{"observed_at":"2026-08-11T15:24:45.728357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:24:45.472879Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.472879Z"},"links":{"citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:bd5eb8b7fdb626dde51acedad219cb2a48ec46651611c8c29cb23b80ce88354b","observation_id":"746a2b86-0a58-44b0-a11c-64a66b273267","resolution":{"observed_at":"2026-08-11T15:24:45.472879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:24:45.702228Z","title":"Senticap: Generating image descriptions with sentiments","venue":null,"work_id":"3662f593-dd3d-4727-ab91-73d38e692365","year":2016},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.476760Z"},"links":{"citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:29396ba97f3dc685b6fb2f125fd8d564d9ab561c37e886dfa0f4c01a33698af1","observation_id":"c678db3f-7e05-418c-8ed4-12bb848d409a","resolution":{"observed_at":"2026-08-11T15:24:45.706579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19753","last_updated":"2024-04-30T17:56:24Z","snapshot_observed_at":"2026-08-16T13:56:31.060458Z","submitted_at":"2024-04-30T17:56:24Z","title":"DOCCI: Descriptions of Connected and Contrasting Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19753","snapshot_observed_at":"2026-08-11T15:24:45.480790Z","title":"Docci: Descriptions of connected and contrasting images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.480790Z"},"links":{"cited_paper":"/paper/2404.19753","citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:d7f98157466f14f7685e0ce11901e2f91a3f6d6543a22fa27673ed160c00dd07","observation_id":"18b39670-52ec-483d-a12f-b4458503fee8","resolution":{"observed_at":"2026-08-11T15:24:45.480790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01509","last_updated":"2025-03-20T02:49:09Z","snapshot_observed_at":"2026-08-16T13:38:01.678643Z","submitted_at":"2024-07-01T17:53:35Z","title":"MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01509","snapshot_observed_at":"2026-08-11T15:24:45.485184Z","title":"Mia-bench: Towards better instruction following evaluation of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.485184Z"},"links":{"cited_paper":"/paper/2407.01509","citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:d197332c4fcfabf29dcf18fa9ce5875d8d85c0252474cdc5f47080bc8afa5cb2","observation_id":"df434336-d4e5-4e5d-bb17-09a8496acd31","resolution":{"observed_at":"2026-08-11T15:24:45.485184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:24:45.489457Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.489457Z"},"links":{"citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:5be31c2e2d170c6a895016bcc11a9e8beb6566a0712352a855aad1d9c49df54b","observation_id":"1b935a20-74e6-4d84-94be-26e0e78ba214","resolution":{"observed_at":"2026-08-11T15:24:45.489457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:24:45.679383Z","title":"Transform and tell: Entity-aware news image captioning","venue":null,"work_id":"0f15e7e0-2c93-479b-b254-23cdb2234764","year":2020},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.494118Z"},"links":{"citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:f3599ee17f284f8bb5eebfa068026cce914e0b9f375c898dde2d34aa2403cbcd","observation_id":"1d414e3d-5147-4484-a82a-3bf687482106","resolution":{"observed_at":"2026-08-11T15:24:45.684563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:24:45.663054Z","title":"Caption anything: Interactive image description with diverse multimodal controls, 2023","venue":null,"work_id":"26f76732-618c-49f4-b00c-a754d65ba9f5","year":2023},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.497871Z"},"links":{"citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:e2fb6795914455951af90c6c964900c65c195a21b0ae404ba802d90dce5e543c","observation_id":"2dbf42ab-2fa8-46d2-b1fc-6c1aaebda271","resolution":{"observed_at":"2026-08-11T15:24:45.669385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03978","last_updated":"2024-10-31T08:11:04Z","snapshot_observed_at":"2026-08-16T13:37:01.478869Z","submitted_at":"2024-07-04T14:50:45Z","title":"Benchmarking Complex Instruction-Following with Multiple Constraints Composition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03978","snapshot_observed_at":"2026-08-11T15:24:45.502117Z","title":"Benchmarking complex instruction-following with multiple constraints composition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.502117Z"},"links":{"cited_paper":"/paper/2407.03978","citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:aca8b39b9a181b1ee97f14654229f98b98443f0bddd9a98805399932fe237a4b","observation_id":"f3af1ea4-6029-4021-b093-4c892a614eaa","resolution":{"observed_at":"2026-08-11T15:24:45.502117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:24:45.645405Z","title":"Depth anything v2, 2024","venue":null,"work_id":"94af0b82-6851-41ef-aa40-8e2f60d313bc","year":2024},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.506396Z"},"links":{"citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:ef4ebe4692aa52663ca4c9bae6b8980ad16376fba9ce8e17b64b3c87b5fdc178","observation_id":"c552cfe7-5b28-4fea-bb6d-ccd3e0bd8b40","resolution":{"observed_at":"2026-08-11T15:24:45.650809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-11T15:24:45.510794Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:24:45.510794Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2412.11025"},"observation_digest":"sha256:f5402a7632ad636554e11a76c4d6620a63bda78d6782f11c4d70012d46d6c6ba","observation_id":"ef7dd429-1e6c-4b22-bbe1-abb71cc03fa6","resolution":{"observed_at":"2026-08-11T15:24:45.510794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.11025","last_updated":"2024-12-15T02:37:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T01:51:21.533441Z","submitted_at":"2024-12-15T02:37:20Z","title":"From Simple to Professional: A Combinatorial Controllable Image Captioning Agent"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2412.11025."}