{"as_of":"2026-08-15T15:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ae878fe50117faad222559f97ed3e86d962cb8fe9231618ba4107e2b46575a63","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T14:44:00.120823Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.02632/citation-record","integrity":"/paper/1908.02632/integrity","json":"/paper/1908.02632/citation-record.json","paper":"/paper/1908.02632"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.920488Z","title":"Spice: Semantic propositional image cap- tion evaluation","venue":null,"work_id":"44d6d711-0215-4e91-b55c-bf5cf88e7fa0","year":2016},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.827858Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:9763917f209c036ba0f58f2f468260f3e1c065c9b3411563d644aab29f78cee9","observation_id":"315c9eb5-a4db-463b-a410-1dd72a310c35","resolution":{"observed_at":"2026-08-14T14:44:00.925937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.907340Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":"71c29bbe-ed7e-4dc8-997e-0488bd07f560","year":2018},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.833279Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:64f02a21f0ae318ddf08a341bd6acc925cd218c59d506fff764cb5eddf362c87","observation_id":"4c796bfc-7a31-4222-9fce-82b3fac8c542","resolution":{"observed_at":"2026-08-14T14:44:00.911590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-12T12:07:33.202888Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-14T14:43:59.838299Z","title":"Neural machine translation by jointly learning to align and translate","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.838299Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:d060ce7f11c178b2bb54f708e527344465d300ac8d57ad2d57641e685efa05b4","observation_id":"7c170da0-25f9-4254-b73c-bebaaefd668d","resolution":{"observed_at":"2026-08-14T14:43:59.838299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.893608Z","title":"Structcap: Structured semantic embedding for image captioning","venue":null,"work_id":"4307155f-f976-4cef-91bd-7a25c38036c2","year":2017},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.843391Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:c3fb8ceaf293d7535368b0db0d80b3e8b77b7d55836b212670e84f1150829798","observation_id":"8302efd5-2b26-45ae-9adf-22ce001be4de","resolution":{"observed_at":"2026-08-14T14:44:00.898623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.881330Z","title":"Groupcap: Group-based image captioning with structured relevance and diversity constraints","venue":null,"work_id":"217b3446-9722-4b45-9e3b-b20c20d1bbc5","year":2018},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.848627Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:af348615c4a3281036767822177dd38df9efbe3dee3547c42a7422bd1090fef6","observation_id":"11f9952c-5fdb-4d9c-94c3-90efbac243bb","resolution":{"observed_at":"2026-08-14T14:44:00.885076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.869862Z","title":"Boosted attention: Leveraging hu- man attention for image captioning","venue":null,"work_id":"83a3f804-a2ca-4aa9-a286-cbf0683efc07","year":2018},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.854963Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:86cd1bad5e9c05f692b291fa4aa1dfe634da1d566d7086646f3e3ba70b206115","observation_id":"28931702-8439-443e-bc14-854d8b36f956","resolution":{"observed_at":"2026-08-14T14:44:00.873551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.858281Z","title":"Show, adapt and tell: Adversarial training of cross-domain image cap- tioner","venue":null,"work_id":"fc6c9eba-5685-484d-a849-8d02239a16a0","year":2017},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.860617Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:8ca269f77d8af1d32413ab40f9fb1d0412d381b2c61a0e3b69f894dc86be505c","observation_id":"c5732c48-f89c-4aee-ae4d-69fdae7db894","resolution":{"observed_at":"2026-08-14T14:44:00.862258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-14T14:43:59.865303Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.865303Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:0fcf8be1499af7030a6e2f389de2702574255d38844b13b605a86a810f68a7a8","observation_id":"ec088722-61bc-4c31-8a9c-a0faf5eecd43","resolution":{"observed_at":"2026-08-14T14:43:59.865303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.845189Z","title":"Mind’s eye: A recur- rent visual representation for image caption generation","venue":null,"work_id":"06af0be0-09f9-4d83-a5b3-1b38f0dabfc2","year":2015},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.870298Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:47b79d5f1dc5d1738e5393711365409778f277e6d93b7db0a03b0c458d61390e","observation_id":"73010fc5-74a8-4b34-b8ae-d6084e50c023","resolution":{"observed_at":"2026-08-14T14:44:00.849822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.831317Z","title":"Regularizing rnns for caption generation by reconstruct- ing the past with the present","venue":null,"work_id":"7f5d9911-6a01-4290-a0bd-32e859d9a9dc","year":2018},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.873861Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:334f13cdbbfc3c41e624ff123991ffe511bb3128c0fcd9357f520996e9907002","observation_id":"de26f60e-42c1-46ef-bccc-60a62291b295","resolution":{"observed_at":"2026-08-14T14:44:00.835861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.815453Z","title":"To- wards diverse and natural image descriptions via a condi- tional gan","venue":null,"work_id":"f020183d-bfb5-43a0-a46a-ccf19fee0742","year":2017},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.878495Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:02962f38c736c6a6e2c6ac6af90c446a303fafa9699a9b4d4f0d91fc51e47f91","observation_id":"8d0bef78-0fd0-4d34-b357-f707a0520a18","resolution":{"observed_at":"2026-08-14T14:44:00.820381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.802165Z","title":"Meteor universal: Lan- guage speciﬁc translation evaluation for any target language","venue":null,"work_id":"acb4d66d-865b-4d0b-9de2-551bf541a0fb","year":2014},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.882738Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:696c88c72752133ca7249a85969994a395785c47798f36f613f264e5c8e6f143","observation_id":"d80ce108-32f6-447a-9096-510627b788ef","resolution":{"observed_at":"2026-08-14T14:44:00.806728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.787890Z","title":"Aligning where to see and what to tell: Image cap- tioning with region-based attention and scene-speciﬁc con- texts","venue":null,"work_id":"dadcf32c-4424-4d2d-833e-6dfeb73356fe","year":2017},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.887530Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:a85bc6178d5f4c6d242a03c2c33d0c6a45be7ecee1152e40855effa7b1f6a3ed","observation_id":"ab4769fe-1639-40fb-8131-d6c2cd63b3ca","resolution":{"observed_at":"2026-08-14T14:44:00.792389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.773159Z","title":"Stylenet: Generating attractive visual captions with styles","venue":null,"work_id":"f4065d24-c2db-438d-b5d8-3edad3a31c55","year":2017},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.896138Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:e59abc9882cfd422ec02ecb0ea1182c631b3f86d325e48511d3221b765138ede","observation_id":"894ee86b-a40e-42c6-a1bb-83309987b465","resolution":{"observed_at":"2026-08-14T14:44:00.778316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:43:59.901252Z","title":"Semantic compositional networks for visual captioning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.901252Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:442908f554caeb2e81723b09016e86410981c72ad32d8d88002abfc5131e10a1","observation_id":"fb003172-98a7-48c8-b6c6-1947828eaf81","resolution":{"observed_at":"2026-08-14T14:43:59.901252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.749150Z","title":"Deliberate attention networks for image captioning","venue":null,"work_id":"9e677104-3459-4991-b512-470f7e961d8a","year":2019},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.906665Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:9eb8d9c9e662cade9571230940ca35b93bf765e4f86483e5ca5931914e433221","observation_id":"6a314a0e-15ad-4d44-a47a-3d6c08e8f0ff","resolution":{"observed_at":"2026-08-14T14:44:00.753650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.734701Z","title":"Locally supervised deep hybrid model for scene recogni- tion","venue":null,"work_id":"ed7c37d3-30f2-4c30-ba81-eb739771f0cf","year":2017},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.912060Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:bcd8107ba28951549430ef50e5c820475bd6539a12ff95bc7316e76cbfb85cfc","observation_id":"903fd968-ac1a-4e39-92bb-15251428f64a","resolution":{"observed_at":"2026-08-14T14:44:00.739388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:43:59.917701Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.917701Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:32f2d9ff160ab1c7bd670a0a480b7a75668b668877350dc48e8a388da47fe533","observation_id":"a5f216c4-5e93-4e28-81f7-e309b8efdef8","resolution":{"observed_at":"2026-08-14T14:43:59.917701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.709806Z","title":"Maximum expected bleu train- ing of phrase and lexicon translation models","venue":null,"work_id":"aa221569-92d8-406a-9ac6-0657dac4a332","year":2012},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.922086Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:d828a48c8a4f9241db1f605baebb1a4509ff0ffa12c06d96a04aea7584aebbb8","observation_id":"47f946bf-bb62-4404-802d-64965fc1da3c","resolution":{"observed_at":"2026-08-14T14:44:00.714749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:43:59.927468Z","title":"Long short-term memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.927468Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:1dba1d05c9446f5ed89947384b528e25bb315abb5af0efd29fe360d5c242de19","observation_id":"2068a202-762f-4438-aac6-14a2217c8178","resolution":{"observed_at":"2026-08-14T14:43:59.927468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.686573Z","title":"Learning to guide decoding for image captioning","venue":null,"work_id":"67af6965-e27f-472e-8daa-890951312702","year":2018},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.932880Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:afa5580fe3aa5858132fa3101eaf76cb0f1b4271ed9fb2a1db9379537b3514c5","observation_id":"c0adb881-fceb-4e72-a8ca-46b059bb8705","resolution":{"observed_at":"2026-08-14T14:44:00.692372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.670302Z","title":"Deep visual-semantic align- ments for generating image descriptions","venue":null,"work_id":"b8616402-3e2f-43b8-bd84-655f64d8cdd1","year":2015},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.937356Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:90eafc700b29024ed65269b7c4d8e6860b0043ff70f0540bb371d9bd8a6573ce","observation_id":"b7edca00-58c2-427a-a1e9-7e7da4aea4b4","resolution":{"observed_at":"2026-08-14T14:44:00.675233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:43:59.941775Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.941775Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:ca4a54a7ac8170f7d3dcda7902c611e5599ef5b3f267fbbf35182d2b711e44eb","observation_id":"4023d798-30e8-4f66-847a-b8b68d40a9e7","resolution":{"observed_at":"2026-08-14T14:43:59.941775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.646612Z","title":"Multi- modal neural language models","venue":null,"work_id":"f2d471a1-7bd1-4dc7-800a-b1e945f5c239","year":2014},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.945590Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:6096ef21acd5307c2a1d9ddb1cabaaadae1a3832b719180e4ede6a68d76ac1bd","observation_id":"45a7c3aa-5357-4cc6-a3dc-23879dd0b8ed","resolution":{"observed_at":"2026-08-14T14:44:00.650770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.634176Z","title":"Learn- ing hierarchical semantic description via mixed-norm reg- ularization for image understanding","venue":null,"work_id":"05ed2912-634c-469d-a39a-38fca0554c0b","year":2012},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.950561Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:ed848c8dd6edc210dfe97822042f9f76cfc4929f12bbd5cc01d3d9141cd87830","observation_id":"1d982e61-1b3d-42b3-b5e3-ded59602f5f2","resolution":{"observed_at":"2026-08-14T14:44:00.638434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.620571Z","title":"Object bank: A high-level image representation for scene classiﬁcation & semantic feature sparsiﬁcation","venue":null,"work_id":"ea6325bc-354b-4c5e-8660-d29b80ac40b7","year":2010},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.955051Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:3c8af220eaa8c95ab228077973b645381a89b930af2112cb7d720ef0e33e4300","observation_id":"bb17c0d5-d29b-4fba-9f8a-477b9165aae2","resolution":{"observed_at":"2026-08-14T14:44:00.624939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:43:59.958905Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.958905Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:3d92ada55d57c851e38c99a15ebe2494aa1a2767294356a8d6b2fbc39b21b76d","observation_id":"d85e45c8-fbe4-401f-8016-9d8e7d902294","resolution":{"observed_at":"2026-08-14T14:43:59.958905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.597552Z","title":"Improved image captioning via policy gra- dient optimization of spider","venue":null,"work_id":"348b0d8a-e8e3-4ab8-bbf5-b5b1bec237d5","year":2017},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.963373Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:298f6b2a8b6fd435f3f9aee75116d788356b669aacc3e3575a9d91939f9308a2","observation_id":"323625d0-acba-4f12-a48b-9046a6247670","resolution":{"observed_at":"2026-08-14T14:44:00.602430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.581507Z","title":"Knowing when to look: Adaptive attention via a visual sen- tinel for image captioning","venue":null,"work_id":"9d50f9ab-1987-4370-84f5-6948742b5d6a","year":2017},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.967522Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:6d754dcfe67ae194ecc6ad702712dca08f0b8fdef8570893ffe4966775c60936","observation_id":"86312d41-2dd7-4e74-95df-7341d7ad14a8","resolution":{"observed_at":"2026-08-14T14:44:00.586188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.566999Z","title":"Discriminability objective for training de- scriptive captions","venue":null,"work_id":"ece77cbc-73a1-44c9-a142-bd8dd0097587","year":2018},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.976422Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:747e7d6825082e03f854ac9aaa580774f68863c2636b317e0dc80895ca4e7612","observation_id":"59698848-7914-4b36-a342-0bbb825678c9","resolution":{"observed_at":"2026-08-14T14:44:00.571266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6632","last_updated":"2015-06-11T15:26:58Z","snapshot_observed_at":"2026-08-15T10:22:07.704120Z","submitted_at":"2014-12-20T08:10:04Z","title":"Deep Captioning with Multimodal Recurrent Neural Networks (m-RNN)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6632","snapshot_observed_at":"2026-08-14T14:43:59.980770Z","title":"Deep captioning with multimodal recurrent neural networks (m-rnn)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.980770Z"},"links":{"cited_paper":"/paper/1412.6632","citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:2d0f5071479e8210378717e48b829c4d7579c575a18adc3dc1b493aedc567438","observation_id":"1fea4764-3dc6-4b55-8cd0-cb9487344e28","resolution":{"observed_at":"2026-08-14T14:43:59.980770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.551975Z","title":"Unsupervised learning of image transformations","venue":null,"work_id":"e04381dd-4bad-4877-9103-d624b6e9011b","year":2007},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.985466Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:6721e688a3914cd79eedf1a1df9730944168d10e3d825ce2daf420ac5a6ee192","observation_id":"2c4d372b-291a-4c5f-bd16-b65cddb81ac5","resolution":{"observed_at":"2026-08-14T14:44:00.557827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.538899Z","title":"Modeling the shape of the scene: A holistic representation of the spatial envelope","venue":null,"work_id":"be2aab3d-07b1-45a1-aded-f9a0ccb8c829","year":2001},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.989637Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:8836a3976ec001ad4a66f6bf0117aeccc171e5a8161050122fc93f6cc907bafa","observation_id":"eea89e18-739d-4c9d-b1be-0211af1a45f7","resolution":{"observed_at":"2026-08-14T14:44:00.542672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.526295Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"e2b47772-a487-4c1c-82c2-c9e04d7d08f7","year":2002},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.993538Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:4d5bd9523520b945a692b48aee34290d9becbf3a7e714ac859553f25dee403c6","observation_id":"79f34f7d-8a43-4a7d-b258-905845a69ab1","resolution":{"observed_at":"2026-08-14T14:44:00.530296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:43:59.997490Z","title":"Relative attributes","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T14:43:59.997490Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:ca1e52c315e2fdd4faae21c50e7ab26419f9e45f315ab60bc824c2a31841b05c","observation_id":"ef208dea-a96d-47b9-b49a-5dfe9d4e474e","resolution":{"observed_at":"2026-08-14T14:43:59.997490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.504092Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":"79de9738-b9e1-4187-a527-f01cf6a61e8c","year":2015},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.003050Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:1e6f9c7202210343fb13f4c92d3c528b5f68b080516df18d21e4e9a1028d73b3","observation_id":"b2d753f4-9897-43b9-a7db-3a4dab7078f8","resolution":{"observed_at":"2026-08-14T14:44:00.509401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.489873Z","title":"Self-critical sequence training for image captioning","venue":null,"work_id":"1252bd61-e02c-4377-b796-c094a462f44e","year":2017},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.013877Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:ea14f37d2f7fb6daaabe645de324bb42629cbcfc658e4022265069b8e63a2a0b","observation_id":"bc5bd7f7-23f2-4137-a349-a6166c4fbc5e","resolution":{"observed_at":"2026-08-14T14:44:00.494562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.475818Z","title":"Biologically inspired fea- ture manifold for scene classiﬁcation","venue":null,"work_id":"221ee400-d43d-4d34-969c-408d173d41ea","year":2010},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.018518Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:f07f796735dbedb6951faa8ffe858400bfd4a6bd4f63bcc41f17bda62ede97da","observation_id":"eca88d9e-ac91-4a2f-81a2-721d76014d08","resolution":{"observed_at":"2026-08-14T14:44:00.481364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.456163Z","title":"Factored tem- poral sigmoid belief networks for sequence learning","venue":null,"work_id":"b333f235-6ee7-41c4-b683-04a95bb44dfa","year":2016},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.024714Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:f14572d014909f3d360ca8a869fd87d9e6d7f0ff854ff11a8d7e8d726faab67d","observation_id":"49355caa-5f35-4b7a-8379-ca24273a7cd5","resolution":{"observed_at":"2026-08-14T14:44:00.461712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.442993Z","title":"Gen- erating text with recurrent neural networks","venue":null,"work_id":"37eba532-f9dc-4928-b6fa-ff568b034e58","year":2011},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.030368Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:df2795170696c02659fb0846c23f52c58eb1fda9b4aa723b06b2595f719a2de3","observation_id":"5f58d516-a410-4e32-b34e-30fb3550113c","resolution":{"observed_at":"2026-08-14T14:44:00.447073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.427049Z","title":"Sequence to sequence learning with neural networks","venue":null,"work_id":"53ad6642-148a-483b-aca3-ff599dae07b2","year":2014},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.036341Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:639adf57e20974994ee0ca2a65f32fdae1273865dd3e207ac0946e3739b1fc9f","observation_id":"a8506475-8cfa-4c07-9530-354456f44689","resolution":{"observed_at":"2026-08-14T14:44:00.432836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.041043Z","title":"Rethinking the inception archi- tecture for computer vision","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.041043Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:3589d2c1559c261210b7f7204e92d2f776e10cc06480e943bc3e3db8621bc633","observation_id":"0a11428a-1ac9-429a-a0c9-699e64fb1b0a","resolution":{"observed_at":"2026-08-14T14:44:00.041043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.397854Z","title":"Factored con- ditional restricted boltzmann machines for modeling motion style","venue":null,"work_id":"b42aaa9a-4e5b-4912-a434-683bfc82707c","year":2009},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.046436Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:8cec7697f7465dfb5ebd96b9bc28e6c5760f3b97faba7ef649adbe4e1163f602","observation_id":"57362296-9b15-41b2-af4b-3dd98e296344","resolution":{"observed_at":"2026-08-14T14:44:00.402979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.050375Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.050375Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:c0915046ecf58f7397f0282989e4dcdd76428ac38574a65e8ac9c73c2d4cf3e6","observation_id":"8926f0fa-dea3-47f4-88e9-26cd06a467cd","resolution":{"observed_at":"2026-08-14T14:44:00.050375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.371656Z","title":"Show and tell: A neural image caption gen- erator","venue":null,"work_id":"f4f33123-adb6-400a-a046-852021fbb8c5","year":2015},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.058987Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:280d1098b15b40b0b18303a3b44c43da72794eab5a706266cd51593829cade7c","observation_id":"a822829e-f86e-422c-a38d-98b1d8d2c4eb","resolution":{"observed_at":"2026-08-14T14:44:00.377521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.357581Z","title":"Show and tell: Lessons learned from the 2015 mscoco image captioning challenge","venue":null,"work_id":"9efb2a79-a1ab-48f2-abd9-18757e6dae29","year":2015},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.065483Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:46174871db060fb92133aac90fc8be87e51c87f17ea1db2822acc498f202e282","observation_id":"633b4075-8110-4f33-9245-0230690a8ca1","resolution":{"observed_at":"2026-08-14T14:44:00.362382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.344069Z","title":"Knowledge guided disambiguation for large- scale scene classiﬁcation with multi-resolution cnns","venue":null,"work_id":"a2678b73-96c5-4927-87d4-4aa5590ce90f","year":2017},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.071017Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:75df44a4878f40df9f0e6f87e0a3191f33cf93ac27d5412e0b4dc6e91c4a83db","observation_id":"c694e35a-19fc-4ed7-9118-9637551401c7","resolution":{"observed_at":"2026-08-14T14:44:00.348426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.332182Z","title":"Semantics- preserving bag-of-words models and applications","venue":null,"work_id":"517380da-703f-4068-8c56-f95cad0376b2","year":1908},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.078127Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:f0d517011f5fe0f0899c0f47e9d5043b9f1314e407874b6751d8b46e98b0b761","observation_id":"c808fb44-12de-400f-8fd4-28d364985b9c","resolution":{"observed_at":"2026-08-14T14:44:00.336263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.318042Z","title":null,"venue":null,"work_id":"7f75bdea-4ffa-4c07-9a41-99bf84bbc955","year":2016},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.083568Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:82013ae7c8e6f5577ee91d2ab0f584e6da66cf1e78c33ea8467726614abd10d6","observation_id":"c95a16d7-f7cd-4e5b-ad62-bdaa127ce467","resolution":{"observed_at":"2026-08-14T14:44:00.322642Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.300604Z","title":"On multiplicative integration with recurrent neural networks","venue":null,"work_id":"3ac53e94-249b-4565-b80c-1c763b2a4f35","year":2016},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.091354Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:bf3e34bac90c346f3058d567b282709c6736eb0af929d0d8e7e3e91519d01b86","observation_id":"e175809b-1262-409d-b712-c5ddd7be3bf9","resolution":{"observed_at":"2026-08-14T14:44:00.306182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.286095Z","title":"Show, attend and tell: Neural im- age caption generation with visual attention","venue":null,"work_id":"fc0b6d72-3a99-4315-a359-695bcc1b480c","year":2015},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.096489Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:4cfd38be3b2de11a1e54a93d257920b1753ffbd2e9deb49c506fa50360de0408","observation_id":"dd80c233-acae-4b92-b943-fd0b9178cb70","resolution":{"observed_at":"2026-08-14T14:44:00.291109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.267238Z","title":"Review networks for caption gen- eration","venue":null,"work_id":"24916858-92a9-4cb5-bbb9-22f55facc0d2","year":2016},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.102542Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:a7dccb4e65282c97caf7bf36612e1e57655e012a00db60fcdf157f9f1a1a113e","observation_id":"a2d57d16-a2a4-434d-85a4-61f164b5d19f","resolution":{"observed_at":"2026-08-14T14:44:00.274286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.248223Z","title":"Boosting image captioning with attributes","venue":null,"work_id":"82c531bf-5b28-43e7-95ad-2a98c6be220f","year":2017},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.107942Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:c2736660b9467109b88156f7278987001b68064e204c09166d2cbece355eb42e","observation_id":"45a37c8f-d7bd-4cb3-a4df-1dded6635766","resolution":{"observed_at":"2026-08-14T14:44:00.254099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.231804Z","title":"Image captioning with semantic attention","venue":null,"work_id":"eaec3070-1c0a-4813-bd0a-751ebe2d3996","year":2016},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.112997Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:42d4c5f1a859ee9f143c15bf74adf21c0f5b79f39e5ef46b0c073d6722d69a86","observation_id":"2cb6420d-9a7b-4f45-8404-af0f6771933f","resolution":{"observed_at":"2026-08-14T14:44:00.237269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.214953Z","title":"Pairwise constraints based multiview features fusion for scene classi- ﬁcation","venue":null,"work_id":"eeb876be-c771-478e-a186-9d6a1e616b70","year":2013},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.117341Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:3d01f40e915734d85d4bbabf8973a224021c611500e08f1d1a5b27d8426745b1","observation_id":"03905dd3-64bf-4c62-9a79-63dae95c4fc9","resolution":{"observed_at":"2026-08-14T14:44:00.220107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:44:00.198917Z","title":"Learning deep features for scene recognition using places database","venue":null,"work_id":"0d6bf529-1e5b-416f-bf70-37f3d6a9e77d","year":2014},"citing_paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-14T14:44:00.120823Z"},"links":{"citing_paper":"/paper/1908.02632"},"observation_digest":"sha256:f6eb2419faad631876e59d66b586e38d75e93d1d6456f3d9fb152f2dd935854d","observation_id":"5b80f39e-ea5c-4284-b806-9e902b78f72d","resolution":{"observed_at":"2026-08-14T14:44:00.205895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.02632","last_updated":"2019-09-02T16:11:16Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T08:29:36.768553Z","submitted_at":"2019-08-07T13:43:25Z","title":"Scene-based Factored Attention for Image Captioning"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:1908.02632."}